Volver al blog
IAAgentesAutomatización

Agentes de IA local: 14MB funcionando sin internet

06 de septiembre de 2026·7 min de lectura·Diego Horvatti

¿Alguna vez te llegó la factura de la API de IA y pensaste "pero si solo la usé para clasificar correos"? Pues eso. La mayor parte de lo que una empresa hace con IA son tareas pequeñas, repetitivas y aburridas. Y venimos pagando precio de cohete para ir a la panadería. Por eso los agentes de IA local, modelos diminutos que funcionan en el propio aparato, empezaron a volverse un tema serio.

Esta semana apareció un modelo llamado Needle2, de Cactus Compute. Ocupa 14 megabytes. No es un error de tipeo. Catorce. Una foto de tu celular pesa más que eso. Y no es un chatbot: es un modelo hecho para llamar herramientas, o sea, decidir qué acción ejecutar y con qué parámetros. Funciona en celular, en reloj, en cerradura inteligente, en robot de almacén.

Qué cambia cuando la IA cabe en el aparato

Hoy el estándar es: tu app pregunta, manda a la nube, espera, recibe, muestra. Funciona bien. Pero arrastra tres problemas que nadie quiere encarar en la reunión.

Primero, costo. Pagas por token, y el token es consumo variable. Cuanto mejor le va al producto, más caro se vuelve. Es el único negocio del mundo donde el éxito te castiga.

Segundo, latencia. La ida y vuelta a la nube cuesta entre 300ms y 2 segundos, según la red del cliente. Para escribir un texto, bien. Para que una cerradura decida si abre la puerta, es una eternidad.

Tercero, los datos. Cada vez que el texto sale de tu máquina, alguien tiene que responder en la auditoría qué pasa con él. Ya vi un proyecto de salud frenarse dos meses por esa pregunta.

El modelo local resuelve los tres de una vez. Costo cero por llamada después de instalar la app. Respuesta en decenas de milisegundos. Y el dato nunca sale del aparato, lo que hace que la conversación sobre protección de datos sea mucho más corta.

No toda tarea necesita un genio. Muchas cosas solo necesitan a alguien que no se equivoque de botón.

¿Pero 14MB piensan algo?

No, y ese es el punto. Un modelo de ese tamaño no escribe tu propuesta comercial, no analiza contratos y no va a reemplazar al Claude o al GPT que usas para trabajo de verdad. Si le pides un análisis de mercado, se lo va a inventar. Con convicción.

Lo que hace es una sola cosa, y bien: tomar una frase y convertirla en una acción estructurada.

  • "Apaga la luz de la sala" se vuelve luz.apagar(ambiente="sala")
  • "Agenda reunión con Pablo el martes a las 14h" se vuelve una llamada de agenda con los campos completos
  • "Cliente reclamó un cobro equivocado" se vuelve un ticket con la categoría correcta

Es enrutamiento inteligente. Traducir lenguaje humano a comando de máquina. Eso es cerca del 70% de lo que necesitan la mayoría de las automatizaciones, y veníamos usando un modelo de miles de millones de parámetros para hacer ese trabajo.

La comparación honesta: es la diferencia entre contratar a un abogado sénior y contratar a una recepcionista muy buena. No pones al sénior a transferir llamadas.

Dónde sirve esto en un negocio de verdad

Déjame sacarlo de lo abstracto. Tres escenarios que aparecen a cada rato por aquí.

Aplicación de campo. Técnico de mantenimiento, repartidor, vendedor externo. Gente que trabaja en galpones, subsuelos, carreteras, lugares donde el 4G muere. Hoy su app o es un formulario aburrido o depende de internet para "entender" lo que la persona escribió. Con un modelo local, el tipo dice "cambié el compresor, pieza 4402, cliente firmó" y la app llena el informe. Sin señal. Sincroniza después.

Triaje de mensajes. Una empresa que recibe 300 mensajes por día en WhatsApp. Clasificar cada uno (presupuesto, soporte, reclamo, spam) vía API cuesta poco por mensaje, pero cuesta. Y cada mensaje pasa por un servidor de terceros. Un modelo pequeño corriendo en tu propio servidor hace el triaje, y solo lo complejo sube a un modelo grande.

Dispositivo físico. Tótem, torniquete, panel de control, equipo industrial. Aquí no hay discusión: si la decisión depende de la nube y la nube se cae, el equipo se vuelve un adorno.

Fíjate en el patrón. En ninguno de ellos la inteligencia bruta es el cuello de botella. El cuello de botella es el costo, la conexión o la privacidad.

El truco que vale más que el modelo

Aquí viene la parte que realmente importa, y que vale exista o no el Needle2.

La arquitectura que funciona es por capas. Modelo pequeño adelante, modelo grande atrás. El pequeño atiende todo lo que llega, resuelve lo simple y pasa adelante lo difícil. Es exactamente como funciona una buena atención humana: nivel 1 y nivel 2.

En la práctica, en un flujo de soporte típico, algo entre el 60% y el 80% de las entradas son repetición. Segunda copia de la factura, horario de atención, estado del pedido, cambio de datos. Si el modelo local resuelve esa franja, tu factura de API cae en la misma proporción. Y la calidad no baja, porque lo difícil sigue yendo al modelo bueno.

Yo implementé esa lógica con un cliente sin siquiera usar un modelo local: solo un filtro de reglas antes de la IA. La factura cayó un 40% en el primer mes. Con un modelo pequeño adelante, el recorte es mayor y el filtro se vuelve más listo, porque entiende las variaciones de escritura ("factura", "factur", "ese papel de pagar").

La lección no es "usa un modelo diminuto". Es: deja de mandar todo al modelo más caro que existe. Eso es el equivalente en IA a pedir un taxi de lujo para ir a la esquina, todos los días, y después quejarse del extracto.

Qué no haría con esto todavía

Una opinión fuerte, ya que estamos: yo no pondría un modelo de 14MB tomando decisiones solo en nada que involucre dinero, salud o seguridad de personas. No porque sea malo, sino porque la tasa de error de un modelo pequeño es mayor, y necesitas un plan para cuando se equivoque.

La forma correcta de usarlo es con escape. Si el modelo no está seguro, no adivina: escala. Manda al modelo grande, o al humano. Ese "no sé" bien implementado vale más que diez puntos de exactitud.

Tampoco vale la pena embarcar esto en un producto que todavía no existe. Si no tienes el flujo mapeado, poner IA local antes es optimizar algo que no sabes si la gente va a usar. Primero haz que funcione de la manera cara y simple. Después abarata con datos reales en la mano.

Por dónde empezar sin gastar

Un camino corto, en orden:

  1. Toma 200 interacciones reales de tu atención al cliente o de tu app. No inventes, usa las de verdad.
  2. Sepáralas en dos pilas: "una respuesta estándar lo resuelve" y "hay que pensar".
  3. Si la primera pila tiene más de 100 ítems, tienes un caso claro. Si tiene 20, déjalo así y ocúpate de otra cosa.
  4. Mide cuánto cuesta hoy esa primera pila: en API, en tiempo de gente, en clientes esperando.

Ese número es tu presupuesto. Si es pequeño, genial, acabas de ahorrarte un proyecto. Si es grande, ahora sabes exactamente qué estás comprando.

Lo interesante del Needle2 y de los modelos de ese tipo no es el tamaño. Es el mensaje implícito: la industria pasó dos años corriendo detrás de modelos más grandes y ahora descubrió que el problema de muchas empresas es el contrario. No falta inteligencia. Falta poner la inteligencia correcta en el lugar correcto, con el costo correcto.

Si tienes una operación que pasa todo por IA y sospechas que estás pagando de más por tareas simples, eso normalmente se mide en una tarde. Cuéntame qué estás automatizando y vemos si el recorte existe de verdad o si es solo teoría bonita.

Resumen para LinkedIn

Tu factura de IA subió otra vez y buena parte fue solo para clasificar correos.

Esta semana apareció Needle2, un modelo de 14 megabytes que funciona en el propio aparato, sin internet. No piensa, no analiza contratos, no escribe propuestas. Hace una sola cosa: convertir una frase en una acción.

Y mira, cerca del 70% de las automatizaciones que veo por ahí necesitan exactamente eso, pero están corriendo en un modelo de miles de millones de parámetros.

La cuenta no es sobre el tamaño del modelo. Es sobre dejar de pedir un taxi de lujo para ir a la esquina todos los días y después quejarse del extracto.

Modelo pequeño adelante, modelo grande atrás, y lo que no sabe lo escala en vez de adivinar. Ya vi caer un 40% de costo solo con un filtro de reglas antes de la IA.

Si sospechas que estás pagando de más por tareas simples, eso se mide en una tarde. Cuéntame qué estás automatizando.

#InteligenciaArtificial #IALocal #EdgeAI #Automatizacion #Tecnologia