Volver al blog
Agentes de IAAutomatización

IA local: el agente de IA que corre en tu empresa

03 de septiembre de 2026·6 min de lectura·Diego Horvatti

Abres la factura de la API de IA y te llevas un susto. Tres mil reales en un mes en el que nadie "usó IA" a propósito. Fue el robotito que clasifica correos corriendo de madrugada, el script que resume tickets, el flujo que revisa pedidos cada diez minutos. Cada llamada cuesta centavos. Centavos por cien mil llamadas se vuelven un sueldo. Es justo ahí donde la IA local empieza a tener sentido: un modelo más pequeño, corriendo en una máquina tuya, encendido todo el día, sin contador girando.

Meta lanzó en junio el Muse Glimmer, un modelo abierto de 30 mil millones de parámetros hecho justamente para eso: agentes que quedan encendidos todo el tiempo, en tu infraestructura. No es el modelo más inteligente del mundo. No hace falta que lo sea. Fue hecho para otra cosa.

Qué quiere decir "siempre encendido" en la práctica

Hay dos tipos de uso de IA en la empresa y la gente los mezcla.

El primero es el uso puntual. Alguien pide un texto, un análisis, una propuesta. Pasa diez, veinte veces al día. Tiene que ser bueno. Cuesta poco porque es poco volumen.

El segundo es el uso de fondo. El agente que lee todo correo que llega y decide si es presupuesto, reclamo o spam. El que monitorea un inventario. El que transcribe y resume cada llamada del área comercial. Eso corre todo el tiempo, sin nadie mirando, y el volumen es absurdo comparado con el primer caso.

El error común es usar el modelo caro en los dos. Es como contratar a un abogado sénior para sellar papeles. Funciona, pero pagas hora de abogado para sellar hojas.

El modelo grande es para pensar. El modelo pequeño es para trabajar.

Por qué un modelo de 30B cambia la cuenta

Treinta mil millones de parámetros parece mucho. En 2023 era cosa de data center. Hoy corre en una sola placa de video de unos 24 GB, de esas que un estudio de arquitectura ya tiene en la máquina de renderizado.

Eso cambia tres cosas de una vez.

El costo se vuelve fijo. Compras o alquilas la máquina y listo. No importa si el agente corrió mil o un millón de veces ese mes. Un cliente mío tenía un flujo que clasificaba mensajes de WhatsApp: unos 40 mil al mes. En la nube, andaba cerca de R$ 900. Migrado a un modelo local en una VPS con GPU de R$ 400 al mes, sobró espacio para montar tres automatizaciones más encima sin tocar el precio.

Los datos no salen. Estudio contable, clínica, despacho de abogados. Si el agente lee documentos de clientes, alguien va a preguntar a dónde fue ese documento. "Se queda en el servidor de la empresa" es una respuesta mucho más fácil de dar que un párrafo sobre la política de retención de un proveedor de afuera.

La latencia desaparece. Sin viaje hasta un servidor en otro continente. Respuesta en menos de un segundo, siempre. Para un agente que da veinte pasos en una tarea, esa es la diferencia entre dos segundos y treinta.

Dónde la IA local no sirve

Voy a ser honesto, porque esta parte casi nadie la escribe.

El modelo pequeño falla más en tareas abiertas. Si le pides "analiza este contrato y dime los riesgos", va a dar una respuesta razonable y vas a pensar que todo está bien. No lo está. En ese tipo de tarea la diferencia con un modelo grande es enorme y cara de descubrir tarde.

El modelo local tampoco tiene los últimos meses de internet en la cabeza. No sabe de la ley que cambió la semana pasada. Necesita acceso a tus datos para ser útil, y eso es trabajo de integración, no magia.

Y está lo obvio: alguien tiene que cuidar la máquina. Si tu empresa no tiene a nadie que sepa levantar un servidor y se cae un sábado, cambiaste una factura por un problema.

La regla que uso es simple. Si la tarea es repetitiva, tiene formato claro y un error ocasional no rompe nada, ve por local. Si la tarea es abierta, rara y cara de equivocar, usa el modelo bueno y paga los centavos.

Un ejemplo que se puede copiar

Distribuidora de repuestos, seis personas en el área comercial. Llegaban unos 300 pedidos por día entre correo y WhatsApp, todo en texto libre: "manda 20 de aquel filtro que compré el mes pasado".

El flujo viejo era una persona leyendo y tecleando en el ERP. Cuatro horas al día de esa persona.

Lo que armamos:

  • Un agente local lee el mensaje y extrae tres cosas: cliente, producto, cantidad.
  • Consulta el historial del cliente en la base para resolver el "aquel filtro".
  • Si tiene confianza alta, crea el borrador del pedido en el ERP.
  • Si tiene cualquier duda, lo manda a la fila humana con lo que entendió ya rellenado.

Nada de "IA autónoma". El agente es un pasante rápido que llena formularios y levanta la mano cuando no sabe. Cerca del 70% de los pedidos pasan sin toque humano. El otro 30% llega medio listo, así que hasta esos salen más rápido.

La tarea es aburrida, repetitiva y estructurada. Un modelo de 30B da abasto de sobra. Y como corre local, nadie contó llamadas de API.

Cómo probar esto sin gastar un dineral

No compres GPU. En serio. Ese es el error clásico: el dueño se entusiasma, gasta 15 mil en una máquina y termina de adorno.

Hazlo en este orden:

  1. Elige una sola tarea. La más repetitiva que tengas. Si no logras explicar en dos frases qué decide el agente, todavía no está lista.
  2. Corre en la nube primero, con un modelo bueno. Por dos semanas. Es caro, y es justo esa factura la que te va a decir si vale migrar. También es así como descubres si la tarea funciona.
  3. Mide la tasa de acierto. Compara con el humano haciéndolo. Si el humano acierta 97% y la IA acierta 91%, decide si esa diferencia duele o no. A veces duele. A veces es irrelevante.
  4. Solo entonces prueba local. Alquila una máquina con GPU por mes, corre la misma prueba, compara los números. Si cae mucho, vuelve atrás.
  5. Si quedó bien por tres meses seguidos, ahí piensas en comprar hardware.

Ese camino cuesta unos pocos cientos de reales para descubrir si la idea sirve. Es mucho más barato que descubrirlo después.

El punto que te interesa

La noticia relevante no es "salió un modelo más". Sale un modelo nuevo cada semana y de aquí a seis meses el Muse Glimmer va a estar viejo.

El punto es que la calidad necesaria para automatizar rutina dejó de ser exclusiva de quien tiene contrato con un gigante de la nube. Un estudio de un solo desarrollador logra montar, hoy, un agente corriendo en la infraestructura del cliente, con datos que no salen de ahí, por un costo mensual fijo que cabe en una empresa de diez personas.

Eso cambia el tipo de pregunta que vale la pena hacer. Ya no es "cuánto va a costar por mes esta IA". Es "qué tarea de mi operación es lo bastante repetitiva para justificar un agente cuidándola".

Si ya tienes una tarea en mente y quieres una opinión sincera sobre si compensa automatizarla o no, escríbeme para conversar. La mitad de las veces mi respuesta es que todavía no vale la pena, y eso también es información útil.

Resumen para LinkedIn

Recibí la captura de una factura de API de IA: 3 mil reales en un mes en el que nadie "usó IA" a propósito.

Era un robotito clasificando correos de madrugada. Centavos por llamada, cien mil llamadas, un sueldo.

El error no es la IA. Es usar un modelo caro para una tarea tonta. Es contratar a un abogado sénior para sellar papeles.

El modelo grande es para pensar. El modelo pequeño es para trabajar. Y hoy un modelo pequeño corre en tu máquina, con tus datos, por un costo fijo.

En una distribuidora de repuestos, el 70% de los pedidos entra al ERP sin toque humano. Costo mensual: el alquiler de la máquina, y ya.

Si ya tienes una tarea repetitiva en mente y quieres saber si compensa automatizar, escríbeme. La mitad de las veces digo que todavía no vale la pena, y eso también es una respuesta.

#InteligenciaArtificial #Automatizacion #IALocal #PequenasEmpresas #Tecnologia