Volver al blog
Agentes de IAAutomatizaciónNegocios

Agentes de IA: el ranking cambió de dueño otra vez

28 de agosto de 2026·6 min de lectura·Diego Horvatti

Aprobaste un proyecto de automatización en abril basado en "el mejor modelo del mercado". En agosto, el mejor modelo es otro. Y probablemente chino.

Qwen3.8 Max se quedó con la cima del índice de agentes de Artificial Analysis, que mide cuánto logra un modelo ejecutar tareas de varias etapas por su cuenta, no solo responder preguntas bonito. Es el tercer cambio de líder en el año. Si eres dueño de un negocio y estás tratando de decidir dónde apostar en agentes de IA, esa noticia parece importante. Es menos importante de lo que parece, y voy a explicar por qué.

Qué mide de verdad ese ranking

Hay una diferencia grande entre un modelo que conversa bien y un modelo que trabaja bien.

Conversar bien es responder una pregunta. Trabajar bien es recibir "consolida los pedidos de esta hoja de cálculo, revisa cuáles tienen factura pendiente y mándame un resumen", y hacer las tres cosas en el orden correcto, sin inventar datos en el camino.

El índice de agentes intenta medir la segunda cosa. Pone al modelo a usar herramientas, navegar, escribir código, consultar sistemas y completar tareas largas. Es la prueba más cercana a lo que realmente quieres: alguien que hace, no alguien que opina.

Y aquí está el dato curioso. En ese tipo de prueba, la distancia entre el primer lugar y el quinto es pequeña. Estamos hablando de pocos puntos porcentuales. El primer lugar da titular. En la práctica, si tu proceso funciona con el quinto, funciona con el primero, y al revés también.

Por qué cambiar de modelo casi nunca resuelve tu problema

Voy a ser directo: en casi todo proyecto de automatización que vi fracasar, el modelo no era el culpable.

Los culpables suelen ser:

  • Datos desordenados. El agente lee la hoja de cálculo donde el mismo cliente aparece como "Silva SA", "Silva Sa" y "silva mercadito". Ningún modelo del ranking arregla eso solo.
  • Proceso indefinido. Nadie sabe explicar por escrito qué pasa cuando el pedido llega sin datos fiscales. Si la persona no sabe, el agente tampoco va a saber.
  • Falta de acceso. El sistema que guarda la información no tiene integración, y la respuesta es "Fulana lo exporta a mano todos los viernes".

Esos tres problemas cuestan más caro que cualquier diferencia entre modelos. Y son latosos de resolver, lo que explica por qué mucha gente prefiere discutir cuál IA es la mejor.

Cambiar de modelo es fácil. Arreglar el proceso es el trabajo de verdad.

El caso del presupuesto que tomaba dos días

Un cliente mío, una distribuidora, tenía un flujo así. El vendedor recibía un pedido por WhatsApp, casi siempre una foto de una lista escrita a mano o un PDF del cliente. Lo tecleaba todo en el sistema, revisaba inventario, calculaba flete, armaba el presupuesto y lo devolvía. Promedio de dos días por presupuesto en los días llenos.

Armamos un agente para la parte mecánica: leer el pedido, identificar los productos en el catálogo, revisar inventario y generar el borrador del presupuesto. El vendedor revisa y aprueba. Bajó a unos veinte minutos.

Lo que hizo que funcionara no fue el modelo. Fue el mes anterior, gastado en tres cosas nada glamorosas:

  1. Estandarizamos el catálogo de productos, porque el mismo artículo tenía cuatro nombres distintos.
  2. Definimos por escrito qué hace el agente cuando no está seguro (respuesta: se detiene y pregunta, nunca adivina).
  3. Pusimos al vendedor al final del flujo, con poder de veto.

El modelo que se usaba ahí ya cambió dos veces desde entonces. El proceso sigue igual, y el cambio tomó una tarde. Ese es el punto.

¿Entonces el ranking no sirve para nada?

Sí sirve. Solo que no sirve para lo que la mayoría cree.

Sirve para que entiendas la dirección del mercado. Y la dirección es clara: los modelos abiertos chinos, como Qwen, están pegados a los americanos y cuestan una fracción del precio. Eso cambia la cuenta de tu proyecto.

Un agente que corre mil tareas por día con un modelo caro puede costar algunos miles de reales al mes. El mismo agente con un modelo abierto competitivo puede costar cientos. Cuando la diferencia de calidad es de dos puntos en un benchmark y la diferencia de precio es de cinco veces, la decisión se vuelve bastante menos filosófica.

También sirve para calibrar la expectativa. Los mejores modelos de hoy aciertan algo así como el 60% a 70% de las tareas agénticas complejas en ambiente de prueba. No el 99%. Si alguien te vende un agente que "hace todo solo sin supervisión", pregunta qué benchmark sostiene eso. La respuesta va a ser interesante.

Cómo decidir sin volverte rehén del titular

Una forma práctica de encarar esto, en orden:

Elige el proceso, no la tecnología. Toma una tarea que sea repetitiva, tenga regla clara y consuma horas de gente cara. Presupuestos, filtrado de correos, revisión de documentos, respuesta de primera línea. Si la tarea exige juicio fino o el error sale demasiado caro, déjala para después.

Arma todo para poder cambiar de motor. Eso es responsabilidad de quien construye, pero tú puedes exigirlo. La pregunta correcta para tu proveedor es: "si sale un modelo mejor o más barato en tres meses, ¿cuánto trabajo cuesta cambiarlo?". Si la respuesta es "rehacemos todo", el proyecto está mal diseñado.

Mide antes de empezar. ¿Cuánto tiempo toma esa tarea hoy? ¿Cuántos errores pasan al mes? Sin esos dos números no vas a poder probar que la automatización valió la pena, y vas a terminar decidiendo por sensación.

Deja a un humano en el punto de decisión. No porque la IA sea tonta, sino porque la responsabilidad sigue siendo tuya. El agente prepara, la persona aprueba. Funciona mejor y se duerme mejor.

Qué haría yo en tu lugar

Ignora el ranking por seis meses. Va a cambiar de nuevo, probablemente antes de eso.

Usa ese tiempo para elegir un proceso, documentar cómo funciona de verdad (no como está en el manual) y limpiar los datos que usa. Cuando eso esté listo, conectar un agente encima se vuelve cuestión de semanas, y vas a poder cambiar el modelo cuantas veces quieras sin rehacer nada.

La parte difícil de la automatización nunca fue la IA. Siempre fue entender tu propio proceso lo suficiente para explicárselo a alguien que nunca trabajó en tu empresa. Resulta que ahora ese alguien es una máquina, y es bastante literal.

Si tienes un proceso en mente y quieres una opinión honesta sobre si vale la pena automatizarlo, cuéntame qué haces hoy. A veces la respuesta es una hoja de cálculo mejor, y también lo digo.

Resumen para LinkedIn

En abril aprobaste un proyecto de automatización con "el mejor modelo del mercado". En agosto el mejor es otro, y probablemente chino.

Qwen3.8 Max se quedó con la cima del ranking de agentes. Tercer cambio de líder en el año.

Pero en casi todo proyecto de automatización que vi fracasar, el modelo nunca fue el culpable. Fueron datos desordenados, procesos que nadie sabe explicar por escrito y sistemas sin integración.

Un cliente mío bajó el presupuesto de 2 días a 20 minutos. Lo que lo hizo funcionar fue un mes limpiando el catálogo y definiendo reglas, no la IA de moda. El modelo ya cambió dos veces desde entonces y el cambio tomó una tarde.

Ignora el ranking por seis meses. Usa ese tiempo para entender tu propio proceso.

Si tienes una tarea repetitiva en mente y quieres una opinión honesta sobre si vale la pena automatizarla, escríbeme. A veces la respuesta es una hoja de cálculo mejor, y también lo digo.

#InteligenciaArtificial #Automatizacion #Productividad #Tecnologia #Negocios