Agentes de IA: el ranking cambió, ¿y ahora?
Elegiste una herramienta de IA hace seis meses. Pagaste, capacitaste al equipo, la integraste al sistema. Ayer salió un ranking nuevo y tu elección ya no está en primer lugar. ¿Y ahora, tiras todo a la basura?
No. Pero vale la pena entender qué pasó, porque va a volver a pasar. El ranking de agentes de IA de Artificial Analysis, que mide qué tan bien los modelos ejecutan tareas de verdad en lugar de solo responder preguntas, puso a Qwen3.8 Max en la cima. Es un modelo chino, de Alibaba. Superó a los nombres que probablemente conoces. Y dentro de tres meses probablemente otro lo supere a él.
Esa es la noticia real. No es cuál modelo ganó. Es la velocidad con la que el podio cambia de dueño.
Qué es un "índice agéntico" y por qué importa más
Los primeros rankings de IA medían conocimiento. Preguntaban cosas y veían quién acertaba más. Lindo de ver, pero casi inútil para quien tiene una empresa.
El índice agéntico mide otra cosa: si el modelo logra hacer algo. Abrir un sistema, buscar un dato, compararlo con otro, tomar una decisión, ejecutar. Una secuencia de pasos donde cada error contamina el siguiente.
Es la diferencia entre un pasante que sabe mucho y un pasante que resuelve el problema solo. El primero es agradable en el almuerzo. Al segundo no lo despides.
En la práctica, ese índice responde la pregunta que interesa: ¿este modelo aguanta una tarea de diez etapas sin perderse en el camino? Porque es lo que tu operación necesita. Nadie automatiza "escribir un texto". Automatiza "recibir el pedido, revisar el stock, generar la factura, avisar al cliente, actualizar la planilla".
¿Qué dice que un modelo chino esté en primer lugar?
Dice que el tema se volvió un commodity más rápido de lo que mucha gente esperaba.
Hace dos años existía una diferencia clara entre el líder y el resto. Hoy existe un pelotón. Cinco o seis modelos peleando por décimas, con cambios de posición en cada lanzamiento. Algunos de ellos con precios que son una fracción de lo que se cobraba.
Eso es buenísimo para ti y pésimo para quien apostó todo a un solo proveedor.
Cuando el líder cambia cada trimestre, elegir al líder deja de ser estrategia.
Está la cuestión de dónde corren los datos, claro. Si vas a procesar información sensible de clientes, el país del servidor importa, e importa jurídicamente. Pero eso es una decisión de arquitectura, no un motivo para ignorar lo que está pasando. Varios de esos modelos corren en local o en nube local. Ya escribí sobre eso.
El error que veo cometer a las empresas
Voy a ser directo porque es lo que más aparece en las conversaciones que tengo.
La empresa contrata una herramienta de IA, y la herramienta viene con un modelo incorporado, elegido por el proveedor. No se puede cambiar. Entonces el modelo se queda atrás, o triplica su precio, y descubres que toda tu automatización depende de una decisión que tomó otra persona.
Vi a una distribuidora que armó todo el filtrado de pedidos por WhatsApp sobre una plataforma cerrada. Funcionó bien durante ocho meses. Después el proveedor cambió el plan, el costo por conversación subió, y cambiar significaba rehacer todo desde cero. Sacaron las cuentas: unos 40 días de trabajo para migrar algo que tomó 12 días construir.
El problema no fue la elección del modelo. Fue no haber dejado la puerta abierta.
Cómo armar una automatización que sobreviva al próximo cambio de líder
La regla es simple: el modelo es una pieza, no el cimiento.
Lo que hace funcionar tu automatización no es el modelo. Es lo que está alrededor:
- Los datos. De dónde viene la información, cómo llega limpia, quién la mantiene.
- Las reglas. Qué puede y qué no puede hacer el agente. Dónde se detiene y llama a un humano.
- Las pruebas. Un conjunto de casos reales de tu empresa que corres contra cualquier modelo nuevo.
- El punto de cambio. Un único lugar en el código donde se elige el modelo.
Si esos cuatro están en pie, cambiar de modelo es una tarde de trabajo. Tomas al nuevo líder del ranking, corres tus treinta casos de prueba, comparas resultado y costo, y decides. Sin drama.
Si no están, cada cambio es un proyecto.
El punto de cambio es la parte más barata y la que más gente se salta. En concreto: en lugar de esparcir llamadas al modelo por quince archivos, las concentras en uno. Todo el resto del sistema habla con ese uno. Cambiar el motor pasa a ser modificar una línea. Cuesta casi nada hacerlo al principio, cuesta semanas hacerlo después.
¿Y las pruebas? Cómo saber si el modelo nuevo es mejor para ti
El ranking público mide tareas genéricas. Tu empresa no es genérica.
Arma tu propio conjunto. No necesita ser sofisticado. Toma de 20 a 40 casos reales que ya ocurrieron, con la respuesta correcta que tú ya conoces. Pedidos confusos, correos ambiguos, facturas con datos faltantes. Las situaciones que dan trabajo.
Entonces, cuando salga un modelo nuevo, corres los 30 casos y miras tres números:
- Cuántos acertó. Obvio, pero tiene que estar escrito.
- Cuánto costó. Suma el costo de los 30 y multiplícalo por tu volumen mensual.
- Cuánto tardó. Si el cliente espera respuesta por WhatsApp, 40 segundos es distinto de 4.
Un modelo que acierta un 2% más y cuesta tres veces más no es mejor para ti. Es mejor en el ranking. Son cosas distintas.
Ya vi el caso de un modelo más barato ganarle al "mejor del mundo" en una tarea específica de extracción de datos de facturas, simplemente porque la tarea era estrecha y el modelo caro gastaba razonamiento al pedo. El ranking no sabía eso. Los 30 casos sí.
Qué hacer esta semana
Si ya tienes alguna automatización con IA funcionando, tres preguntas:
¿Sabes qué modelo hay detrás? Si la respuesta es "creo que es el de OpenAI, pero no estoy seguro", ya es una señal.
¿Puedes cambiarlo? Pregúntale al proveedor o a quien lo construyó. Si la respuesta viene con "ahí habría que rehacerlo", ya sabes el tamaño del riesgo.
¿Tienes cómo comparar? Si nadie escribió nunca los casos de prueba, escríbelos. Una tarde con quien hace el trabajo a mano, listando los casos que suelen dar problemas. Es el activo más duradero de todo el proyecto, porque sobrevive a cualquier cambio de modelo.
Y si todavía no tienes nada funcionando, buenísimo. Empiezas ya con la estructura correcta, sin la deuda técnica de nadie.
El ranking va a cambiar de nuevo. Probablemente antes de Navidad. La pregunta no es quién va a estar en la cima. Es si, cuando eso pase, vas a tener que leer la noticia con miedo o con curiosidad.
Si quieres conversar sobre cómo está armada tu automatización, o cómo armar una que no te ate, échale un vistazo a quién soy y mándame un mensaje.
Resumen para LinkedIn
Elegiste una herramienta de IA hace seis meses. Ayer salió un ranking nuevo y ya no está en primer lugar. ¿Y ahora, tiras todo a la basura? No. Pero el mensaje es claro: el podio cambia de dueño cada trimestre. Elegir al líder dejó de ser estrategia. Lo que hace que tu automatización sobreviva no es el modelo. Son los datos, las reglas, las pruebas con casos reales de tu empresa y un único lugar en el código donde se cambia el modelo. Con eso en pie, migrar es una tarde de trabajo. Sin eso, cada cambio se convierte en un proyecto de 40 días. Si quieres, escríbeme para conversar sobre cómo está armada la tuya: se puede descubrir el tamaño del riesgo con tres preguntas. #InteligenciaArtificial #AgentesDeIA #Automatizacion #TransformacionDigital #Tecnologia