Volver al blog
IABenchmarksEstrategia

Grok 4.6 sacó 61 en el ranking de IA. ¿Qué cambia para ti?

21 de agosto de 2026·6 min de lectura·Diego Horvatti

Cada semana llega un mensaje a mi WhatsApp con una captura de un ranking y la pregunta: "Diego, ¿vale la pena cambiar a este?". Esta vez la captura era de Grok 4.6, el nuevo modelo de xAI, que marcó 61 puntos en el Artificial Analysis Intelligence Index. Es un buen número. Coloca al modelo en el grupo de élite, peleando con los mejores del mercado. Pero antes de sacar la tarjeta de crédito, vale la pena entender qué mide ese 61, qué no mide y cómo se conecta con tu facturación.

Qué es el Artificial Analysis Intelligence Index

Artificial Analysis es una empresa independiente que prueba modelos de IA de la forma más comparable posible entre sí. Toman un conjunto de pruebas estandarizadas: razonamiento, matemáticas, programación, conocimiento general, capacidad de seguir instrucciones largas, uso de herramientas. Ejecutan todo en las mismas condiciones y lo juntan en una sola nota, de 0 a 100.

Grok 4.6 sacó 61. Para dar escala: los modelos de punta hoy están en la franja de los 60 y pico. Los modelos buenos y baratos quedan entre 40 y 50. Los modelos de hace un año y medio, que en su momento parecían magia, quedan por debajo de 40.

Así que sí, es un resultado de primera línea. xAI pasó de ser "el chatbot de Twitter" a un competidor de verdad en poco más de dos años.

Solo que hay un detalle que la captura no muestra.

Lo que la nota esconde

El índice es un promedio. Y el promedio esconde cosas.

Un modelo puede ser brillante en matemáticas y mediocre siguiendo instrucciones de formato. Otro puede ser excelente escribiendo texto en español y flojo en código. Los dos pueden tener la misma nota final.

En el caso de Grok 4.6, lo que llamó la atención en el informe fue la combinación de dos cosas: nota alta y velocidad alta. Responde rápido y piensa bien. Eso es raro. Normalmente, cuanto más "piensa" el modelo antes de responder, más lento y más caro se vuelve.

Pero el informe también muestra dónde gasta más tokens que la competencia para llegar a la misma respuesta. En lenguaje de dueño de negocio: la cuenta a fin de mes puede ser mayor de lo que sugiere el precio por millón de tokens, porque el modelo habla de más para resolver la misma tarea.

El ranking mide el examen. Tu negocio mide el resultado.

Esa distinción vale más que cualquier benchmark.

Por qué el mejor modelo del ranking puede ser la peor elección para ti

Te cuento un caso real, con los nombres cambiados.

Una clínica odontológica me contactó a principios de año. Querían automatizar la clasificación de mensajes en WhatsApp: identificar si es una cita, una duda sobre el seguro, un presupuesto o una queja, y derivarlo al lugar correcto. Volumen: unos 400 mensajes por día.

El socio había visto un ranking y quería "el mejor". El mejor en ese momento costaba unos 15 dólares por millón de tokens de salida.

Probamos tres modelos con 200 mensajes reales de la clínica. Resultado:

  • Modelo de punta: acertó el 97% de las clasificaciones.
  • Modelo intermedio: acertó el 96%.
  • Modelo barato: acertó el 94%.

La diferencia entre el primero y el segundo era de dos mensajes en 200. El costo era siete veces mayor. Cerramos con el intermedio. Ahorro de más de 600 reales al mes en una operación pequeña, sin pérdida perceptible.

Clasificar mensajes de pacientes no es lo mismo que resolver un problema de matemáticas olímpicas. El ranking evalúa lo segundo. Tú necesitas lo primero.

Cuándo el ranking importa de verdad

No quiero que salgas de aquí pensando que el benchmark es inútil. Importa en tres situaciones:

Cuando la tarea es difícil de verdad. Análisis de contratos con cláusulas cruzadas, código complejo, informes que exigen cruzar varias fuentes. Ahí la diferencia entre 55 y 61 aparece en la práctica, y aparece en errores que cuestan caro.

Cuando vas a usar agentes. Un agente es ese sistema que ejecuta tareas en varias etapas por sí solo: abre una planilla, consulta una API, toma una decisión, sigue. Un error en la etapa 2 contamina todo lo que viene después. Los modelos más fuertes se equivocan menos en el camino, y eso se acumula.

Cuando no tienes cómo probar antes. Si no puedes correr un piloto con tus datos, el ranking es la mejor aproximación que existe. Mejor que la publicidad de la empresa, sin duda.

Fuera de eso, el ranking es solo curiosidad. Buena curiosidad, pero curiosidad.

Cómo elegir el modelo correcto sin volverte especialista

Aquí va el proceso que uso con clientes, reducido a lo esencial:

  1. Define la tarea con precisión. "Usar IA en la atención al cliente" no es una tarea. "Clasificar mensajes en 5 categorías" sí lo es.
  2. Junta de 100 a 200 ejemplos reales. De tus datos, no de ejemplos de internet. Mensajes de tus clientes, tus documentos, tus planillas.
  3. Prueba 3 modelos de rangos de precio distintos. Uno de punta, uno intermedio, uno barato.
  4. Mide acierto y costo lado a lado. Si el barato acierta el 94% y el caro el 97%, pregúntate: ¿cuánto cuesta cada error? A veces vale la pena pagar. La mayoría de las veces, no.
  5. Deja el cambio fácil. Usa una capa que permita cambiar de modelo sin reescribir todo. En tres meses el ranking cambia otra vez y no quieres rehacer el sistema.

Ese último punto es el que más dinero ahorra a largo plazo. El Grok 4.6 de hoy es el modelo intermedio de mañana. Ya lo vi pasar con cada modelo que algún día fue "el mejor".

¿Y Grok 4.6, vale la pena?

Mi opinión honesta: vale la pena probarlo si ya tienes algo funcionando y quieres comparar. No vale la pena cambiar por impulso.

El modelo es competente, rápido y xAI ha invertido fuerte en infraestructura. Pero es una empresa joven, con historial de cambios bruscos de dirección, y el ecosistema de herramientas a su alrededor todavía es menor que el de los competidores. Para una empresa que depende de que el sistema funcione todos los días, la estabilidad del proveedor pesa tanto como la nota en el ranking.

Si tu operación de IA depende de un número que cambia cada semana, el problema no es el modelo. Es la falta de método para elegir.

Es exactamente este tipo de decisión la que ayudo a tomar a las empresas: probar con datos reales, medir lo que importa y montar una automatización que no se rompe cuando el ranking cambia. Si quieres conversar sobre tu caso, conóceme mejor aquí.

Resumen para LinkedIn

Grok 4.6 sacó 61 en el ranking de IA. ¿Y qué?

Cada semana recibo una captura de un ranking por WhatsApp con la misma pregunta: "Diego, ¿vale la pena cambiar?"

El ranking mide el examen. Tu negocio mide el resultado.

Probé tres modelos con 200 mensajes reales de una clínica: el de punta acertó el 97%, el intermedio el 96%, el barato el 94%. El más caro costaba siete veces más por dos mensajes de diferencia.

Si tu operación de IA depende de un número que cambia cada semana, el problema no es el modelo. Es la falta de método para elegir.

¿Quieres saber cómo elegir con datos reales en vez de capturas? Escríbeme.

#InteligenciaArtificial #Automatizacion #IAparaNegocios #Grok #Tecnologia