MODELOS IA / COMPARATIVA
Modelos IA
Benchmarks de los modelos que dan capacidades a los entornos. Datos de Artificial Analysis, filtrados por herramientas y tareas reales.

COMPARATIVA AGÉNTICA
Los modelos más potentes para capacidades agénticas
20 modelos ordenados por el Agentic Index de Artificial Analysis, el composite que mide trabajo agéntico real (GDPval-AA v2 + 𝜏³-Banking). Incluye costo por tarea y tokens por segundo.



El Agentic Index mide cuán bien un modelo trabaja con herramientas en tareas reales: tool use, planificación y ejecución multi-paso. TerminalBench v2.1 (TB) y el Intelligence Index (INT) acompañan como contexto; un modelo con alto INT pero bajo AG puede ser excelente conversando pero ineficaz operando agentes.
RANKING POR RUBRO
Los mejores en cada categoría
Top modelos por métrica individual. Cada rubro mide algo distinto — ningún modelo domina todos.
TerminalBench v2.1
- 1GPT-5.6 Sol (xhigh)OpenAI
- 2
- 3Grok 4.6 (high)SpaceXAI
- 4GPT-5.6 Terra (max)OpenAI
- 5GPT-5.6 Sol (max)OpenAI
- 6
- 7Grok 4.6 (xhigh)SpaceXAI
- 8
- 9GPT-5.6 Sol (high)OpenAI
- 10GPT-5.6 Sol (medium)OpenAI
Humanity's Last Exam
- 1
- 2
- 3
- 4
- 5
- 6GPT-5.6 Sol (max)OpenAI
- 7
- 8Gemini 3.7 Flash (high)Google
- 9GPT-5.6 Sol (xhigh)OpenAI
- 10Gemini 3.1 Pro PreviewGoogle
Intelligence Index
- 1
- 2
- 3
- 4
- 5GPT-5.6 Sol (max)OpenAI
- 6Grok 4.6 (high)SpaceXAI
- 7Grok 4.6 (xhigh)SpaceXAI
- 8Kimi K3 (max)Kimi OW
- 9GLM-5.3 (max)Z AI OW
- 10GPT-5.6 Sol (xhigh)OpenAI
Coding Index
- 1GPT-5.6 Sol (xhigh)OpenAI
- 2
- 3GPT-5.6 Sol (max)OpenAI
- 4GPT-5.6 Sol (high)OpenAI
- 5
- 6Grok 4.6 (high)SpaceXAI
- 7GPT-5.6 Terra (max)OpenAI
- 8
- 9
- 10GPT-5.6 Sol (medium)OpenAI
Tau2
- 1GLM-5.2 (max)Z AI OW
- 2GLM-4.7-Flash (Reasoning)Z AI OW
- 3
- 4GLM 5V Turbo (Reasoning)Z AI OW
- 5GLM-5-TurboZ AI OW
- 6GLM-5 (Reasoning)Z AI OW
- 7Grok 4.3 (high)SpaceXAI
- 8GLM-5.1 (Reasoning)Z AI OW
- 9Qwen3.6 PlusAlibaba
- 10GLM-5 (Non-reasoning)Z AI OW
GPQA
- 1Grok 4.6 (high)SpaceXAI
- 2Gemini 3.7 Flash (high)Google
- 3GPT-5.6 Sol (max)OpenAI
- 4Gemini 3.1 Pro PreviewGoogle
- 5
- 6
- 7Grok 4.6 (xhigh)SpaceXAI
- 8Grok 4.6 (medium)SpaceXAI
- 9Kimi K3 (max)Kimi OW
- 10Qwen3.8 2.4T A95BAlibaba OW
OPEN WEIGHTS
Modelos con Parámetros Abiertos OpenWeight
Pesos descargables con licencia abierta. Para quienes quieren correr modelos en su propia infraestructura o usarlos con harnesses open source.
GLOSARIO DE CAMPO
Ocho términos para leer la tabla sin perderte
- Agentic Index
- Score compuesto de Artificial Analysis que mide trabajo agéntico real: tool use, planificación, autonomía y ejecución multi-paso. Combina GDPval-AA v2 y 𝜏³-Banking. Escala 0–100.
- Intelligence Index
- Score compuesto de Artificial Analysis que mide capacidad general. Escala 0–100.
- Coding Index
- Score compuesto de capacidad de código. Escala 0–100.
- TerminalBench v2.1
- Mide si el modelo completa tareas reales en terminal: instalar dependencias, editar código, correr tests. La métrica agéntica más actualizada (sucesora de TerminalBench Hard).
- Humanity's Last Exam (HLE)
- El examen de frontera de Artificial Analysis: preguntas durísimas que abarcan todo el conocimiento humano. La vara más exigente de capacidad general. Escala 0–1.
- Tau2
- Tareas multi-turno con herramientas. Mide retención, uso de tools y razonamiento en cadena.
- GPQA
- Preguntas de nivel postgrado en ciencia. Evalúa razonamiento profundo. Escala 0–1.
- LiveCodeBench
- Problemas de código reales y actualizados. Escala 0–1.
- Open Weights
- Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura.
- Velocidad
- Tokens de salida por segundo. Más alto = respuestas más rápidas.
