MODELOS IA / COMPARATIVA

Modelos IA

Benchmarks de los modelos que dan capacidades a los entornos. Datos de Artificial Analysis, filtrados por herramientas y tareas reales.

Benchmarks verificablesCATÁLOGO / 20 MODELOS
Balanza editorial que contrapone pesos abiertos y documentación de modelos
MODELOS / 001OPEN WEIGHTS · BENCHMARKS · CONTEXTO

COMPARATIVA AGÉNTICA

Los modelos más potentes para capacidades agénticas

20 modelos ordenados por el Agentic Index de Artificial Analysis, el composite que mide trabajo agéntico real (GDPval-AA v2 + 𝜏³-Banking). Incluye costo por tarea y tokens por segundo.

ACTUALIZADO25 ago 2026, 12:00 p.m.FUENTE: Artificial Analysis Agentic Index
#MODELOMÉTRICASCOSTO / VEL.
🥇
Anthropic
Claude Opus 5 (max)Anthropic
AG
59.2
TB
89.1%
INT
63
TAREA $5 / $25TOK 54/s54 t/s
🥈
Z AI
GLM-5.3 (max)Z AI
AG
59.1
TB
83.9%
INT
60
TAREA $1.32TOK ——
🥉
SpaceXAI
Grok 4.6 (high)SpaceXAI
AG
58.7
TB
88.4%
INT
61
TAREA $1.95TOK 62/s54 t/s
04
OpenAI
GPT-5.6 Sol (max)OpenAI
AG
57.8
TB
88.0%
INT
61
TAREA $2.06TOK 74/s62 t/s
05
Alibaba
Qwen3.8 2.4T A95BAlibaba
AG
57.1
TB
82.0%
INT
58
TAREA $2 / $6TOK 27/s27 t/s
06
Anthropic
Claude Fable 5 (with fallback)Anthropic
AG
56.6
TB
84.6%
INT
62
TAREA $10 / $50TOK 66/s66 t/s
07
Kimi
Kimi K3 (max)Kimi
AG
54.3
TB
85.0%
INT
60
TAREA $1.64TOK 35/s35 t/s
08
Alibaba
Qwen3.8 27B (xhigh)Alibaba
AG
50.9
TB
79.8%
INT
52
TAREA $0.38TOK 52/s52 t/s
09
OpenAI
GPT-5.6 Terra (max)OpenAI
AG
50.2
TB
88.0%
INT
57
TAREA $0.89TOK 122/s114 t/s
10
DeepSeek
DeepSeek V4 Pro 0813 (max)DeepSeek
AG
49.6
TB
78.7%
INT
53
TAREA $0.37TOK 69/s69 t/s
11
Meta
Muse Spark 1.2 (xhigh)Meta
AG
49.3
TB
80.1%
INT
57
TAREA $0.61TOK ——
12
OpenAI
GPT-5.6 Luna (max)OpenAI
AG
46.9
TB
80.9%
INT
52
TAREA $0.08TOK 141/s139 t/s
13
Google
Gemini 3.7 Flash (high)Google
AG
45.1
TB
85.8%
INT
56
TAREA $0.82TOK 358/s358 t/s
14
Motif Technologies
Motif 3Motif Technologies
AG
37.6
TB
74.9%
INT
47
TAREA $0 / $0TOK ——
15
MiniMax
MiniMax-M3MiniMax
AG
36.1
TB
65.2%
INT
45
TAREA $0.21TOK 126/s139 t/s
16
Thinking Machines
InklingThinking Machines
AG
34.1
TB
55.1%
INT
42
TAREA $0.44TOK 49/s47 t/s
17
Upstage
Solar Open2 250BUpstage
AG
27.8
TB
44.2%
INT
37
TAREA $0 / $0TOK ——
18
NVIDIA
Nemotron 3 UltraNVIDIA
AG
27.5
TB
53.9%
INT
38
TAREA $0.49TOK 168/s155 t/s
19
Google
Gemini 3.5 Flash-LiteGoogle
AG
27.2
TB
53.6%
INT
37
TAREA $0.13TOK 382/s364 t/s
20
SK Telecom
A.X-K2SK Telecom
AG
25.7
TB
39.0%
INT
35
TAREA $0 / $0TOK ——

El Agentic Index mide cuán bien un modelo trabaja con herramientas en tareas reales: tool use, planificación y ejecución multi-paso. TerminalBench v2.1 (TB) y el Intelligence Index (INT) acompañan como contexto; un modelo con alto INT pero bajo AG puede ser excelente conversando pero ineficaz operando agentes.

RANKING POR RUBRO

Los mejores en cada categoría

Top modelos por métrica individual. Cada rubro mide algo distinto — ningún modelo domina todos.

OPEN WEIGHTS

Modelos con Parámetros Abiertos OpenWeight

Pesos descargables con licencia abierta. Para quienes quieren correr modelos en su propia infraestructura o usarlos con harnesses open source.

#MODELOMÉTRICASPRECIO / VEL.
🥇
Kimi
Kimi K3 (max)OpenWeightKimi
TB
85.0%
INT
60
COD
76
IN $3OUT $1535 t/s
🥈
Z AI
GLM-5.3 (max)OpenWeightZ AI
TB
83.9%
INT
60
COD
75
IN $1.4OUT $4.4—
🥉
Kimi
Kimi K3 (low)OpenWeightKimi
TB
82.4%
INT
48
COD
72
IN $3OUT $1532 t/s
04
Alibaba
Qwen3.8 2.4T A95BOpenWeightAlibaba
TB
82.0%
INT
58
COD
72
IN $2OUT $627 t/s
05
Meta
Muse Spark 1.2 (xhigh)OpenWeightMeta
TB
80.1%
INT
57
COD
72
IN $1.25OUT $4.25—
06
Alibaba
Qwen3.8 27B (xhigh)OpenWeightAlibaba
TB
79.8%
INT
52
COD
68
IN $0.5OUT $352 t/s
07
DeepSeek
DeepSeek V4 Pro 0813 (Reasoning, Max Effort)OpenWeightDeepSeek
TB
78.7%
INT
53
COD
69
IN $1.32OUT $3.9669 t/s
08
DeepSeek
DeepSeek V4 Flash 0731 (Reasoning, Max Effort)OpenWeightDeepSeek
TB
78.7%
INT
52
COD
69
IN $0.44OUT $1.32109 t/s
09
Z AI
GLM-5.2 (max)OpenWeightZ AI
TB
77.9%
INT
53
COD
69
IN $1.4OUT $4.4—
10
Meta
Muse Spark 1.1 (xhigh)OpenWeightMeta
TB
77.9%
INT
53
COD
71
IN $1.25OUT $4.25—
11
Kimi
Kimi K2.7 CodeOpenWeightKimi
TB
67.4%
INT
43
COD
61
IN $0.95OUT $443 t/s
12
Alibaba
Qwen3.8 27B (low)OpenWeightAlibaba
TB
67.4%
INT
43
COD
58
IN $0.5OUT $358 t/s

GLOSARIO DE CAMPO

Ocho términos para leer la tabla sin perderte

Agentic Index
Score compuesto de Artificial Analysis que mide trabajo agéntico real: tool use, planificación, autonomía y ejecución multi-paso. Combina GDPval-AA v2 y 𝜏³-Banking. Escala 0–100.
Intelligence Index
Score compuesto de Artificial Analysis que mide capacidad general. Escala 0–100.
Coding Index
Score compuesto de capacidad de código. Escala 0–100.
TerminalBench v2.1
Mide si el modelo completa tareas reales en terminal: instalar dependencias, editar código, correr tests. La métrica agéntica más actualizada (sucesora de TerminalBench Hard).
Humanity's Last Exam (HLE)
El examen de frontera de Artificial Analysis: preguntas durísimas que abarcan todo el conocimiento humano. La vara más exigente de capacidad general. Escala 0–1.
Tau2
Tareas multi-turno con herramientas. Mide retención, uso de tools y razonamiento en cadena.
GPQA
Preguntas de nivel postgrado en ciencia. Evalúa razonamiento profundo. Escala 0–1.
LiveCodeBench
Problemas de código reales y actualizados. Escala 0–1.
Open Weights
Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura.
Velocidad
Tokens de salida por segundo. Más alto = respuestas más rápidas.
Ver señales relacionadas