MODELOS / CEREBROS DEL ENTORNO

Modelos (Cerebros)

Benchmarks en vivo de los modelos que dan capacidades a los entornos agénticos. Datos de Artificial Analysis, filtrados por herramientas y tareas reales.

Benchmarks verificablesCATÁLOGO / 22 MODELOS
Balanza editorial que contrapone pesos abiertos y documentación de modelos
MODELOS / 001OPEN WEIGHTS · BENCHMARKS · CONTEXTO

COMPARATIVA AGÉNTICA

Los modelos más potentes para capacidades agénticas

22 modelos ordenados por TerminalBench Hard. Filtrados por creadores cuyos modelos se usan con harnesses agénticos.

ACTUALIZADO03 ago 2026, 03:57 p.m.FUENTE: Artificial Analysis
#MODELOCREADORINTEL.?Intelligence Index Score compuesto que mide capacidad general. Escala 0–100.CODING?Coding Index Score compuesto de capacidad de código. Escala 0–100.TERMINALBENCH?TerminalBench Hard Tareas reales en terminal: instalar dependencias, editar código, correr tests. La métrica más agéntica.TAU2?Tau2 Tareas multi-turno con herramientas. Mide retención, uso de tools y razonamiento en cadena.IN $/M?Precio entrada Costo por millón de tokens de entrada (input).OUT $/M?Precio salida Costo por millón de tokens de salida (output).VEL.?Velocidad Tokens de salida por segundo. Más alto = respuestas más rápidas.
1GPT-5.6 Sol (max)OpenAI597765.9%85.1%$5$3078
2GPT-5.6 Sol (medium)OpenAI547662.9%81.0%$5$3070
3GPT-5.6 Terra (xhigh)OpenAI527162.9%80.4%$2$12121
4Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic607762.9%98.5%$10$5071
5GPT-5.6 Sol (high)OpenAI567762.1%83.3%$5$3074
6GPT-5.6 Sol (xhigh)OpenAI587861.4%84.8%$5$3073
7GPT-5.6 Sol (low)OpenAI497060.6%76.0%$5$3070
8Claude Opus 4.8 (Adaptive Reasoning, Max Effort)Anthropic567458.3%94.4%$5$250
9Claude Opus 4.7 (Non-reasoning, High Effort)Anthropic4354.5%74.0%$5$250
10Gemini 3.1 Pro PreviewGoogle476953.8%95.6%$2$12130
11Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort)Anthropic476353.0%75.7%$3$150
12Claude Opus 4.7 (Adaptive Reasoning, Max Effort)Anthropic547451.5%88.6%$5$250
13GLM-5.2 (max)OW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura.Z AI516950.8%99.1%$1.4$4.4194
14Qwen3.7 MaxOW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura.Alibaba466650.8%94.7%$2.5$7.5204
15Claude Opus 4.6 (Non-reasoning, High Effort)Anthropic3848.5%84.8%$5$250
16Qwen3.7 PlusOW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura.Alibaba395647.0%93.0%$0.4$1.652
17Gemini 3.5 Flash (minimal)Google3546.2%58.8%$1.5$9249
18DeepSeek V4 Pro (Reasoning, Max Effort)OW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura.DeepSeek445946.2%96.2%$0.435$0.8760
19Muse SparkOW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura.Meta435945.5%91.5%$0$00
20Kimi K2.7 CodeOW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura.Kimi426144.7%90.1%$0.95$439
21Qwen3.6 PlusOW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura.Alibaba405543.9%97.7%$0.5$355
22Kimi K2.6OW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura.Kimi446243.9%95.9%$0.95$40

TerminalBench y Tau2 son las métricas más representativas para uso agéntico. Un modelo con alto Intelligence Index pero bajo TerminalBench puede ser excelente conversando pero ineficaz operando herramientas.

RANKING POR RUBRO

Los mejores en cada categoría

Top modelos por métrica individual. Cada rubro mide algo distinto — ningún modelo domina todos.

TerminalBench Hard?TerminalBench Hard Tareas reales en terminal: instalar dependencias, editar código, correr tests. La métrica más agéntica.

15
  1. 1
    65.9%
  2. 2
    62.9%
  3. 3
    62.9%
  4. 4
    62.9%
  5. 5
    62.1%
  6. 6
    61.4%
  7. 7
    60.6%
  8. 8
    60.6%
  9. 9
    59.8%
  10. 10
    58.3%
  11. 11
    57.6%
  12. 12
    57.6%
  13. 13
    57.6%
  14. 14
    57.6%
  15. 15
    54.5%

Intelligence Index?Intelligence Index Score compuesto de Artificial Analysis que mide capacidad general. Escala 0–100.

10
  1. 1
    60
  2. 2
    59
  3. 3
    58
  4. 4
    56
  5. 5
    56
  6. 6
    55
  7. 7
    55
  8. 8
    54
  9. 9
    54
  10. 10
    53

Tau2?Tau2 Tareas multi-turno con herramientas. Mide retención, uso de tools y razonamiento en cadena.

10
  1. 1
    99.1%
  2. 2
    98.8%
  3. 3
    98.5%
  4. 4
    98.5%
  5. 5
    98.5%
  6. 6
    98.2%
  7. 7
    97.7%
  8. 8
    97.7%
  9. 9
    97.7%
  10. 10
    97.4%

OPEN WEIGHTS

Modelos que puedes desplegar

Pesos descargables con licencia abierta. Para quienes quieren correr modelos en su propia infraestructura o usarlos con harnesses open source.

#MODELOCREADORINTEL.?Intelligence Index Score compuesto que mide capacidad general. Escala 0–100.CODING?Coding Index Score compuesto de capacidad de código. Escala 0–100.TERMINALBENCH?TerminalBench Hard Tareas reales en terminal: instalar dependencias, editar código, correr tests. La métrica más agéntica.TAU2?Tau2 Tareas multi-turno con herramientas. Mide retención, uso de tools y razonamiento en cadena.IN $/M?Precio entrada Costo por millón de tokens de entrada (input).OUT $/M?Precio salida Costo por millón de tokens de salida (output).VEL.?Velocidad Tokens de salida por segundo. Más alto = respuestas más rápidas.
1GLM-5.2 (max)OW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura.Z AI516950.8%99.1%$1.4$4.4194
2Qwen3.7 MaxOW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura.Alibaba466650.8%94.7%$2.5$7.5204
3Qwen3.7 PlusOW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura.Alibaba395647.0%93.0%$0.4$1.652
4DeepSeek V4 Pro (Reasoning, Max Effort)OW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura.DeepSeek445946.2%96.2%$0.435$0.8760
5Muse SparkOW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura.Meta435945.5%91.5%$0$00
6Kimi K2.7 CodeOW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura.Kimi426144.7%90.1%$0.95$439
7Qwen3.6 PlusOW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura.Alibaba405543.9%97.7%$0.5$355
8Kimi K2.6OW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura.Kimi446243.9%95.9%$0.95$40
9Qwen3.6 Max PreviewOW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura.Alibaba4043.9%95.9%$1.3$7.80
10GLM-5 (Reasoning)OW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura.Z AI4043.2%98.2%$1$3.20
11GLM-5.1 (Reasoning)OW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura.Z AI405643.2%97.7%$1.38$4.40
12MiniMax-M3OW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura.MiniMax445942.4%88.9%$0.3$1.287

GLOSARIO DE CAMPO

Ocho términos para leer la tabla sin perderte

Intelligence Index
Score compuesto de Artificial Analysis que mide capacidad general. Escala 0–100.
Coding Index
Score compuesto de capacidad de código. Escala 0–100.
TerminalBench Hard
Mide si el modelo completa tareas reales en terminal: instalar dependencias, editar código, correr tests. La métrica más agéntica.
Tau2
Tareas multi-turno con herramientas. Mide retención, uso de tools y razonamiento en cadena.
GPQA
Preguntas de nivel postgrado en ciencia. Evalúa razonamiento profundo. Escala 0–1.
LiveCodeBench
Problemas de código reales y actualizados. Escala 0–1.
Open Weights
Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura.
Velocidad
Tokens de salida por segundo. Más alto = respuestas más rápidas.
Ver señales relacionadas