MODELOS / CEREBROS DEL ENTORNO
Modelos (Cerebros)
Benchmarks en vivo de los modelos que dan capacidades a los entornos agénticos. Datos de Artificial Analysis, filtrados por herramientas y tareas reales.

COMPARATIVA AGÉNTICA
Los modelos más potentes para capacidades agénticas
22 modelos ordenados por TerminalBench Hard. Filtrados por creadores cuyos modelos se usan con harnesses agénticos.
| # | MODELO | CREADOR | INTEL.?Intelligence Index Score compuesto que mide capacidad general. Escala 0–100. | CODING?Coding Index Score compuesto de capacidad de código. Escala 0–100. | TERMINALBENCH?TerminalBench Hard Tareas reales en terminal: instalar dependencias, editar código, correr tests. La métrica más agéntica. | TAU2?Tau2 Tareas multi-turno con herramientas. Mide retención, uso de tools y razonamiento en cadena. | IN $/M?Precio entrada Costo por millón de tokens de entrada (input). | OUT $/M?Precio salida Costo por millón de tokens de salida (output). | VEL.?Velocidad Tokens de salida por segundo. Más alto = respuestas más rápidas. | |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | GPT-5.6 Sol (max) | OpenAI | 59 | 77 | 65.9% | 85.1% | $5 | $30 | 78 | ↗ |
| 2 | GPT-5.6 Sol (medium) | OpenAI | 54 | 76 | 62.9% | 81.0% | $5 | $30 | 70 | ↗ |
| 3 | GPT-5.6 Terra (xhigh) | OpenAI | 52 | 71 | 62.9% | 80.4% | $2 | $12 | 121 | ↗ |
| 4 | Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | Anthropic | 60 | 77 | 62.9% | 98.5% | $10 | $50 | 71 | ↗ |
| 5 | GPT-5.6 Sol (high) | OpenAI | 56 | 77 | 62.1% | 83.3% | $5 | $30 | 74 | ↗ |
| 6 | GPT-5.6 Sol (xhigh) | OpenAI | 58 | 78 | 61.4% | 84.8% | $5 | $30 | 73 | ↗ |
| 7 | GPT-5.6 Sol (low) | OpenAI | 49 | 70 | 60.6% | 76.0% | $5 | $30 | 70 | ↗ |
| 8 | Claude Opus 4.8 (Adaptive Reasoning, Max Effort) | Anthropic | 56 | 74 | 58.3% | 94.4% | $5 | $25 | 0 | ↗ |
| 9 | Claude Opus 4.7 (Non-reasoning, High Effort) | Anthropic | 43 | — | 54.5% | 74.0% | $5 | $25 | 0 | ↗ |
| 10 | Gemini 3.1 Pro Preview | 47 | 69 | 53.8% | 95.6% | $2 | $12 | 130 | ↗ | |
| 11 | Claude Sonnet 4.6 (Adaptive Reasoning, Max Effort) | Anthropic | 47 | 63 | 53.0% | 75.7% | $3 | $15 | 0 | ↗ |
| 12 | Claude Opus 4.7 (Adaptive Reasoning, Max Effort) | Anthropic | 54 | 74 | 51.5% | 88.6% | $5 | $25 | 0 | ↗ |
| 13 | GLM-5.2 (max)OW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura. | Z AI | 51 | 69 | 50.8% | 99.1% | $1.4 | $4.4 | 194 | ↗ |
| 14 | Qwen3.7 MaxOW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura. | Alibaba | 46 | 66 | 50.8% | 94.7% | $2.5 | $7.5 | 204 | ↗ |
| 15 | Claude Opus 4.6 (Non-reasoning, High Effort) | Anthropic | 38 | — | 48.5% | 84.8% | $5 | $25 | 0 | ↗ |
| 16 | Qwen3.7 PlusOW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura. | Alibaba | 39 | 56 | 47.0% | 93.0% | $0.4 | $1.6 | 52 | ↗ |
| 17 | Gemini 3.5 Flash (minimal) | 35 | — | 46.2% | 58.8% | $1.5 | $9 | 249 | ↗ | |
| 18 | DeepSeek V4 Pro (Reasoning, Max Effort)OW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura. | DeepSeek | 44 | 59 | 46.2% | 96.2% | $0.435 | $0.87 | 60 | ↗ |
| 19 | Muse SparkOW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura. | Meta | 43 | 59 | 45.5% | 91.5% | $0 | $0 | 0 | ↗ |
| 20 | Kimi K2.7 CodeOW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura. | Kimi | 42 | 61 | 44.7% | 90.1% | $0.95 | $4 | 39 | ↗ |
| 21 | Qwen3.6 PlusOW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura. | Alibaba | 40 | 55 | 43.9% | 97.7% | $0.5 | $3 | 55 | ↗ |
| 22 | Kimi K2.6OW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura. | Kimi | 44 | 62 | 43.9% | 95.9% | $0.95 | $4 | 0 | ↗ |
TerminalBench y Tau2 son las métricas más representativas para uso agéntico. Un modelo con alto Intelligence Index pero bajo TerminalBench puede ser excelente conversando pero ineficaz operando herramientas.
RANKING POR RUBRO
Los mejores en cada categoría
Top modelos por métrica individual. Cada rubro mide algo distinto — ningún modelo domina todos.
TerminalBench Hard?TerminalBench Hard Tareas reales en terminal: instalar dependencias, editar código, correr tests. La métrica más agéntica.
15- 1GPT-5.6 Sol (max)OpenAI
- 2GPT-5.6 Sol (medium)OpenAI
- 3GPT-5.6 Terra (xhigh)OpenAI
- 4
- 5GPT-5.6 Sol (high)OpenAI
- 6GPT-5.6 Sol (xhigh)OpenAI
- 7GPT-5.6 Sol (low)OpenAI
- 8GPT-5.5 (xhigh)OpenAI
- 9GPT-5.5 (high)OpenAI
- 10
- 11GPT-5.6 Terra (high)OpenAI
- 12GPT-5.6 Terra (max)OpenAI
- 13GPT-5.4 (xhigh)OpenAI
- 14GPT-5.5 (medium)OpenAI
- 15
Intelligence Index?Intelligence Index Score compuesto de Artificial Analysis que mide capacidad general. Escala 0–100.
10- 1
- 2GPT-5.6 Sol (max)OpenAI
- 3GPT-5.6 Sol (xhigh)OpenAI
- 4GPT-5.6 Sol (high)OpenAI
- 5
- 6GPT-5.6 Terra (max)OpenAI
- 7GPT-5.5 (xhigh)OpenAI
- 8GPT-5.6 Sol (medium)OpenAI
- 9
- 10GPT-5.5 (high)OpenAI
Coding Index?Coding Index Score compuesto de capacidad de código. Escala 0–100.
10- 1GPT-5.6 Sol (xhigh)OpenAI
- 2GPT-5.6 Sol (max)OpenAI
- 3GPT-5.6 Sol (high)OpenAI
- 4GPT-5.6 Terra (max)OpenAI
- 5
- 6GPT-5.6 Sol (medium)OpenAI
- 7GPT-5.5 (xhigh)OpenAI
- 8
- 9
- 10GPT-5.5 (high)OpenAI
Tau2?Tau2 Tareas multi-turno con herramientas. Mide retención, uso de tools y razonamiento en cadena.
10- 1GLM-5.2 (max)Z AI
- 2
- 3
- 4GLM-5-TurboZ AI
- 5
- 6
- 7Qwen3.6 PlusAlibaba
- 8Grok 4.3 (high)SpaceXAI
- 9
- 10
OPEN WEIGHTS
Modelos que puedes desplegar
Pesos descargables con licencia abierta. Para quienes quieren correr modelos en su propia infraestructura o usarlos con harnesses open source.
| # | MODELO | CREADOR | INTEL.?Intelligence Index Score compuesto que mide capacidad general. Escala 0–100. | CODING?Coding Index Score compuesto de capacidad de código. Escala 0–100. | TERMINALBENCH?TerminalBench Hard Tareas reales en terminal: instalar dependencias, editar código, correr tests. La métrica más agéntica. | TAU2?Tau2 Tareas multi-turno con herramientas. Mide retención, uso de tools y razonamiento en cadena. | IN $/M?Precio entrada Costo por millón de tokens de entrada (input). | OUT $/M?Precio salida Costo por millón de tokens de salida (output). | VEL.?Velocidad Tokens de salida por segundo. Más alto = respuestas más rápidas. | |
|---|---|---|---|---|---|---|---|---|---|---|
| 1 | GLM-5.2 (max)OW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura. | Z AI | 51 | 69 | 50.8% | 99.1% | $1.4 | $4.4 | 194 | ↗ |
| 2 | Qwen3.7 MaxOW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura. | Alibaba | 46 | 66 | 50.8% | 94.7% | $2.5 | $7.5 | 204 | ↗ |
| 3 | Qwen3.7 PlusOW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura. | Alibaba | 39 | 56 | 47.0% | 93.0% | $0.4 | $1.6 | 52 | ↗ |
| 4 | DeepSeek V4 Pro (Reasoning, Max Effort)OW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura. | DeepSeek | 44 | 59 | 46.2% | 96.2% | $0.435 | $0.87 | 60 | ↗ |
| 5 | Muse SparkOW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura. | Meta | 43 | 59 | 45.5% | 91.5% | $0 | $0 | 0 | ↗ |
| 6 | Kimi K2.7 CodeOW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura. | Kimi | 42 | 61 | 44.7% | 90.1% | $0.95 | $4 | 39 | ↗ |
| 7 | Qwen3.6 PlusOW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura. | Alibaba | 40 | 55 | 43.9% | 97.7% | $0.5 | $3 | 55 | ↗ |
| 8 | Kimi K2.6OW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura. | Kimi | 44 | 62 | 43.9% | 95.9% | $0.95 | $4 | 0 | ↗ |
| 9 | Qwen3.6 Max PreviewOW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura. | Alibaba | 40 | — | 43.9% | 95.9% | $1.3 | $7.8 | 0 | ↗ |
| 10 | GLM-5 (Reasoning)OW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura. | Z AI | 40 | — | 43.2% | 98.2% | $1 | $3.2 | 0 | ↗ |
| 11 | GLM-5.1 (Reasoning)OW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura. | Z AI | 40 | 56 | 43.2% | 97.7% | $1.38 | $4.4 | 0 | ↗ |
| 12 | MiniMax-M3OW?Open Weights Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura. | MiniMax | 44 | 59 | 42.4% | 88.9% | $0.3 | $1.2 | 87 | ↗ |
GLOSARIO DE CAMPO
Ocho términos para leer la tabla sin perderte
- Intelligence Index
- Score compuesto de Artificial Analysis que mide capacidad general. Escala 0–100.
- Coding Index
- Score compuesto de capacidad de código. Escala 0–100.
- TerminalBench Hard
- Mide si el modelo completa tareas reales en terminal: instalar dependencias, editar código, correr tests. La métrica más agéntica.
- Tau2
- Tareas multi-turno con herramientas. Mide retención, uso de tools y razonamiento en cadena.
- GPQA
- Preguntas de nivel postgrado en ciencia. Evalúa razonamiento profundo. Escala 0–1.
- LiveCodeBench
- Problemas de código reales y actualizados. Escala 0–1.
- Open Weights
- Modelos con pesos descargables. Puedes desplegarlos en tu propia infraestructura.
- Velocidad
- Tokens de salida por segundo. Más alto = respuestas más rápidas.
