Hogar
Grok 4.6 se lanza, igualando el rendimiento de GPT-5.6 con un coste superior al 60% menor

xAI ha lanzado Grok 4.6, alcanzando una puntuación de 61 en el Índice de Inteligencia de IA, igualando a GPT-5.6 Sol (Max) y quedándose ligeramente por detrás de Claude Opus 5 (63 puntos) y Claude Fable 5 (62 puntos). Este rendimiento posiciona a Grok 4.6 entre los modelos de élite a nivel mundial, desafiando directamente las ofertas principales de OpenAI y Anthropic. Basado en la base de Grok 4.5, la actualización introduce mejoras fundamentales en el razonamiento y el entrenamiento de conceptos técnicos avanzados, aprovechando datos curados generados por el propio modelo, junto con conjuntos de datos de ingeniería de alta calidad y un algoritmo de entrenamiento optimizado.
Un cambio crucial en la metodología de entrenamiento implica un bucle de datos auto-reforzante: se utilizó Grok 4.5 para regenerar trayectorias de ajuste fino supervisado, centrándose en el razonamiento, la utilización de herramientas de agentes y dominios como STEM, ingeniería de software y trabajo del conocimiento. El modelo también recibió un entrenamiento extenso en tareas de aprendizaje por refuerzo basado en agentes, que incluyen trabajo del conocimiento, codificación general, optimización de núcleos, desarrollo web y diseño asistido por computadora; una estrategia claramente diseñada para abordar las cargas de trabajo principales de la emergente «era de los agentes».
Los benchmarks de agentes han experimentado mejoras dramáticas, reduciendo sustancialmente el esfuerzo requerido para tareas complejas y a largo plazo.
En las evaluaciones de benchmarks relacionados con agentes, Grok 4.6 demostró un rendimiento excepcional. Alcanzó una puntuación Elo de 1753 en GDPval-AA v2, ubicándose en segundo lugar solo por detrás de Claude Opus 5. Las puntuaciones de DeepSWE v1.1 subieron al 65,9 %, un aumento notable respecto al 54 % de Grok 4.5, mientras que APEX-Agents saltó del 47,1 % al 57,5 %. Terminal-Bench v3.0 mejoró del 15,7 % al 26 %, con resultados adicionales sólidos del 69,9 % en CursorBench v3.2 y del 61,3 % en FrontierCode v1.1, marcando avances significativos tanto en capacidades de codificación como de agentes.
Cabe destacar que Grok 4.6 ofrece una ventaja distintiva en eficiencia de costos. Con un precio de 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida, es más del 60 % más barato que Claude Opus 5 (5/25 dólares) y GPT-5.6 Sol (5/30 dólares). En el benchmark de trabajo del conocimiento a largo plazo AA-Briefcase, Grok 4.6 completó las tareas en un promedio de 53 rondas utilizando aproximadamente 500 millones de tokens de entrada, mientras que Claude Opus 5 requirió aproximadamente 103 rondas y 2 mil millones de tokens. Esto significa que Grok 4.6 logra resultados comparables utilizando menos de una cuarta parte de los recursos, destacando una clara ventaja en costo-rendimiento. El modelo ya está disponible a través de Cursor, Grok Build, API, OpenRouter, Vercel y Cloudflare. Durante su primera semana, los usuarios reciben créditos de uso duplicados en Grok Build y Cursor. Con una ventana de contexto de 500 000 tokens, ha comenzado oficialmente un panorama competitivo centrado en la «igual inteligencia a precios más bajos».
Artículo relacionado
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr
Google prueba el agente Remy AI para Gemini a medida que el enfoque se desplaza hacia el control del usuario
Según Business Insider, Google está probando Remy, un nuevo agente personal de IA para Gemini. Esta herramienta tiene como objetivo ejecutar tareas en nombre de los usuarios, optimizando tanto los flujos de trabajo profesionales como las rutinas diar
Recomendaciones de temas especiales relacionados
comentario (0)
0/500

xAI ha lanzado Grok 4.6, alcanzando una puntuación de 61 en el Índice de Inteligencia de IA, igualando a GPT-5.6 Sol (Max) y quedándose ligeramente por detrás de Claude Opus 5 (63 puntos) y Claude Fable 5 (62 puntos). Este rendimiento posiciona a Grok 4.6 entre los modelos de élite a nivel mundial, desafiando directamente las ofertas principales de OpenAI y Anthropic. Basado en la base de Grok 4.5, la actualización introduce mejoras fundamentales en el razonamiento y el entrenamiento de conceptos técnicos avanzados, aprovechando datos curados generados por el propio modelo, junto con conjuntos de datos de ingeniería de alta calidad y un algoritmo de entrenamiento optimizado.
Un cambio crucial en la metodología de entrenamiento implica un bucle de datos auto-reforzante: se utilizó Grok 4.5 para regenerar trayectorias de ajuste fino supervisado, centrándose en el razonamiento, la utilización de herramientas de agentes y dominios como STEM, ingeniería de software y trabajo del conocimiento. El modelo también recibió un entrenamiento extenso en tareas de aprendizaje por refuerzo basado en agentes, que incluyen trabajo del conocimiento, codificación general, optimización de núcleos, desarrollo web y diseño asistido por computadora; una estrategia claramente diseñada para abordar las cargas de trabajo principales de la emergente «era de los agentes».
Los benchmarks de agentes han experimentado mejoras dramáticas, reduciendo sustancialmente el esfuerzo requerido para tareas complejas y a largo plazo.
En las evaluaciones de benchmarks relacionados con agentes, Grok 4.6 demostró un rendimiento excepcional. Alcanzó una puntuación Elo de 1753 en GDPval-AA v2, ubicándose en segundo lugar solo por detrás de Claude Opus 5. Las puntuaciones de DeepSWE v1.1 subieron al 65,9 %, un aumento notable respecto al 54 % de Grok 4.5, mientras que APEX-Agents saltó del 47,1 % al 57,5 %. Terminal-Bench v3.0 mejoró del 15,7 % al 26 %, con resultados adicionales sólidos del 69,9 % en CursorBench v3.2 y del 61,3 % en FrontierCode v1.1, marcando avances significativos tanto en capacidades de codificación como de agentes.
Cabe destacar que Grok 4.6 ofrece una ventaja distintiva en eficiencia de costos. Con un precio de 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida, es más del 60 % más barato que Claude Opus 5 (5/25 dólares) y GPT-5.6 Sol (5/30 dólares). En el benchmark de trabajo del conocimiento a largo plazo AA-Briefcase, Grok 4.6 completó las tareas en un promedio de 53 rondas utilizando aproximadamente 500 millones de tokens de entrada, mientras que Claude Opus 5 requirió aproximadamente 103 rondas y 2 mil millones de tokens. Esto significa que Grok 4.6 logra resultados comparables utilizando menos de una cuarta parte de los recursos, destacando una clara ventaja en costo-rendimiento. El modelo ya está disponible a través de Cursor, Grok Build, API, OpenRouter, Vercel y Cloudflare. Durante su primera semana, los usuarios reciben créditos de uso duplicados en Grok Build y Cursor. Con una ventana de contexto de 500 000 tokens, ha comenzado oficialmente un panorama competitivo centrado en la «igual inteligencia a precios más bajos».
Las acciones de EE. UU. alcanzan un hito histórico mientras gigantes de la IA y la aeroespacial se preparan para su debut de un billón de dólares
Elon Musk, Sam Altman y Dario Amodei, tres titanes del sector tecnológico, están avanzando hacia ofertas públicas iniciales para sus respectivas empresas. Con SpaceX, OpenAI y Anthropic, tres gigantes de la industria que se acercan a valoraciones de
La startup sueca de inteligencia artificial Lovable Eyes alcanza una valoración de 13.200 millones de dólares tras una importante ronda de financiación
Mientras las herramientas de codificación impulsadas por inteligencia artificial ganan terreno, la startup sueca Lovable ha asegurado una importante ronda de financiación. La empresa tiene como objetivo recaudar 3 000 millones de dólares, lo que podr











