Дом
Grok 4.6 запускается, сопоставим с GPT-5.6 по производительности при стоимости на 60% ниже

xAI выпустила Grok 4.6, достигнув оценки 61 в Индексе интеллекта ИИ, что соответствует показателю GPT-5.6 Sol (Max) и немного уступает Claude Opus 5 (63 балла) и Claude Fable 5 (62 балла). Такие результаты позволяют Grok 4.6 войти в число ведущих мировых моделей, напрямую конкурируя с флагманскими предложениями OpenAI и Anthropic. Основанная на базе Grok 4.5, эта версия предлагает ключевые улучшения в области рассуждений и обучения продвинутым техническим концепциям, используя курируемые данные, сгенерированные самой моделью, а также высококачественные инженерные наборы данных и оптимизированный алгоритм обучения.
Важным сдвигом в методологии обучения стал самоусиливающийся цикл данных: Grok 4.5 использовалась для генерации траекторий контролируемой тонкой настройки, с акцентом на рассуждения, использование инструментов агентами, а также такие области, как STEM, программная инженерия и интеллектуальный труд. Модель также прошла обширное обучение на задачах обучения с подкреплением на основе агентов, включая интеллектуальный труд, общее программирование, оптимизацию ядра, веб-разработку и компьютерное проектирование — стратегия, явно направленная на решение основных рабочих нагрузок наступающей «эры агентов».
Бенчмарки для агентов показали драматические улучшения, существенно снизив усилия, необходимые для сложных долгосрочных задач.
В оценках бенчмарков, связанных с агентами, Grok 4.6 продемонстрировала исключительные результаты. Она достигла оценки Elo 1753 на GDPval-AA v2, заняв второе место после Claude Opus 5. Оценки DeepSWE v1.1 выросли до 65,9%, что является заметным увеличением по сравнению с 54% в Grok 4.5, в то время как APEX-Agents выросли с 47,1% до 57,5%. Terminal-Bench v3.0 улучшился с 15,7% до 26%, с дополнительными сильными результатами 69,9% на CursorBench v3.2 и 61,3% на FrontierCode v1.1, что отмечает значительные прорывы как в возможностях программирования, так и в возможностях агентов.
Примечательно, что Grok 4.6 предлагает явное преимущество по стоимости. При цене 2 доллара за миллион входных токенов и 6 долларов за миллион выходных токенов, она более чем на 60% дешевле, чем Claude Opus 5 (5/25 доллара) и GPT-5.6 Sol (5/30 долларов). На бенчмарке долгосрочного интеллектуального труда AA-Briefcase Grok 4.6 выполняла задачи в среднем за 53 раунда, используя около 500 миллионов входных токенов, тогда как Claude Opus 5 потребовал примерно 103 раунда и 2 миллиарда токенов. Это означает, что Grok 4.6 достигает сопоставимых результатов, используя менее четверти ресурсов, что подчеркивает явное преимущество по соотношению стоимости и производительности. Модель теперь доступна через Cursor, Grok Build, API, OpenRouter, Vercel и Cloudflare. В течение первой недели пользователи получают удвоенные кредиты на использование в Grok Build и Cursor. При окне контекста в 500 000 токенов официально началась конкурентная борьба, сфокусированная на «равном интеллекте по более низким ценам».
Связанная статья
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её
Google тестирует агента Remy AI для Gemini по мере смещения фокуса на управление пользователями
Согласно Business Insider, Google тестирует Remy, нового ИИ-персонального агента для Gemini. Этот инструмент предназначен для выполнения задач от имени пользователей, упрощая как профессиональные рабочие процессы, так и повседневные рутины.В настоящ
Рекомендации по связанным специальным темам
Комментарии (0)

xAI выпустила Grok 4.6, достигнув оценки 61 в Индексе интеллекта ИИ, что соответствует показателю GPT-5.6 Sol (Max) и немного уступает Claude Opus 5 (63 балла) и Claude Fable 5 (62 балла). Такие результаты позволяют Grok 4.6 войти в число ведущих мировых моделей, напрямую конкурируя с флагманскими предложениями OpenAI и Anthropic. Основанная на базе Grok 4.5, эта версия предлагает ключевые улучшения в области рассуждений и обучения продвинутым техническим концепциям, используя курируемые данные, сгенерированные самой моделью, а также высококачественные инженерные наборы данных и оптимизированный алгоритм обучения.
Важным сдвигом в методологии обучения стал самоусиливающийся цикл данных: Grok 4.5 использовалась для генерации траекторий контролируемой тонкой настройки, с акцентом на рассуждения, использование инструментов агентами, а также такие области, как STEM, программная инженерия и интеллектуальный труд. Модель также прошла обширное обучение на задачах обучения с подкреплением на основе агентов, включая интеллектуальный труд, общее программирование, оптимизацию ядра, веб-разработку и компьютерное проектирование — стратегия, явно направленная на решение основных рабочих нагрузок наступающей «эры агентов».
Бенчмарки для агентов показали драматические улучшения, существенно снизив усилия, необходимые для сложных долгосрочных задач.
В оценках бенчмарков, связанных с агентами, Grok 4.6 продемонстрировала исключительные результаты. Она достигла оценки Elo 1753 на GDPval-AA v2, заняв второе место после Claude Opus 5. Оценки DeepSWE v1.1 выросли до 65,9%, что является заметным увеличением по сравнению с 54% в Grok 4.5, в то время как APEX-Agents выросли с 47,1% до 57,5%. Terminal-Bench v3.0 улучшился с 15,7% до 26%, с дополнительными сильными результатами 69,9% на CursorBench v3.2 и 61,3% на FrontierCode v1.1, что отмечает значительные прорывы как в возможностях программирования, так и в возможностях агентов.
Примечательно, что Grok 4.6 предлагает явное преимущество по стоимости. При цене 2 доллара за миллион входных токенов и 6 долларов за миллион выходных токенов, она более чем на 60% дешевле, чем Claude Opus 5 (5/25 доллара) и GPT-5.6 Sol (5/30 долларов). На бенчмарке долгосрочного интеллектуального труда AA-Briefcase Grok 4.6 выполняла задачи в среднем за 53 раунда, используя около 500 миллионов входных токенов, тогда как Claude Opus 5 потребовал примерно 103 раунда и 2 миллиарда токенов. Это означает, что Grok 4.6 достигает сопоставимых результатов, используя менее четверти ресурсов, что подчеркивает явное преимущество по соотношению стоимости и производительности. Модель теперь доступна через Cursor, Grok Build, API, OpenRouter, Vercel и Cloudflare. В течение первой недели пользователи получают удвоенные кредиты на использование в Grok Build и Cursor. При окне контекста в 500 000 токенов официально началась конкурентная борьба, сфокусированная на «равном интеллекте по более низким ценам».
Акции США достигли исторической отметки, поскольку гиганты искусственного интеллекта и аэрокосмической отрасли готовятся к дебюту с оценкой в триллион долларов
Илон Маск, Сэм Алтман и Дарио Амодэй, три титана технологического сектора, продвигаются к первичным публичным предложениям акций своих respective компаний. Благодаря SpaceX, OpenAI и Anthropic — трем отраслевым гигантам, чья оценка приближается к три
Шведский стартап в области искусственного интеллекта Lovable Eyes достиг оценки в 13,2 миллиарда долларов после крупного раунда финансирования
По мере того как инструменты для программирования на основе искусственного интеллекта набирают популярность, шведский стартап Lovable привлек крупный раунд финансирования. Компания нацелена на привлечение $3 млрд, что потенциально может увеличить её











