Новые возможности для ИИ-агентов
Компания SpaceXAI выпустила модель Grok 4.6, которая ориентирована на выполнение сложных, длительных задач. В отличие от стандартных чат-ботов, эта модель предназначена для работы в режиме агента: она способна самостоятельно изучать кодовую базу, искать информацию, использовать инструменты и исправлять ошибки после нескольких неудачных попыток.
Модель поддерживает работу с текстом и изображениями, а объем контекста (объем информации, который ИИ удерживает в памяти за один раз) составляет 500 тысяч токенов. Для управления сложностью рассуждений разработчики предусмотрели четыре уровня: низкий, средний, высокий и сверхвысокий. По умолчанию включен высокий уровень.
Улучшенное обучение и результаты тестов
Разработчики уделили больше времени дообучению модели по сравнению с предыдущей версией Grok 4.5. Обучение включало инженерные задачи, технические рассуждения и траектории поведения агентов в различных средах. Также применялось обучение с подкреплением для улучшения навыков в программировании, веб-разработке и проектировании.
Первые тесты показывают заметный рост характеристик. Сводный индекс Artificial Analysis вырос с 56 до 61 балла. В тестах на программирование и работу с кодом (DeepSWE, Terminal-Bench, APEX-Agents) модель также показала значительный прирост. В некоторых специализированных тестах, таких как GDPVal-AA и Harvey LAB, Grok 4.6 заняла первые места.
Эффективность в CursorBench
В тесте CursorBench 3.2, который имитирует реальные многофайловые задачи, Grok 4.6 показала результат 70,8% в режиме сверхвысокого рассуждения. При этом модель справилась с заданием быстрее и дешевле многих конкурентов, таких как Fable 5 или Opus 5 Max.
Несмотря на высокую точность, разработчики Cursor отмечают, что разрыв в результатах с конкурентами может быть статистически незначимым. Однако Grok 4.6 выделяется тем, что достигает нужного результата за меньшее количество шагов и с меньшими затратами ресурсов.
Стоимость и работа с длинным контекстом
Тарифная сетка модели зависит от объема передаваемой информации. На коротких запросах цена остается стандартной: 2 доллара за миллион входных токенов и 6 долларов за миллион выходных. Однако после достижения порога в 200 тысяч токенов стоимость удваивается.
Это критически важно для агентных систем, так как в процессе работы ИИ постоянно возвращается к файлам и истории решений, что увеличивает объем контекста. Для экономии SpaceXAI рекомендует использовать кэширование промпта и сжатие контекста, чтобы снизить задержки и затраты.
Что это значит
Grok 4.6 становится сильным игроком в сегменте универсальных агентов, особенно эффективным при работе с большими репозиториями кода и длительными процессами. Модель наиболее интересна командам, использующим Cursor или создающим собственных агентов через API, где важна способность ИИ самостоятельно проверять свою работу в рамках одного проекта.
