Вышел Grok 4.6 с упором на долгие автономные задачи
Grok 4.6 вышел всего через несколько недель после Grok 4.5, но направление обновления довольно чёткое. Разработчики сделали упор не на ещё один быстрый ответ в чате, а на задачи, где модель должна долго работать самостоятельно: исследовать тему, разбираться в большом проекте, пользоваться инструментами, писать код и не терять цель после множества промежуточных шагов.
Что значит «долгая автономная задача»
Для обычного чат-бота работа заканчивается после одного ответа. У ИИ-агента всё сложнее. Допустим, нужно найти причину ошибки в большом приложении. Модели приходится изучить код, определить связанные файлы, предложить изменение, внести его, запустить проверку, увидеть новую ошибку, вернуться к предыдущему шагу и продолжить. Чем длиннее эта цепочка, тем проще нейросети начать ходить кругами или забыть, зачем она вообще что-то делает.
Именно эту проблему Grok 4.6 должен решать лучше предшественника. SpaceXAI пишет, что модель способна дольше удерживать сложную задачу при исследовании информации, анализе данных, работе с кодовой базой и создании приложений или других рабочих материалов. На длинных траекториях разработчики также наблюдали больше самостоятельных проверок: модель чаще тестировала собственный результат перед переходом к следующему этапу.
По факту это намного важнее очередного прироста в качестве коротких ответов. Для автономного агента ошибка на третьем шаге может испортить следующие двадцать. Поэтому способность остановиться, проверить себя и поменять подход здесь ценнее, чем просто умение с первой попытки написать красивый фрагмент кода.
Grok 4.6 заметно подтянули именно в агентных задачах
Для новой версии провели более продолжительное дополнительное обучение, чем для Grok 4.5. В него вошли данные для рассуждений, сложных технических задач и программной инженерии. После этого модель дополнительно обучали с подкреплением в средах для обычного и специализированного программирования, веб-разработки, оптимизации вычислений, инженерного проектирования и другой агентной работы.
В собственных опубликованных тестах компании разница с Grok 4.5 действительно заметна. В DeepSWE 1.1 результат вырос с 54% до 65,9%, в APEX-Agents — с 47,1% до 57,5%, а в расширенном FrontierCode 1.1 — с 56,6% до 61,3%. Эти цифры полезны для понимания направления развития, но переносить их напрямую на любой реальный проект не стоит: поведение агента сильно зависит от инструментов, промта и самой рабочей среды.
Есть улучшения и в создании интерфейсов. SpaceXAI утверждает, что Grok 4.6 лучше справляется с первым вариантом визуальных и интерактивных проектов: может самостоятельно продумать структуру приложения, базовый визуальный язык и основные взаимодействия, а затем дорабатывать результат по обратной связи.
Что доступно разработчикам
У Grok 4.6 контекстное окно на 500 тысяч токенов. Модель принимает текст и изображения, а отвечает текстом. В API доступны function calling, структурированный вывод, выполнение кода, веб-поиск и поиск по X. Уровень рассуждений можно задавать вручную: low, medium, high или xhigh. Последний режим рассчитан на случаи, где качество важнее скорости и расхода ресурсов.
Большой контекст особенно полезен как раз для длинных агентных процессов, но тут есть подвох с ценой. При запросах до 200 тысяч токенов Grok 4.6 стоит $2 за миллион входных и $6 за миллион выходных токенов. Если промт превышает 200 тысяч токенов, тариф увеличивается до $4 и $12 соответственно. Поэтому просто складывать в контекст всю историю работы агента без разбора — не лучший вариант ни по цене, ни по качеству.
Для долгих процессов у платформы есть механизм сжатия контекста. Старые сообщения и результаты инструментов можно сворачивать в более компактное представление, чтобы многочасовой агентный цикл не упирался в предел окна и не таскал за собой весь накопленный мусор. Это как раз тот технический нюанс, без которого красивое обещание «работать автономно долго» быстро начинает захлёбываться в собственной истории действий.
Кому Grok 4.6 действительно интересен
Главная аудитория обновления — не человек, которому нужно иногда задать вопрос нейросети. Разница заметнее разработчикам и компаниям, которые строят поверх модели агентов: автоматизируют программирование, исследование информации, работу с документами или другие процессы с большим количеством промежуточных действий.
Модель уже доступна через API, Grok Build и Cursor, а также у партнёров, включая OpenRouter, Vercel и Cloudflare. Базовая стоимость осталась на уровне Grok 4.5 — $2 за миллион входных и $6 за миллион выходных токенов при обычном размере контекста. Есть и ускоренный вариант Grok 4.6 Fast, который стоит вдвое дороже.
Переходить с Grok 4.5 вслепую всё равно не стоит. Для агента полезнее сравнить обе версии на десятке настоящих задач и посмотреть не только на финальный ответ. Имеет значение, сколько шагов потребовалось модели, сколько раз она повторяла одно действие, правильно ли использовала инструменты, смогла ли исправиться после ошибки и во сколько в итоге обошёлся успешно выполненный процесс.
Grok 4.6 хорошо показывает, куда сейчас движутся большие языковые модели. Гонка постепенно смещается от вопроса «кто лучше ответит» к вопросу «кто сможет получить задачу и дольше работать без постоянного присмотра человека». Новая версия Grok как раз пытается увеличить этот рабочий горизонт. Если улучшения проявятся не только в тестах, а в реальных агентных системах, именно это окажется куда полезнее очередных нескольких процентов в обычных чатовых бенчмарках.
Комментарии
Оставить комментарий
Имя можно не указывать. Все комментарии сначала отправляются на модерацию.