Выход Grok 4.5 от SpaceXAI: официальные характеристики и независимые оценки

16 июля 2026 года компания SpaceXAI опубликовала официальный анонс модели Grok 4.5. Согласно заявлению, это «самая умная модель SpaceXAI, созданная для решения задач в области программирования, агентных (agentic) задач и работы с знаниями». Модель позиционируется как «самая сильная модель компании на сегодняшний день».https://x.ai/news/grok-4-5

Администратор

ПоделитьсяВКонтактеTelegramMAX

Выход Grok 4.5 от SpaceXAI: официальные характеристики и независимые оценки

16 июля 2026 года компания SpaceXAI опубликовала официальный анонс модели Grok 4.5. Согласно заявлению, это «самая умная модель SpaceXAI, созданная для решения задач в области программирования, агентных (agentic) задач и работы с знаниями». Модель позиционируется как «самая сильная модель компании на сегодняшний день».https://x.ai/news/grok-4-5

Ключевые характеристики по официальным данным

SpaceXAI сообщает, что Grok 4.5 обучалась на наборах данных, охватывающих программирование, науку, инженерию и математику. Обучение проводилось в дата-центрах компании в Мемфисе с использованием десятков тысяч GPU NVIDIA GB300. Особое внимание уделялось фильтрации и курированию данных (дедупликация, оценка качества) и масштабированию reinforcement learning с фокусом на «интеллект за токен». Модель обучалась совместно с инструментом Cursor (дополнительное обучение на данных Cursor).https://x.ai/news/grok-4-5

Официальные бенчмарки (по данным SpaceXAI, competitor figures взяты из опубликованных system cards и лидербордов):

  • DeepSWE 1.0: Grok 4.5 — 62,0 % (Fable max — 66,1 %, GPT 5.5 xhigh — 64,31 %, Opus 4.8 max — 55,75 %).

  • SWE Marathon (pass@1): Grok 4.5 — 29,0 % (Opus 4.8 max — 26,0 %).

  • Terminal Bench 2.1: Grok 4.5 — 83,3 % (Fable max — 84,3 %, GPT 5.5 xhigh — 83,4 %).

  • SWE Bench Pro: Grok 4.5 — 64,7 % (Opus 4.8 max — 69,2 %).

Модель демонстрирует высокую токен-эффективность: на задачах SWE Bench Pro Grok 4.5 использует в среднем 15 954 выходных токена — примерно в 4,2 раза меньше, чем Opus 4.8 (67 020 токенов). Скорость генерации — 80 токенов в секунду.https://x.ai/news/grok-4-5

Ценообразование (официальное):

  • Входные токены: $2 за 1 млн.

  • Выходные токены: $6 за 1 млн.

Knowledge cutoff модели — 1 февраля 2026 года.https://docs.x.ai/developers/grok-4-5

Доступность

Grok 4.5 доступна через:

  • xAI API (модель grok-4.5);

  • Grok Build (по умолчанию);

  • Cursor (на всех тарифах);

  • Office-аддоны для Word, PowerPoint, Excel и Outlook;

  • Другие шлюзы (OpenRouter и др.).

Модель поддерживает function calling, web search, X search и code execution.https://docs.x.ai/developers/grok-4-5

Независимая оценка экспертов (Snorkel AI)

8 июля 2026 года Snorkel AI опубликовала результаты независимого тестирования Grok 4.5 на наборе GDPval+ — примерно 2000 экспертно созданных задач профессиональной работы из разных отраслей экономики США. Тестирование проводилось с использованием агентного харнесса и автоматической верификации по экспертным рубрикам.

Результаты:

  • Средний pass rate Grok 4.5 — 29 % (GPT 5.5 — 22 %, Claude Opus 4.8 — 21 %).

  • Преимущество особенно заметно в областях, требующих глубокого профессионального суждения: юридическая работа (40 % vs 27–28 %), образование (58 % vs 35–42 %), здравоохранение (35 % vs 23–25 %), QA-анализ (37 % vs 19–27 %).

  • Grok 4.5 показала наименьшую долю ошибок во всех шести отслеживаемых категориях (включая «missing domain analysis» — 40 % против 51–52 % у конкурентов).https://snorkel.ai/blog/grok-4-5-testing-results-how-spacexais-new-model-performs-on-real-professional-work/

Snorkel AI отмечает, что даже лучшие модели проходят менее трети экспертных критериев, поэтому прирост Grok 4.5 считается значимым.

Краткое резюме официальной позиции

SpaceXAI подчёркивает, что Grok 4.5 сочетает высокую производительность в реальных инженерных и агентных задачах с существенно более низкой стоимостью и большей токен-эффективностью по сравнению с сопоставимыми frontier-моделями. Модель уже интегрирована в продукты Cursor и Office-аддоны, а также доступна через API.

Источники (официальные и независимые):

Статья написана исключительно на основе официальных заявлений SpaceXAI и опубликованных результатов независимого тестирования Snorkel AI. Никаких дополнительных интерпретаций или предположений не добавлено.

По теме: ии, дизайн

Ещё в разделе «Новости»

Все материалы