OpenAI в четверг выпустила семейство моделей GPT-5.6 в общий доступ после ограниченного периода предварительного просмотра.
В рамках запуска представлена Sol — новая флагманская модель компании, а также Terra, позиционируемая как сбалансированная модель для повседневной работы, и Luna — наиболее экономичный вариант.
GPT-5.6 Sol набрала 53,6 балла на тесте Agents’ Last Exam, оценивающем длительные профессиональные рабочие процессы в 55 областях. Этот результат превысил показатель Claude Fable 5 с адаптивным рассуждением на 13,1 балла. При среднем уровне рассуждения Sol превзошла Fable 5 на 11,4 балла при примерно вчетверо меньших расчётных затратах, по данным OpenAI.
В индексе Artificial Analysis Intelligence Index, измеряющем интеллект в области агентной работы, программирования, научного мышления и общих возможностей, GPT-5.6 Sol с максимальным уровнем рассуждения отстала от Fable 5 менее чем на один балл. Модель выполняла задачи на 61% быстрее при примерно вдвое меньших расчётных затратах.
В задачах программирования GPT-5.6 Sol с максимальным уровнем рассуждения набрала 80 баллов в индексе Artificial Analysis Coding Agent Index — на 2,8 балла выше Fable 5. OpenAI сообщила, что модель использовала менее половины выходных токенов, затратила менее половины времени и обошлась примерно на треть дешевле конкурента.
Компания представила новую настройку возможностей под названием ultra, которая по умолчанию координирует работу четырёх агентов параллельно. Такой подход предполагает более высокое потребление токенов в обмен на более высокое качество результатов и более быстрое выполнение сложных задач.
Итамар Фридман, сооснователь и генеральный директор Qodo, сообщил, что GPT-5.6 стала самой сильной моделью из всех, которые компания оценивала в своих тестах агентного код-ревью. По его словам, модель превзошла GPT-5.5 по метрике F1, используя примерно втрое меньше токенов на один pull request и обеспечивая примерно вдвое меньшую медианную задержку.
В оценках работы со знаниями GPT-5.6 Sol установила новые результаты: 92,2% на BrowseComp и 62,6% на OSWorld 2.0. На OSWorld модель превзошла Opus 4.8, используя на 85% меньше выходных токенов.
В области кибербезопасности GPT-5.6 набрала 73,5% на ExploitBench1 по сравнению с 47,9% у GPT-5.5 при сопоставимом бюджете выходных токенов. На ExploitGym2 модель достигла 24,9% при двухчасовом ограничении — почти вдвое больше пикового показателя GPT-5.5 в 15,1%.
OpenAI сообщила, что модели GPT-5.6 превосходят предыдущие версии как в области биологии, так и в области кибербезопасности, однако не пересекают порог Critical ни в одной из категорий. Компания внедрила многоуровневые средства защиты, включающие встроенные в модель механизмы безопасности, проверки в режиме реального времени, непрерывный мониторинг и контроль на уровне аккаунтов.
Перед запуском модели прошли примерно 700 000 часов работы GPU A100e в рамках автоматизированного тестирования методом «чёрного ящика», а также масштабное тестирование с участием экспертов-людей.
GPT-5.6 доступна начиная с четверга в ChatGPT, Codex и через OpenAI API. Развёртывание начинается по всему миру и будет постепенно продолжаться до полного охвата в течение следующих 24 часов.
Цены на API установлены на уровне $5 за входные и $30 за выходные данные на 1 миллион токенов для Sol, $2,50 за входные и $15 за выходные — для Terra, $1 за входные и $6 за выходные — для Luna. Запись в кэш тарифицируется по ставке, в 1,25 раза превышающей некэшированную входную ставку модели, тогда как чтение из кэша предоставляется со скидкой 90% на кэшированные входные данные.
