OpenAI o1-мини

Продвижение экономически эффективного обоснования.
Мы выпускаем OpenAI o1-mini, экономичную модель рассуждений. o1-mini преуспевает в STEM, особенно в математике и кодировании, почти сравнявшись с OpenAI o1 по таким оценочным тестам, как AIME и Codeforces. Мы ожидаем, что o1-mini станет более быстрой и экономичной моделью для приложений, требующих рассуждений без широких знаний о мире.
Сегодня мы запускаем o1-mini для пользователей API 5-го уровня.(открывается в новом окне)по цене на 80% дешевле, чем OpenAI o1-preview. Пользователи ChatGPT Plus, Team, Enterprise и Edu могут использовать o1-mini в качестве альтернативы o1-preview с более высокими ограничениями скорости и меньшей задержкой (см. Модель Скорость ).
Оптимизировано для STEM-рассуждения
Большие языковые модели, такие как o1, предварительно обучаются на обширных текстовых наборах данных. Хотя эти высокопроизводительные модели обладают обширными мировыми знаниями, они могут быть дорогими и медленными для реальных приложений. Напротив, o1-mini — это меньшая модель, оптимизированная для рассуждений STEM во время предварительного обучения. После обучения с тем же высокопроизводительным конвейером обучения с подкреплением (RL), что и o1, o1-mini достигает сопоставимой производительности во многих полезных задачах рассуждения, при этом будучи значительно более экономически эффективным.
При оценке по тестам, требующим интеллекта и рассуждений, o1-mini показывает хорошие результаты по сравнению с o1-preview и o1. Однако o1-mini показывает худшие результаты в задачах, требующих не-STEM фактических знаний (см. Ограничения ).
Математика: На школьном математическом конкурсе AIME o1-mini (70,0%) конкурирует с o1 (74,4%), будучи при этом значительно дешевле, и превосходит o1-preview (44,6%). Результат o1-mini (около 11/15 вопросов) ставит его примерно в число 500 лучших учеников старших классов США.
Кодирование: На сайте соревнований Codeforces o1-mini достигает 1650 Эло, что снова сопоставимо с o1 (1673) и выше, чем o1-preview (1258). Этот показатель Эло ставит модель примерно на 86-й процентиль программистов, соревнующихся на платформе Codeforces. o1-mini также хорошо справляется с тестом кодирования HumanEval и задачами кибербезопасности по захвату флага (CTF) на уровне средней школы.
STEM: В некоторых академических тестах, требующих рассуждений, таких как GPQA (естественные науки) и MATH-500, o1-mini превосходит GPT-4o. o1-mini не показывает таких же результатов, как GPT-4o, в таких задачах, как MMLU, и отстает от o1-preview в GPQA из-за отсутствия у него широких знаний о мире.
Оценка человеческих предпочтений: мы попросили людей сравнить o1-mini с GPT-4o по сложным, открытым подсказкам в различных областях, используя ту же методологию, что и наше сравнение o1-preview с GPT-4o . Подобно o1-preview, o1-mini предпочтительнее GPT-4o в областях, требующих рассуждений, но не предпочтительнее GPT-4o в областях, ориентированных на язык.
Модель Скорость
В качестве конкретного примера мы сравнили ответы GPT-4o, o1-mini и o1-preview на вопрос по словесному обоснованию. В то время как GPT-4o не ответил правильно, o1-mini и o1-preview ответили правильно, а o1-mini пришел к ответу примерно в 3-5 раз быстрее.
Безопасность
o1-mini обучен с использованием тех же методов выравнивания и безопасности, что и o1-preview. Модель имеет на 59% более высокую устойчивость к джейлбрейку на внутренней версии набора данных StrongREJECT по сравнению с GPT-4o. Перед развертыванием мы тщательно оценили риски безопасности o1-mini, используя тот же подход к готовности, внешнему red-teaming и оценкам безопасности, что и o1-preview. Мы публикуем подробные результаты этих оценок в прилагаемой системной карточке .
Ограничения и что дальше
Благодаря специализации на возможностях рассуждений STEM, фактические знания o1-mini по темам, не относящимся к STEM, таким как даты, биографии и мелочи, сопоставимы с небольшими LLM, такими как GPT-4o mini. Мы улучшим эти ограничения в будущих версиях, а также поэкспериментируем с расширением модели на другие модальности и специальности за пределами STEM.



