Описание
Microsoft Research представила Phi-2 — значительный прорыв в области малых языковых моделей (SLM). Эта модель с 2,7 миллиарда параметров демонстрирует замечательные способности к рассуждению и пониманию языка, позиционируя себя как лидера среди базовых языковых моделей с менее чем 13 миллиардами параметров. Phi-2 достигает наилучших результатов на различных бенчмарках, часто соответствуя или превосходя модели, в 25 раз превосходящие ее по размеру. Этот скачок производительности обусловлен инновационными методами масштабирования моделей и тщательным отбором обучающих данных.
Разработка Phi-2 основана на предыдущих моделях из линейки Phi, включая Phi-1 и Phi-1.5. В то время как Phi-1 преуспела в написании кода на Python, Phi-1.5 продемонстрировала сопоставимую производительность с моделями, в пять раз превосходящими ее по размеру, в задачах здравого смысла и понимания языка. Phi-2 далее совершенствует эти возможности, встраивая знания из Phi-1.5 в более крупную архитектуру, ускоряя сходимость обучения и повышая результаты на бенчмарках.
Ключевым фактором успеха Phi-2 является критическая роль качества обучающих данных. Microsoft Research уделила исключительное внимание данным «учебного качества», включая синтетические наборы данных, предназначенные для обучения здравому смыслу, общим знаниям, науке, повседневным действиям и теории разума. Это дополняется тщательно отфильтрованными веб-данными, отобранными по их образовательной ценности и качеству контента. Модель основана на архитектуре Transformer, обучена на 1,4 триллиона токенов из нескольких проходов по смеси синтетических и веб-данных для задач NLP и кодирования.
Phi-2 доступна в каталоге моделей Azure AI Studio, способствуя исследованиям и разработкам. Несмотря на отсутствие обучения с подкреплением на основе обратной связи от человека (RLHF) или дообучения на инструкциях, Phi-2 демонстрирует лучшее поведение в отношении токсичности и предвзятости по сравнению с некоторыми выровненными моделями с открытым исходным кодом. Это согласуется с наблюдениями, сделанными для Phi-1.5, и объясняется методами целенаправленного отбора данных.
Компактный размер Phi-2 делает ее отличной платформой для исследователей, изучающих такие области, как механическая интерпретируемость, улучшение безопасности и эксперименты по дообучению для различных задач. Ее производительность на сложных бенчмарках, включая Big Bench Hard, задачи здравого смысла, понимание языка, математику и кодирование, конкурирует или превосходит более крупные модели, такие как Mistral 7B и модели Llama-2, и даже конкурирует с Gemini Nano 2.
Главное о Языковая модель Phi-2
2,7 миллиарда параметров
Наилучшая производительность для моделей с менее чем 13B параметров
Превосходит модели, в 25 раз превосходящие ее по размеру, на сложных бенчмарках
Продвинутые способности к рассуждению и пониманию языка
Обучена на данных «учебного качества» и отобранных веб-данных
Архитектура на основе Transformer
Цель предсказания следующего слова
Обучена на 1,4 триллиона токенов
Доступна в каталоге моделей Azure AI Studio
Демонстрирует высокую производительность без RLHF или дообучения на инструкциях
Проявляет более низкую токсичность и предвзятость по сравнению с некоторыми выровненными моделями
Идеально подходит для исследований, интерпретируемости и экспериментов по дообучению
Начало работы с Языковая модель Phi-2
Доступ к модели: Найдите Phi-2 в каталоге моделей Azure AI Studio.
Аутентификация: Настройте необходимые учетные данные для служб Azure AI.
Настройка среды: Настройте среду разработки с необходимыми библиотеками и SDK.
Интеграция через API: Используйте предоставленные конечные точки API для отправки запросов и получения выходных данных модели.
Экспериментирование: Начните дообучение или проводите исследовательские эксперименты, используя возможности модели.
Варианты использования Языковая модель Phi-2
- Исследовательская работа
- Эксперименты по дообучению
- Задачи рассуждения
- Понимание языка
- Здравый смысл






