Descrição
A Microsoft Research apresentou o Phi-2, um avanço significativo no campo dos modelos de linguagem pequenos (SLMs). Este modelo de 2,7 bilhões de parâmetros exibe capacidades notáveis de raciocínio e compreensão de linguagem, posicionando-o como líder entre os modelos de linguagem base com menos de 13 bilhões de parâmetros. O Phi-2 alcança desempenho de ponta em vários benchmarks, frequentemente igualando ou superando modelos até 25 vezes maiores. Esse salto de desempenho é atribuído a técnicas inovadoras de escalonamento de modelos e curadoria meticulosa de dados de treinamento.
O desenvolvimento do Phi-2 baseia-se em modelos anteriores da suíte Phi, incluindo Phi-1 e Phi-1.5. Enquanto o Phi-1 se destacou na codificação em Python, o Phi-1.5 demonstrou desempenho comparável a modelos cinco vezes maiores em raciocínio de senso comum e compreensão de linguagem. O Phi-2 refina ainda mais essas capacidades, incorporando o conhecimento do Phi-1.5 em uma arquitetura maior, acelerando a convergência do treinamento e impulsionando as pontuações de benchmark.
Uma percepção chave que impulsiona o sucesso do Phi-2 é o papel crítico da qualidade dos dados de treinamento. A Microsoft Research adotou um foco extremo em dados de "qualidade de livro didático", incorporando conjuntos de dados sintéticos projetados para ensinar raciocínio de senso comum, conhecimento geral, ciência, atividades diárias e teoria da mente. Isso é complementado por dados da web cuidadosamente filtrados, selecionados por seu valor educacional e qualidade de conteúdo. O modelo é baseado em Transformer, treinado em 1,4 trilhão de tokens de múltiplas passagens sobre uma mistura de conjuntos de dados sintéticos e da web para tarefas de PNL e codificação.
O Phi-2 está disponível no catálogo de modelos do Azure AI Studio, promovendo pesquisa e desenvolvimento. Apesar de não ter passado por aprendizado por reforço com feedback humano (RLHF) ou ajuste fino de instruções, o Phi-2 exibe melhor comportamento em relação à toxicidade e viés em comparação com alguns modelos de código aberto alinhados. Isso é consistente com as observações no Phi-1.5, atribuído às técnicas de curadoria de dados personalizadas.
O tamanho compacto do Phi-2 o torna uma excelente plataforma para pesquisadores que exploram áreas como interpretabilidade mecanicista, melhorias de segurança e experimentação de ajuste fino em diversas tarefas. Seu desempenho em benchmarks complexos, incluindo Big Bench Hard, raciocínio de senso comum, compreensão de linguagem, matemática e codificação, rivaliza ou supera modelos maiores como Mistral 7B e modelos Llama-2, e até compete com Gemini Nano 2.
Destaques de Modelo de Linguagem Phi-2
2,7 bilhões de parâmetros
Desempenho de ponta para modelos com menos de 13B parâmetros
Supera modelos até 25 vezes maiores em benchmarks complexos
Capacidades avançadas de raciocínio e compreensão de linguagem
Treinado em dados de "qualidade de livro didático" e dados da web curados
Arquitetura baseada em Transformer
Objetivo de predição da próxima palavra
Treinado em 1,4 trilhão de tokens
Disponível no catálogo de modelos do Azure AI Studio
Demonstra forte desempenho sem RLHF ou ajuste fino de instruções
Exibe menor toxicidade e viés em comparação com alguns modelos alinhados
Ideal para pesquisa, interpretabilidade e experimentos de ajuste fino
Primeiros passos com Modelo de Linguagem Phi-2
Acessar Modelo: Localize o Phi-2 no catálogo de modelos do Azure AI Studio.
Autenticar: Configure as credenciais de autenticação necessárias para os serviços do Azure AI.
Configurar Ambiente: Configure seu ambiente de desenvolvimento com as bibliotecas e SDKs necessários.
Integrar via API: Utilize os endpoints de API fornecidos para enviar prompts e receber saídas do modelo.
Experimentar: Comece o ajuste fino ou realize experimentos de pesquisa usando as capacidades do modelo.
Casos de uso de Modelo de Linguagem Phi-2
- Exploração de Pesquisa
- Experimentos de Ajuste Fino
- Tarefas de Raciocínio
- Compreensão de Linguagem
- Raciocínio de Senso Comum






