Descripción
Microsoft Research ha presentado Phi-2, un avance significativo en el campo de los modelos de lenguaje pequeños (SLM). Este modelo de 2.7 mil millones de parámetros muestra notables capacidades de razonamiento y comprensión del lenguaje, posicionándose como líder entre los modelos de lenguaje base con menos de 13 mil millones de parámetros. Phi-2 logra un rendimiento de vanguardia en varios puntos de referencia, a menudo igualando o superando a modelos hasta 25 veces su tamaño. Este salto de rendimiento se atribuye a técnicas innovadoras de escalado de modelos y a una meticulosa curación de los datos de entrenamiento.
El desarrollo de Phi-2 se basa en modelos anteriores de la suite Phi, incluidos Phi-1 y Phi-1.5. Mientras que Phi-1 destacó en la codificación en Python, Phi-1.5 demostró un rendimiento comparable al de modelos cinco veces su tamaño en razonamiento de sentido común y comprensión del lenguaje. Phi-2 refina aún más estas capacidades al integrar el conocimiento de Phi-1.5 en una arquitectura más grande, acelerando la convergencia del entrenamiento y mejorando las puntuaciones de los puntos de referencia.
Una idea clave que impulsa el éxito de Phi-2 es el papel fundamental de la calidad de los datos de entrenamiento. Microsoft Research adoptó un enfoque extremo en datos de "calidad de libro de texto", incorporando conjuntos de datos sintéticos diseñados para enseñar razonamiento de sentido común, conocimiento general, ciencia, actividades diarias y teoría de la mente. Esto se complementa con datos web cuidadosamente filtrados, seleccionados por su valor educativo y calidad de contenido. El modelo se basa en Transformer, entrenado con 1.4 billones de tokens de múltiples pasadas sobre una mezcla de conjuntos de datos sintéticos y web para tareas de PNL y codificación.
Phi-2 está disponible en el catálogo de modelos de Azure AI Studio, fomentando la investigación y el desarrollo. A pesar de no haber sido sometido a aprendizaje por refuerzo con retroalimentación humana (RLHF) ni a ajuste fino de instrucciones, Phi-2 exhibe un mejor comportamiento en cuanto a toxicidad y sesgo en comparación con algunos modelos de código abierto alineados. Esto es coherente con las observaciones en Phi-1.5, atribuido a las técnicas de curación de datos personalizadas.
El tamaño compacto de Phi-2 lo convierte en una plataforma excelente para investigadores que exploran áreas como la interpretabilidad mecanicista, las mejoras de seguridad y la experimentación de ajuste fino en diversas tareas. Su rendimiento en puntos de referencia complejos, incluidos Big Bench Hard, razonamiento de sentido común, comprensión del lenguaje, matemáticas y codificación, rivaliza o supera a modelos más grandes como Mistral 7B y los modelos Llama-2, e incluso compite con Gemini Nano 2.
Aspectos destacados de Modelo de Lenguaje Phi-2
2.7 mil millones de parámetros
Rendimiento de vanguardia para modelos de menos de 13B parámetros
Supera a modelos hasta 25 veces más grandes en puntos de referencia complejos
Capacidades avanzadas de razonamiento y comprensión del lenguaje
Entrenado con datos de "calidad de libro de texto" y datos web curados
Arquitectura basada en Transformer
Objetivo de predicción de la siguiente palabra
Entrenado con 1.4 billones de tokens
Disponible en el catálogo de modelos de Azure AI Studio
Demuestra un rendimiento sólido sin RLHF ni ajuste fino de instrucciones
Exhibe menor toxicidad y sesgo en comparación con algunos modelos alineados
Ideal para investigación, interpretabilidad y experimentos de ajuste fino
Primeros pasos con Modelo de Lenguaje Phi-2
Acceder al Modelo: Localice Phi-2 dentro del catálogo de modelos de Azure AI Studio.
Autenticarse: Configure las credenciales de autenticación necesarias para los servicios de Azure AI.
Configurar Entorno: Configure su entorno de desarrollo con las bibliotecas y SDK requeridos.
Integrar vía API: Utilice los puntos de conexión de API proporcionados para enviar indicaciones y recibir salidas del modelo.
Experimentar: Comience el ajuste fino o realice experimentos de investigación utilizando las capacidades del modelo.
Casos de uso de Modelo de Lenguaje Phi-2
- Exploración de Investigación
- Experimentos de Ajuste Fino
- Tareas de Razonamiento
- Comprensión del Lenguaje
- Razonamiento de Sentido Común






