Descripción
Phi-4-Reasoning-Vision-15B es un modelo de razonamiento multimodal de peso abierto compacto desarrollado por Microsoft, construido sobre la base del modelo de lenguaje Phi-4-Reasoning y el codificador de visión SigLIP-2. Este modelo utiliza una arquitectura de fusión media, donde el codificador de visión convierte imágenes en tokens visuales, que luego se proyectan en el espacio de incrustación del modelo de lenguaje. Este enfoque innovador combina las fortalezas de ambos componentes preentrenados mientras mantiene costos de entrenamiento e inferencia manejables.
El modelo es capaz de procesar texto e imágenes, con una longitud de contexto de 16,384 tokens. Ha sido entrenado utilizando Ajuste Fino Supervisado (SFT) en un conjunto de datos cuidadosamente curado que incluye tanto datos de razonamiento como no de razonamiento. Esto permite que Phi-4-Reasoning-Vision-15B realice razonamiento extendido en cadena de pensamiento para tareas complejas, como razonamiento matemático y científico, mientras también maneja inferencias directas para tareas centradas en la percepción como subtitulado y detección de objetos.
Phi-4-Reasoning-Vision-15B es particularmente efectivo en entornos con limitaciones de memoria o computación, lo que lo hace ideal para sistemas de IA multimodal de propósito general. Sus principales casos de uso incluyen razonamiento científico y matemático sobre entradas visuales, así como tareas de agente de uso informático que implican interpretar contenido de pantalla y localizar elementos de la interfaz gráfica de usuario. El modelo también es capaz de realizar tareas multimodales generales como subtitulado de imágenes, respuesta a preguntas visuales y reconocimiento óptico de caracteres.
El entrenamiento del modelo involucró 240 GPUs NVIDIA B200 durante un período de cuatro días, con un enfoque en la seguridad y la alineación. Incorpora un enfoque de post-entrenamiento de seguridad que incluye una mezcla de conjuntos de datos sintéticos generados internamente y de código abierto para garantizar un comportamiento apropiado en respuesta a contenido dañino. Se aconseja a los desarrolladores que consideren las limitaciones del modelo, particularmente en escenarios de alto riesgo, y que apliquen prácticas de IA responsable al integrarlo en aplicaciones.
Aspectos destacados de Phi-4-reasoning-vision-15B
Tipo de Modelo: Multimodal
API Disponible: Sí
Licencia: MIT
Parámetros: 15B
Longitud de Contexto: 16,384 tokens
GPUs de Entrenamiento: 240
Tiempo de Entrenamiento: 4 días
Soporte para Ajuste Fino: Sí
Multimodal: Sí
Primeros pasos con Phi-4-reasoning-vision-15B
Acceder al modelo: Visita la página de Hugging Face para Phi-4-Reasoning-Vision-15B.
Autenticarse: Configura tu cuenta de Hugging Face para acceso a la API.
Configurar el entorno: Asegúrate de que tu sistema cumpla con los requisitos técnicos.
Integrar a través de la API: Utiliza la documentación de la API proporcionada para integrar el modelo en tu aplicación.
Optimizar: Ajusta el modelo según tu caso de uso específico.
Casos de uso de Phi-4-reasoning-vision-15B
- Razonamiento Científico
- Tareas de Agente de Uso Informático
- Subtitulado de Imágenes
- Respuesta a Preguntas Visuales
- Reconocimiento Óptico de Caracteres






