Descrição
Phi-4-Reasoning-Vision-15B é um modelo de raciocínio multimodal de peso aberto compacto desenvolvido pela Microsoft, construído sobre a base do modelo de linguagem Phi-4-Reasoning e o codificador de visão SigLIP-2. Este modelo utiliza uma arquitetura de fusão média, onde o codificador de visão converte imagens em tokens visuais, que são então projetados no espaço de incorporação do modelo de linguagem. Esta abordagem inovadora combina as forças de ambos os componentes pré-treinados, mantendo custos de treinamento e inferência gerenciáveis.
O modelo é capaz de processar texto e imagens, com um comprimento de contexto de 16.384 tokens. Ele foi treinado usando Ajuste Fino Supervisionado (SFT) em um conjunto de dados cuidadosamente selecionado que inclui dados de raciocínio e não raciocínio. Isso permite que o Phi-4-Reasoning-Vision-15B realize raciocínio em cadeia estendido para tarefas complexas, como raciocínio matemático e científico, enquanto também lida com inferência direta para tarefas focadas em percepção, como legendagem e detecção de objetos.
Phi-4-Reasoning-Vision-15B é particularmente eficaz em ambientes com restrições de memória ou computação, tornando-o ideal para sistemas de IA multimodal de uso geral. Seus principais casos de uso incluem raciocínio científico e matemático sobre entradas visuais, bem como tarefas de agente de uso de computador que envolvem a interpretação de conteúdo de tela e a localização de elementos da interface gráfica do usuário. O modelo também é capaz de realizar tarefas multimodais gerais, como legendagem de imagens, resposta a perguntas visuais e reconhecimento óptico de caracteres.
O treinamento do modelo envolveu 240 GPUs NVIDIA B200 ao longo de um período de quatro dias, com foco em segurança e alinhamento. Ele incorpora uma abordagem de pós-treinamento de segurança que inclui uma mistura de conjuntos de dados sintéticos gerados internamente e de código aberto para garantir um comportamento apropriado em resposta a conteúdo prejudicial. Os desenvolvedores são aconselhados a considerar as limitações do modelo, particularmente em cenários de alto risco, e a aplicar práticas de IA responsável ao integrá-lo em aplicações.
Destaques de Phi-4-reasoning-vision-15B
Tipo de Modelo: Multimodal
API Disponível: Sim
Licença: MIT
Parâmetros: 15B
Comprimento do Contexto: 16.384 tokens
GPUs de Treinamento: 240
Tempo de Treinamento: 4 dias
Suporte a Ajuste Fino: Sim
Multimodal: Sim
Primeiros passos com Phi-4-reasoning-vision-15B
Acessar modelo: Visite a página do Hugging Face para Phi-4-Reasoning-Vision-15B.
Autenticar: Configure sua conta do Hugging Face para acesso à API.
Configurar ambiente: Certifique-se de que seu sistema atende aos requisitos técnicos.
Integrar via API: Use a documentação da API fornecida para integrar o modelo em sua aplicação.
Otimizar: Ajuste o modelo com base em seu caso de uso específico.
Casos de uso de Phi-4-reasoning-vision-15B
- Raciocínio Científico
- Tarefas de Agente de Uso de Computador
- Legendagem de Imagens
- Resposta a Perguntas Visuais
- Reconhecimento Óptico de Caracteres






