Deskripsi
Microsoft Research telah memperkenalkan Phi-2, sebuah kemajuan signifikan dalam bidang model bahasa kecil (SLM). Model dengan 2,7 miliar parameter ini menampilkan kemampuan penalaran dan pemahaman bahasa yang luar biasa, memposisikannya sebagai pemimpin di antara model bahasa dasar dengan kurang dari 13 miliar parameter. Phi-2 mencapai kinerja mutakhir pada berbagai tolok ukur, sering kali menyamai atau melampaui model yang hingga 25 kali lebih besar darinya. Lompatan kinerja ini dikaitkan dengan teknik penskalaan model yang inovatif dan kurasi data pelatihan yang cermat.
Pengembangan Phi-2 dibangun di atas model-model sebelumnya dalam rangkaian Phi, termasuk Phi-1 dan Phi-1.5. Sementara Phi-1 unggul dalam pengkodean Python, Phi-1.5 menunjukkan kinerja yang sebanding dengan model lima kali lebih besar dalam penalaran akal sehat dan pemahaman bahasa. Phi-2 lebih lanjut menyempurnakan kemampuan ini dengan menyematkan pengetahuan dari Phi-1.5 ke dalam arsitektur yang lebih besar, mempercepat konvergensi pelatihan dan meningkatkan skor tolok ukur.
Wawasan utama yang mendorong keberhasilan Phi-2 adalah peran penting kualitas data pelatihan. Microsoft Research mengadopsi fokus ekstrem pada data "berkualitas buku teks", menggabungkan kumpulan data sintetis yang dirancang untuk mengajarkan penalaran akal sehat, pengetahuan umum, sains, aktivitas sehari-hari, dan teori pikiran. Ini ditambah dengan data web yang difilter dengan cermat yang dipilih karena nilai edukatif dan kualitas kontennya. Model ini berbasis Transformer, dilatih pada 1,4 triliun token dari beberapa kali lintasan pada campuran kumpulan data sintetis dan web untuk tugas NLP dan pengkodean.
Phi-2 tersedia di katalog model Azure AI Studio, mendorong penelitian dan pengembangan. Meskipun tidak menjalani pembelajaran penguatan dari umpan balik manusia (RLHF) atau penyempurnaan instruksi, Phi-2 menunjukkan perilaku yang lebih baik terkait toksisitas dan bias dibandingkan dengan beberapa model sumber terbuka yang selaras. Hal ini konsisten dengan pengamatan pada Phi-1.5, yang dikaitkan dengan teknik kurasi data yang disesuaikan.
Ukuran Phi-2 yang ringkas menjadikannya platform yang sangat baik bagi para peneliti yang mengeksplorasi area seperti interpretasi mekanistik, peningkatan keamanan, dan eksperimen penyempurnaan di berbagai tugas. Kinerjanya pada tolok ukur yang kompleks, termasuk Big Bench Hard, penalaran akal sehat, pemahaman bahasa, matematika, dan pengkodean, menyaingi atau melampaui model yang lebih besar seperti Mistral 7B dan model Llama-2, dan bahkan bersaing dengan Gemini Nano 2.
Sorotan Model Bahasa Phi-2
2,7 miliar parameter
Kinerja mutakhir untuk model di bawah 13 miliar parameter
Melampaui model hingga 25 kali lebih besar pada tolok ukur yang kompleks
Kemampuan penalaran dan pemahaman bahasa tingkat lanjut
Dilatih pada data "berkualitas buku teks" dan data web yang dikurasi
Arsitektur berbasis Transformer
Tujuan prediksi kata berikutnya
Dilatih pada 1,4 triliun token
Tersedia di katalog model Azure AI Studio
Menunjukkan kinerja kuat tanpa RLHF atau penyempurnaan instruksi
Menunjukkan toksisitas dan bias yang lebih rendah dibandingkan dengan beberapa model yang selaras
Ideal untuk penelitian, interpretasi, dan eksperimen penyempurnaan
Memulai dengan Model Bahasa Phi-2
Akses Model: Temukan Phi-2 di katalog model Azure AI Studio.
Otentikasi: Siapkan kredensial otentikasi yang diperlukan untuk layanan Azure AI.
Siapkan Lingkungan: Konfigurasikan lingkungan pengembangan Anda dengan pustaka dan SDK yang diperlukan.
Integrasikan melalui API: Gunakan titik akhir API yang disediakan untuk mengirim prompt dan menerima keluaran model.
Eksperimen: Mulai penyempurnaan atau lakukan eksperimen penelitian menggunakan kemampuan model.
Kasus Penggunaan Model Bahasa Phi-2
- Eksplorasi Penelitian
- Eksperimen Penyempurnaan
- Tugas Penalaran
- Pemahaman Bahasa
- Penalaran Akal Sehat






