Deskripsi
PlaNet adalah algoritma reinforcement learning yang sepenuhnya berbasis model yang dirancang untuk menyelesaikan tugas kontrol langsung dari input piksel. Algoritma ini mencapainya dengan mempelajari urutan keadaan tersembunyi yang ringkas yang memodelkan dinamika dunia. Untuk perencanaan, PlaNet pertama-tama mengkodekan riwayat gambar sebelumnya ke dalam keadaan saat ini. Dari keadaan ini, algoritma ini secara efisien memprediksi imbalan di masa depan untuk berbagai urutan tindakan dalam ruang laten yang dipelajarinya.
Algoritma beroperasi dengan mengeksekusi tindakan pertama dari urutan yang paling menjanjikan yang diidentifikasi melalui perencanaan. Setelah mengamati gambar berikutnya, algoritma ini merencanakan ulang. Proses iteratif ini memungkinkan PlaNet untuk membuat keputusan berdasarkan model prediktif lingkungan, daripada hanya mengandalkan coba-coba. Keunggulan utama PlaNet adalah efisiensinya, yang membutuhkan interaksi yang jauh lebih sedikit dengan lingkungan dibandingkan dengan banyak metode reinforcement learning model-free, sambil tetap mencapai kinerja yang kompetitif.
Proyek ini menawarkan implementasi open-source dari agen PlaNet, memungkinkan peneliti dan pengembang untuk memanfaatkan dan membangun kemampuannya. Implementasi ini mencakup komponen untuk mempelajari model transisi laten, jaringan encoder dan decoder, serta skrip untuk melatih agen pada berbagai tugas. Instruksi disediakan untuk melatih agen, termasuk instalasi dependensi dan argumen baris perintah untuk pemilihan tugas dan konfigurasi parameter.
Repositori PlaNet diarsipkan dan hanya dapat dibaca sejak 28 Mei 2024. Namun, kode tetap tersedia untuk diperiksa dan digunakan. Modifikasi pada kode dapat dilakukan dengan menjelajahi direktori seperti `scripts/configs.py` untuk penyesuaian parameter, `scripts/tasks.py` untuk modifikasi lingkungan, dan `models` serta `networks` untuk mengubah model transisi laten dan arsitektur jaringan saraf, masing-masing. Tips untuk pengembangan meliputi penggunaan konfigurasi debug untuk iterasi yang lebih cepat dan eksplorasi strategi isolasi lingkungan yang berbeda.
Proyek ini diuji di bawah Ubuntu 18 dan memerlukan versi paket tertentu, termasuk `tensorflow-gpu==1.13.1`, `tensorflow_probability==0.6.0`, `dm_control`, `gym`, `scikit-image`, `scipy`, `ruamel.yaml`, dan `matplotlib`. Penting untuk dicatat bahwa ini bukan produk resmi Google. Situs web proyek dan PDF dari makalah terkait memberikan rincian lebih lanjut tentang metode dan aplikasinya.
Sorotan PlaNet
Reinforcement learning berbasis model
Perencanaan dari piksel
Dinamika laten yang dipelajari
Prediksi imbalan di masa depan yang efisien
Perbandingan metode model-free
Pengurangan interaksi lingkungan
Implementasi open-source
Model transisi laten
Jaringan encoder dan decoder
Pelatihan agen reinforcement learning
Tugas kontrol dari gambar
Memulai dengan PlaNet
Akses model: Klon repositori GitHub.
Siapkan lingkungan: Instal dependensi Python termasuk TensorFlow dan dm_control.
Integrasi melalui API: Jalankan skrip pelatihan dengan parameter dan direktori log yang ditentukan.
Optimalkan: Modifikasi file konfigurasi untuk tugas, parameter, dan arsitektur jaringan.
Kasus Penggunaan PlaNet
- Kontrol robotika
- Navigasi otonom
- Bermain game
- Lingkungan simulasi
- Reinforcement learning visual








