Описание
LGM, что расшифровывается как Large Multi-View Gaussian Model, представляет собой передовую платформу, предназначенную для создания 3D-контента высокого разрешения. Этот проект, представленный на ECCV 2024 в качестве устного доклада, предлагает надежную реализацию новой гауссовой модели, способной генерировать детализированные 3D-ресурсы из нескольких входных видов. Суть LGM заключается в его способности использовать многовидовую информацию для реконструкции и рендеринга сложных 3D-сцен с впечатляющей точностью.
Проект предоставляет полный набор инструментов для исследователей и разработчиков, интересующихся генерацией 3D-контента. Это включает официальный репозиторий кода, предварительно обученные веса модели, доступные для загрузки, и четкие инструкции для инференса. LGM поддерживает как конвейеры генерации text-to-3D, так и image-to-3D, что делает его универсальным инструментом для различных творческих и технических приложений. Реализация основана на существующих исследованиях в области гауссова сплэттинга и техник нейронного рендеринга, стремясь расширить границы качества и разрешения в 3D-синтезе.
Ключевые возможности LGM включают вывод высокого разрешения, позволяющий создавать детализированные 3D-модели и сцены. Архитектура модели оптимизирована для многовидовых входных данных, обеспечивая точную реконструкцию геометрии и внешнего вида. Проект также предлагает локальный графический интерфейс для визуализации сохраненных файлов PLY и скрипты для преобразования мешей, что облегчает интеграцию в существующие 3D-рабочие процессы. Хотя обучающий набор данных основан на AWS и не может быть напрямую перенесен, проект предоставляет фреймворк для обучающего кода и отфильтрованный поднабор набора данных Objaverse для пользователей, желающих обучать собственные модели.
LGM особенно актуален для исследователей в области компьютерного зрения и графики, 3D-художников, разработчиков игр и всех, кто занимается созданием или манипулированием 3D-ресурсами. Открытый исходный код проекта и подробная документация способствуют вкладу сообщества и дальнейшему развитию. Акцент на выводе высокого разрешения и многовидовой согласованности позиционирует LGM как значительный прорыв в области генеративного 3D-моделирования.
Основные функции LGM: Large Multi-View Gaussian Model
Создание 3D-контента высокого разрешения
Реализация Large Multi-View Gaussian Model
Поддержка генерации text-to-3D
Поддержка генерации image-to-3D
Предоставлен официальный код и предварительно обученные веса
Включает скрипты для инференса
Локальный GUI для визуализации 3D-моделей
Утилиты для преобразования мешей
Основано на техниках Gaussian Splatting
Устный доклад на ECCV 2024
Начало работы с LGM: Large Multi-View Gaussian Model
Клонировать репозиторий: Получите код LGM с GitHub.
Установить зависимости: Настройте необходимые пакеты Python, включая PyTorch и xformers.
Загрузить веса: Получите предварительно обученные чекпоинты модели с Hugging Face.
Настроить инференс: Укажите пути к рабочей области и тестовые пути для генерации.
Выполнить инференс: Запустите скрипт `infer.py` для 3D-генерации.
Визуализировать результаты: Используйте `gui.py` для просмотра сгенерированных файлов PLY.
Преобразовать в меш: Используйте `convert.py` для извлечения меша.
Варианты использования LGM: Large Multi-View Gaussian Model
- Генерация 3D-ресурсов высокого разрешения
- Создание контента text-to-3D
- Реконструкция 3D из изображений
- 3D-контент для AR/VR
- Ресурсы для разработки игр
- Исследования в области генеративного 3D






