Статья разбирает ключевые идеи метода Alpha-Composited Block Coordinate Descent (ABCD) для обучения больших сцен в формате Gaussian Splatting при фиксированном объёме видеопамяти.
Контекст целой сцены через альфа-композитинг
Главная идея ABCD — разделить большую радианс‑сцену на чанки, но при этом не терять глобальный контекст и не получать швы между частями.
Неактивные части сцены «сворачиваются» в два RGBA‑изображения: foreground и background. Эти слои предварительно рендерятся и хранятся как статичные. Активные гауссианы (текущий чанк) рендерятся между этими слоями.
Ключевой момент: удаление гауссианов из GPU‑памяти не означает их исчезновение из итогового изображения. Они остаются визуально присутствующими через предрендеренные слои. Оптимизатор видит, как активный чанк должен:
- окклюдировать другие части сцены,
- смешиваться (blend) с ними,
- располагаться спереди или сзади относительно окружающей геометрии.
Благодаря этому чанк не обучается «в вакууме», а учитывает полную сцену. Это предотвращает несогласованность и артефакты на стыках, типичные для независимого обучения отдельных фрагментов и последующей «сшивки» сцен.
Трейд‑оффы: VRAM vs RAM, диск и время обучения
Текущая реализация ABCD сознательно меняет тип ресурсов: экономит дефицитный VRAM за счёт увеличения нагрузки на системную память, диск и время обучения.
Распределение ресурсов:
- VRAM определяется размером активного чанка и разрешением рендера.
- RAM используется для кэша изображений с камер, которые могут видеть этот чанк.
- Диск хранит более крупный набор предрендеренных комбинаций «камера × чанк».
Критически важное свойство для очень больших сцен: пиковый VRAM не обязан расти вместе с размером сцены — можно держать размер активного чанка постоянным.
Проблемы и направления оптимизации
Сейчас видимость чанка определяется консервативно: проверяется только попадание в пирамиду видимости камеры (frustum), без учёта окклюзии. Это ведёт к избыточному кэшированию.
Потенциальные улучшения:
- Окклюзионный отбор (occlusion-aware culling) — исключать чанки, которые формально в фрустуме, но полностью закрыты другой геометрией. Это особенно важно для больших миров, где камера «видит» только локальное окружение (например, одна улица в городе). В идеале RAM должна расти ближе к локальному рабочему набору, а не к размеру всей сцены.
- Сжатие кэша — сейчас кэш хранится как lossless PNG. Более агрессивное сжатие, улучшенные стратегии кэширования и снижение частоты обновления партиций могут заметно уменьшить требования к диску и время обучения.
Эти направления пока не исследованы авторами, но рассматриваются как перспективные.
Выводы
- ABCD хранит неактивные части сцены как предрендеренные RGBA‑слои и рендерит активный чанк между ними, сохраняя контекст всей сцены.
- Такой подход предотвращает швы и несогласованность между чанками, типичные для независимого обучения фрагментов.
- Метод меняет дефицитный VRAM на RAM, диск и время обучения, при этом пиковый VRAM не растёт с размером сцены.
- Окклюзионный отбор и более умное кэширование могут существенно сократить использование RAM и диска.
- Сжатие кэша (альтернатива PNG) и реже обновляемые партиции — ключевые направления для ускорения и удешевления обучения.