Лаборатория интеллектуального творчества ByteDance представила и выпустила в открытый доступ мультимодальную унифицированную модель Lance. При всего лишь 3 миллиардах активных параметров (общее число параметров — 6 миллиардов) и бюджете на обучение, позволяющем использовать до 128 графических процессоров, модель способна решать шесть различных задач в рамках единой архитектуры: понимание, генерацию и редактирование изображений и видео. Также она поддерживает генерацию изображений/видео с заданными объектами. Уже на следующий день после релиза модель попала в тройку лидеров рейтинга HuggingFace. В ключевых тестах Lance показала следующие результаты: 85,11 баллов в VBench (генерация видео — лучший показатель среди аналогичных моделей), 62,0 балла в MVBench (понимание видео — оптимальный результат для унифицированных моделей; это примерно на 11,3% выше показателя второй по эффективности модели Show-o2 7B), 0,90 балла в GenEval (генерация изображений — совместное лидерство среди унифицированных моделей) и 7,30 балла в GEdit-Bench (редактирование изображений — оптимальный результат для унифицированных моделей).
С точки зрения архитектуры Lance использует концепцию двухпоточного смешанного экспертного обучения (dual-stream MoE): один поток обрабатывает семантические визуальные токены, другой — латентные токены VAE; оба потока работают с единым перекрестным мультимодальным контекстом, но их функции остаются независимыми. Кроме того, в модели применена модально-осознанная ротационная позиционная кодировка (MaPE), которая чётко разделяет разнородные визуальные токены с разной функциональностью в одной последовательности, тем самым устраняя помехи при совместной оптимизации нескольких задач. Процесс обучения состоит из четырёх этапов: предварительное обучение, продолженное обучение, настроение модели с помощью руководящих данных и обучение методами усиленного обучения. Исследования показали, что постоянное добавление данных по редактированию и генерации с заданными объектами дополнительно повышает базовые возможности модели, что подтверждает положительное влияние «полноты охвата задач» на возникновение унифицированных моделей — такое совместное решение задач служит механизмом развития способностей, а не просто их суммированием. Веса модели и исходный код доступны на GitHub и в HuggingFace; статья о модели опубликована на arXiv (arXiv:2605.18678).