ByteDance abre el código de Lance: un modelo de 3B parámetros que realiza seis tareas distintas de comprensión, generación y edición de imágenes y videos; al día siguiente de su lanzamiento, entró en el top 3 de la lista trending de Hugging Face.

El Laboratorio de Creación Inteligente de ByteDance ha lanzado y puesto a disposición de forma abierta el modelo multimodal unificado Lance. Con 3 mil millones de parámetros activos (un total de 6 mil millones de parámetros) y un presupuesto de entrenamiento suficiente para hasta 128 GPUs, este modelo permite realizar seis tipos de tareas distintas en un único marco nativo: comprensión, generación y edición de imágenes y videos. También admite la generación de imágenes y videos basada en sujetos específicos. A tan solo un día de su publicación, Lance alcanzó los tres primeros puestos en la lista de tendencias de HuggingFace. En las principales pruebas de referencia, Lance obtuvo una puntuación de 85,11 en VBench (generación de videos; líder entre los modelos unificados), 62,0 en MVBench (comprensión de videos; mejor resultado entre los modelos unificados, con un incremento relativo del 11,3 % respecto al segundo clasificado, Show-o2 de 7 mil millones de parámetros), 0,90 en GenEval (generación de imágenes; empate en el primer puesto entre los modelos unificados) y 7,30 en GEdit-Bench (edición de imágenes; mejor desempeño entre los modelos unificados).

En cuanto a su arquitectura, Lance emplea un diseño de mezcla de expertos de doble flujo (dual-stream MoE): la ruta de comprensión procesa tokens visuales semánticos, mientras que la ruta de generación maneja los tokens latentes del VAE. Ambas rutas comparten un contexto multimodal entrelazado, pero mantienen sus capacidades separadas. Además, se incorpora una codificación posicional rotacional sensible a los modos (MaPE) que diferencia explícitamente los distintos tipos de tokens visuales dentro de una misma secuencia, reduciendo así las interferencias posicionales durante la optimización conjunta de múltiples tareas. El entrenamiento sigue un paradigma de cuatro fases: preentrenamiento, entrenamiento continuo, ajuste fino supervisado y aprendizaje por refuerzo. Los estudios demuestran que la inclusión continua de datos provenientes de diversas tareas —como edición y generación basada en sujetos— potencia aún más la capacidad generativa básica del modelo, lo cual confirma que una cobertura completa de tareas favorece la generalización emergente de los modelos unificados; en otras palabras, la colaboración entre múltiples tareas impulsa la evolución de las capacidades del modelo, en lugar de ser una simple suma de funcionalidades. Los pesos del modelo y el código fuente ya están disponibles en GitHub y HuggingFace; el artículo científico correspondiente se ha publicado en arXiv (arXiv:2605.18678).

ByteDance Research | arXiv