Marlin 2B se vuelve de código abierto: permite descripciones de timestamps en videos y localización de fragmentos en lenguaje natural en cuestión de segundos

El equipo de NemoStation ha lanzado como código abierto el modelo visual-lenguaje para videos Marlin 2B, afinado a partir de Qwen3.5-2B y diseñado específicamente para dos escenarios prácticos: describir «qué ocurre en el video» y determinar «cuándo sucede». Ofrece dos interfaces de llamada. En el modo caption, al introducir un video se genera un diccionario estructurado que incluye una descripción general de la escena y una lista de eventos con marcas temporales en segundos (por ejemplo, «\u003c14.3 - 18.2\u003e Una persona empuja una puerta para entrar»); el modo find acepta consultas en lenguaje natural y devuelve los tiempos de inicio y finalización del fragmento correspondiente en el video. Ambos modos se invocan mediante la API estándar de transformers de Hugging Face, sin necesidad de capas de encapsulación adicionales.

En cuanto a evaluaciones, Marlin 2B ocupa el primer puesto entre modelos de 2 mil millones de parámetros en el benchmark CaReBench para subtítulos detallados; supera a Qwen2.5-VL-7B por +6.4 puntos de mIoU en el benchmark TimeLens-Bench de localización temporal, igualando así a Gemini-2.0-Flash; además, en DREAM-1K queda situado entre Tarsier-34B y Gemini-1.5-Pro, convirtiéndose en el mejor modelo de código abierto de este tamaño para descripciones densas y localización temporal.

El entrenamiento siguió una estrategia de dos fases: primero se realizó un afinado supervisado (SFT) con aproximadamente 400.000 fragmentos de alta calidad reetiquetados mediante el modo de razonamiento de Gemini-3-Flash y verificados por personas, y posteriormente se aplicó optimización de preferencias mediante SimPO; todo el proceso se completó en una sola tarjeta gráfica H100. El sistema requiere transformers ≥ 5.7.0, torch ≥ 2.11.0 y torchcodec; permite desplegarse localmente en una única GPU de consumo o en un Mac M1 con 16 GB de RAM, y también es compatible con los frameworks de inferencia vLLM y Swift. La licencia aplicable es BSL-1.1 (para uso comercial es preciso contactar al equipo para obtener autorización); una vez solicitado el acceso, los pesos del modelo se facilitan gratuitamente.

HuggingFace