NemoStation 팀이 Qwen3.5-2B를 기반으로 미세 조정한 오픈소스 비디오 시각 언어 모델 ‘Marlin 2B’를 공개했습니다. 이 모델은 ‘비디오에서 무슨 일이 일어났는가?’와 ‘언제 일어났는가?’라는 두 가지 실용적인 개발 시나리오에 특화되어 있으며, 두 가지 호출 인터페이스를 제공합니다. ‘caption’ 모드에서는 비디오를 입력하면 전체 장면 설명과 초 단위 타임스탬프가 포함된 이벤트 목록을 담은 구조화된 사전 형태의 결과가 출력됩니다(예: „<14.3 - 18.2> 한 사람이 문을 밀고 들어옴“). ‘find’ 모드에서는 자연어 질문을 입력하면 해당 내용이 나타나는 비디오 구간의 시작·종료 시간이 반환됩니다. 두 모드 모두 별도의 래퍼 없이 표준 HF ‘transformers’ API를 통해 호출할 수 있습니다. 평가 결과, Marlin 2B는 CaReBench 세부 캡션 벤치마크에서 2B 파라미터급 모델 중 1위를 차지했으며, TimeLens-Bench 시간 위치 추적 벤치마크에서는 Qwen2.5-VL-7B보다 +6.4 mIoU 우위를 보이며 Gemini-2.0-Flash와 동등한 성능을 기록했습니다. 또한 DREAM-1K 테스트에서는 Tarsier-34B와 Gemini-1.5-Pro 사이에 위치해, 2B 규모 내에서 밀집된 설명과 시간 위치 추적을 모두 충족하는 최강의 오픈소스 비디오 모델임이 입증되었습니다.
훈련은 두 단계로 진행됩니다. 먼저 Gemini-3-Flash의 사고 패턴을 활용해 재주석하고 인간 검수를 거친 약 40만 개의 고품질 클립을 대상으로 SFT(지도 학습 미세 조정)를 실시한 뒤, SimPO 기반 선호도 최적화를 통해 정렬 과정을 마칩니다. 훈련은 단일 H100 GPU만으로 완료됩니다. 본 시스템은 transformers ≥ 5.7.0, torch ≥ 2.11.0 및 torchcodec를 필요로 하며, 일반 소비자용 GPU 한 대 혹은 Mac M1 16GB 환경에서도 로컬 배포가 가능합니다. 또한 vLLM 및 swift 추론 프레임워크도 지원합니다. 라이선스는 BSL-1.1이며 상업적 이용 시에는 팀 측에 연락해 허가를 받아야 합니다. 접근 권한 신청 후 모델 가중치는 무료로 제공됩니다.