NVIDIA Nemotron Nano V2 VL

Resumen

Presentamos Nemotron Nano V2 VL, el último modelo de la serie Nemotron de lenguaje visual, diseñado para ofrecer una sólida comprensión de documentos del mundo real, comprensión de vídeos largos y tareas de razonamiento. Nemotron Nano V2 VL ofrece mejoras significativas respecto a nuestro modelo anterior, Llama-3.1-Nemotron-Nano-VL-8B, en todos los dominios visuales y textuales, gracias a importantes mejoras en la arquitectura del modelo, los conjuntos de datos y las metodologías de entrenamiento. Nemotron Nano V2 VL se basa en Nemotron Nano V2, un LLM híbrido Mamba-Transformer, y en técnicas innovadoras de reducción de tokens para lograr un mayor rendimiento en inferencia en escenarios de documentos y vídeos largos. Estamos publicando puntos de control del modelo en formatos BF16, FP8 y FP4, y compartiendo gran parte de nuestros conjuntos de datos, metodologías y código de entrenamiento.

English

We introduce Nemotron Nano V2 VL, the latest model of the Nemotron vision-language series designed for strong real-world document understanding, long video comprehension, and reasoning tasks. Nemotron Nano V2 VL delivers significant improvements over our previous model, Llama-3.1-Nemotron-Nano-VL-8B, across all vision and text domains through major enhancements in model architecture, datasets, and training recipes. Nemotron Nano V2 VL builds on Nemotron Nano V2, a hybrid Mamba-Transformer LLM, and innovative token reduction techniques to achieve higher inference throughput in long document and video scenarios. We are releasing model checkpoints in BF16, FP8, and FP4 formats and sharing large parts of our datasets, recipes and training code.