ChatPaper.aiChatPaper

AVControl: Efficiënt Framework voor het Trainen van Audiovisuele Besturingen

AVControl: Efficient Framework for Training Audio-Visual Controls

March 25, 2026
Auteurs: Matan Ben-Yosef, Tavi Halperin, Naomi Ken Korem, Mohammad Salama, Harel Cain, Asaf Joseph, Anthony Chen, Urska Jelercic, Ofir Bibi
cs.AI

Samenvatting

Het aansturen van video- en audiogeneratie vereist diverse modaliteiten, van diepte en pose tot cameratrajecten en audiotransformaties. Toch trainen bestaande methodes ofwel één monolithisch model voor een vaste set aansturingen, ofwel introduceren ze kostbare architectuurwijzigingen voor elke nieuwe modaliteit. Wij introduceren AVControl, een lichtgewicht, uitbreidbaar framework gebouwd op LTX-2, een gezamenlijk audio-visueel foundation model. Hierbij wordt elke aansturingsmodaliteit getraind als een aparte LoRA op een parallel canvas dat het referentiesignaal levert als extra tokens in de attention-lagen, zonder architectuurwijzigingen buiten de LoRA-adapters zelf. Wij tonen aan dat het eenvoudig uitbreiden van op afbeeldingen gebaseerde in-context methoden naar video faalt voor structurele aansturing, en dat onze parallelle canvasaanpak dit oplost. Op de VACE Benchmark overtreffen we alle geëvalueerde baselines voor diepte- en pose-gestuurde generatie, inpainting en outpainting, en tonen we competitieve resultaten voor camerabesturing en audio-visuele benchmarks. Ons framework ondersteunt een diverse set onafhankelijk getrainde modaliteiten: ruimtelijk uitgelijnde aansturingen zoals diepte, pose en edges, cameratrajecten met intrinsieke parameters, sparse motion control, videobewerking en, voor zover wij weten, de eerste modulaire audio-visuele aansturingen voor een gezamenlijk generatiemodel. Onze methode is zowel reken- als data-efficiënt: elke modaliteit vereist slechts een kleine dataset en convergeert binnen een paar honderd tot een paar duizend trainingsstappen, een fractie van de kosten van monolithische alternatieven. Wij maken onze code en getrainde LoRA-checkpoints openbaar.
English
Controlling video and audio generation requires diverse modalities, from depth and pose to camera trajectories and audio transformations, yet existing approaches either train a single monolithic model for a fixed set of controls or introduce costly architectural changes for each new modality. We introduce AVControl, a lightweight, extendable framework built on LTX-2, a joint audio-visual foundation model, where each control modality is trained as a separate LoRA on a parallel canvas that provides the reference signal as additional tokens in the attention layers, requiring no architectural changes beyond the LoRA adapters themselves. We show that simply extending image-based in-context methods to video fails for structural control, and that our parallel canvas approach resolves this. On the VACE Benchmark, we outperform all evaluated baselines on depth- and pose-guided generation, inpainting, and outpainting, and show competitive results on camera control and audio-visual benchmarks. Our framework supports a diverse set of independently trained modalities: spatially-aligned controls such as depth, pose, and edges, camera trajectory with intrinsics, sparse motion control, video editing, and, to our knowledge, the first modular audio-visual controls for a joint generation model. Our method is both compute- and data-efficient: each modality requires only a small dataset and converges within a few hundred to a few thousand training steps, a fraction of the budget of monolithic alternatives. We publicly release our code and trained LoRA checkpoints.