ChatPaper.aiChatPaper

Kling-MotionControl Technisch Rapport

Kling-MotionControl Technical Report

March 3, 2026
Auteurs: Kling Team, Jialu Chen, Yikang Ding, Zhixue Fang, Kun Gai, Kang He, Xu He, Jingyun Hua, Mingming Lao, Xiaohan Li, Hui Liu, Jiwen Liu, Xiaoqiang Liu, Fan Shi, Xiaoyu Shi, Peiqin Sun, Songlin Tang, Pengfei Wan, Tiancheng Wen, Zhiyong Wu, Haoxian Zhang, Runze Zhao, Yuanxing Zhang, Yan Zhou
cs.AI

Samenvatting

Karakteranimatie heeft als doel levensechte video's te genereren door bewegingsdynamiek uit een besturingsvideo over te dragen naar een referentiebeeld. Recente vooruitgang in generatieve modellen heeft de weg geëffend voor hoogwaardige karakteranimatie. In dit werk presenteren we Kling-MotionControl, een uniform DiT-gebaseerd raamwerk dat specifiek is ontworpen voor robuuste, precieze en expressieve holistische karakteranimatie. Door gebruik te maken van een verdeel-en-heersstrategie binnen een samenhangend systeem, coördineert het model heterogene bewegingsrepresentaties die zijn afgestemd op de distinctieve kenmerken van lichaam, gezicht en handen, waarbij grootschalige structurele stabiliteit effectief wordt verzoend met fijnmazige articulatoire expressiviteit. Om robuuste generalisatie over identiteiten heen te waarborgen, incorporeren we adaptief identiteitsonafhankelijk leren, waardoor natuurlijke motion retargeting wordt gefaciliteerd voor diverse karakters, van realistische mensen tot gestileerde cartoons. Tegelijkertijd garanderen we getrouwe uiterlijkbehoud door zorgvuldige identiteitsinjectie- en fusieontwerpen, verder ondersteund door een subjectbibliotheekmechanisme dat gebruikmaakt van uitgebreide referentiecontexten. Om de praktische bruikbaarheid te waarborgen, implementeren we een geavanceerd versnellingsraamwerk dat gebruikmaakt van meerfasige distillatie, waardoor de inferentiesnelheid met meer dan 10x wordt verhoogd. Kling-MotionControl onderscheidt zich door intelligente semantische bewegingsinterpretatie en precieze tekstresponsiviteit, wat flexibele controle voorbij visuele inputs mogelijk maakt. Evaluaties op basis van menselijke voorkeuren tonen aan dat Kling-MotionControl superieure prestaties levert in vergelijking met toonaangevende commerciële en open-source oplossingen, met uitzonderlijke getrouwheid in holistische bewegingscontrole, generalisatie in open domeinen, en visuele kwaliteit en samenhang. Deze resultaten positioneren Kling-MotionControl als een robuuste oplossing voor hoogwaardige, bestuurbare en levensechte karakteranimatie.
English
Character animation aims to generate lifelike videos by transferring motion dynamics from a driving video to a reference image. Recent strides in generative models have paved the way for high-fidelity character animation. In this work, we present Kling-MotionControl, a unified DiT-based framework engineered specifically for robust, precise, and expressive holistic character animation. Leveraging a divide-and-conquer strategy within a cohesive system, the model orchestrates heterogeneous motion representations tailored to the distinct characteristics of body, face, and hands, effectively reconciling large-scale structural stability with fine-grained articulatory expressiveness. To ensure robust cross-identity generalization, we incorporate adaptive identity-agnostic learning, facilitating natural motion retargeting for diverse characters ranging from realistic humans to stylized cartoons. Simultaneously, we guarantee faithful appearance preservation through meticulous identity injection and fusion designs, further supported by a subject library mechanism that leverages comprehensive reference contexts. To ensure practical utility, we implement an advanced acceleration framework utilizing multi-stage distillation, boosting inference speed by over 10x. Kling-MotionControl distinguishes itself through intelligent semantic motion understanding and precise text responsiveness, allowing for flexible control beyond visual inputs. Human preference evaluations demonstrate that Kling-MotionControl delivers superior performance compared to leading commercial and open-source solutions, achieving exceptional fidelity in holistic motion control, open domain generalization, and visual quality and coherence. These results establish Kling-MotionControl as a robust solution for high-quality, controllable, and lifelike character animation.
PDF241March 7, 2026