ChatPaper.aiChatPaper

マルチタスク・マルチフレームによる視覚的ピアノ採譜

Multi-Task Multi-Frame Visual Piano Transcription

August 4, 2026
著者: Yonghyun Kim, Hoyeol Sohn, Juhan Nam, Alexander Lerch
cs.AI

要旨

オーディオベースのピアノ採譜はオンセット、ピッチ、ベロシティにおいて良好な性能を示すが、サステインペダルにより鍵盤を離した後も音が持続するため、オーディオシステムは物理的な鍵盤開放ではなく、ペダルによって延長されたオフセットを予測する。しかしながら、既存のVisual Piano Transcription(VPT)システムは短い映像ウィンドウからのオンセット検出に焦点を当てており、オフセット精度はオンセットに大幅に劣り、ノートレベルのベロシティは報告されていない。これらのギャップに対処するため、我々は最初の完全なVPTシステムであるV2N(Video to Notes)を提示する。これは、共有時間バックボーンがオンセット、オフセット、鍵盤保持、ベロシティのためのタスク別ヘッドに特徴を供給し、ウィンドウ中心のみではなくフレームごとの教師信号で共同訓練されるものである。アブレーション実験により、マルチタスクの教師信号がオンセット精度を改善しつつオフセットとベロシティの予測を可能にすること、より長い時間的文脈がさらなる改善をもたらすことが示される。V2NはPianoVAMとR3において新たな最先端結果を達成する。
English
Audio-based piano transcription performs well on onset, pitch, and velocity, but the sustain pedal lets sound persist long after key release, so audio systems predict pedal-extended offsets rather than physical key release. Yet existing Visual Piano Transcription (VPT) systems focus on onset detection from short video windows, offset accuracy lags onset by a wide margin, and note-level velocity has not been reported. To address these gaps, we present V2N (Video to Notes), the first complete VPT system: a shared temporal backbone feeds task-specific heads for onset, offset, key hold, and velocity, jointly trained with per-frame supervision rather than only at the window center. Ablations show that multi-task supervision enables offset and velocity prediction while improving onset accuracy; longer temporal context yields further improvements. V2N sets new state-of-the-art results on PianoVAM and R3.