ChatPaper.aiChatPaper

Petit mais fiable : Raisonnement vision-langage efficace pour la détection d'anomalies dans les séries temporelles

Tiny but Trusted: Efficient Vision-Language Reasoning for Time-Series Anomaly Detection

May 28, 2026
Auteurs: Xiaona Zhou, Muntasir Wahed, Tianjiao Yu, Constantin Brif, Ismini Lourentzou
cs.AI

Résumé

Les récentes avancées des modèles vision-langage (MVL) ont permis d'obtenir des performances impressionnantes sur de nombreuses tâches. Pourtant, des études antérieures rapportent des résultats insatisfaisants lors de l'application de grands modèles de langage ou multimodaux à la détection de motifs anormaux dans des données séquentielles. Les référentiels publics de détection d'anomalies fournissent généralement des annotations par intervalle, mais pas de justifications en langage naturel, ce qui rend difficile l'ajustement fin des MVL pour produire des décisions fondées et interprétables. Pour combler cette lacune, nous construisons VisAnomBench, un référentiel organisé à partir d'ensembles de données de séries temporelles publiques, enrichi d'explications d'anomalies de haute qualité sélectionnées à partir de plusieurs grands MVL à l'aide de récompenses fines et spécifiques aux tâches. Grâce à un ajustement fin sur ce référentiel, nous développons VisAnomReasoner, un MVL efficace en paramètres pour la détection d'anomalies dans les séries temporelles. Les résultats expérimentaux sur VisAnomBench montrent que VisAnomReasoner obtient une localisation des anomalies plus précise et surpasse systématiquement toutes les références, avec des améliorations d'au moins 21,23 et 23,87 points de pourcentage respectivement en précision et en F1. Des expériences supplémentaires sur le référentiel TSB-AD-U démontrent une forte capacité de généralisation inter-benchmarks, VisAnomReasoner améliorant la précision et le F1 de 9,57 et 13,39 points de pourcentage respectivement.
English
Recent advances in Vision-Language Models (VLMs) have achieved impressive performance across many tasks, yet prior studies report unsatisfactory performance when applying large language or multimodal models to finding abnormal patterns in sequential data. Public anomaly detection benchmarks typically provide interval annotations but not natural-language rationales, making it difficult to fine-tune VLMs to produce grounded, interpretable decisions. To address this gap, we construct VisAnomBench, a curated benchmark built from public time-series datasets and augmented with high-quality anomaly explanations selected from multiple large VLMs using fine-grained, task-specific rewards. Through fine-tuning on this benchmark, we develop VisAnomReasoner, a parameter-efficient VLM for time-series anomaly detection. Experimental results on VisAnomBench show that VisAnomReasoner achieves more accurate anomaly localization and consistently outperforms all baselines, with improvements of at least 21.23 and 23.87 percentage points in precision and F1, respectively. Additional experiments on the TSB-AD-U benchmark demonstrate strong cross-benchmark generalization, with VisAnomReasoner improving precision and F1 by 9.57 and 13.39 percentage points, respectively.