ChatPaper.aiChatPaper

De la représentation généraliste à la représentation spécialisée

From Generalist to Specialist Representation

May 12, 2026
Auteurs: Yujia Zheng, Fan Feng, Yuke Li, Shaoan Xie, Kevin Murphy, Kun Zhang
cs.AI

Résumé

Étant donné un modèle généraliste, apprendre une représentation spécialisée pertinente pour une tâche est fondamental pour les applications aval. L'identifiabilité, c'est-à-dire la garantie asymptotique de retrouver la représentation réelle, est cruciale car elle fixe la limite ultime de tout modèle, même avec des données et un calcul infinis. Nous étudions ce problème dans un cadre complètement non paramétrique, sans recourir à des interventions, des formes paramétriques ou des contraintes structurelles. Nous prouvons d'abord que la structure entre les pas de temps et les tâches est identifiable de manière totalement non supervisée, même lorsque les séquences manquent de dépendance temporelle stricte et peuvent présenter des déconnexions, et que les affectations de tâches peuvent suivre des structures arbitrairement complexes et entrelacées. Nous prouvons ensuite que, au sein de chaque pas de temps, la représentation latente pertinente pour la tâche peut être désentrelacée de la partie non pertinente sous une simple régularisation de parcimonie, sans aucune information supplémentaire ni contrainte paramétrique. Ensemble, ces résultats établissent un fondement hiérarchique : la structure des tâches est identifiable à travers les pas de temps, et les représentations latentes pertinentes pour la tâche sont identifiables au sein de chaque pas. À notre connaissance, chaque résultat fournit une première garantie générale d'identifiabilité non paramétrique, et ensemble, ils marquent une étape vers le passage prouvable de modèles généralistes à des modèles spécialisés.
English
Given a generalist model, learning a task-relevant specialist representation is fundamental for downstream applications. Identifiability, the asymptotic guarantee of recovering the ground-truth representation, is critical because it sets the ultimate limit of any model, even with infinite data and computation. We study this problem in a completely nonparametric setting, without relying on interventions, parametric forms, or structural constraints. We first prove that the structure between time steps and tasks is identifiable in a fully unsupervised manner, even when sequences lack strict temporal dependence and may exhibit disconnections, and task assignments can follow arbitrarily complex and interleaving structures. We then prove that, within each time step, the task-relevant latent representation can be disentangled from the irrelevant part under a simple sparsity regularization, without any additional information or parametric constraints. Together, these results establish a hierarchical foundation: task structure is identifiable across time steps, and task-relevant latent representations are identifiable within each step. To our knowledge, each result provides a first general nonparametric identifiability guarantee, and together they mark a step toward provably moving from generalist to specialist models.