ChatPaper.aiChatPaper

Een gravitationele interpretatie van de omkering van fijnafstemming

A Gravitational Interpretation of Fine-Tuning Reversion

June 26, 2026
Auteurs: Samuele Poppi, Nils Lukas
cs.AI

Samenvatting

Fine-tuning op onschadelijke data kan gedragingen die eerder in de training zijn verworven gedeeltelijk ongedaan maken. Veiligheid kan worden aangetast onder onschuldige updates na uitlijning, verloren vaardigheden kunnen opnieuw opduiken, latente eigenschappen kunnen worden overgedragen via schijnbaar niet-gerelateerde supervisie, en gerelateerde kwetsbaarheid na uitlijning komt voor in andere generatieve settings. Wij stellen dat deze fenomenen nuttig kunnen worden bekeken door een gemeenschappelijke trainingsgeschiedenislens. Onze hypothese is geometrisch: grote vroege trainingsfasen creëren dominante gedragsmanifolds, terwijl latere uitlijnings- of specialisatiefasen ondiepere verschuivingen daarvan zijn. Daaropvolgende fine-tuning kan daardoor een persistente terugkeringscomponent erven die terugwijst naar een getuige van het dominante manifold. We noemen dit de gravitatie-interpretatie van fine-tuning-reversie. In onze belangrijkste settings verkrijgt representatiedrift snel een component langs een door de geschiedenis gedefinieerde omkeerrichting (v_rev). In onze hoofdsetting stijgt de uitlijning met v_rev van cos = 0,429 ± 0,052 na de eerste update naar 0,647 ± 0,021 bij stap 20. Over 24 run-stap-paren heen overschrijdt elke waargenomen uitlijning het p99-percentiel van een isotrope null in de activatieruimte. We tonen aan dat het selectief blokkeren van beweging langs v_rev de uiteindelijke uitlijning bij T=100 verandert van 0,648 ± 0,009 naar -0,211 ± 0,021 en de schadelijkheid reduceert van 19,0% ± 4,0% naar 8,5% ± 1,5%, met weinig taakkosten. Deze resultaten ondersteunen v_rev als een causaal relevante mediator van vroege post-uitlijningsreversie in onze opstelling. Belangrijk is dat we niet beweren dat v_rev de unieke veiligheidsrichting is, noch dat het dominante manifold direct wordt waargenomen; we identificeren eerder een robuuste, door de geschiedenis gedefinieerde richting die de vroege reversiedynamiek verklaart en gedeeltelijk controleert.
English
Fine-tuning on harmless data can partially undo behaviors acquired earlier in training. Safety can erode under benign post-alignment updates, unlearned capabilities can re-emerge, latent traits can transfer through apparently unrelated supervision, and related post-alignment fragility appears in other generative settings. We argue these phenomena are usefully viewed through a common training-history lens. Our hypothesis is geometric: large early training phases create dominant behavioral manifolds, while later alignment or specialization phases are shallower displacements from them. Subsequent fine-tuning can therefore inherit a persistent reversion component pointing back toward a witness of the dominant manifold. We call this the gravitational interpretation of fine-tuning reversion. Across our main settings, representational drift rapidly acquires a component along a history-defined reversion direction (v_rev). In our main track, alignment with v_rev rises from cos = 0.429 +/- 0.052 after the first update to 0.647 +/- 0.021 by step 20. Across 24 run-step pairs, every observed alignment exceeds the p99 of an isotropic activation-space null. We demonstrate that selectively blocking motion along v_rev changes the final alignment at T=100 from 0.648 +/- 0.009 to -0.211 +/- 0.021 and reduces harmfulness from 19.0% +/- 4.0% to 8.5% +/- 1.5% with little task cost. These results support v_rev as a causally relevant mediator of early post-alignment reversion in our setup. Importantly, we do not claim that v_rev is the unique safety direction, nor that the dominant manifold is directly observed; rather, we identify a robust, history-defined direction that explains and partially controls early reversion dynamics.