Virtuelle Breitennetze

papers.abstract

Wir stellen Virtual Width Networks (VWN) vor, ein Framework, das die Vorteile breiterer Repräsentationen bietet, ohne die quadratischen Kosten einer Vergrößerung der Hidden Size zu verursachen. VWN entkoppelt die Repräsentationsbreite von der Backbone-Breite und erweitert den Einbettungsraum, während die Backbone-Berechnung nahezu konstant bleibt. In unserem Großexperiment beschleunigt eine 8-fache Erweiterung die Optimierung um über das 2-fache für die Next-Token- und um das 3-fache für die Next-2-Token-Prädiktion. Der Vorteil verstärkt sich während des Trainings, da sowohl die Loss-Lücke wächst als auch das Konvergenzbeschleunigungsverhältnis zunimmt, was zeigt, dass VWN nicht nur token-effizient ist, sondern mit zunehmender Skala auch immer wirksamer wird. Darüber hinaus identifizieren wir eine annähernd log-lineare Skalierungsbeziehung zwischen der virtuellen Breite und der Loss-Reduktion, was eine erste empirische Grundlage und Motivation für die Erforschung der Virtual-Width-Skalierung als eine neue Dimension der Effizienz großer Modelle bietet.

English

We introduce Virtual Width Networks (VWN), a framework that delivers the benefits of wider representations without incurring the quadratic cost of increasing the hidden size. VWN decouples representational width from backbone width, expanding the embedding space while keeping backbone compute nearly constant. In our large-scale experiment, an 8-times expansion accelerates optimization by over 2 times for next-token and 3 times for next-2-token prediction. The advantage amplifies over training as both the loss gap grows and the convergence-speedup ratio increases, showing that VWN is not only token-efficient but also increasingly effective with scale. Moreover, we identify an approximately log-linear scaling relation between virtual width and loss reduction, offering an initial empirical basis and motivation for exploring virtual-width scaling as a new dimension of large-model efficiency.