Dónde cortar, qué tan profundo: BPE y Unigram-LM en SMILES químicos
Where to cut, how deep: BPE and Unigram-LM on chemistry SMILES
July 6, 2026
Autores: Hunter Heidenreich
cs.AI
Resumen
Cada modelo de lenguaje químico que lee SMILES comienza con un tokenizador, pero el campo ha heredado la codificación por pares de bytes (BPE) del lenguaje natural con escaso escrutinio. En el lenguaje natural, la principal alternativa a BPE, Unigram-LM, es conocida por construir vocabularios estructuralmente diferentes. Si ese contraste se mantiene en química era una cuestión abierta. Presentamos una comparación controlada entre BPE y Unigram-LM sobre una base química fija de 165 tokens, en los tamaños de vocabulario pequeños donde los embeddings de tokens son aprendibles, a través de tres tipologías de corpus (diverso, similar a fármacos, productos naturales) y ambas políticas de límite de pre-tokenización. Los dos no convergen. En las 22 condiciones emparejadas construyen vocabularios de subpalabras casi disjuntos: la superposición Jaccard entre algoritmos en las piezas aprendidas nunca supera 0,161, y como máximo 0,05 al ponderar hacia las piezas de alta frecuencia que un modelo actualiza más. Unigram-LM también segmenta moléculas reservadas en un 29-41% más de tokens; los brazos coinciden ampliamente en dónde cortar, pero no en la profundidad, por lo que la segmentación de BPE es un estricto refinamiento de la de Unigram-LM en el 80-99% de las moléculas. La separación se mantiene a través del corpus, el límite y el tamaño del vocabulario, incluso persistiendo a ocho veces esa escala. Por lo tanto, el algoritmo de subpalabras es una decisión de modelado, no un valor predeterminado gratuito. El estudio no entrena ningún modelo de lenguaje.
English
Every chemical language model reading SMILES begins with a tokenizer, yet the field has inherited byte-pair encoding (BPE) from natural language with little scrutiny. In natural language, BPE's principal alternative, Unigram-LM, is known to build structurally different vocabularies. Whether that contrast survives in chemistry was open. We report a controlled comparison of BPE and Unigram-LM over a fixed 165-token chemistry base, at the small vocabulary sizes where token embeddings are learnable, across three corpus typologies (diverse, drug-like, natural-products) and both pre-tokenization boundary policies. The two do not converge. In all 22 matched conditions they build near-disjoint subword vocabularies: cross-algorithm Jaccard overlap on the learned pieces never exceeds 0.161, and at most 0.05 once weighted toward the high-frequency pieces a model updates most. Unigram-LM also segments held-out molecules into 29-41% more tokens; the arms largely agree on where to cut but not how deeply, so BPE's segmentation is a strict coarsening of Unigram-LM's on 80-99% of molecules. The separation holds across corpus, boundary, and vocabulary size, persisting even at eight times that scale. The subword algorithm is therefore a modeling decision, not a free default. The study trains no language models.