Где резать, как глубоко: BPE и Unigram-LM для химических SMILES
Where to cut, how deep: BPE and Unigram-LM on chemistry SMILES
July 6, 2026
Авторы: Hunter Heidenreich
cs.AI
Аннотация
Любая химическая языковая модель, читающая SMILES, начинается с токенизатора, однако в этой области кодирование пар байтов (BPE) было унаследовано из естественного языка без должного критического анализа. В обработке естественного языка основная альтернатива BPE — Unigram-LM — известна тем, что формирует структурно иные словари. Было неясно, сохраняется ли это различие в химии. Мы провели контролируемое сравнение BPE и Unigram-LM на фиксированной химической базе из 165 токенов, при малых размерах словаря, когда внедрения токенов обучаемы, на трех типах корпусов (разнообразные, лекарственноподобные, природные продукты) и при обеих политиках границ предтокенизации. Два метода не сходятся. Во всех 22 сопоставимых условиях они формируют почти непересекающиеся подсловные словари: перекрытие по Жаккару между алгоритмами для выученных единиц никогда не превышает 0,161, а с весовым учетом высокочастотных единиц, которые модель обновляет чаще всего, — не более 0,05. Unigram-LM также сегментирует отложенные молекулы на 29–41% больше токенов; оба подхода в основном согласуются, где производить разрез, но не в его глубине, так что сегментация BPE является строгим огрублением сегментации Unigram-LM для 80–99% молекул. Различие сохраняется для всех корпусов, границ и размеров словаря, даже при восьмикратном увеличении этого масштаба. Таким образом, выбор алгоритма подслов является моделировочным решением, а не свободным значением по умолчанию. В исследовании не обучались никакие языковые модели.
English
Every chemical language model reading SMILES begins with a tokenizer, yet the field has inherited byte-pair encoding (BPE) from natural language with little scrutiny. In natural language, BPE's principal alternative, Unigram-LM, is known to build structurally different vocabularies. Whether that contrast survives in chemistry was open. We report a controlled comparison of BPE and Unigram-LM over a fixed 165-token chemistry base, at the small vocabulary sizes where token embeddings are learnable, across three corpus typologies (diverse, drug-like, natural-products) and both pre-tokenization boundary policies. The two do not converge. In all 22 matched conditions they build near-disjoint subword vocabularies: cross-algorithm Jaccard overlap on the learned pieces never exceeds 0.161, and at most 0.05 once weighted toward the high-frequency pieces a model updates most. Unigram-LM also segments held-out molecules into 29-41% more tokens; the arms largely agree on where to cut but not how deeply, so BPE's segmentation is a strict coarsening of Unigram-LM's on 80-99% of molecules. The separation holds across corpus, boundary, and vocabulary size, persisting even at eight times that scale. The subword algorithm is therefore a modeling decision, not a free default. The study trains no language models.