Дослідники адаптували мовні моделі до роботи з байтами

Дослідники адаптували мовні моделі до роботи з байтами

Дослідники представили спосіб адаптації мовних моделей до роботи з байтами, що покращив результати в STEM і завданнях кодування.

Дослідники представили метод byteification, який дає змогу перетворювати вже навчені великі мовні моделі з обробки субслів на роботу безпосередньо з байтами. Як повідомляє Nature, підхід дозволив створити байтові моделі, що за низкою завдань наблизилися до результатів початкових моделей або перевершили їх, витративши на адаптацію менш ніж 1% типового бюджету попереднього навчання.

Сучасні мовні моделі зазвичай ділять текст на слова або частини слів — токени. Автори роботи зазначають, що такий підхід обмежує розуміння тексту на рівні символів, може створювати зміщення через англоцентричні словники та ускладнює роботу з кодом, біологічними послідовностями й іншими науковими даними.

 

Перехід від субслів до байтів

 

Метод byteification не передбачає навчання нової моделі з нуля. Дослідники почали з відкритих моделей Olmo 3 7B, OLMo 2 1B, Qwen3 8B Base та Llama 3 8B і створили на їхній основі відповідно Bolmo 7B, Bolmo 1B, Bwen 8B і Blama 8B. Загальний обсяг даних, використаних для адаптації, становив 49,1 млрд токенів.

У запропонованій архітектурі потік байтів об’єднують у змінні за довжиною фрагменти — патчі. Їх опрацьовує велика трансформерна модель, після чого представлення знову розгортаються до рівня окремих байтів для прогнозування наступного символу. Автори назвали цей тип систем latent tokenizer language model.

 

Результати тестування

 

Ключовою зміною стала можливість визначати межі патчів із урахуванням одного наступного байта під час обробки вже введеного тексту. На думку авторів, це краще відтворює принцип субсловної токенізації, де межа токена може залежати від наступних символів. Під час генерації модель окремо прогнозує, чи завершився патч, разом із наступним байтом.

За наведеними результатами, Bolmo 7B у середньому перевершила всі раніше доступні байтові моделі зі співставною кількістю параметрів. Зокрема, у STEM-завданнях вона випередила BLT 7B на 16,5 відсоткового пункта. Також Bolmo 7B показала кращі результати за початкову Olmo 3 у розумінні символів і в окремих сценаріях програмування. Bwen 8B перевершила Bolmo 7B та в деяких тестах зрівнялася або перевершила модель Qwen, з якої її адаптували.

Автори також вказують, що байтові моделі можна прискорювати, збільшуючи кількість байтів у патчі. Вони розглядають такий підхід як перспективний для зниження обчислювальних, енергетичних і витрат на розгортання моделей, а також для завдань, де потрібне детальне розуміння тексту.