Метод byteification дозволив мовним моделям рахувати окремі літери
Метод byteification адаптував великі мовні моделі до роботи з окремими символами та підрахунку літер у тексті.
Дослідники представили підхід byteification, який дає змогу дооснастити великі мовні моделі для роботи з текстом на рівні байтів і окремих символів. Як повідомляє Nature, метод застосували до вже наявних моделей, що зазвичай опрацьовують слова не по літерах, а через токени — послідовності символів.
Чому моделі помиляються в підрахунку
Токенний принцип роботи допомагає мовним моделям досягати високих результатів у багатьох завданнях, однак обмежує їхню здатність аналізувати окремі знаки в словах. Наприклад, у слові strawberry літера r трапляється тричі, але багато великих мовних моделей відповідають, що вона міститься там двічі.
Причина в тому, що такі моделі не мають прямого доступу до окремих символів: слова для них подано як токени, тоді як самі символи кодуються двійковими послідовностями — байтами. Через це моделі можуть ненадійно виконувати завдання на кшталт підрахунку конкретної літери у слові чи фразі.
Модифікація на рівні байтів
У статті, на яку посилається Nature, Мінксхофер та співавтори описали byteification як спосіб адаптації токенних моделей до опрацювання байтів. Автори огляду Чжао Чжан і Їнфей Сюн зазначили, що моделі після такої модифікації зберігають конкурентні показники роботи, водночас отримуючи здатність читати окремі символи.
Назва роботи ілюструє цю можливість прикладом із фразою artificial intelligence: модифікована модель може коректно порахувати в ній літери i. Підхід орієнтований не на створення моделі з нуля, а на переоснащення вже наявних великих мовних моделей.