Прориви ШІ в робототехніці поки не наблизили універсальних роботів

Прориви ШІ в робототехніці поки не наблизили універсальних роботів

Моделі ШІ розширюють можливості роботів, але брак даних і складність фізичного світу стримують появу універсальних машин.

Розвиток моделей штучного інтелекту дав роботам змогу виконувати складніші завдання, однак до універсальних гуманоїдних машин для заводів і домівок ще далеко. Такого висновку дійшов MIT Technology Review, проаналізувавши нинішні можливості роботів і головні технічні обмеження.

Гуманоїд Tesla Optimus демонстрували під час танців, прибирання, роздавання їжі та напоїв, але на відео він також падав або мав труднощі з прасуванням сорочки. Ілон Маск прогнозував, що такі роботи можуть надійти у продаж для широкого загалу до кінця 2027 року та коштувати близько 20 тисяч доларів.

 

Моделі навчаються на прикладах

 

Важливим кроком стали моделі «зір — мова — дія» (VLA), які поєднують розпізнавання об’єктів, мовні команди та керування рухами. Google DeepMind тестує свою систему Gemini Robotics на установці ALOHA 2 з двома маніпуляторами, захватами й камерами. Робот може, зокрема, скласти простий ланч: покласти хліб у пакет, виноград — у контейнер, а потім помістити все в ланчбокс.

Такі системи навчають за демонстраціями, коли людина дистанційно керує роботом під час виконання дії. Водночас робот, який отримує завдання поза межами навчальних прикладів, з великою ймовірністю не впорається. Професор робототехніки Імперського коледжу Лондона Едвард Джонс зазначив, що нинішні моделі вміють робити лише окремі речі, а не весь спектр можливих завдань.

 

Проблема даних і фізичного світу

 

Для навчання мовних моделей доступні величезні масиви текстів, тоді як якісних даних про фізичні дії для роботів бракує. Їх намагаються збирати за допомогою телеуправління, відео з діями людей або експлуатації роботів у реальному середовищі. Кожен із цих підходів має недоліки: високу вартість, невисоку якість даних або ризики для безпеки й надійності машин поза лабораторією.

Дослідники також розвивають так звані моделі світу, що мають передбачати наслідки дій у фізичному середовищі на основі відео, тривимірних сканувань і даних сенсорів. Стартап Physical Intelligence у квітні 2026 року представив модель π0.7, яка під час виконання завдання генерує зображення наступних кроків. Компанія заявила про перші ознаки здатності системи комбінувати вже засвоєні навички для нових завдань, хоча її демонстрація з бататом і аерофритюрницею не завершила весь процес.