ШІ-агенти збільшили обсяг коду, але не прискорили розробку ПЗ

ШІ-агенти збільшили обсяг коду, але не прискорили розробку ПЗ

Дослідження показало, що ШІ-агенти збільшують обсяг коду, але людська перевірка стримує темпи випуску програмного забезпечення.

ШІ-агенти для програмування суттєво збільшують кількість написаного коду, однак це не призводить до статистично значущого зростання випуску програмного забезпечення чи скорочення штату. Такого висновку дійшли дослідники Гарвардського університету Фіона Чен і Джеймс Страттон, повідомляє Ars Technica.

Автори дослідження проаналізували агреговані дані платформи Jellyfish: 300 млн робочих подій, зокрема комітів і запитів на злиття коду, а також дані систем управління завданнями. Вибірка охопила понад 700 тисяч працівників у більш ніж 700 компаніях, що розробляють програмне забезпечення, за період від 2021 року до березня 2026-го.

 

Коду стало більше

 

Після впровадження агентів, які самостійно пишуть і подають код на основі запитів, загальна кількість рядків коду в компаніях у середньому зростала на 30%. Кількість комітів збільшувалася на 20%, а кількість pull request — на 23%.

Водночас темпи закриття Issues та Epics у системах на кшталт Jira, якими відстежують завдання й великі функції продукту, статистично значуще не змінилися. Дослідники також не виявили змін у розмірі або складності таких завдань після запровадження інструментів ШІ.

 

Перевірка коду стала вузьким місцем

 

Основним обмеженням став етап людської перевірки. Середній час між поданням pull request і його злиттям із кодовою базою зріс на 49%. Частка запитів, для яких рецензенти вимагали змін, майже подвоїлася, а кількість коментарів до одного pull request збільшилася на 35%.

Після появи агентів частка працівників, які займаються перевіркою коду, зросла на 14%. Автори також не змогли пов’язати використання ШІ зі значущими змінами в загальній кількості активних працівників компаній.

Станом на березень 2026 року 80% компаній із вибірки застосовували певні інструменти ШІ для рев’ю коду. Проте агенти залишали лише 23,3% усіх коментарів під час перевірки та створювали 10,8% pull request, тому основний обсяг контролю якості залишався за людьми.