У справі New York Times розсекретили заяви Microsoft про ШІ-скрейпінг

У справі New York Times розсекретили заяви Microsoft про ШІ-скрейпінг

У матеріалах позову New York Times наведено твердження про збирання контенту для ШІ та ризики для видавців.

У розсекреченій частині матеріалів у позові The New York Times проти OpenAI та Microsoft містяться твердження про масове збирання контенту медіа для навчання моделей штучного інтелекту. Як повідомляє TechCrunch, у поданні газети наведено внутрішні висловлювання представників компаній про ризики таких практик для видавців і журналістів.

Зокрема, директор Microsoft із прикладної науки Брент Гехт у внутрішній записці за січень 2023 року нібито назвав це «приголомшливою крадіжкою безпрецедентних масштабів» і «найбільшою крадіжкою праці в історії людства». Водночас видання зазначає, що значна частина нових відомостей походить із самого подання The New York Times, а первинні додатки до нього досі залишаються закритими. Наведені цитати подано без початкового контексту.

 

Дані про трафік і контент

 

Згідно з матеріалами позову, внутрішні дані Microsoft показали, що пошуковий сервіс відповідей Copilot зменшував переходи на домен The New York Times до 93% порівняно зі звичайним пошуком Bing. У презентації Гехта від січня 2024 року це описано як «петлю приреченості», яка може одночасно погіршити роботу моделей і становище всього вебу.

Позивачі також стверджують, що проміжні набори даних OpenAI містили понад 91 692 копії матеріалів The New York Times, Daily News і Center for Investigative Reporting. Набір даних, сформований на основі Common Crawl, нібито включав понад 2 млн документів із nytimes.com. За твердженням у позові, у наборі Project Mango були копії щонайменше 160 903 унікальних робіт новинних видавців.

 

Твердження про обхід платного доступу

 

У поданні стверджується, що OpenAI та Microsoft отримували контент, зокрема через індекс Bing, а працівники OpenAI обговорювали спосіб обійти платний доступ The New York Times непомітно. Там само йдеться про нібито вилучення повідомлень про авторські права з навчальних даних, аби моделі не відтворювали їх користувачам.

Генеральний директор Microsoft Сатья Наделла раніше під час свідчень заявив, що матеріали за платним доступом мають ліцензуватися для використання в навчанні або для надання відповідей. За його словами, якби він дізнався про навчання OpenAI на такому контенті, то скористався б правом Microsoft вимагати повторного навчання моделей. OpenAI та Microsoft не відповіли на запити про коментар, пише TechCrunch.