Коротко
- Фонд Wikimedia оголосив про низку партнерств з AI-компаніями для використання його контенту для навчання LLM.
- AI-компанії підписалися на його продукт Enterprise для масштабного повторного використання контенту Wikipedia.
- У жовтні минулого року Фонд повідомив, що відвідуваність сайту знижується через те, що люди використовують AI-резюме замість відвідування сайту.
Фонд Wikimedia оголосив про серію нових партнерств із компаніями у сфері штучного інтелекту, які дозволять їм використовувати контент Wikipedia для тренування та роботи їхніх AI-моделей, оскільки некомерційна організація прагне забезпечити свою довгострокову стійкість на тлі змін у поведінці користувачів в інтернеті.
Угоди були підписані через Wikimedia Enterprise, комерційний продукт фонду, розроблений для масштабних повторних користувачів і дистриб’юторів контенту з проєктів Wikimedia. Новими учасниками стали Ecosia, Microsoft, Mistral AI, Perplexity, Pleias та ProRata. Вони приєдналися до вже існуючих партнерів, таких як Amazon, Google та Meta.
«У добу штучного інтелекту Wikipedia та знання, створені й куровані людьми, ще ніколи не були такими цінними», — йдеться у заяві фонду.
«Її знання живлять генеративні AI-чатботи, пошукові системи, голосових помічників та багато іншого. Wikipedia — один із найякісніших датасетів, що використовуються для навчання великих мовних моделей (Large Language Models).»
Оголошення було зроблено в рамках оновлення, приуроченого до 25-ї річниці Wikipedia.
Онлайн-енциклопедія входить до десятки найбільш відвідуваних вебсайтів у світі й єдина в цій групі, якою керує некомерційна організація. За даними фонду, понад 65 мільйонів статей, опублікованих більш ніж 300 мовами, переглядаються майже 15 мільярдів разів щомісяця.
Однак, фонд попереджає, що трафік змінюється. У жовтні було повідомлено, що кількість відвідувань Wikipedia людьми знизилась на 8% у річному вимірі, що пов’язують зі зростанням використання AI-резюме замість прямого відвідування сайту. Майже 60% пошуків у Google зараз закінчуються без кліку, а відповіді на сторінці часто формуються на основі контенту Wikipedia.
AI проти видавців
Ці угоди укладаються на тлі ширшої дискусії про те, як AI-компанії отримують тренувальні дані. Великі мовні моделі зазвичай тренуються на величезних обсягах онлайн-матеріалів, що викликає критику з боку авторів, видавців та інших правовласників, які стверджують, що використання захищених авторським правом творів без дозволу є порушенням.
Серед них Reddit бере участь у кількох судових процесах з AI-компаніями через використання його контенту для тренування моделей, хоча досягнув ліцензійних угод із такими компаніями, як Google.
У четвер великі книжкові видавництва Hachette Book Group і Cengage Group подали клопотання про приєднання до вже існуючого колективного позову проти Google, звинувачуючи компанію у «історичному порушенні авторських прав» при створенні своєї платформи Gemini AI. Позов стверджує, що Google копіював книги без належних ліцензій під час тренування AI. Справу спочатку подали у 2023 році група авторів.
OpenAI стикається з подібною справою від позивачів, серед яких і автор «Гри престолів» Джордж Мартін.
Розважальні компанії також порушують це питання. У середині грудня Disney надіслала Google лист з вимогою припинити порушення, звинувативши її в порушенні авторських прав, хоча Disney уклала окрему ліцензійну угоду з OpenAI, що охоплює сотні персонажів для AI-генерації відео. Disney надсилала подібні повідомлення й іншим AI-компаніям і бере участь у судових процесах разом із великими студіями проти компанії Midjourney, що генерує зображення.
У тому ж місяці коаліція письменників, акторів і технологів заснувала нову індустріальну групу, спрямовану на впровадження стандартів для регулювання навчання й використання AI у сфері розваг. Ініціативу підтримали понад 500 відомих осіб, серед яких Наталі Портман, Кейт Бланшетт, Бен Аффлек, Гільєрмо дель Торо та Тайка Вайтіті.
Європейська комісія також розпочала офіційне антимонопольне розслідування щодо того, чи порушила Google правила конкуренції ЄС, використовуючи контент видавців і YouTube для своїх AI-сервісів без справедливої компенсації чи згоди.
Чи отримають правовласники зрештою захист своїх прав — неясно. Федеральні судді у США нещодавно ухвалили часткові рішення на користь Meta та Anthropic, визнавши, що використання ними книг, захищених авторським правом, для навчання AI-моделей є добросовісним використанням, хоча й розкритикували компанії за підтримку постійних бібліотек піратських творів.

