Разработчики ИИ начали приобретать корпоративные переписки и чаты для обучения моделей
Спрос на корпоративные данные, такие как переписки и записи видеоконференций, значительно возрос среди разработчиков ИИ. Это связано с ограничениями на сбор общедоступной информации в интернете.
Разработчики больших языковых моделей, включая OpenAI и Anthropic, проявляют растущий интерес к внутренним данным компаний, что стало ответом на сложности с получением общедоступной информации для обучения нейросетей. В последнее время наблюдается резкий рост спроса на такие данные, как переписки в мессенджерах, электронные письма, записи видеозвонков и изменения в программном коде.
По словам Бобби Сэмюэлса, генерального директора брокера данных Protege, объем сделок его компании увеличился с 30 миллионов долларов в прошлом году до как минимум 100 миллионов долларов в текущем. Этот рост интереса к данным обусловлен развитием ИИ-агентов, которые способны выполнять повседневные задачи пользователей.
Корпоративные данные становятся привлекательными, так как они содержат информацию о реальном взаимодействии работников, что может быть полезно для обучения ИИ-моделей. В частности, покупатели проявляют интерес к данным стартапов, находящихся на грани банкротства или поглощения.
К примеру, стартап Warmly, который разрабатывает ИИ-агентов и был недавно приобретен HubSpot, получил несколько предложений на сумму до 300 тысяч долларов за данные о рабочем взаимодействии сотрудников. Эти предложения поступили после завершения сделки о поглощении, но были отклонены.
С увеличением торговли корпоративными данными становится актуальным вопрос их анонимности. Компании, занимающиеся продажей данных для обучения ИИ, вынуждены уделять внимание удалению информации, позволяющей идентифицировать людей. Шуб Синха, гендиректор компании по обработке данных Integral, отметил, что они соблюдают строгие процедуры анонимизации для сохранения ценности данных и соблюдения конфиденциальности.
По материалам: 3dnews.ru