404 Media опубликовала расследование о внутренней программе OpenAI под названием Project Lily. Сотни внешних подрядчиков, нанятых через рекрутингового посредника Crossing Hurdles и получающих выплаты через платформу Mercor, читают настоящие промпты и целые диалоги пользователей ChatGPT, оценивают ответы модели и пишут разборы.
Сама практика такой «человеческой» оценки известна давно. Новостью стал масштаб и то, насколько мало о ней знают пользователи. У ChatGPT больше 900 млн пользователей.
Что видят рецензенты
Подрядчики работают с полными разговорами, включая те, где есть и ваши личные данные. По описанию 404 Media, вместе с диалогом рецензенту показывают сводку памяти пользователя — накопленный контекст из прошлых чатов, локацию, обстоятельства жизни. Имен пользователей в интерфейсе нет.
Работа устроена так. Рецензент пишет, что именно хотел получить пользователь, затем оценивает несколько вариантов ответа модели по шкале от 1 до 7.
Оплата заметно выше обычной для разметки. Один рецензент из Северной Америки называл ставку больше 50 $ в час. Задачи при этом крутятся вокруг поведения модели. Подавление антропоморфизации, борьба с подхалимством и настройка тона.
Один из подрядчиков сказал 404 Media, что пользователи, по его мнению, вообще не представляют себе, что где-то сидит человек и разбирает их разговоры. Вспоминается история лондонского Builder.ai, который продавал автоматическую сборку приложений, где значительную часть работы делал не ИИ, а живые инженеры в Индии. В мае 2025 года компания с оценкой в 1,5 млрд $ ушла в банкротство. Общее одно — про людей в этой схеме пользователь узнает последним.
Как это обезличивается
За очистку отвечает отдельная модель, Privacy Filter. Она вычищает имена, адреса, почту и телефоны. OpenAI признает ее ограничения: фильтр пропускает редкие идентификаторы и плохо работает там, где деталь значима только в контексте, особенно в коротких переписках.
Механизм описан, только легче от этого не становится. Деанонимизация по косвенным признакам обходится без имени. Представьте разговор, где человек упомянул свой город, профессию, редкий диагноз и дату операции. Каждый элемент по отдельности безобиден, ни на одном фильтр не сработает. Но если кто-то захочет покопать на определенного человека, вместе они складываются в пазл.
Где здесь юридическая тонкость
Законно ли все это? Формально да. Опция «улучшать модель для всех» включена по умолчанию на тарифах Free, Plus и Pro, а политика приватности OpenAI разрешает использовать персональные данные для улучшения моделей. Претензия не к законности, а к тому, что про чтение промптов живыми людьми там прямо не сказано. После запроса 404 Media компания обновила справочную документацию и описала практику явно.
На будущее вопрос закрыт. Зато история хорошо показывает, что формулировка «данные используются для улучшения сервиса» не абстракция, а вполне конкретный человек в другой стране, читающий ваш разговор.
Два пункта, которые стоит знать пользователю. На корпоративных тарифах — Enterprise, Business и Edu — обучение на диалогах выключено по умолчанию. И отказ не распространяется задним числом: разговоры, отправленные до того, как вы сняли галочку, из цикла оценки не исчезают.
OpenAI здесь не уникальна, но условия у всех разные. Anthropic тоже использует человеческую оценку, однако требует явного согласия через настройку «Help improve our AI models», то есть по умолчанию она выключена. Google в Gemini предупреждает о человеческой проверке заметнее, чем OpenAI до публикации 404 Media.
Что это значит
Человек из пайплайна никуда не делся. Он переехал с разметки картинок на оценку поведения моделей и заметно подорожал.
Ставка тут большая. 50 $ с лишним в час платят за экспертную работу, это уровень оплаты сеньора во многих странах. Обратная связь по поведению модели, будь то подхалимство, антропоморфизация или тон, не формализуется в инструкцию для дешевого исполнителя и не снимается автоматической метрикой. Пока RLHF и его наследники остаются основным способом настраивать характер модели, человеческая оценка будет дорожать вместе с требованиями к моделям.
Для тех, кто внедряет LLM в корпоративные процессы, вывод понятен. Тариф определяет не только лимиты. Выяснять надо, попадают ли промпты в цикл человеческой оценки и как это отключается. У корпоративных и API-контуров условия обычно другие, чем у потребительских тарифов, но «обычно» здесь слово слабое, читать нужно договор.
Минимальный чеклист по любому используемому ассистенту. Включено ли обучение на диалогах по умолчанию и где этот переключатель. Распространяется ли отказ на уже отправленные разговоры или только на будущие. Сколько хранятся логи после отключения. Отличаются ли условия корпоративного тарифа от персонального у тех же сотрудников, которые заходят со своих аккаунтов. Последний пункт ломается чаще всего, потому что политика написана для корпоративного контура, а половина команды пользуется личной подпиской с дефолтными настройками.