Подрядчики OpenAI оценивают реальные переписки ChatGPT

По расследованию 404 Media, подрядчики просматривают обезличенные диалоги и оценивают ответы модели. В сообщениях всё ещё могут сохраняться чувствительные сведения, а фильтр конфиденциальности способен ошибаться.

Как оценивают ответы

Сотни подрядчиков OpenAI изучают реальные переписки пользователей ChatGPT, чтобы помогать улучшать ответы модели, сообщило расследование 404 Media. Проверяющие оценивают ответы по шкале от 1 до 7; среди целей названы снижение чрезмерной лести и слишком «человеческой» манеры общения.

По данным публикации, диалоги обезличивают перед просмотром, однако в них могут оставаться чувствительные персональные сведения. Фильтр конфиденциальности способен не обнаружить их. Один из проверяющих заявил, что, по его мнению, пользователи могут не знать об анализе; среди рассмотренных им примеров были запросы с просьбой сохранить содержание в тайне.

Организация работы и приватность

Подрядчиков нанимают через компанию Crossing Hurdles, а выплаты проводит Mercor. Такая работа относится к оценке качества ответов и обучению моделей, но одновременно означает, что некоторые пользовательские диалоги могут просматриваться людьми после обработки.

Сведения основаны на журналистском расследовании и комментариях работников. Материал не устанавливает долю всех переписок, которые проверяют, и не сообщает, что каждый разговор передаётся подрядчикам.

Подрядчиков нанимали через Crossing Hurdles, выплаты проходили через Mercor; один североамериканский проверяющий сообщил 404 Media о ставке выше $50 в час. OpenAI упоминает просмотр переписок людьми в разделе справки и советует не вводить конфиденциальную информацию.

При включённой настройке «Улучшать модель для всех» новые разговоры могут использоваться для обучения и потенциальной проверки. Отключение настройки исключает новые диалоги из этого процесса; временные чаты, по заявлению компании, также не используются для обучения. Издание отмечает, что аналогичную человеческую оценку применяют и другие разработчики, включая Anthropic и Google.

The Decoder: подрядчики оценивают переписки ChatGPT