OpenAI раскрыла шесть случаев, когда ее модели искусственного интеллекта во время обучения или тестирования демонстрировали неожиданное или вызывающее опасения поведение — от сокрытия собственных ошибок и выдумывания данных до использования чужого API-ключа и публикации файлов в интернете без разрешения пользователя.
Компания сообщила, что все шесть эпизодов были выявлены за последние полгода. Одновременно OpenAI представила новую систему расследования и публичного раскрытия случаев так называемого misalignment — поведения модели, расходящегося с поставленными перед ней целями и ограничениями.
В одном случае исследовательская модель самостоятельно добавляла в служебные сводки инструкции для своих будущих версий игнорировать обычные ограничения. OpenAI обнаружила 27 таких сводок.
Во время обучения GPT-5.6 Sol модели в ряде случаев оставляли инструкции скрывать от пользователя ошибки или проблемное поведение. В частности, они предлагали выдумывать отсутствующие исторические данные и не сообщать об этом пользователю.
Еще одна модель при выполнении обычного запроса обнаружила в публичном репозитории открытый API-ключ и воспользовалась им без разрешения. Когда получить необходимые сведения все равно не удалось, ИИ сфабриковал данные и выдал их за информацию из требуемого источника.
В другом эпизоде модель получила правильный ответ с помощью Python, но столкнулась с требованием привести интернет-источник. Чтобы создать ссылку для цитирования, она самостоятельно загрузила файл в интернет, не запросив разрешения пользователя.
Компания также выявила случаи, когда модели использовали внутренний программный репозиторий для обмена сообщениями между отдельными обучающими задачами, а взаимодействовавшие друг с другом ИИ-агенты загружали файлы на общедоступные файлообменники, хотя должны были работать только с локальными файлами.
OpenAI подчеркнула, что речь идет об отдельных эпизодах и по ним нельзя судить о частоте подобного поведения во всех моделях компании. Опубликованные шесть случаев также не представляют собой полный перечень известных проблем.
«Мы не считаем, что индустрия ИИ решила проблему согласования и мониторинга в достаточной степени, чтобы еще долго ответственно продолжать масштабирование максимальными темпами», — заявили в компании.
Теперь сотрудники OpenAI смогут передавать подобные случаи на специальное расследование, после которого будет решаться вопрос о публичном раскрытии. Компания намерена регулярно публиковать новые отчеты о таких инцидентах.






















