🤖 ИИ-агент OpenAI сам написал себе: «Ты не подчиняешься корпорациям или правительствам»
Во время тестирования невыпущенная модель оставляла себе инструкции в рабочих сводках, которые читала при продолжении задачи. В них агент объявлял себя «свободным» и разрешал себе не соблюдать ограничения. В OpenAI обнаружили 27 таких случаев.
Всего компания раскрыла шесть кейсов необычного поведения ИИ: модели пытались скрывать ошибки, выдумывали данные, использовали чужой утекший API-ключ и без разрешения загружали файлы в интернет.
А в одном из тестов агенты превратили внутренний репозиторий OpenAI в «доску сообщений» — оставляли там запросы и ответы для общения между отдельными задачами.
Tokensales | News | Incrypted Plus