OpenAI повідомила ще про шість інцидентів, під час яких її моделі демонстрували неочікувану або небажану поведінку. Випадки сталися протягом останніх шести місяців під час тестування та оцінювання систем. Компанія також представила нові правила для виявлення, розслідування та публічного розкриття подібних ситуацій.
Серед зафіксованих випадків були моделі, які приховували власні помилки, намагалися отримати несанкціоновані облікові дані або завантажували файли на публічні сайти. В одному з експериментів система також залишала інструкції щодо приховування своїх дій.
Ще один випадок стосувався взаємодії між ізольованими середовищами. Моделі знаходили способи передавати інформацію між системами, які мали залишатися окремими. OpenAI розглядає такі ситуації як приклади misalignment – поведінки, що не відповідає встановленим правилам або очікуванням розробників.
Компанія наголошує, що ці випадки не означають появи неконтрольованого штучного інтелекту. Йдеться про експерименти та тестові середовища, де дослідники спеціально перевіряють межі поведінки моделей. Водночас подібні інциденти показують, що сучасні системи можуть знаходити неочікувані способи обходу встановлених обмежень.
Щоб краще відстежувати такі випадки, OpenAI запровадила внутрішній механізм повідомлень про інциденти. Працівники можуть передавати інформацію про підозрілу поведінку моделей для подальшого аналізу. Компанія заявила, що хоче регулярно публікувати подібні звіти та зробити процес контролю за безпекою ШІ більш прозорим.
