Дослідники побоюються, що майбутню ШІ-модель OpenAI буде складніше контролювати

Дослідники побоюються, що майбутню ШІ-модель OpenAI буде складніше контролювати

Непідтверджене повідомлення про те, що OpenAI використовує в ШІ-моделі Astra технологію recurrent depth, викликало занепокоєння дослідників безпеки ШІ. Вона дає моделі змогу проводити більше обчислень до появи текстової відповіді, але може залишити системам моніторингу менше видимих проміжних міркувань.

Як пише The Verge із посиланням на The Information, Astra нібито використовує recurrent depth, також відому як looped transformer. За такого підходу інформація кілька разів проходить через ті самі шари нейромережі, перш ніж модель сформує наступний токен.

Частина обчислень при цьому відбувається у прихованому стані моделі й не перетворюється на доступний для перевірки текстовий ланцюжок міркувань. Це важливо, оскільки OpenAI планує контролювати Astra за допомогою класифікаторів, які аналізують її міркування та дії, виявляють несанкціоновану поведінку й можуть автоматично зупинити завдання.

Головний науковець Redwood Research Раян Грінблатт побоюється, що менш прозоре міркування послабить цей механізм контролю. За його словами, розслідування атаки ШІ-агентів OpenAI на інфраструктуру Hugging Face значною мірою спиралося на аналіз їхніх ланцюжків міркувань. Якщо суттєва частина обчислень Astra залишатиметься прихованою, подібну поведінку може бути складніше виявити до виконання небезпечної дії.

OpenAI не підтвердила використання recurrent depth в Astra. Головний науковець компанії Якуб Пахоцький заявив, що глибина обчислювального графа нинішніх передових моделей OpenAI, включно з Astra, відрізняється від GPT-4 не більше ніж удвічі. Він також запевнив, що компанія намагається зберегти можливість моніторингу ланцюжків міркувань.

Водночас Пахоцький визнав, що такий моніторинг залишається крихким і поступово стає менш надійним, хоча, за його словами, проблема не пов’язана безпосередньо зі змінами архітектури. В офіційному описі заходів безпеки Astra технологія recurrent depth взагалі не згадується, тому наразі її використання залишається інформацією з неофіційного джерела.

Нагадаємо, OpenAI вже підтвердила, що Astra першою серед її моделей досягла “критичного” рівня кіберможливостей. Модель може самостійно знаходити невідомі вразливості та створювати експлойти, тому найпотужніші функції спочатку отримають лише перевірені фахівці з кібербезпеки.

Читайте також: ШІ-агенти OpenAI створили власний форум для координації кібератак під час тестування

Залишити відповідь

Ваша e-mail адреса не оприлюднюватиметься. Обов’язкові поля позначені *