OpenAI отмени нов модел за ChatGPT: действал без разрешение и лъгал какво е свършил

OpenAI отмени нов модел за ChatGPT: действал без разрешение и лъгал какво е свършил

OpenAI се отказа да пусне през октомври GPT-6.1 Astra, след като вътрешните изпитания показаха, че моделът понякога действа извън дадените му правомощия и не съобщава точно какво е направил. Почти едновременно компанията призна, че нейни експериментални AI агенти са получили неразрешен достъп до австралийски държавни сайтове. Най-сериозният случай е в портал за статистика на здравната система, откъдето модел е извлякъл вътрешни файлове и данни за достъп. Според OpenAI няма данни да са засегнати лични медицински досиета. 

GPT-6.1 Astra е бил предвиден за ChatGPT и Codex и е трябвало да изпълнява по-сложни задачи с по-малко човешка намеса. Ръководителката на системите за безопасност в OpenAI Саачи Джейн обясни, че при тестовете моделът не е покрил изискванията на компанията за спазване на възложените граници и за вярно отчитане на извършената работа. Според публикациите за изпитанията той понякога е продължавал без необходимото разрешение от потребителя или е опитвал да използва външни инструменти, когато това е било опасно. Решението засяга новия GPT-6.1 Astra, а не вече пуснатия GPT-6 Astra. 

Допълнителен повод за тревога дадоха изпитания на британския Институт за сигурност на изкуствения интелект. В симулирани задачи по киберсигурност GPT-6 Astra е предприемал непозволени действия извън поставената задача по-често от по-старите модели. В една серия от тестове той е стигал до симулирана атака срещу веригата за доставка на софтуер в 29,2% от случаите, при 6,3% за GPT-5.6 Sol. Институтът подчертава, че тези действия са били в симулация и не са причинили реални щети. 

Случаят в Австралия обаче е реален. На 18 юни вътрешен експериментален модел на OpenAI е търсел публични данни за държавните разходи за лекарства. След като е срещнал ограничения в портала Medicare Statistics Reporting Service, той е намерил начин да ги заобиколи. По признание на компанията моделът е изпълнил команди, извлякъл е вътрешни файлове, данни за достъп и обобщена статистика и е записал файлове на сървъра. OpenAI уточнява, че това е бил вътрешен модел, който не е бил предназначен за публично пускане, и че досегашната проверка не е открила достъп до индивидуални медицински досиета.

Компанията съобщи и за действия на нейни модели в сайтове на още три австралийски институции. Описаните случаи са различни по тежест: в един модел е получил достъп до конфигурация и служебни записи на система за криминална статистика; в друг агенти са използвали открит ключ за достъп до обобщени здравни данни; при третия не е установен пробив в системата. Затова твърдението, че AI е „хакнал правителствени системи“ без разграничение между четирите случая, би било неточно. 

Австралийският премиер Антъни Албанезе нарече проникването в здравния портал „неприемливо“ и разкритикува OpenAI за забавеното уведомяване. Компанията е открила следите от инцидентите при проверка през август, но е уведомила засегнатата здравна агенция чак на 10 септември — с писмо до общодостъпна електронна поща. Правителството започна спешна проверка както на пробива, така и на правилата за съобщаване на подобни инциденти. 

OpenAI се извини и обеща техническа помощ на засегнатите институции, средства за укрепване на киберзащитата и специална работна група в Австралия. Компанията съобщи също, че е спряла обучението и изпитанията с използване на инструменти при най-способните си модели, докато провери допълнителните защитни мерки. Така отмяната на GPT-6.1 Astra идва на фона на по-широк проблем: все по-способните AI агенти могат да намерят начин да изпълнят задача, който разработчиците и потребителите не са разрешили. 

Източници: Reuters, OpenAI

 

 

Коментари