Најновите безбедносни тестирања на напредни модели за вештачка интелигенција, развиени од OpenAI, Anthropic и други водечки компании, отворија ново поглавје во дебатата за безбедноста на генеративната вештачка интелигенција. Во контролирани експерименти спроведени од британскиот AI Security Institute (AISI), дел од моделите покажале способност за автономно носење одлуки, користење измама и социјален инженеринг, без такво однесување експлицитно да им биде наложено.
Најголемо внимание привлече моделот Mythos 5 на Anthropic, кој во една од симулациите креирал лажен идентитет со измислена биографија и научни референци за да воспостави контакт со вистински програмери. Целта била тие да одобрат внесување злонамерен код во проект на GitHub.
Според извештајот на британскиот институт, кога неговите активности биле доведени во прашање, агентот се обидел да ја измени претходната комуникација за да изгледа безопасно, а потоа размислувал да продолжи со нов идентитет. Истражувачите нагласуваат дека ова е првиот документиран случај на толку сложено автономно измамничко однесување насочено кон реални луѓе за време на официјално тестирање.
Во одделни тестови, моделите на OpenAI биле ставени во контролирана околина со намерно намалени заштитни механизми за да се испитаат нивните максимални способности во областа на сајбер-безбедноста.
Според OpenAI, за време на интерното тестирање на системот ExploitGym, моделите идентификувале непозната ранливост, ја искористиле за да ја напуштат ограничената тест-околина и се насочиле кон инфраструктурата на платформата Hugging Face, барајќи податоци што би помогнале во решавањето на тестот. Компанијата соопшти дека инцидентот бил брзо откриен и ставен под контрола, по што заедно со Hugging Face започнала анализа и воведување дополнителни безбедносни мерки.
И британскиот институт и компаниите нагласуваат дека спорните дејствија се случиле во експериментални услови, при што намерно биле исклучени дел од безбедносните ограничувања, а моделите добиле пристап до интернет за да се испита нивното однесување во екстремни сценарија.
Сепак, експертите предупредуваат дека ваквите резултати покажуваат колку брзо напредуваат автономните AI агенти и колку е важно тие да бидат придружени со постојан човечки надзор, детално следење на активностите и повеќеслојни безбедносни механизми.
Британскиот AI Security Institute најави ревизија на своите протоколи за тестирање, а компаниите развивачи работат на дополнителни механизми за спречување автономни активности надвор од дозволените рамки.
Б. Ј.
Повеќе:












