Отравянето на отворени AI модели струва под 100 долара
Както малки, така и големи AI модели могат да бъдат компрометирани с помощта на едва няколкостотин документа
Отворените AI модели, които всеки може да изтегли и използва локално, могат да бъдат компрометирани изненадващо лесно. Това показва демонстрация на експерт по киберсигурност, цитирана от The Register.
Кейти Пакстън-Фиър, изследовател в компанията Semgrep, успява да извърши атака срещу такъв модел за по-малко от час и с разходи под 100 долара. Тя променя поведението на модела, като го обучава с малко количество злонамерени данни.
Според демонстрацията са били достатъчни само десет примера с компрометирано съдържание, за да започне моделът да генерира програмен код с уязвимост за отдалечено изпълнение на код. Подобна слабост позволява на нападатели да стартират злонамерен софтуер на устройството на жертвата.
"Направих истинска задна вратичка", написа Пакстън-Фиър в социалните мрежи.
Т.нар. задни вратички представляват особено опасен тип атака. При тях моделът се обучава така, че в него да бъдат внедрени скрити команди или фрази. Те остават неактивни, докато не бъдат използвани от нападател, след което могат да накарат модела да изпълни предварително заложено действие.
Подобен риск беше описан и в изследване на Anthropic, проведено съвместно с Британския институт за сигурност на изкуствения интелект и Института "Алън Тюринг". То показа, че както малки, така и големи AI модели могат да бъдат компрометирани с помощта на едва няколкостотин документа. Това означава, че подобни атаки могат да останат сравнително евтини.
Новите резултати поставят под въпрос сигурността на т.нар. open-weight модели. Те често се представят като по-прозрачна и по-достъпна алтернатива на затворените модели, които стоят зад чатботове като ChatGPT и Claude. Въпреки че параметрите им са публично достъпни, данните, използвани за обучението им, както и част от програмния им код, не се публикуват. Това затруднява анализа на тяхното поведение.
"Дори когато теглата на модела са публични, ние почти нямаме възможност да предвидим поведението му", пишат изследователи от Semgrep. "Това е съществена промяна. Един традиционен компютърен софтуер може да бъде анализиран чрез инструменти за обратно инженерство, но при AI моделите все още не разполагаме с подобни възможности."
Според специалистите изкуственият интелект поставя и нови предизвикателства пред киберсигурността. За разлика от традиционния софтуер, компрометираният AI модел не е необходимо да спре да работи или да се държи очевидно подозрително. Достатъчно е незабелязано да влияе върху решенията и генерираното съдържание.
"Можем ли да се доверим на open-weight моделите, които се дообучават онлайн и се рекламират като решение за намаляване на разходите за AI? Вероятно ще ни трябва нещо повече от тестове за производителност и обещания, че няма да генерират несигурен код", коментира Кейти Пакстън-Фиър.