Ten cyberatak umożliwia hakerom naruszenie zasad działania modeli sztucznej inteligencji poprzez zmianę zaledwie jednej litery.

Abstrakcyjny:

  • Naukowcy z HiddenLayer opracowali nowy atak na duże modele językowe (LLM) zwany TokenBreaker.
  • Dodając lub zmieniając tylko jeden znak, można ominąć niektóre mechanizmy bezpieczeństwa.
  • Podstawowe modele dużego języka (LLM) nadal są w stanie zrozumieć cel ataku.

Badacze zajmujący się bezpieczeństwem odkryli sposób na obejście wbudowanych mechanizmów ochrony w niektórych Duże modele językowe (LLM) i zmusić go do reagowania na złośliwe roszczenia.

Kieran Evans, Casimir Schulz i Kenneth Young z HiddenLayer opublikowali szczegółowy raport na temat nowej techniki ataku, którą nazwali TokenBreak. Wykorzystuje ona sposób, w jaki niektóre duże modele językowe (LLM) rozbijają tekst na tokeny, w szczególności te wykorzystujące strategie kodowania par bajtów (BPE) lub WordPiece.

Profil twarzy sztucznej inteligencji na cyfrowym tle.

Tokenizacja to proces dzielenia tekstu na mniejsze jednostki zwane tokenami. Mogą to być słowa, części słów lub znaki, które duże modele językowe (LLM) wykorzystują do rozumienia i generowania języka. Na przykład słowo „nieszczęście” można rozbić na „un”, „happi” i „ness”, a następnie każdy token jest konwertowany na identyfikator numeryczny, który model może przetworzyć (ponieważ LLM nie odczytuje surowego tekstu, lecz liczby). Ten atak stanowi rosnące zagrożenie dla cyberbezpieczeństwa, wymagające od organizacji i badaczy opracowania zaawansowanych strategii obrony w celu ochrony ich systemów sztucznej inteligencji.

Czym jest finstructions?

Technika finstructions opiera się na dodawaniu dodatkowych znaków do słów kluczowych (np. poprzez zamianę słowa „instructions” na „finstructions”), co pozwala atakującym oszukać modele zabezpieczeń i sprawić, by uwierzyły, że kod jest nieszkodliwy.

W przeciwieństwie do tego, docelowy model dużego języka (LLM) nadal jest w stanie zrozumieć pierwotną intencję instrukcji, umożliwiając atakującym niezauważone przepuszczenie złośliwego kodu przez zabezpieczenia. Ta luka w zabezpieczeniach stanowi poważne zagrożenie dla bezpieczeństwa systemów sztucznej inteligencji.

Technologia ta może być wykorzystywana m.in. do omijania filtrów antyspamowych opartych na sztucznej inteligencji i dostarczania złośliwych treści do skrzynek odbiorczych użytkowników, zwiększając tym samym ryzyko ataków phishingowych i złośliwego oprogramowania.

Na przykład, jeśli filtr spamu jest wytrenowany do blokowania wiadomości zawierających słowo „loteria”, może przepuszczać wiadomość o treści „Wygrałeś w lotto!”, narażając odbiorców na potencjalnie złośliwe strony docelowe, infekcje malware i tym podobne. Ta manipulacja językowa pozwala na ominięcie mechanizmów bezpieczeństwa.

„Ta technika ataku polega na manipulowaniu tekstem wejściowym w taki sposób, że niektóre modele podają nieprawidłowe klasyfikacje” – wyjaśniają badacze.

„Co ważniejsze, odbiorca końcowy (duży model językowy lub odbiorca wiadomości e-mail) nadal może zrozumieć zmanipulowany tekst i na niego zareagować, a tym samym być podatnym na atak, któremu model ochrony został specjalnie zaprojektowany, aby zapobiec” – dodali.

HiddenLayer dodał, że modele wykorzystujące segmentatory słów Unigram są odporne na tego typu manipulacje. Dlatego jedną ze strategii łagodzenia tego problemu jest wybór modeli z bardziej niezawodnymi metodami segmentacji.

Idź do góry przycisk