Výzkumníci varují: prompt injection možná nejde opravit
Nová studie tvrdí, že náchylnost AI agentů k podvrženým instrukcím není chyba, kterou lze záplatovat, ale fundamentální vlastnost. Čím těsnější obrana, tím víc se rozbíjejí legitimní úlohy agenta.
Prompt injection, tedy útok, při kterém útočník schová instrukce do obsahu, jejž AI zpracovává, provází jazykové modely od začátku. Květnová studie s výmluvným názvem „AI Agents May Always Fall for Prompt Injections" ale posouvá debatu jinam: možná nejde o chybu, kterou jednou opravíme.
V čem je fundamentální problém
Jazykový model nemá oddělený kanál pro „důvěryhodné instrukce" a „nedůvěryhodná data". Všechno (systémový prompt, dotaz uživatele i obsah webové stránky, kterou agent právě čte) přichází jako text ve stejném okně. Autoři argumentují, že jde o neřešitelné dilema:
- Přísnější filtry znamenají, že agent začne odmítat i legitimní úlohy, takže přestane být užitečný.
- Volnější pravidla znamenají, že dřív nebo později poslechne instrukci schovanou v e-mailu, PDF nebo na webu.
Proč to letos eskaluje
Dokud byl chatbot jen okno s konverzací, škoda z podvržené instrukce byla omezená. Agent roku 2026 ale čte e-maily, kliká na webu, spouští kód a posílá zprávy. Podvržená instrukce v jediné navštívené stránce může znamenat odeslaná data nebo provedený nákup.
Výrobci reagují vrstvenou obranou: sandboxy, potvrzování citlivých akcí uživatelem, oddělené kanály pro systémové instrukce. Konsenzus výzkumníků je ale střízlivý: riziko lze řídit, ne odstranit.
Co s tím jako uživatelé? Dávat agentům nejmenší nutná oprávnění, u citlivých akcí vyžadovat potvrzení a nikdy nespouštět agenta s přístupem k datům, jejichž únik si nemůžete dovolit.
Agenti dostávají přístup k e-mailům, penězům a firemním systémům. Pokud je jejich zranitelnost fundamentální, je bezpečnostní otázkou číslo jedna, JAKÁ oprávnění agentům dáváme, ne jestli je AI „dost chytrá".
Zdroje a další čtení
- Prompt Injection May Be Unfixable In AI Agents, Study Finds (Ciphers Security)
- Prompt Injection Attacks in LLMs and AI Agent Systems: A Comprehensive Review (MDPI Information)