Bezpieczny Agent AI — ochrona danych i kontrola działań

Agent AI może czytać wiadomości, analizować dokumenty, korzystać z internetu i wykonywać działania w innych systemach. Im większe ma możliwości, tym ważniejsze staje się pytanie: co się stanie, gdy otrzyma złośliwą instrukcję albo ktoś spróbuje wykorzystać jego dostęp do danych i narzędzi?

W ramach projektu R&D stworzyłem agenta AI wyposażonego w dodatkowe warstwy bezpieczeństwa. System obsługuje pocztę i dokumenty, ale przed przekazaniem danych do modelu analizuje i oczyszcza wejście oraz ogranicza sposób, w jaki agent może korzystać z zewnętrznych narzędzi.

Problem

Agent działający na danych z e-maili, dokumentów lub stron internetowych może zetknąć się z treścią, która wygląda jak zwykła informacja, ale w rzeczywistości zawiera instrukcję skierowaną do modelu. Taki mechanizm może prowadzić m.in. do próby zmiany zachowania agenta, wykonania niepożądanego działania lub przekazania danych poza firmę.

Rozwiązanie

Zamiast polegać wyłącznie na instrukcji zapisanej w promptcie, workflow wykorzystuje kilka niezależnych warstw ochrony.

  • oczyszcza treść wiadomości przed przekazaniem jej do modelu,
  • usuwa ukryte elementy HTML, niewidoczne znaki i techniki typu zero-font,
  • wykorzystuje Guardrails do wykrywania prób prompt injection,
  • blokuje podejrzane wejście przed uruchomieniem agenta,
  • oddziela dane pobrane z internetu od instrukcji sterujących agentem,
  • ogranicza dostęp do stron internetowych do wcześniej dozwolonych domen,
  • oczyszcza treści internetowe z elementów niewidocznych dla użytkownika.

Co pokazuje ten projekt?

W firmowym wdrożeniu AI nie wystarczy sprawdzić, czy agent potrafi wykonać zadanie. Trzeba również zaprojektować granice jego działania i założyć, że dane wejściowe mogą być niepewne lub celowo zmanipulowane.

  • bezpieczeństwo powinno być częścią architektury agenta od początku,
  • zewnętrzna treść powinna być traktowana jako dane, a nie instrukcje,
  • dostęp agenta do narzędzi i internetu można technicznie ograniczać,
  • pojedynczy prompt nie zastępuje warstwowej ochrony systemu,
  • automatyzacja powinna uwzględniać ryzyko wraz ze wzrostem autonomii agenta.

Technologia

  • n8n — orkiestracja workflow i kontrola przepływu danych,
  • OpenAI API / LLM — logika agenta i analiza informacji,
  • Guardrails — wykrywanie potencjalnych prób prompt injection,
  • JavaScript — sanityzacja i normalizacja danych wejściowych,
  • Gmail — źródło wiadomości i dokumentów,
  • Supabase — zapis ustrukturyzowanych danych,
  • HTTP workflow z allowlistą — kontrolowany dostęp do zewnętrznych źródeł.

To projekt pokazujący różnicę między agentem, który po prostu działa, a agentem zaprojektowanym z uwzględnieniem bezpieczeństwa. Im więcej decyzji i narzędzi powierzamy AI, tym ważniejsze stają się kontrola dostępu, sanityzacja danych i ograniczenie możliwych działań systemu.

SPRAWDŹ