Wyobraź sobie typowy scenariusz: firma zaczyna intensywnie używać AI — ChatGPT w dziale obsługi klienta, Claude do redagowania umów, GitHub Copilot u programistów. Każdy dział wdraża narzędzia na własną rękę, każdy wysyła zapytania przez wspólny klucz API. Kiedy faktura za kolejny miesiąc jest dwukrotnie wyższa od poprzedniej, nikt nie potrafi powiedzieć, co ją napędziło — który projekt, który zespół, które narzędzie.
Brak widoczności w wywołaniach AI to dziś jeden z najczęstszych problemów firm, które wdrożyły AI, ale nie wdrożyły jeszcze struktury zarządczej wokół tych wdrożeń.
5 sierpnia 2026 Cloudflare ogłosił open betę funkcji identity-aware AI Gateway — rozszerzenia platformy AI Gateway o pełną identyfikację użytkowników wykonujących wywołania API. To narzędzie odpowiada na pytanie, które powinno paść znacznie wcześniej: kto dokładnie generuje Twoje koszty AI i czy coś tu nie gra?
Czym jest Cloudflare AI Gateway
AI Gateway to warstwa pośrednia między Twoją aplikacją lub narzędziem a dostawcą AI. Zamiast wysyłać zapytania bezpośrednio do OpenAI, Anthropic lub Google, cały ruch przechodzi przez jeden punkt kontrolny na infrastrukturze Cloudflare.
Obsługiwane dostawcy to m.in. OpenAI, Anthropic, Google Gemini, Replicate, Workers AI, ElevenLabs, Groq, Mistral AI, Cohere i DeepSeek. Co istotne dla firm używających narzędzi dla programistów — Gateway obsługuje też agentyczne środowiska pracy: Claude Code, Claude Desktop, GitHub Copilot CLI, OpenAI Codex. Jeden punkt wejścia, pełny widok na wszystko.
Dostępne funkcje obejmują:
- Analitykę i logowanie — liczba zapytań, zużyte tokeny, koszty w jednym dashboardzie, w podziale na dostawców
- Cache — identyczne zapytania obsługiwane z pamięci Cloudflare zamiast płatnego wywołania u dostawcy (szybciej, taniej)
- Rate limiting — kontrola liczby zapytań w oknie czasowym
- Retry i fallback — automatyczne przełączenie na zapasowy model przy błędzie dostawcy
- Spend limits (beta) — limity budżetu per użytkownik lub agent
- Guardrails (beta) — filtrowanie szkodliwych lub niezgodnych treści
- Data Loss Prevention (beta) — wykrywanie wrażliwych danych w zapytaniach wychodzących
- User Insights — analiza behawioralna wywołań: kiedy coś zaczyna wyglądać inaczej niż zwykle
Cloudflare informuje, że wdrożenie wymaga zmiany jednej linii kodu — podmianę URL dostawcy na adres Gateway. Bez przebudowy architektury, bez nowych bibliotek.
Warto zatrzymać się przy funkcji cache, bo dla niektórych zastosowań MŚP może ona sama z siebie uzasadniać wdrożenie Gateway. Jeśli Twoja aplikacja wielokrotnie wysyła do modelu AI identyczne lub bardzo podobne zapytania — np. kategoriazację przychodzących zgłoszeń według stałego schematu, generowanie standardowych odpowiedzi na często zadawane pytania albo ekstrakcję danych ze sformatowanych dokumentów — identyczne żądania są obsługiwane z pamięci Cloudflare. Dostawca AI nie dostaje wywołania, a Ty nie płacisz za tokeny. W środowiskach z dużym odsetkiem powtarzalnych zapytań oszczędności są realne i mierzalne od pierwszego dnia.
Problem: wspólne klucze API nie mają właściciela
Zanim przejdziemy do nowych funkcji, warto nazwać problem, który Gateway rozwiązuje.
Większość firm zaczyna przygodę z AI API w ten sam sposób: jeden klucz API na cały team, wpisany w .env lub przekazywany przez menedżera projektu. To wygodne na start. Problem pojawia się, gdy masz pięć aplikacji i kilkanaście osób wysyłających zapytania przez ten sam token — a do tego kilka autonomicznych agentów uruchamianych w tle.
Max Baumgarten, Staff Security Engineer w Flexport, ujął to precyzyjnie w sierpniowym komunikacie Cloudflare: wspólne klucze API sprawiają, że praktycznie niemożliwe jest ustalenie, kto korzysta z danej usługi AI — bo klucz nie ma właściciela, ma tylko uprawnienia.
To nie jest wyłącznie problem kosztowy. To problem bezpieczeństwa i zgodności. Kiedy jeden klucz API ma dostęp do wszystkiego, nie ma granicy między tym, co powinien robić analityk marketingu, a tym, co może zrobić agent automatyzujący dokumenty prawne. Jeśli klucz wycieknie — wycieknie dostęp do całości.
Badania prowadzone przez Stanford University — cytowane bezpośrednio w sierpniowym komunikacie Cloudflare — wskazują, że 59% organizacji uznaje luki wiedzy za największą przeszkodę w odpowiedzialnym zarządzaniu AI. Nie technologię, nie koszt, lecz właśnie brak wglądu w to, co się dzieje.
Podobny problem opisywaliśmy, analizując shadow AI w firmie — niezatwierdzonych narzędzi AI używanych poza wiedzą IT. Gateway rozwiązuje inny, ale powiązany problem: to, co jest zatwierdzone, też wymaga nadzoru na poziomie wywołań API.
Identity-aware AI Gateway — co się zmieniło 5 sierpnia
Open beta identity-aware AI Gateway to praktyczna integracja dwóch produktów Cloudflare: AI Gateway oraz Cloudflare Access.
Cloudflare Access to system zero-trust do uwierzytelniania użytkowników przed dostępem do zasobów. Obsługuje SAML — co oznacza integrację z Okta, Microsoft Entra i podobnymi dostawcami tożsamości korporacyjnej, z których korzysta większość firm powyżej kilkudziesięciu pracowników.
Po połączeniu obu produktów każde wywołanie AI API niesie ze sobą zweryfikowaną tożsamość użytkownika. Cloudflare przypisuje do każdego uwierzytelnionego żądania identyfikator cf.user_id. To pole pojawia się potem w logach, analityce i alertach — i pozwala filtrować wszystko per osoba lub per agent.
Praktyczne konsekwencje dla MŚP:
Koniec z anonimowymi wywołaniami. Zamiast widoku „klucz API wysłał 2 000 zapytań”, widzisz: konkretna osoba z konkretnego działu wykonała konkretną liczbę wywołań — i kiedy dokładnie.
Per-user spend limits. Funkcja dostępna w fazie beta pozwala przypisać każdemu użytkownikowi (lub agentowi) budżet. Po jego wyczerpaniu Gateway blokuje kolejne wywołania lub automatycznie przełącza na tańszy model. Koniec z sytuacją, w której jeden entuzjasta AI generuje rachunek całego działu.
Jeden adres hostname bez kluczy w URL. Baumgarten z Flexportu opisał architekturę wdrożoną w Flexport: hostname w stylu ai.example.com obsługiwany przez Cloudflare Access. Klucze API dostawców są przechowane po stronie Cloudflare w funkcji Store Keys, nie w URL ani kodzie klienta. To istotna zmiana dla bezpieczeństwa — klucz nie przecieka przez historię przeglądarki, logi serwera ani repozytoria kodu.
Samo połączenie Access z Gateway Baumgarten opisał jako wstawienie jednej warstwy przed Gatewayem, która przypisuje każdemu żądaniu zweryfikowaną tożsamość i pozwala stosować firmowe reguły dostępu — te same, które obowiązują przy wejściu do innych chronionych zasobów Flexport.
User Insights — jak system wykrywa anomalie
User Insights to analiza statystyczna, nie reguła. Nie blokujesz użytkownika dlatego, że przekroczył arbitralny limit — system analizuje, czy jego bieżące zachowanie odbiega od jego własnej historii.
Algorytm działa na 30-dniowej historii sesji konkretnego użytkownika lub agenta. Oblicza 95. percentyl (p95) kosztu sesji per osoba. Następnie porównuje każdą bieżącą sesję z tym indywidualnym benchmarkiem. Jeśli bieżąca sesja jest jednocześnie ponad dwukrotnie droższa od osobistego p95 użytkownika i przekracza zbiorczy próg konta (p99 dla całego ruchu), system oznacza sesję jako anomalię i pokazuje ją administratorowi.
Cloudflare opublikował dane kalibracyjne z własnego ruchu wewnętrznego: typowa sesja kosztuje poniżej 10 dolarów, p95 wynosi około 20 dolarów, a p99 — około 200 dolarów. Próg wykrycia jest oparty na realnych danych, nie na odgórnej liczbie.
Ważne zastrzeżenie z dokumentacji Cloudflare: User Insights nie rozstrzyga intencji i nie blokuje nikogo samodzielnie. System wskazuje administratorowi te konta, które zaczęły się zachowywać inaczej niż zwykle — żeby to człowiek mógł zadać kolejne pytanie i ocenić sytuację.
System nie wydaje wyroków. Nie blokuje. Skraca czas potrzebny administratorowi do zauważenia czegoś niepokojącego z „dopóki nie sprawdzę ręcznie” do „zostało mi wyróżnione w dashboardzie”. To rozróżnienie jest ważne dla MŚP. Nie chcesz systemu, który samoczynnie blokuje pracownika w środku ważnego projektu. Chcesz systemu, który wyłapuje sygnał anomalii i przekazuje go do decyzji człowieka.
Co może być sygnałem anomalii? Kilka przykładowych scenariuszy:
- Ktoś uruchomił w weekend nieautoryzowany skrypt przetwarzający duże ilości danych przez API
- Agent automatyzujący wpadł w pętlę i wielokrotnie powtarza to samo kosztowne wywołanie
- Pracownik testuje na koncie produkcyjnym coś, co powinno trafiać na środowisko deweloperskie
- Wyciekły dane uwierzytelniające i ktoś z zewnątrz używa Twojego konta
Cechą wspólną tych scenariuszy jest to, że odchylenie od normy jest widoczne statystycznie, zanim zdążymy je zauważyć ręcznie. W każdym z tych przypadków User Insights nie musi znać powodu. Musi tylko wyłapać sygnał i skierować uwagę administratora we właściwe miejsce.
Agenci AI — osobna kategoria problemu
Nową warstwą wyzwań w zarządzaniu wywołaniami AI są agenty — skrypty i narzędzia, które autonomicznie wysyłają zapytania do API. Agent piszący projekty odpowiedzi, sprawdzający oferty dostawców, przetwarzający faktury. Każdy taki agent działa pod kluczem API, często z szerokimi uprawnieniami i bez naturalnych ograniczeń, które nakłada na człowieka czas i uwaga.
Cloudflare opublikował 5 sierpnia — równolegle z ogłoszeniem identity-aware Gateway — artykuł o Agent Access Model (AAM), nowym modelu bezpieczeństwa dla agentów AI. Kluczowa obserwacja: agenci różnią się od użytkowników pod czterema względami, które mają bezpośrednie znaczenie dla bezpieczeństwa.
Po pierwsze, agenci są efemeryczni, ale ich dane uwierzytelniające są trwałe. Serwisowe klucze API przeżywają zadanie, dla którego zostały stworzone — i często są znacznie rzadziej rotowane niż hasła użytkowników. Po drugie, agenci działają z maszynową prędkością — jeśli coś pójdzie nie tak, zanim system wykrycia anomalii kalibrowany pod ludzkie tempo zareaguje, szkoda może być już wyrządzona. Po trzecie, prompt nie jest granicą bezpieczeństwa — instrukcje pomagają, ale nie egzekwują dostępu tak, jak to robi warstwa sieciowa. Po czwarte, agenci komponują uprawnienia przez łańcuch wywołań — agent wywołuje narzędzie, które wywołuje innego agenta, i w każdym przeskoku może zmienić się zakres dostępu.
Rekomendacja AAM jest prosta: uprawnienia agenta powinny być jak najmniejsze i dopasowane do konkretnego zadania. Nie stały klucz API z pełnym dostępem, lecz token skopowany do jednej operacji, wygasający po jej zakończeniu.
Połączenie Gateway z Access i User Insights daje MŚP praktyczną infrastrukturę do tej zasady: każde wywołanie agenta jest logowane z tożsamością, każda anomalia szybkościowa czy kosztowa jest sygnalizowana, limity budżetu chronią przed niekontrolowanym narastaniem kosztów.
Co zapowiada Cloudflare w roadmapie
Cloudflare zapowiedział dwie funkcje w dalszym planie rozwoju AI Gateway.
Task-based smart routing — automatyczne kierowanie prostszych zadań do tańszego modelu. Jeśli agent sprawdza, czy e-mail zawiera dane osobowe, nie potrzebuje do tego najdroższego dostępnego modelu. Gateway ma samodzielnie rozpoznawać złożoność zadania i wybierać model proporcjonalnie do potrzeby — bez zmiany kodu aplikacji.
Prompt classification — automatyczne tagowanie zapytań według kategorii, zanim trafią do dostawcy. Dzięki temu dashboardy analityczne pokażą nie tylko, kto ile wydaje, ale też na co — na kreatywne pisanie, na analizę danych, na kodowanie.
Obie funkcje są na etapie zapowiedzi, bez opublikowanej daty ogólnej dostępności.
Jak zacząć — plan dla MŚP
User Insights i podstawowa analityka są dostępne dla każdego konta AI Gateway bez dodatkowego kosztu — Cloudflare ogłosił ogólną dostępność User Insights bez dodatkowej opłaty dla wszystkich klientów AI Gateway. Integracja z Cloudflare Access i identity-aware Gateway wymaga konta Cloudflare z aktywnym produktem Access (dostępnym w planie Zero Trust — istnieje bezpłatny tier dla małych zespołów do 50 użytkowników).
Praktyczne kroki:
Połącz aplikacje z AI Gateway. Zamień URL dostawcy (np.
https://api.openai.com/v1) na adres Cloudflare Gateway w formaciehttps://gateway.ai.cloudflare.com/v1/{account_id}/{gateway_id}/openai. To jedna zmiana per aplikacja lub narzędzie. Dashboard zacznie zbierać dane od razu.Włącz logowanie i analitykę. Po kilku dniach zobaczysz rozkład wywołań, zużycie tokenów i koszty w podziale na dostawców i modele. Już to daje podstawowy wgląd w strukturę wydatków.
Skonfiguruj Cloudflare Access. Jeśli korzystasz z Okta lub Microsoft Entra, integracja SAML jest standardowym krokiem konfiguracyjnym. Użytkownicy logują się do zasobów firmowych przez Access tak samo jak do innych chronionych aplikacji.
Połącz Access z AI Gateway. Po połączeniu każde uwierzytelnione wywołanie niesie pole
cf.user_id. Logi stają się czytelne — wiesz, kto co robił.Ustaw spend limits per użytkownik (beta). Zacznij od wysokiego limitu, obserwuj dane przez miesiąc, potem dopasuj progi do rzeczywistych wzorców użycia. Lepiej zacząć konserwatywnie od strony limitu niż od strony blokady.
Monitoruj User Insights. Pierwsze anomalie system wyłapuje po zebraniu wystarczającej historii (30 dni na użytkownika). Po tym czasie dashboard pokaże sesje odbiegające od normy — te wymagają krótkiego przeglądu przez administratora.
Jeśli równolegle chcesz obniżyć faktury za AI API, warto zapoznać się z technikami po stronie samych zapytań — takimi jak prompt caching i batch processing. Gateway jest warstwą kontrolną i nadzorczą — nie zastępuje optymalizacji kosztowej samych wywołań, ale razem z nią daje pełny obraz.
Co to zmienia dla MŚP
Przez ostatnie dwa lata wdrożenia AI w firmach rosły szybciej niż umiejętność ich nadzorowania. Nowe narzędzia były adoptowane przez poszczególne działy, klucze API krążyły w plikach środowiskowych i wewnętrznych komunikatorach, faktury przychodziły jako zbiorcze rachunki bez rozbicia na inicjatywy.
AI Gateway z funkcją identyfikacji tożsamości i analityki behawioralnej to odpowiedź na dojrzalszy etap tego procesu. Nie zmniejsza liczby wywołań AI — i nie ma takiego celu. Daje widoczność i przenosi decyzje o alokacji budżetu, politykach dostępu czy wykrywaniu nadużyć z reaktywnej analizy faktur na bieżący nadzór.
Dla MŚP, które wdrożyły AI, ale nie wdrożyły jeszcze struktury zarządczej wokół tych wdrożeń, to dobry moment na zmianę — zwłaszcza że narzędzie w podstawowej wersji nie wiąże się z dodatkowym kosztem, a koszt wdrożenia to podmiana jednej linii kodu w każdej zintegrowanej aplikacji.
Jeśli interesuje Cię, jak podobne rozwiązania infrastrukturalne wpisują się w szerszą strategię AI dla MŚP — więcej tekstów i przewodników znajdziesz w sekcji Sztuczna Inteligencja na monaltro.pl.