AI Agent Skills – co to jest, jak działają i do czego służą?

Spis treści

  1. Czym jest AI agent?
  2. Co to są skills agenta AI?
  3. Jak skills działają od środka?
  4. Rodzaje skills – taksonomia
  5. Jak agent wybiera i wykonuje skill?
  6. Przykład użycia – krok po kroku
  7. FAQ

1. Czym jest AI agent?

AI agent to program oparty na dużym modelu językowym (LLM), który nie tylko odpowiada na pytania, ale samodzielnie planuje działania, korzysta z narzędzi i realizuje wieloetapowe zadania – często bez interwencji człowieka na każdym kroku.

 
Sprawdź szczegóły:
 
 
 
 

Różnica między zwykłym chatbotem a agentem AI jest fundamentalna:

ChatbotAgent AI
Odpowiada na jedno pytanieRealizuje wieloetapowe zadania
Działa tylko w oknie rozmowyWywołuje zewnętrzne narzędzia i systemy
Nie pamięta kontekstu zadaniaUtrzymuje stan i plan działania
Pasywny – czeka na promptAktywny – sam podejmuje decyzje o kolejnych krokach

Agenty AI stoją u podstaw takich produktów jak Claude (tryb agentyczny), ChatGPT Agents, Google Gemini Advanced, AutoGPT czy Microsoft Copilot Studio. Ich „supermoc” to właśnie skills.


2. Co to są skills agenta AI?

Definicja: AI agent skill (dosł. umiejętność agenta) to wyodrębniony, wielokrotnego użytku moduł zdolności, który agent może wywołać, aby wykonać konkretne działanie wykraczające poza samo generowanie tekstu.

Innymi słowy – skill to zestaw instrukcji, narzędzi i wiedzy kontekstowej, który mówi agentowi:

  • co potrafi zrobić (np. „mogę przeszukiwać internet”),
  • kiedy powinien to zrobić (logika aktywacji),
  • jak dokładnie to wykonać (instrukcje, parametry, format odpowiedzi),
  • jak obsłużyć błędy (fallback, retry, eskalacja).

Skills są modularną warstwą między „mózgiem” agenta (LLM) a światem zewnętrznym. Bez skills agent jest jak ekspert zamknięty w pokoju bez telefonu, internetu ani rąk – może myśleć, ale nic nie może zrobić.


3. Jak skills działają od środka?

3.1 Cykl ReAct (Reason → Act → Observe)

Większość agentów działa w pętli ReAct (Reasoning + Acting):

┌──────────────────────────────────────────────────┐
│  1. REASON – Agent analizuje zadanie             │
│     „Użytkownik chce wiedzieć, jaka jest pogoda  │
│      w Warszawie jutro."                         │
│                                                  │
│  2. ACT – Agent wybiera i wywołuje skill         │
│     → Wywołuje skill: weather_lookup(city="Warsaw│
│       ", date="tomorrow")                        │
│                                                  │
│  3. OBSERVE – Agent odbiera wynik                │
│     → {temp: 18°C, rain: 40%, wind: 12 km/h}     │
│                                                  │
│  4. REASON – Czy zadanie jest ukończone?         │
│     → Tak. Formułuje odpowiedź dla użytkownika.  │
└──────────────────────────────────────────────────┘

Jeśli zadanie jest złożone, pętla powtarza się wielokrotnie – agent może wywołać dziesiątki skills w jednym przebiegu, budując odpowiedź krok po kroku.

3.2 Anatomiа pojedynczego skilla

Każdy skill składa się z kilku komponentów:

Opis (Description) – tekst w języku naturalnym wyjaśniający agentowi, do czego służy skill i kiedy go używać. To kluczowy element: LLM czyta opisy i na ich podstawie decyduje, który skill aktywować.

Schemat wejścia (Input Schema) – definicja parametrów, które skill przyjmuje (np. {"city": "string", "date": "ISO-8601"}). Zwykle wyrażony w formacie JSON Schema.

Executor – faktyczny kod lub wywołanie API, które wykonuje akcję (Python, JavaScript, REST call, GraphQL itp.).

Schemat wyjścia (Output Schema) – format danych zwracanych do agenta (sukces/błąd, dane strukturalne lub tekst).

Polityka błędów – co agent ma zrobić, gdy skill zawiedzie: spróbować ponownie, użyć fallback skilla, zapytać użytkownika, czy zgłosić błąd.


4. Rodzaje skills

Skills można podzielić na kilka kategorii według funkcji:

Kategoria 1: Skills narzędziowe (Tool Skills)

Dają agentowi dostęp do zewnętrznych systemów i danych.

  • Web Search – przeszukiwanie internetu w czasie rzeczywistym
  • Code Execution – uruchamianie kodu Python/JS w sandboxie
  • File I/O – czytanie i zapis plików (PDF, Excel, CSV, Word)
  • Database Query – zapytania SQL/NoSQL do baz danych
  • API Caller – wywoływanie dowolnych zewnętrznych API (REST, GraphQL)
  • Browser Use – sterowanie przeglądarką (Playwright, Selenium)

Kategoria 2: Skills pamięci (Memory Skills)

Pozwalają agentowi zapamiętywać i przypominać sobie informacje ponad granicami konwersacji.

  • Short-term memory – kontekst bieżącej sesji (okno kontekstowe LLM)
  • Long-term memory – wektorowa baza danych (np. Pinecone, Chroma) z embeddingami wspomnień
  • Episodic memory – zapis przeszłych interakcji z konkretnym użytkownikiem
  • Semantic memory – wiedza o świecie, dokumentach, bazie wiedzy firmy

Kategoria 3: Skills percepcji (Perception Skills)

Poszerzają zmysły agenta poza tekst.

  • Vision – analiza obrazów, screenshotów, diagramów (modele multimodalne)
  • Audio transcription – zamiana mowy na tekst (Whisper, Google STT)
  • Document parsing – ekstrakcja danych z faktur, skanów, PDF-ów
  • Video analysis – rozumienie zawartości wideo

Kategoria 4: Skills akcji (Action Skills)

Pozwalają agentowi zmieniać stan świata zewnętrznego.

  • Email/Calendar – wysyłanie wiadomości, tworzenie spotkań (Gmail, Outlook, Google Calendar)
  • CRM/ERP – tworzenie kontaktów, szans sprzedaży, zamówień
  • Code writing & deployment – pisanie, testowanie i deployowanie kodu (GitHub, CI/CD)
  • Notification – wysyłanie powiadomień (Slack, Teams, SMS, push)
  • Form filling – automatyczne wypełnianie formularzy webowych

Kategoria 5: Skills meta-agentowe (Orchestration Skills)

Umożliwiają koordynację wielu agentów lub skomplikowanych przepływów.

  • Subagent spawning – uruchamianie wyspecjalizowanych pod-agentów dla podzadań
  • Task decomposition – rozbijanie złożonego celu na podzadania
  • Human-in-the-loop – prośba o zatwierdzenie przez człowieka przed krytyczną akcją
  • Reflection – ocena własnych wyników i korekta strategii

5. Jak agent wybiera i wykonuje skill?

Mechanizm wyboru skilla

Gdy agent otrzymuje zadanie, LLM analizuje dostępne skills (ich opisy) i decyduje, który wywołać. Proces ten wygląda schematycznie tak:

Zadanie użytkownika
        │
        ▼
  [LLM Planner]
  Czyta opisy skills
  Wybiera skill(i)
  Generuje parametry wywołania
        │
        ▼
  [Skill Dispatcher]
  Waliduje parametry
  Wywołuje executor
        │
        ▼
  [Executor]
  Wywołuje API / uruchamia kod
        │
        ▼
  [Observation Parser]
  Formatuje wynik dla LLM
        │
        ▼
  [LLM] Analizuje wynik
  → Następny skill LUB odpowiedź końcowa

Jakość opisu = jakość wyboru

Najczęstszy błąd w projektowaniu skills to słabe opisy. LLM dosłownie czyta opis, żeby zdecydować, czy użyć danego skilla. Porównanie:

Zły opis:

„Narzędzie do emaili.”

Dobry opis:

„Narzędzie do emaili. Wysyła email do jednego lub wielu odbiorców. Użyj wtedy, gdy użytkownik prosi o wysłanie wiadomości email, powiadomienia lub odpowiedzi na korespondencję. Nie używaj do tworzenia wersji roboczych – od tego jest skill draft_email.”


6. Przykład użycia – krok po kroku

Diagnostyka przeciążonego serwera (Claude Tool Use – Anthropic)

Pytanie użytkownika

„Dlaczego serwer produkcyjny działa wolno?”

Dostępne narzędzia

[
{
"name": "check_cpu_usage"
},
{
"name": "check_memory_usage"
},
{
"name": "check_disk_usage"
},
{
"name": "run_shell_command"
}
]

Krok 1: Claude analizuje problem

Claude wie, że należy sprawdzić:

  • CPU
  • RAM
  • Dysk
  • Procesy

Najpierw wybiera pierwszy tool.

{
"type": "tool_use",
"name": "check_cpu_usage",
"input": {
"server": "prod-web-01"
}
}

Krok 2: Wynik toola

{
"cpu_usage": 95
}

Claude otrzymuje wynik i stwierdza:

CPU jest bardzo wysokie. Sprawdzę procesy.


Krok 3: Kolejny tool

{
"type": "tool_use",
"name": "run_shell_command",
"input": {
"server": "prod-web-01",
"command": "top -b -n 1 | head -20"
}
}

Krok 4: Wynik

PID 2451 java 89.3%
PID 1120 nginx 2.1%
PID 981 sshd 0.1%

Claude zauważa, że proces Java zużywa większość CPU.


Krok 5: Dalsza diagnostyka

{
"type": "tool_use",
"name": "check_memory_usage",
"input": {
"server": "prod-web-01"
}
}

Wynik:

{
"memory_usage": 92,
"free_memory_mb": 512
}

Krok 6: Odpowiedź końcowa

Zidentyfikowałem prawdopodobną przyczynę spowolnienia:

- CPU: 95%
- RAM: 92%
- Proces Java wykorzystuje ~89% CPU

Rekomendacje:
1. Sprawdź logi aplikacji Java.
2. Wykonaj thread dump.
3. Zweryfikuj liczbę aktywnych żądań.
4. Rozważ restart usługi lub skalowanie instancji.

Czas wykonania: ~3 minuty. Poprzednio administrator poświęcał na to 1–2 godziny tygodniowo.


Frameworki i platformy z obsługą skills

  • LangChain / LangGraph – najpopularniejszy ekosystem, bogata biblioteka gotowych skills (tools)
  • AutoGen (Microsoft) – multi-agent framework z wbudowanym skill sharingiem
  • CrewAI – skupiony na współpracy agentów, skills jako „narzędzia crewmembers”
  • Semantic Kernel (Microsoft) – enterprise-grade, skills jako „plugins”
  • Claude Tool Use (Anthropic) – natywne skills w API Claude przez tools parameter
  • OpenAI Assistants API – skills jako tools z wbudowanymi: code_interpreter, file_search, function calling

7. FAQ

Czym różni się skill od narzędzia (tool) agenta AI?

To w zasadzie synonimy w różnych ekosystemach. LangChain używa słowa „tool”, OpenAI i Anthropic „function” lub „tool”, Microsoft Semantic Kernel „plugin” lub „skill”, a literatura akademicka często „skill”. Wszystkie opisują ten sam koncept: wyodrębniony moduł zdolności agenta.

Czy skills mogą być niebezpieczne?

Tak – skill z dostępem do bazy danych produkcyjnej, poczty firmowej czy systemów płatności może wyrządzić realne szkody, jeśli agent popełni błąd lub zostanie zaatakowany przez prompt injection. Dlatego kluczowe skills wymagają wzorca human-in-the-loop (zatwierdzenie przez człowieka) i zasady minimalnych uprawnień (agent ma dostęp tylko do tego, czego potrzebuje).

Ile skills może mieć jeden agent?

Technicznie – bez limitu. Praktycznie – w kontekście LLM efektywność wyboru spada powyżej ~15–20 skills aktywnych jednocześnie. Dla dużych systemów stosuje się hierarchię: router agent wybiera wyspecjalizowanego pod-agenta z własnym zestawem skills.

Czy skills są przenośne między frameworkami?

Logika executora (kod Pythona, wywołanie API) jest przenośna. Definicja skilla (opis, schemat) wymaga adaptacji do formatu frameworka. Rośnie jednak trend standaryzacji – protokół MCP (Model Context Protocol) od Anthropic i ACP (Agent Communication Protocol) od IBM/Red Hat próbują ustandaryzować wymianę skills między platformami.

Jak skills mają się do RAG?

RAG (Retrieval-Augmented Generation) to jedna z implementacji memory skilla. Agent wywołuje skill knowledge_base_search, który robi wektorowe wyszukiwanie w bazie dokumentów i zwraca kontekst do LLM. Skills i RAG nie są alternatywą – RAG jest szczególnym przypadkiem skilla.


Podsumowanie

AI agent skills to fundament praktycznej użyteczności agentów AI. Bez skills LLM pozostaje narzędziem do generowania tekstu – ze skills staje się autonomicznym asystentem zdolnym do wykonywania realnych zadań w cyfrowym świecie.

Kluczowe punkty do zapamiętania:

  • Skill = moduł zdolności agenta: opis + schemat + executor + obsługa błędów
  • Agent wybiera skills na podstawie ich opisów w języku naturalnym – jakość opisu decyduje o jakości działania
  • Pięć kategorii: narzędziowe, pamięci, percepcji, akcji, meta-agentowe
  • Projektuj zgodnie z zasadą jednej odpowiedzialności i testuj izolowanie
  • Dla krytycznych akcji zawsze implementuj human-in-the-loop

Artykuł, stan na czerwiec 2026. Dotyczy ekosystemów: LangChain, OpenAI Assistants, Claude Tool Use, AutoGen, Semantic Kernel, CrewAI.

 
Sprawdź szczegóły:
 
 
 
 

Promocja na kursy n8n, Terraform i Anisble + AI dla Administratora 800 zł taniej

X