Spis treści
- Czym jest AI agent?
- Co to są skills agenta AI?
- Jak skills działają od środka?
- Rodzaje skills – taksonomia
- Jak agent wybiera i wykonuje skill?
- Przykład użycia – krok po kroku
- FAQ
1. Czym jest AI agent?
AI agent to program oparty na dużym modelu językowym (LLM), który nie tylko odpowiada na pytania, ale samodzielnie planuje działania, korzysta z narzędzi i realizuje wieloetapowe zadania – często bez interwencji człowieka na każdym kroku.
Różnica między zwykłym chatbotem a agentem AI jest fundamentalna:
| Chatbot | Agent AI |
|---|---|
| Odpowiada na jedno pytanie | Realizuje wieloetapowe zadania |
| Działa tylko w oknie rozmowy | Wywołuje zewnętrzne narzędzia i systemy |
| Nie pamięta kontekstu zadania | Utrzymuje stan i plan działania |
| Pasywny – czeka na prompt | Aktywny – sam podejmuje decyzje o kolejnych krokach |
Agenty AI stoją u podstaw takich produktów jak Claude (tryb agentyczny), ChatGPT Agents, Google Gemini Advanced, AutoGPT czy Microsoft Copilot Studio. Ich „supermoc” to właśnie skills.
2. Co to są skills agenta AI?
Definicja: AI agent skill (dosł. umiejętność agenta) to wyodrębniony, wielokrotnego użytku moduł zdolności, który agent może wywołać, aby wykonać konkretne działanie wykraczające poza samo generowanie tekstu.
Innymi słowy – skill to zestaw instrukcji, narzędzi i wiedzy kontekstowej, który mówi agentowi:
- co potrafi zrobić (np. „mogę przeszukiwać internet”),
- kiedy powinien to zrobić (logika aktywacji),
- jak dokładnie to wykonać (instrukcje, parametry, format odpowiedzi),
- jak obsłużyć błędy (fallback, retry, eskalacja).
Skills są modularną warstwą między „mózgiem” agenta (LLM) a światem zewnętrznym. Bez skills agent jest jak ekspert zamknięty w pokoju bez telefonu, internetu ani rąk – może myśleć, ale nic nie może zrobić.
3. Jak skills działają od środka?
3.1 Cykl ReAct (Reason → Act → Observe)
Większość agentów działa w pętli ReAct (Reasoning + Acting):
┌──────────────────────────────────────────────────┐
│ 1. REASON – Agent analizuje zadanie │
│ „Użytkownik chce wiedzieć, jaka jest pogoda │
│ w Warszawie jutro." │
│ │
│ 2. ACT – Agent wybiera i wywołuje skill │
│ → Wywołuje skill: weather_lookup(city="Warsaw│
│ ", date="tomorrow") │
│ │
│ 3. OBSERVE – Agent odbiera wynik │
│ → {temp: 18°C, rain: 40%, wind: 12 km/h} │
│ │
│ 4. REASON – Czy zadanie jest ukończone? │
│ → Tak. Formułuje odpowiedź dla użytkownika. │
└──────────────────────────────────────────────────┘
Jeśli zadanie jest złożone, pętla powtarza się wielokrotnie – agent może wywołać dziesiątki skills w jednym przebiegu, budując odpowiedź krok po kroku.
3.2 Anatomiа pojedynczego skilla
Każdy skill składa się z kilku komponentów:
Opis (Description) – tekst w języku naturalnym wyjaśniający agentowi, do czego służy skill i kiedy go używać. To kluczowy element: LLM czyta opisy i na ich podstawie decyduje, który skill aktywować.
Schemat wejścia (Input Schema) – definicja parametrów, które skill przyjmuje (np. {"city": "string", "date": "ISO-8601"}). Zwykle wyrażony w formacie JSON Schema.
Executor – faktyczny kod lub wywołanie API, które wykonuje akcję (Python, JavaScript, REST call, GraphQL itp.).
Schemat wyjścia (Output Schema) – format danych zwracanych do agenta (sukces/błąd, dane strukturalne lub tekst).
Polityka błędów – co agent ma zrobić, gdy skill zawiedzie: spróbować ponownie, użyć fallback skilla, zapytać użytkownika, czy zgłosić błąd.
4. Rodzaje skills
Skills można podzielić na kilka kategorii według funkcji:
Kategoria 1: Skills narzędziowe (Tool Skills)
Dają agentowi dostęp do zewnętrznych systemów i danych.
- Web Search – przeszukiwanie internetu w czasie rzeczywistym
- Code Execution – uruchamianie kodu Python/JS w sandboxie
- File I/O – czytanie i zapis plików (PDF, Excel, CSV, Word)
- Database Query – zapytania SQL/NoSQL do baz danych
- API Caller – wywoływanie dowolnych zewnętrznych API (REST, GraphQL)
- Browser Use – sterowanie przeglądarką (Playwright, Selenium)
Kategoria 2: Skills pamięci (Memory Skills)
Pozwalają agentowi zapamiętywać i przypominać sobie informacje ponad granicami konwersacji.
- Short-term memory – kontekst bieżącej sesji (okno kontekstowe LLM)
- Long-term memory – wektorowa baza danych (np. Pinecone, Chroma) z embeddingami wspomnień
- Episodic memory – zapis przeszłych interakcji z konkretnym użytkownikiem
- Semantic memory – wiedza o świecie, dokumentach, bazie wiedzy firmy
Kategoria 3: Skills percepcji (Perception Skills)
Poszerzają zmysły agenta poza tekst.
- Vision – analiza obrazów, screenshotów, diagramów (modele multimodalne)
- Audio transcription – zamiana mowy na tekst (Whisper, Google STT)
- Document parsing – ekstrakcja danych z faktur, skanów, PDF-ów
- Video analysis – rozumienie zawartości wideo
Kategoria 4: Skills akcji (Action Skills)
Pozwalają agentowi zmieniać stan świata zewnętrznego.
- Email/Calendar – wysyłanie wiadomości, tworzenie spotkań (Gmail, Outlook, Google Calendar)
- CRM/ERP – tworzenie kontaktów, szans sprzedaży, zamówień
- Code writing & deployment – pisanie, testowanie i deployowanie kodu (GitHub, CI/CD)
- Notification – wysyłanie powiadomień (Slack, Teams, SMS, push)
- Form filling – automatyczne wypełnianie formularzy webowych
Kategoria 5: Skills meta-agentowe (Orchestration Skills)
Umożliwiają koordynację wielu agentów lub skomplikowanych przepływów.
- Subagent spawning – uruchamianie wyspecjalizowanych pod-agentów dla podzadań
- Task decomposition – rozbijanie złożonego celu na podzadania
- Human-in-the-loop – prośba o zatwierdzenie przez człowieka przed krytyczną akcją
- Reflection – ocena własnych wyników i korekta strategii
5. Jak agent wybiera i wykonuje skill?
Mechanizm wyboru skilla
Gdy agent otrzymuje zadanie, LLM analizuje dostępne skills (ich opisy) i decyduje, który wywołać. Proces ten wygląda schematycznie tak:
Zadanie użytkownika
│
▼
[LLM Planner]
Czyta opisy skills
Wybiera skill(i)
Generuje parametry wywołania
│
▼
[Skill Dispatcher]
Waliduje parametry
Wywołuje executor
│
▼
[Executor]
Wywołuje API / uruchamia kod
│
▼
[Observation Parser]
Formatuje wynik dla LLM
│
▼
[LLM] Analizuje wynik
→ Następny skill LUB odpowiedź końcowa
Jakość opisu = jakość wyboru
Najczęstszy błąd w projektowaniu skills to słabe opisy. LLM dosłownie czyta opis, żeby zdecydować, czy użyć danego skilla. Porównanie:
Zły opis:
„Narzędzie do emaili.”
Dobry opis:
„Narzędzie do emaili. Wysyła email do jednego lub wielu odbiorców. Użyj wtedy, gdy użytkownik prosi o wysłanie wiadomości email, powiadomienia lub odpowiedzi na korespondencję. Nie używaj do tworzenia wersji roboczych – od tego jest skill
draft_email.”
6. Przykład użycia – krok po kroku
Diagnostyka przeciążonego serwera (Claude Tool Use – Anthropic)
Pytanie użytkownika
„Dlaczego serwer produkcyjny działa wolno?”
Dostępne narzędzia
[
{
"name": "check_cpu_usage"
},
{
"name": "check_memory_usage"
},
{
"name": "check_disk_usage"
},
{
"name": "run_shell_command"
}
]
Krok 1: Claude analizuje problem
Claude wie, że należy sprawdzić:
- CPU
- RAM
- Dysk
- Procesy
Najpierw wybiera pierwszy tool.
{
"type": "tool_use",
"name": "check_cpu_usage",
"input": {
"server": "prod-web-01"
}
}
Krok 2: Wynik toola
{
"cpu_usage": 95
}
Claude otrzymuje wynik i stwierdza:
CPU jest bardzo wysokie. Sprawdzę procesy.
Krok 3: Kolejny tool
{
"type": "tool_use",
"name": "run_shell_command",
"input": {
"server": "prod-web-01",
"command": "top -b -n 1 | head -20"
}
}
Krok 4: Wynik
PID 2451 java 89.3%
PID 1120 nginx 2.1%
PID 981 sshd 0.1%
Claude zauważa, że proces Java zużywa większość CPU.
Krok 5: Dalsza diagnostyka
{
"type": "tool_use",
"name": "check_memory_usage",
"input": {
"server": "prod-web-01"
}
}
Wynik:
{
"memory_usage": 92,
"free_memory_mb": 512
}
Krok 6: Odpowiedź końcowa
Zidentyfikowałem prawdopodobną przyczynę spowolnienia:
- CPU: 95%
- RAM: 92%
- Proces Java wykorzystuje ~89% CPU
Rekomendacje:
1. Sprawdź logi aplikacji Java.
2. Wykonaj thread dump.
3. Zweryfikuj liczbę aktywnych żądań.
4. Rozważ restart usługi lub skalowanie instancji.
Czas wykonania: ~3 minuty. Poprzednio administrator poświęcał na to 1–2 godziny tygodniowo.
Frameworki i platformy z obsługą skills
- LangChain / LangGraph – najpopularniejszy ekosystem, bogata biblioteka gotowych skills (tools)
- AutoGen (Microsoft) – multi-agent framework z wbudowanym skill sharingiem
- CrewAI – skupiony na współpracy agentów, skills jako „narzędzia crewmembers”
- Semantic Kernel (Microsoft) – enterprise-grade, skills jako „plugins”
- Claude Tool Use (Anthropic) – natywne skills w API Claude przez
toolsparameter - OpenAI Assistants API – skills jako
toolsz wbudowanymi: code_interpreter, file_search, function calling
7. FAQ
Czym różni się skill od narzędzia (tool) agenta AI?
To w zasadzie synonimy w różnych ekosystemach. LangChain używa słowa „tool”, OpenAI i Anthropic „function” lub „tool”, Microsoft Semantic Kernel „plugin” lub „skill”, a literatura akademicka często „skill”. Wszystkie opisują ten sam koncept: wyodrębniony moduł zdolności agenta.
Czy skills mogą być niebezpieczne?
Tak – skill z dostępem do bazy danych produkcyjnej, poczty firmowej czy systemów płatności może wyrządzić realne szkody, jeśli agent popełni błąd lub zostanie zaatakowany przez prompt injection. Dlatego kluczowe skills wymagają wzorca human-in-the-loop (zatwierdzenie przez człowieka) i zasady minimalnych uprawnień (agent ma dostęp tylko do tego, czego potrzebuje).
Ile skills może mieć jeden agent?
Technicznie – bez limitu. Praktycznie – w kontekście LLM efektywność wyboru spada powyżej ~15–20 skills aktywnych jednocześnie. Dla dużych systemów stosuje się hierarchię: router agent wybiera wyspecjalizowanego pod-agenta z własnym zestawem skills.
Czy skills są przenośne między frameworkami?
Logika executora (kod Pythona, wywołanie API) jest przenośna. Definicja skilla (opis, schemat) wymaga adaptacji do formatu frameworka. Rośnie jednak trend standaryzacji – protokół MCP (Model Context Protocol) od Anthropic i ACP (Agent Communication Protocol) od IBM/Red Hat próbują ustandaryzować wymianę skills między platformami.
Jak skills mają się do RAG?
RAG (Retrieval-Augmented Generation) to jedna z implementacji memory skilla. Agent wywołuje skill knowledge_base_search, który robi wektorowe wyszukiwanie w bazie dokumentów i zwraca kontekst do LLM. Skills i RAG nie są alternatywą – RAG jest szczególnym przypadkiem skilla.
Podsumowanie
AI agent skills to fundament praktycznej użyteczności agentów AI. Bez skills LLM pozostaje narzędziem do generowania tekstu – ze skills staje się autonomicznym asystentem zdolnym do wykonywania realnych zadań w cyfrowym świecie.
Kluczowe punkty do zapamiętania:
- Skill = moduł zdolności agenta: opis + schemat + executor + obsługa błędów
- Agent wybiera skills na podstawie ich opisów w języku naturalnym – jakość opisu decyduje o jakości działania
- Pięć kategorii: narzędziowe, pamięci, percepcji, akcji, meta-agentowe
- Projektuj zgodnie z zasadą jednej odpowiedzialności i testuj izolowanie
- Dla krytycznych akcji zawsze implementuj
human-in-the-loop
Artykuł, stan na czerwiec 2026. Dotyczy ekosystemów: LangChain, OpenAI Assistants, Claude Tool Use, AutoGen, Semantic Kernel, CrewAI.

