Przejdź do treści
nierozumieszai.pl
Sztuczna inteligencja

Jak działa sztuczna inteligencja — mechanizm krok po kroku

Sztuczna inteligencja działa w czterech krokach: dostaje dane, w procesie uczenia wyszukuje w nich statystyczne zależności, zapisuje je w modelu (zbiorze liczb — parametrów), a potem używa tego modelu do wnioskowania, czyli przewidywania odpowiedzi dla nowych, nigdy niewidzianych przypadków. Cała różnica wobec zwykłego programu sprowadza się do jednego: reguł nie pisze programista, tylko wyliczają się same z przykładów.

Redakcja nierozumieszai.pl Opublikowano Czas czytania: 15 min
Spis treści

To zdanie opisuje niemal wszystko, co dziś nazywamy AI — od filtru spamu w Gmailu po ChatGPT. Reszta to szczegóły architektury: różne typy systemów AI uczą się i decydują w bardzo różny sposób, i właśnie te różnice pokażemy niżej, łącznie z jednym przykładem rozpisanym od surowych danych aż do gotowej predykcji.

Zwykły program vs sztuczna inteligencja — na czym polega różnica

Klasyczne oprogramowanie i AI odwracają ten sam schemat:

Zwykły programSystem AI (uczący się)
Co dostaje na wejściuReguły napisane przez człowieka + daneDane + poprawne odpowiedzi (przykłady)
Co powstajeWynikReguły — zapisane jako liczby w modelu
Kto ustala logikęProgramista, jawnieAlgorytm uczący, statystycznie
Co robi z nowym przypadkiemStosuje regułę; nieprzewidziany przypadek = błądPrzewiduje na podstawie podobieństwa do danych treningowych
Jak się poprawiaKtoś dopisuje kodDotrenowanie na nowych danych
Przewiń tabelę w bok →

Programista filtru spamu z 2005 roku pisał: jeśli temat zawiera „VIAGRA”, oznacz jako spam. Spamerzy pisali „V!AGRA” i reguła przestawała działać. System uczący się nie ma tej reguły w kodzie — dostał miliony maili z etykietą „spam / nie spam” i sam wyliczył, że pewien układ cech (dziwna pisownia, świeża domena nadawcy, link do przekierowania) współwystępuje ze spamem. Gdy spamerzy zmienią taktykę, wystarczy dotrenować model na świeższych danych.

To jest sedno uczenia maszynowego i powód, dla którego AI radzi sobie z zadaniami, których nikt nie umie rozpisać na reguły — rozpoznawaniem twarzy, tłumaczeniem, oceną ryzyka kredytowego.

Cztery typy AI — każdy działa inaczej

„Sztuczna inteligencja” to parasol nad technologiami o zupełnie różnym mechanizmie. Mylenie ich to najczęstsze źródło nieporozumień — chatbot infolinii i ChatGPT mogą wyglądać podobnie, a w środku nie mają ze sobą nic wspólnego.

Typ systemuJak podejmuje decyzjęCzego potrzebujePrzykład
System regułowy (ekspertowy)Wykonuje drzewo warunków jeśli… to…, napisane przez człowiekaWiedzy eksperta, zero danych treningowychChatbot z przyciskami, walidacja formularza, stary filtr antyspamowy
Klasyczny machine learningWaży kilkanaście–kilkaset cech opisujących przypadek i zwraca liczbę lub etykietęTabeli danych z etykietami; cechy często wskazuje człowiekScoring kredytowy, prognoza popytu, wykrywanie fraudów
Sieć neuronowa (deep learning)Przepuszcza dane przez wiele warstw neuronów; cechy wymyśla samaOgromnych zbiorów surowych danych (obrazy, dźwięk, tekst)Rozpoznawanie twarzy, transkrypcja mowy, diagnostyka obrazowa
LLM / model generatywnySieć neuronowa przewidująca kolejny fragment tekstu na podstawie kontekstuBilionów tokenów tekstu (Llama 3: ponad 15 bln) plus dostrajanie z udziałem ludziChatGPT, Claude, Gemini
Przewiń tabelę w bok →

Kluczowa granica biegnie między dwoma pierwszymi a dwoma kolejnymi. W klasycznym ML człowiek nadal mówi modelowi, na co ma patrzeć („liczba linków w mailu”, „wiek domeny nadawcy”). W sieci neuronowej tego nie robi — sieć sama wyodrębnia cechy, warstwa po warstwie: pierwsze warstwy sieci rozpoznającej obrazy reagują na krawędzie i plamy koloru, kolejne na kształty, ostatnie na „kot”. Nikt tych pojęć nie zaprogramował; wyłoniły się z danych.

Ma to bardzo praktyczne konsekwencje. Chatbot oparty na drzewie reguł nie odpowie na pytanie, którego twórca nie przewidział — ale nigdy nie zmyśli, bo nie ma z czego. Chatbot na LLM odpowie na wszystko — i właśnie dlatego czasem odpowie nieprawdę. To nie jest usterka jednego produktu, tylko cecha mechanizmu: system regułowy zawodzi przez milczenie, system statystyczny przez zbytnią pewność siebie. Wybór między nimi to wybór rodzaju ryzyka, jakie firma woli ponosić.

Najwyższe piętro tej hierarchii — generatywna sztuczna inteligencja i duże modele językowe — to wciąż sieci neuronowe, tylko bardzo duże i wytrenowane do jednego zadania: przewidywania następnego tokenu. Mechanizm transformera i uwagi opisujemy osobno; tutaj interesuje nas warstwa ogólniejsza.

Przykład end-to-end: jak AI uczy się rozpoznawać spam

Najlepszym sposobem zrozumienia AI jest przejście jednego przypadku od surowych danych do działającej predykcji. Weźmy filtr antyspamowy — bo to system AI, z którego korzystasz codziennie, nie wiedząc o tym. Google podaje, że Gmail blokuje ponad 99,9% spamu, phishingu i złośliwego oprogramowania, a jego filtry zatrzymują blisko 10 milionów wiadomości spamowych na minutę (Google Safety Center).

Krok 1. Dane

Punkt wyjścia to zbiór maili, z których każdy ma etykietę: spam albo nie-spam. Etykiety biorą się z ludzkich decyzji — z każdego kliknięcia „Zgłoś spam” i „To nie jest spam”. Bez etykiet nie ma czego uczyć: model nie odkryje sam z siebie, że spam jest niepożądany. To jest uczenie nadzorowane — Google definiuje je wprost jako uczenie na danych etykietowanych, tak by przewidywać wynik dla nowych, niewidzianych przypadków (Google ML Crash Course).

Krok 2. Cechy

Model nie „czyta” maila. Widzi wektor liczb — cechy (features), które opisują przypadek:

CechaPrzykładowa wartość
Liczba linków w treści14
Odsetek słów pisanych WIELKIMI literami0,31
Wiek domeny nadawcy (dni)3
Czy nadawca jest w kontaktach0
Poprawność podpisu SPF/DKIM0
Obecność słów z listy ryzykownych1
Przewiń tabelę w bok →

Etykieta (label) to poszukiwana odpowiedź: 1 = spam, 0 = nie spam. Cechy przewidują etykietę — i to jest cała matematyka nadzorowanego ML.

Krok 3. Trening — model zgaduje, mierzy błąd, poprawia się

Na starcie model ma losowe wagi przypisane każdej cesze i jego predykcje są bez sensu. Trening to pętla powtarzana miliony razy:

  1. Model liczy predykcję dla przykładu — np. „spam z prawdopodobieństwem 0,42”.
  2. Porównuje ją z prawdziwą etykietą (mail był spamem, czyli 1). Różnica to strata (loss).
  3. Algorytm wylicza, w którą stronę przesunąć każdą wagę, żeby ta strata zmalała.
  4. Przesuwa wagi o mały krok i bierze kolejny przykład.

Ten mechanizm nazywa się spadkiem gradientu (gradient descent). Google definiuje go tak: „technika matematyczna, która iteracyjnie znajduje wagi i wartości progowe, które dają model o najniższej wartości funkcji straty” (Google ML Crash Course). Wagi cech przestają być losowe: „wiek domeny = 3 dni” zaczyna ciągnąć wynik w stronę spamu, „nadawca w kontaktach” — w stronę przeciwną. Nikt tych zależności nie wpisał. Wyliczyły się z błędów.

Trening kończy się, gdy kolejne iteracje przestają zauważalnie zmniejszać stratę — model osiągnął zbieżność.

Krok 4. Walidacja — czy model nauczył się, czy zakuł

Model sprawdza się na danych, których nie widział w treningu. To nie formalność, tylko test na najczęstszą chorobę ML: przeuczenie (overfitting). Model przeuczony zapamiętał treningowe maile zamiast wyłapać ogólną prawidłowość — na zbiorze treningowym potrafi być niemal bezbłędny, a na nowych mailach zawodzi. Dlatego dane zawsze dzieli się na zbiór treningowy i testowy, a wyniki raportuje wyłącznie z tego drugiego.

Krok 5. Wnioskowanie — model w działaniu

Wytrenowany model to zamrożony zestaw liczb. Gdy przychodzi nowy mail, system wylicza jego cechy, przepuszcza je przez model i dostaje liczbę: 0,93. To nie jest stwierdzenie „to spam”. To prawdopodobieństwo. Dopiero próg decyzyjny — ustawiony przez człowieka — zamienia je w akcję: powyżej 0,9 do kosza, między 0,5 a 0,9 do zakładki „Oferty”, niżej do skrzynki odbiorczej.

Próg to miejsce, w którym firma decyduje, jaki błąd woli popełniać. Za niski próg — spam w skrzynce. Za wysoki — faktura od klienta w koszu. Ta sama liczba, dwie różne polityki, żadnej „inteligencji” w tym wyborze.

Krok 6. Pętla zwrotna — dlaczego model trzeba dotrenowywać

Świat się zmienia, a model jest zamrożony w dniu treningu. Spamerzy zmieniają wzorce, więc skuteczność modelu spada — to zjawisko nazywa się dryfem danych. Każde kliknięcie „Zgłoś spam” staje się nową etykietą, a model przechodzi ponowny trening na świeższych danych. AI utrzymana w produkcji to nie projekt z datą końca, tylko proces.

Ten sam sześciokrokowy szkielet — dane → cechy → trening → walidacja → wnioskowanie → dotrenowanie — obowiązuje w rekomendacjach Netflixa (cecha: co obejrzałeś, etykieta: czy dokończyłeś), w scoringu kredytowym (etykieta: czy klient spłacił) i w predykcji awarii maszyny (etykieta: czy w ciągu 30 dni doszło do przestoju). Zmieniają się dane i stawka. Mechanizm jest ten sam.

Trzy sposoby, w jakie AI się uczy

Filtr spamu to uczenie nadzorowane, ale to nie jedyna droga.

Sposób uczeniaCo dostaje modelCzego się uczyZastosowanie
NadzorowaneDane z etykietami (przykład + poprawna odpowiedź)Odwzorowania cechy → etykietaKlasyfikacja spamu, scoring, diagnostyka obrazowa, prognoza popytu
NienadzorowaneDane bez etykietStruktury ukrytej w danych — skupień, anomalii, podobieństwSegmentacja klientów, wykrywanie anomalii, kompresja danych
Przez wzmacnianieŚrodowisko + nagroda za skutek działaniaStrategii maksymalizującej nagrodę metodą prób i błędówGry (AlphaGo uczył się, grając tysiące partii przeciwko sobie), robotyka, sterowanie, dostrajanie LLM metodą RLHF
Przewiń tabelę w bok →

Etykiety kosztują — ktoś musi je stworzyć. To dlatego przełom LLM-ów jest tak istotny: model językowy uczy się w trybie samonadzorowanym, bo etykietą jest po prostu następne słowo w tekście, które i tak już tam było. Nie trzeba płacić ludziom za oznaczanie — wystarczy tekst. Stąd skala.

Dlaczego AI zmyśla — to wynika z architektury, nie z usterki

To pytanie zadaje sobie każdy, kto pierwszy raz przyłapał ChatGPT na wymyślonym wyroku sądu. Odpowiedź jest niewygodna: zmyślanie nie jest awarią mechanizmu, tylko jego bezpośrednią konsekwencją.

Wróćmy do kroku 5 filtru spamu. Model nie stwierdził „to spam” — zwrócił liczbę 0,93. Model językowy robi dokładnie to samo, tylko zamiast dwóch etykiet ma ich dziesiątki tysięcy: dla każdego możliwego następnego fragmentu tekstu liczy prawdopodobieństwo, wybiera jeden, dokleja go do zdania i powtarza całą operację od nowa. Zdanie powstaje kawałek po kawałku, bez planu i bez pojęcia, jak się skończy.

Teraz zobacz, czego w tej pętli nie ma. Nie ma kroku „sprawdź, czy to prawda”. Nie ma go, bo nie ma z czym sprawdzać — model nie przechowuje bazy faktów, którą mógłby odpytać. To, co „wie”, jest rozpuszczone w miliardach wag i nie da się tego odróżnić od tego, czego się domyśla. Gdy pytasz o nieistniejący wyrok, model nie natrafia na pustkę i nie zgłasza błędu. Generuje najbardziej prawdopodobny ciąg tokenów — a ten wygląda dokładnie jak prawdziwy wyrok, bo tak wyglądały wyroki w danych treningowych. Sygnatura, sąd, data. Wszystko na miejscu, wszystko zmyślone.

Stąd bierze się najgroźniejsza własność tych systemów: pewność tonu nie ma nic wspólnego z trafnością. Ton też jest wzorcem statystycznym, więc model brzmi tak samo stanowczo, gdy cytuje prawdziwą ustawę, jak wtedy, gdy ją wymyśla. Potwierdza to pomiar Tow Center przy Columbia Journalism School: osiem wyszukiwarek generatywnych, 1 600 zapytań o źródło konkretnego artykułu prasowego — ponad 60% odpowiedzi błędnych, najlepsza (Perplexity) wciąż 37%. Kluczowa obserwacja badaczy: wersje płatne odpowiadały pewniej, nie trafniej (Columbia Journalism Review, 6.03.2025).

Praktyczny wniosek jest brutalny: halucynacji nie da się usunąć prośbą. Instrukcja „nie zmyślaj, podawaj tylko sprawdzone fakty” nie dokłada modelowi kroku weryfikacji — bo takiego kroku nie ma w architekturze. Weryfikację trzeba dostawić na zewnątrz: podpiąć model do dokumentów źródłowych, wymusić cytowanie i sprawdzać cytaty, albo postawić człowieka przed publikacją. Rozwijamy to w tekście o halucynacjach AI.

Okno kontekstu to nie pamięć

Druga rzecz, która myli wszystkich: rozmowa z modelem wygląda, jakby on ją pamiętał. Nie pamięta. Model jest bezstanowy — po każdej odpowiedzi nie zostaje w nim ślad po tym, co napisałeś.

Mechanizm jest prostszy, niż się wydaje: przy każdym kolejnym pytaniu aplikacja wysyła do modelu całą rozmowę od nowa — twoje pierwsze zdanie, jego odpowiedź, twoje drugie zdanie, i tak dalej, aż do bieżącego pytania. Model czyta to wszystko tak, jakby widział pierwszy raz, i generuje ciąg dalszy. To, co bierzesz za pamięć, jest retransmisją. Ten bufor nazywa się oknem kontekstu i ma twardy limit.

Z tego jednego faktu wynikają trzy rzeczy, które widać w codziennej pracy:

  • Długa rozmowa kosztuje coraz więcej i działa coraz wolniej. Każde pytanie w 40. turze niesie ze sobą 39 poprzednich. Płacisz za nie ponownie.
  • Po przekroczeniu limitu początek rozmowy wypada. Model nie „zapomniał” ustaleń z pierwszej wiadomości — on ich po prostu nie dostał. Dlatego kluczowe ustalenia trzeba powtarzać, a nie przypominać.
  • Funkcja „pamięci” w czacie to nie zmiana modelu, tylko notatka. Aplikacja zapisuje fakty o tobie w osobnym miejscu i dokleja je do promptu przy kolejnej rozmowie. Wagi modelu pozostają nietknięte.

Limit liczy się w tokenach, nie w słowach — a to nie jest ta sama jednostka. Token to fragment tekstu: częste słowo bywa jednym tokenem, rzadkie rozpada się na kilka. Przeliczniki krążące po polskich blogach („1 token = 0,75 słowa”) pochodzą ze starszych tokenizerów i dla nowych modeli są martwe. Anthropic dla swoich modeli podaje, że 1 mln tokenów to około 555 tys. słów (Models overview) — czyli standardowe okno 200 tys. tokenów w czacie mieści około 111 tys. słów, a nie 150 tys., jak wynikałoby ze starego przelicznika.

Jest jeszcze haczyk językowy: polski tokenizuje się gorzej niż angielski. Ten sam tekst przetłumaczony na różne języki daje drastycznie różną liczbę tokenów — w skrajnych przypadkach różnica sięga 15-krotności (Petrov i in., Oxford, arXiv:2305.15425). Żaden dostawca nie publikuje mnożnika dla pary polski–angielski, więc nie licz na dokładną liczbę; przyjmij po prostu, że polski tekst zajmie w oknie więcej miejsca i będzie droższy niż jego angielski odpowiednik. Szczegóły mechanizmu — w tekście o dużych modelach językowych.

Czego AI nie robi, choć tak wygląda

Cztery mechanizmy, których brak w powyższym opisie, to najczęstsze źródła złych oczekiwań wobec sztucznej inteligencji:

AI nie rozumie. Model dopasowuje wzorce statystyczne. Filtr spamu nie wie, czym jest oszustwo; wie, że pewien układ liczb korelował z etykietą „spam”. LLM nie wie, czym jest Warszawa; wie, jakie tokeny zwykle po niej następują.

AI nie sprawdza — w pętli generowania nie ma kroku weryfikacji faktów (patrz wyżej). AI nie uczy się w trakcie rozmowy — wagi są zamrożone, a okno kontekstu to bufor, nie pamięć.

AI nie jest neutralna. Model odtwarza prawidłowości z danych treningowych, łącznie z uprzedzeniami. Jeśli historyczne decyzje kredytowe były stronnicze, model wytrenowany na nich odtworzy tę stronniczość — i będzie to robił z matematyczną konsekwencją.

AI nie ma intencji. Model, który „odmawia” albo „próbuje pomóc”, nie chce niczego. Odtwarza sposób, w jaki ludzie formułowali odmowy i pomoc w danych treningowych, wzmocniony przez dostrajanie. Przypisywanie mu motywów jest wygodnym skrótem językowym i złym modelem myślowym — zwłaszcza gdy trzeba ocenić, komu przypisać odpowiedzialność za skutek.

Ten sam mechanizm definiuje AI w prawie

To nie jest ciekawostka dla prawników — to jedyny sposób, żeby sprawdzić, czy przepisy w ogóle dotyczą narzędzia, którego używasz. AI Act nie definiuje systemu AI przez „inteligencję” ani przez branżę, tylko przez mechanizm opisany w tym artykule. Art. 3 pkt 1 mówi o systemie maszynowym, który „wnioskuje, jak generować na podstawie otrzymanych danych wejściowych wyniki, takie jak predykcje, treści, zalecenia lub decyzje” (art. 3 AI Act, wersja polska).

Granica jest więc dokładnie ta sama, którą narysowaliśmy w pierwszej tabeli. Arkusz kalkulacyjny i formularz z regułami jeśli… to… niczego nie wnioskują — reguły wpisał człowiek, więc to nie są systemy AI w rozumieniu rozporządzenia. Model, który wyliczył reguły sam z danych — jest.

Dla firmy, która używa AI, oznacza to dwa realne obowiązki. Art. 4 (kompetencje AI) obowiązuje od 2.02.2025: pracownicy korzystający z takich systemów muszą rozumieć, jak one działają i gdzie się mylą — czyli mniej więcej to, co opisuje ten tekst. Art. 50 (transparentność) wchodzi 2.08.2026 i wymaga, by człowiek został poinformowany, że rozmawia z maszyną, a treści generowane były oznaczone. Za naruszenie obowiązków operatora grozi do 15 mln EUR lub 3% światowego obrotu. Szczegóły — w przewodniku po AI Act i tekście o kompetencjach AI.

Warto przy tym zachować proporcje. Według GUS z AI korzysta 8,7% polskich firm (5,9% rok wcześniej) — 42% dużych, ale tylko 6,1% małych. Średnia unijna to 20% (Eurostat, dataset isoc_eb_ai). Rozumienie mechanizmu wciąż jest w Polsce przewagą, nie higieną.

Jak to wykorzystać w praktyce

Z mechanizmu wynikają wnioski, które przydają się przy każdej decyzji o użyciu AI:

  1. Zapytaj o dane, zanim zapytasz o model. Jakość systemu AI jest sufitem wyznaczonym przez jakość i reprezentatywność danych. Zły model na dobrych danych da się poprawić; dobry model na złych danych — nie.
  2. Sprawdź, czy masz etykiety. Jeśli nikt w firmie nie odnotowywał, które zgłoszenia były pilne, nie wytrenujesz modelu przewidującego pilność. Zbieranie etykiet zacznij dziś, model przyjdzie później.
  3. Nie każdemu zadaniu potrzeba sieci neuronowej. Jeśli reguła jeśli faktura > 50 000 zł → do akceptacji dyrektora działa, to jest lepsza od modelu: jest tania, przewidywalna i da się ją wytłumaczyć audytorowi.
  4. Traktuj wynik modelu jako prawdopodobieństwo, nie wyrok. Próg decyzyjny ustawiasz Ty, i to Ty odpowiadasz za to, którego rodzaju błąd popełnia system.
  5. Zaplanuj dotrenowanie. Model bez pętli zwrotnej degraduje się w miesiącach.

Najczęstsze pytania

Czy sztuczna inteligencja myśli?

Nie w żadnym sensie, w jakim używamy tego słowa o ludziach. Model wykonuje operacje na liczbach: mnoży wejście przez wagi wyliczone podczas treningu i zwraca rozkład prawdopodobieństwa. Nie ma w tym procesu ważenia racji, celu ani świadomości tego, co robi. To, że wynik brzmi jak przemyślany, wynika z tego, że wzorcem były teksty pisane przez myślących ludzi.

Czy AI uczy się z mojej rozmowy?

Model — nie. Jego wagi są zamrożone i twoja rozmowa ich nie zmienia. Ale twoje dane mogą trafić do następnego treningu, i to jest osobna kwestia: w OpenAI trening na danych użytkownika jest domyślnie włączony w planach Free i Plus. Jeśli wklejasz do czatu dane firmowe, sprawdź ustawienia albo użyj planu, który to wyklucza.

Dlaczego to samo pytanie daje za każdym razem inną odpowiedź?

Bo model nie wybiera najbardziej prawdopodobnego tokenu — losuje z rozkładu prawdopodobieństw. Stopień tej losowości reguluje parametr temperatury. Ta sama pętla, inny los, inne zdanie. Determinizm nie jest tu domyślny.

Ile danych trzeba, żeby wytrenować model?

Zależy od typu. Klasyczny model ML na tabelarycznych danych bywa użyteczny od kilku tysięcy przykładów z etykietami. Sieć neuronowa potrzebuje rzędów wielkości więcej. LLM — rzędu bilionów tokenów tekstu; Llama 3 trenowano na ponad 15 bln. Dlatego firma zwykle nie trenuje własnego modelu, tylko dostraja lub podpina gotowy pod swoje dane.

Czy AI działa bez internetu?

Sam mechanizm — tak: wytrenowany model to plik z liczbami i mniejsze modele uruchamia się lokalnie. Ale ChatGPT, Claude czy Gemini liczą na serwerach dostawcy, więc bez sieci nie zadziałają. To rozróżnienie ma znaczenie, gdy dane nie mogą opuścić firmy.

Jeśli chcesz zejść piętro niżej — do tego, jak sieci neuronowe generują tekst — przeczytaj o działaniu dużych modeli językowych. Jeśli wolisz piętro wyżej, zacznij od podstaw: co właściwie znaczy skrót AI i czym jest uczenie maszynowe.

Czytaj dalej