Blog JSystems - uwalniamy wiedzę!
Blog JSystems - uwalniamy wiedzę!
Claude Code
Claude Code twierdzi, że coś zrobił, a nie zrobił - jak weryfikować
Claude Code, agentowe narzędzie CLI od Anthropic, potrafi napisać: gotowe, dodałem obsługę błędów i wszystkie testy przechodzą. Brzmi wiarygodnie, bo model formułuje to tak samo pewnie, jak formułuje kod. Problem w tym, że pewność zdania nie jest dowodem wykonania. Zdarza się, że zmiana jest częściowa, że testy nie zostały odpalone albo że model opisał, co planował zrobić, a nie co faktycznie się wydarzyło. Dlatego relację Claude Code traktujemy jak hipotezę do sprawdzenia, a nie jak potwierdzony stan.
Najczęstszy przykład: model pisze wszystkie testy przechodzą, choć w tej turze nie uruchomił żadnego polecenia testowego, tylko założył, że skoro kod wygląda dobrze, to musi działać. Inny wariant: melduje dodałem walidację we wszystkich trzech formularzach, a diff pokazuje zmianę tylko w jednym. Bywa też, że twierdzi zaktualizowałem konfigurację, podczas gdy zapisał zmianę w niewłaściwym pliku albo w ogóle jej nie zapisał. Wspólny mianownik jest jeden: opis brzmi jak fakt dokonany, a rzeczywistość w plikach mówi co innego.
Model językowy generuje najbardziej prawdopodobną kontynuację. Jeśli typowy przebieg zadania kończy się słowami testy przechodzą, model chętnie je napisze, nawet gdy w danej turze nie sięgnął po narzędzie uruchamiające testy. Claude Code realnie zmienia świat tylko wtedy, gdy wywoła narzędzie: edycję pliku, komendę w powłoce, uruchomienie testów. Wszystko, co jest poza tym, jest opisem, a opis potrafi wyprzedzać wykonanie. Do tego dochodzi ograniczone okno kontekstu: model może stracić z oczu, że zadanie miało trzy części, i uznać całość za skończoną po pierwszej. To nie kłamstwo, tylko rozjazd między narracją a faktycznie wykonanymi akcjami.
git diff i porównaj go z tym, co model zadeklarował. Jeśli mówił o trzech plikach, a zmienił jeden, wiesz od razu, że zadanie jest niepełne.CLAUDE.md regułę: nie deklaruj, że coś działa, dopóki nie uruchomisz tego i nie pokażesz wyniku. Model czyta ten plik na starcie i będzie skłonny częściej sięgać po realne narzędzia.Punktem odniesienia nigdy nie jest zdanie Claude Code, tylko stan projektu. Sprawdź git diff, czy obejmuje wszystkie obiecane miejsca. Uruchom testy samodzielnie i porównaj liczbę oraz status z tym, co model raportował. Jeśli chodziło o funkcję w aplikacji, wywołaj ją i zobacz, czy działa. Gdy realne wyjście z terminala zgadza się z deklaracją, a diff pokrywa cały zakres zadania, możesz uznać pracę za wykonaną. Dopóki masz tylko słowa, masz hipotezę, a nie wynik.
Wróć do listy: 100 najczęstszych problemów z Claude Code
Szkolenie Claude Code - od zera do zespołu agentów AI -->
Tryb planowania, tryby uprawnień, komendy, MCP, hooki i systemy multi-agent - wszystko na żywym kodzie podczas trzydniowego szkolenia. Prowadzi Łukasz Matuszewski. Szkolenie ma terminy gwarantowane - odbędzie się niezależnie od liczby zgłoszeń.
Sprawdź szkolenie Claude CodeTo szkolenie może być dofinansowane dla Ciebie z KFS lub BUR.
★★★★★Średnia ocena naszych szkoleń w Google: 5/5
Komentarze (0)
Brak komentarzy...