Najnowsze badanie Anthropic pokazuje, że programiści polegający na AI w generowaniu kodu uzyskują o 17% niższe wyniki w testach rozumienia koncepcji i nie kończą zadań szybciej niż ich koledzy, którzy polegają na dokumentacji i wyszukiwarkach internetowych. Wyniki te podkreślają, że choć AI potrafi w kilka sekund wygenerować działający kod, nie obniża to kosztów związanych z prawdziwą wiedzą inżynierską.
Dlaczego to badanie jest ważne
W eksperymencie programistów podzielono na dwie grupy. Jedna otrzymała nieograniczony dostęp do narzędzia AI do generowania kodu; druga rozwiązywała te same problemy, korzystając wyłącznie z oficjalnej dokumentacji i wyszukiwarek internetowych. Po wykonaniu zadań uczestnicy rozwiązali quiz sprawdzający zrozumienie podstawowych zasad. Średni wynik grupy wspomaganej przez AI był o 17% niższy, a żadna z grup nie wykazała mierzalnej przewagi pod względem szybkości.
W praktyce „vibe coding” – polegający na wydawaniu AI poleceń w celu wygenerowania fragmentu kodu i wdrażaniu go bez głębszej analizy – nie zwiększa produktywności. Maskuje on jedynie lukę w wiedzy, która później objawia się w postaci błędów, problemów z utrzymaniem lub kosztownych przebudowań kodu.
Kontekst stojący za liczbami
Badania Anthropic pokazują, że obietnice dotyczące AI są niepełne. Uczestnicy, którzy używali AI na każdym etapie – kopiując i wklejając sugestie, zmieniając nazwy zmiennych i idąc dalej – przyswoili najmniej informacji o dziedzinie problemu. Programiści, którzy traktowali narzędzie jako współpracownika – zadając precyzyjne, wąskie pytania, a następnie analizując otrzymany kod – lepiej zapamiętali ramy koncepcyjne.
To rozróżnienie odzwierciedla szerszą obserwację branżową: inżynierowie promptów potrafią stworzyć funkcję w kilka minut, ale inżynier systemowy porusza się szybciej wraz ze wzrostem złożoności. Przewidują oni, co może ulec awarii i co nie będzie skalowalne. Ich szybkość wynika z umiejętności oceny sytuacji, a nie z braku wydajności.
Kto wygrywa, a kto przegrywa
Inżynierowie zachowujący zdolność oceny Inżynierowie, którzy rozumieją architekturę, wiedzą, gdzie struktury muszą być sztywne, a gdzie elastyczne, i potrafią przepisać komponenty bez psucia systemu, w dłuższej perspektywie oszczędzają organizacjom pieniądze. Ich zestaw umiejętności chroni przed ukrytym długiem technicznym, który często towarzyszy kodowi generowanemu przez AI – kodowi, który wygląda na czysty, ale nie posiada wyraźnej intencji projektowej.
Specjaliści od promptów Osoby traktujące AI jak magiczną różdżkę mogą dostarczać szybkie prototypy lub rozwiązywać odizolowane błędy. W krótkim terminie wydają się produktywni, ale gdy baza kodu się rozrasta, ukryte założenia w fragmentach wygenerowanych przez AI stają się obciążeniem. Debugowanie zmienia się wtedy w poszukiwanie pierwotnej intencji, co zwiększa koszty utrzymania.
Organizacja Firmy, które w dużym stopniu polegają wyłącznie na rozwoju wspomaganym przez AI, ryzykują wyższe przyszłe wydatki: więcej czasu poświęconego na debugowanie, refaktoryzację i wdrażanie nowych inżynierów, którzy muszą rozszyfrowywać niejasny kod. Firmy, które łączą pomoc AI z uporządkowanymi praktykami inżynierskimi, czerpią korzyści ze zwiększonej szybkości, zachowując jednocześnie długoterminową stabilność.
Szczegóły, które większość raportów pomija
- Wpływ na naukę: 17-procentowa różnica została zmierzona w quizie sprawdzającym zrozumienie, a nie tylko znajomość składni. Wskazuje to na realną erozję modeli mentalnych, a nie tylko na powierzchowną wiedzę.
- Czas wykonania zadania: Mimo kuszącej wizji natychmiastowego kodu, badanie nie wykazało statystycznie istotnej różnicy w czasie potrzebnym każdej z grup na ukończenie zadania. Zysk prędkości był iluzoryczny.
- Metoda ma znaczenie: Badanie uwypukliło spektrum wykorzystania AI. Czyste poleganie na AI przyniosło najgorsze wyniki w nauce, podczas gdy selektywne, dociekliwe formułowanie promptów dawało lepsze rezultaty. Nagłówki głoszące, że „AI przyspiesza programowanie”, często pomijają ten niuans.
Kontrargument: AI nie jest bezużyteczne
Badanie nie zaprzecza istnieniu niszowych korzyści; ostrzega jedynie przed przenoszeniem ich na cały proces tworzenia oprogramowania. Gdy problem dotyczy projektowania systemów, optymalizacji wydajności lub kwestii bezpieczeństwa, ludzka ocena pozostaje niezbędna.
Podsumowanie
AI może podać Ci deskorolkę, ale bez znajomości hamulców i umiejętności kierowania rozbijesz się na pierwszym zakręcie. Technologia ta obniża próg wejścia w pisanie kodu, jednak wciąż brakuje inżynierów, którzy potrafią rozumować o systemach, przewidywać awarie i utrzymywać oprogramowanie przy życiu wraz z jego rozwojem. Inwestowanie w tę zdolność oceny, zamiast liczenie na to, że zastąpi ją prompt, pozostaje najmądrzejszym sposobem na kontrolowanie długoterminowych kosztów.
