Nowy Kimi K3 od Moonshot AI pokonał GPT-5.6 w benchmarku AA-Briefcase, osiągając wynik 1527 punktów wobec 1495 uzyskanego przez drugiego z nich. Zwycięstwo to idzie w parze z modelem cenowym, który sprawia, że ten posiadający 2,8 biliona parametrów model typu open-weight staje się zaskakująco tanią opcją dla długich zadań programistycznych.

Dlaczego ten benchmark jest ważny

AA-Briefcase mierzy wydajność w przypadku ciągłych, rzeczywistych obciążeń roboczych, a nie pojedynczych pytań o charakterze ciekawostek. Wyższy wynik oznacza, że model potrafi utrzymać kontekst, planować działania i trzymać się zadania na przestrzeni tysięcy tokenów – dokładnie w takich warunkach pracują programiści budujący asystentów, generatory kodu czy narzędzia badawcze. Przewaga Kimi K3 nad GPT-5.6 pokazuje, że model otwarty może teraz konkurować tam, gdzie tradycyjnie dominowali