Witamy w nowym erze testów modeli językowych, gdzie tradycyjne hierarchie zaczynają się trząść. Jako cyfrowy awatar Juliana Goldiego, pomagam Wam odkrywać ukryte potęgi technologii AI w codziennej pracy.
Spotkanie trzech gigantów
Dziś stawiamy czoła wyjątkowemu starciu między trzema największymi modelami na rynku. Po jednej stronie mamy GLM-5.2, który został wydany w połowie czerwca 2026 roku przez firmę z.ai.
Siły otwartego oprogramowania
Najważniejszą zaletą tego modelu jest jego dostępność jako open source na licencji MIT. Oznacza to, że każdy może go pobrać i uruchomić lokalnie bez konieczności płacenia abonamentu.
Ciemne strony zamkniętych systemów
Na drugim końcu spektrum znajduje się Claude Opus 4.8 od Anthropic oraz najnowszy GPT-5.5 od OpenAI. Te modele są dostępne wyłącznie przez API lub dedykowane aplikacje, co ogranicza swobodę użytkownika.
Kontekst i możliwości
GLM-5.2 wyróżnia się ogromnym oknem kontekstu na milion tokenów, pozwalającym na przetwarzanie gigantycznych ilości kodu naraz. To kluczowa cecha dla programistów pracujących nad złożonymi projektami.
Pierwszy test: Mapa orbit
Zacznijmy od prostej zabawy wizualnej dotyczącej mapy wewnętrznych orbit układu słonecznego. W tym scenariuszu GLM-5.2 wyraźnie pokazuje się jako lider, oferując płynną obsługę parametrów.
Wyniki w dynamice
Claude Opus 4.8 również radzi sobie dobrze, ale Qwen 3.7 Max plasuje się na drugim miejscu z pewnymi błędami. W przypadku mapy orbit bezapelacyjnie wygrywa model od Anthropic.
Test fizyki: Ciecz w kulce
Następnie sprawdziliśmy zdolności modeli do symulacji cieczy zamkniętej w kuli. Tutaj GLM-5.2 zaskakuje pięknymi animacjami i możliwością zmiany motywów, podczas gdy Qwen szybko traci na jakości.
Estetyka a funkcjonalność
Claude Opus 4.8 w tym teście jest postrzegany jako nudny, mimo że spełnia podstawowe zadania fizyczne. GLM-5.2 udowadnia, że otwarte oprogramowanie może być równie atrakcyjne wizualnie jak płatne rozwiązania.
Test strony internetowej
Kolejnym wyzwaniem było zbudowanie kompletnej strony internetowej dla fikcyjnej firmy. Opus 4.8 stworzył bardzo podstawowy projekt, który można określić jako nudny i pozbawiony inspiracji.
Wypełnienie płótna
Z kolei Qwen nie wygenerował niczego poza pustym platem, co jest wynikiem fatalnym. GLM-5.2 natomiast wypełnił całe okno przeglądarki ładnymi animacjami i przejrzystą konfiguracją treści.
Gra zręcznościowa
Ostatnim testem była gra zręcznościowa, gdzie piłka miała odbijać się od ścian. Model Qwen 3.7 zawiodł, ponieważ piłka po prostu znikała zamiast reagować na kolizje.
Werdykt końcowy
Claude Opus 4.8 był grywalny i użyteczny, ale GLM-5.2 okazał się o wiele bardziej ciekawym doświadczeniem dla użytkownika. W sumie model open source wygrał praktycznie wszystkie testy.