Wstęp do wielkiej konfrontacji modeli
Jesteśmy świadkami niespotykanego wcześniej zgiełku w branży technologicznej, ponieważ pojawiło się jednocześnie trzech gigantycznych modeli sztucznej inteligencji.
Zamiast zgadywać kto wygra, postanowiliśmy przeprowadzić rygorystyczne testy oparte na identycznych zadaniach dla każdego kandydata.
Metodologia naszych eksperymentów
Każdy model otrzymał dokładnie to samo polecenie w ramach naszego unikalnego systemu GoldyBench, aby wykluczyć szum medialny z wyników.
Oceniamy każdą odpowiedź na skali od dziesięciu punktów, co pozwala nam uzyskać obiektywny obraz ich rzeczywistych możliwości twórczych i logicznych.
Przygotowania do testu Qwen 3.8
Oczekiwania były ogromne wobec nowego modelu od Alibaby, który zadeklarowano jako drugiego najlepszego na świecie zaraz po Fable 5.
Nie dostarczyli jednak żadnych dowodów ani wyników testów przed premierą, co skłoniło nas do własnej weryfikacji ich twierdzeń.
Wyniki porównawcze Qwen i Claude
Kiedy uruchomiliśmy scenę z fajerwerkami nad wodą, model od OpenAI bezapelacyjnie pokonał konkurencję uzyskując najwyższą możliwą ocenę.
Fable 5 również stworzyło wizualizację miasta w zmierzchu, ale jego wynik był niższy i nie dorównał jakości generowanej przez lidera rynku.
Testy z zakresu gier wideo
Zadaliśmy obom modelom trudne zadanie związane z tworzeniem gry wyścigowej przypominającej popularny tytuł typu open world, co wymagało zaawansowanych umiejętności programistycznych.
Lider rynku znów pokazał swoją klasę, generując pełnoprawną grę ze ściganiami policjantami i działającą minimapą w znacznie lepszej jakości niż Fable 5.
Wizualne osiągnięcia w tematyce kosmicznej
Kiedy poprosiliśmy o stworzenie tunelu czasoprzestrzennego, model od OpenAI znowu wygrał dzięki szczegółowym świecącym pierścieniom i futurystycznej desce rozdzielczej.
Nawet w scenach nocnego nieba pełnych planet krążących wokół gwiazd, generowane obrazy były bardziej kinowe niż te stworzone przez Fable 5.
Specjalistyczne zadania dla Fable
Fable 5 wykazało się jednak niezwykłą siłą w tworzeniu atmosferycznych scen takich jak przerażająca krypta oświetlona płonącymi pochodniami, gdzie cienie i światło były najwyższej klasy.
W tym konkretnym przypadku model od Anthropic wygrał z przewagą dzięki lepszej obsłudze trudnego oświetlenia w zamkniętych przestrzeniach dungeon crawlera.