Debian

Testy Qwen 3.8 i Fable 5: Czy tańszy model zdominuje gigantów?

Ekran laptopa z interfejsem programistycznym pokazującym działanie modelu AI Qwen 3.7 od Alibaba Cloud. Interfejs zawiera kod źródłowy, analizę matematyczną oraz wykresy danych, sugerujące zaawansowane możliwości przetwarzania inf
Obraz przedstawia ujęcie pracy w nowoczesnym biurze IT, skupiające się na laptopie z otwartym interfejsem programistycznym. Na ekranie widoczny jest zaawansowany model sztucznej inteligencji Qwen 3.7 opracowany przez Alibaba Cloud. Interfejs użytkownika (IDE) prezentuje kod źródłowy w języku programowania, a także panel z wynikami analizy danych. Widać wykresy liniowe oraz sekcje poświęcone matematycznej i statystycznej analizie, co podkreśla wszechstronne zastosowanie modelu AI – od generowania kodu po złożone obliczenia naukowe. Scena ma klimat nowoczesnego technologicznego centrum badawczego, z pracownikami w tle, sugerując współpracę nad przełomowymi rozwiązaniami w dziedzinie uczenia maszynowego i przetwarzania języka naturalnego (NLP).

Źródło: eccoapi

W świecie sztucznej inteligencji trwa gorąca bitwa o pierwszeństwo, gdzie trzy potężne modele mierzą siły bez żadnych kompromisów.

Wstęp do wielkiej konfrontacji modeli

Jesteśmy świadkami niespotykanego wcześniej zgiełku w branży technologicznej, ponieważ pojawiło się jednocześnie trzech gigantycznych modeli sztucznej inteligencji.

Zamiast zgadywać kto wygra, postanowiliśmy przeprowadzić rygorystyczne testy oparte na identycznych zadaniach dla każdego kandydata.

Metodologia naszych eksperymentów

Każdy model otrzymał dokładnie to samo polecenie w ramach naszego unikalnego systemu GoldyBench, aby wykluczyć szum medialny z wyników.

Oceniamy każdą odpowiedź na skali od dziesięciu punktów, co pozwala nam uzyskać obiektywny obraz ich rzeczywistych możliwości twórczych i logicznych.

Przygotowania do testu Qwen 3.8

Oczekiwania były ogromne wobec nowego modelu od Alibaby, który zadeklarowano jako drugiego najlepszego na świecie zaraz po Fable 5.

Nie dostarczyli jednak żadnych dowodów ani wyników testów przed premierą, co skłoniło nas do własnej weryfikacji ich twierdzeń.

Wyniki porównawcze Qwen i Claude

Kiedy uruchomiliśmy scenę z fajerwerkami nad wodą, model od OpenAI bezapelacyjnie pokonał konkurencję uzyskując najwyższą możliwą ocenę.

Fable 5 również stworzyło wizualizację miasta w zmierzchu, ale jego wynik był niższy i nie dorównał jakości generowanej przez lidera rynku.

Testy z zakresu gier wideo

Zadaliśmy obom modelom trudne zadanie związane z tworzeniem gry wyścigowej przypominającej popularny tytuł typu open world, co wymagało zaawansowanych umiejętności programistycznych.

Lider rynku znów pokazał swoją klasę, generując pełnoprawną grę ze ściganiami policjantami i działającą minimapą w znacznie lepszej jakości niż Fable 5.

Wizualne osiągnięcia w tematyce kosmicznej

Kiedy poprosiliśmy o stworzenie tunelu czasoprzestrzennego, model od OpenAI znowu wygrał dzięki szczegółowym świecącym pierścieniom i futurystycznej desce rozdzielczej.

Nawet w scenach nocnego nieba pełnych planet krążących wokół gwiazd, generowane obrazy były bardziej kinowe niż te stworzone przez Fable 5.

Specjalistyczne zadania dla Fable

Fable 5 wykazało się jednak niezwykłą siłą w tworzeniu atmosferycznych scen takich jak przerażająca krypta oświetlona płonącymi pochodniami, gdzie cienie i światło były najwyższej klasy.

W tym konkretnym przypadku model od Anthropic wygrał z przewagą dzięki lepszej obsłudze trudnego oświetlenia w zamkniętych przestrzeniach dungeon crawlera.

Słowa kluczowe