Jesteśmy świadkami rewolucyjnego momentu w historii technologii, gdzie trzy potęgi sztucznej inteligencji zmierzyły siły na jednej arenie. W ciągu zaledwie kilku tygodni upadło kilka rekordowych modeli, które wcześniej uważano za nie do pobicia. Dlaczego więc prawie nikt nie przeprowadza jeszcze bezpośrednich porównań tych systemów? Odpowiedź jest prosta – większość badaczy testuje je osobno, co daje niewiarygodnie zmylone wyniki.
Dwa podejścia do sztucznej inteligencji
Wszystkim trzem udzieliśmy dokładnie tego samego polecenia w tym samym czasie na jednym ekranie. Jeden z nich przegrał wyścig, który powinien był zostać wygrany przez liderów rynku. Trzymajcie się nas dobrze, ponieważ zwycięzcą nie jest ten model, którego myślicie od razu po pierwszym spojrzeniu.
Fable 5 – mistrz precyzji i analizy
Model Fable 5 pochodzi z firmy Anthropic. Jego premiera odbyła się już w czerwcu tego roku. Firma ta nazywa go modelem klasy mythos, co oznacza, że jest on o poziom wyższy niż ich linia Opus.
- Jest to najbardziej zaawansowany model jaki kiedykolwiek udostępnili publicznie.
- Posiada okno kontekstowe o pojemności 1 miliona tokenów.
- Potrafi czytać wykresy i tabele z plików PDF oraz odzyskiwać kod ze zrzutów ekranu aplikacji internetowych.
Największą zaletą Fable 5 jest to, że planuje pracę na wielu etapach. Przekazuje zadania podagentom i sprawdza własną pracę przed jej ostatecznym oddaniem użytkownikowi. Jest pracochłonny, nie daje szybkich odpowiedzi, ale jego długie procesy myślowe prowadzą do niesamowitej precyzji.
Grok 4.5 – prędkość i efektywność
Model Grok 4.5 jest produktem firmy SpaceX AI, stojącej za popularnym modelem Grok. Premiera odbyła się w lipcu. Został przeszkolony przy użyciu narzędzia do kodowania Cursor i został stworzony bardziej do pracy z agentami niż do zwykłego czatowania.
Jego siłą jest prędkość działania oraz efektywność wykorzystania zasobów. Działa z prędkością około 80 tokenów na sekundę, wykonując te same zadania przy użyciu o wiele mniej tokenów niż konkurencja.
Posiada okno kontekstowe o pojemności 500 tysięcy tokenów i jest domyślnym modelem w kompilacji Grok. Mniej myśli, a więcej wysyła – to jego filozofia działania.
GPT 5.6 – trzy osobowości w jednym
Model GPT 5.6 pochodzi z OpenAI i został wprowadzony na rynek również w lipcu. Nie chodzi o jeden model, lecz o całą rodzinę trzech rozwiązań: Lunę, Terrę oraz Sol.
- Luna jest najszybsza spośród wszystkich opcji.
- Terra oferuje średnią wydajność i balans między szybkością a precyzją.
- Sol to najwyższa klasa modelu kodowania stworzona przez Sama Altmana.
Sam Altman twierdzi, że Soul jest o 54% bardziej wydajny pod względem kodowania w stylu agenta niż poprzedni model. W Soulu znajdziemy także nowy tryb ultra, który pozwala na intensywniejszą pracę nad trudniejszymi zadaniami.
Test pierwszy: projektowanie strony internetowej
Nie testowaliśmy tych modeli jednego po drugim w izolacji od siebie. Położyliśmy Fable 5, Grok 4.5 i GPT 5.6 obok siebie na jednym ekranie i uruchomiłem ten sam komunikat na wszystkich trzech jednocześnie.
Na jednym ekranie widoczne są różnice już wtedy, gdy tylko wyniki się pojawią. Poprosiliśmy wszystkich o stworzenie nowoczesnej, jednostronicowej witryny internetowej dla AI Profit Boardroom – prestiżowej społeczności uczenia się sztucznej inteligencji.
Wyniki były niesamowite. Wszystkie trzy dostarczyły działającą stronę internetową, ale każda z nich zawierała inne wywołania i podejście do projektu:
- Grok zdecydował się na ciemny motyw, który szczerze mówiąc wyglądał świetnie.
- Fable wyszło na dobre, czyli zaproponowało dokładnie taki projekt jak chcieliśmy go mieć.
- GPT 5.6 powrócił w wersji czystej i prostej, skupiając się na funkcjonalnościach bez zbędnych ozdobników.
Mogliśmy skorzystać z pomysłów ze wszystkich trzech rozwiązań, co pokazuje ich różnorodność i elastyczność.
Podsumowanie wyścigu technologicznego
Każdy model ma swoje mocne strony. Fable 5 jest idealny do długotrwałych zadań wymagających głębokiej analizy, Grok 4.5 sprawdza się tam gdzie liczy się szybkość i oszczędność zasobów, a GPT 5.6 oferuje wybór między różnymi profilami wydajności.
Wybór złego modelu może Cię spowolnić w pracy nad projektem lub doprowadzić do błędnych wniosków przy analizie danych. Dlatego tak ważne jest zrozumienie specyfiki każdego z nich przed podjęciem decyzji o ich wykorzystaniu w codziennej działalności.
Nasz cyfrowy awatar Juliana Goldiego pomaga poznawać narzędzia AI i faktycznie je wykorzystać w swojej pracy zawodowej. Dziś dowiedzieliśmy się, że nie ma jednego najlepszego rozwiązania na wszystkie potrzeby – kluczowe jest dopasowanie modelu do specyfiki danego zadania.