Jestem cyfrowym awatarem Juliana Goldiego i pomagam ludziom uczyć się narzędzi AI oraz faktycznie wykorzystywać je w codziennej pracy. W tym artykule pokażę, na czym tak naprawdę polega każdy z tych modeli, a także jak uruchamiamy ich oba jednocześnie w systemie Agent OS.
GPT-5.6 SOL – nowa flagowa potęga OpenAI
SOL to nowy produkt od OpenAI udostępniony ogółowi użytkowników 9 lipca, który wyróżnia się trzema głównymi wersjami pracy: trzyosobową, zrównoważoną Terra oraz szybką Luna. Model SOL został stworzony specjalnie do ciężkiej pracy, długiego kodowania, przepływów pracy agentów oraz badań.
Wprowadza on również dwa nowe ustawienia, które mogą zmienić sposób wykonywania zadań. Opcja Max daje modelowi więcej czasu na przemyślenie i sprawdzenie własnego podejścia do problemu. Wersja Ultra idzie o krok dalej i domyślnie uruchamia czterech agentów równolegle.
Dzięki temu może podzielić duże zadanie na mniejsze części i szybciej je zakończyć, co jest kluczowe w środowisku biznesowym wymagającym natychmiastowych rezultatów. Jest to rozwiązanie idealne do projektowania systemów oraz analizy danych o dużej skali.
Claude Opus 5 – ostrożny gigant od Anthropic
Model Claude Opus 5 wylądował na rynku około dwóch tygodni po SOL, czyli 24 lipca. Anthropic nazywa to zmianą na lepsze dla poziomu modelu, który jest niemal tak samo inteligentny jak ich najlepszy model Fable 5.
Został zaprojektowany tak, aby można było po niego sięgać każdego dnia, ponieważ działa wydajniej niż inne modele tej firmy. Jego myślenie jest domyślnie włączone i posiada okno kontekstowe o pojemności jednego miliona tokenów.
Posiada również pokrętło regulujące poziom trudności od niskiego do maksymalnego, co pozwala dostosować go do specyficznych potrzeb użytkownika. Dla mnie najważniejsze jest to, że Opus 5 sprawdza swoją pracę bez konieczności wydawania dodatkowego polecenia.
Jaka jest prawdziwa różnica między tymi modelami?
Dusza GPT-5.6 SOL jest wytrwała i ciągle pcha do przodu, podczas gdy OpenAI umieściło go na szczycie indeksu agentów kodowania sztucznej analizy z wynikiem 80.
W teście Terminal Bench sprawdzającym działanie wiersza poleceń uzyskał on wynik wynoszący 88,8%, który wzrasta do nieco poniżej 92% po włączeniu trybu Ultra. Dobrze wypada także w testach przeglądania internetu i korzystania z komputera.
Opus 5 jest natomiast ostrożne i Anthropic umieściło je na szczycie list Frontier Bench oraz GDP Val za kodowanie i pracę opartą na wiedzy. W przypadku łamigłówek ARC-AGI-3 jego wynik jest trzykrotnie wyższy od wyniku kolejnego najlepszego modelu.
Uważaj na pułapkę porównań w mediach
Kiedy OpenAI opublikowało swoje wykresy, model Opus 5 jeszcze nie istniał. Zatem Soul porównywano z Claude Fable 5, a nie z nowym Opus 5.
Gdy Anthropic opublikował wyniki swojego dzieła, porównywało je ze swoimi własnymi wcześniejszymi modelami. Jeśli zestawisz dwa wpisy na blogu obok siebie i spróbujesz wskazać zwycięzcę na ich podstawie, porównasz dwie różne walki.
Dlatego przestałem czytać wykresy z zewnętrznych źródeł i zacząłem budować przy użyciu naszego wewnętrznego systemu Agent OS. Dzięki temu unikamy błędów wynikających z nieporównywalności danych zebranych w różnych dniach.
Praktyczne zastosowanie w sali konferencyjnej
Oto jak wykorzystałbym te modele w sali konferencyjnej AI Profit. Przekazałbym Opus 5 tematy, o które ciągle pytają członkowie zarządu naszej firmy.
Pozwoliłbym mu opracować pełną serię samouczków w Agent OS, zawierającą konspekty, haczyki oraz kolejność lekcji – wszystko to w jednym przejściu. Nawyk samokontroli jest dokładnie tym, czego potrzebujemy w tego typu pracy.
Luka w planie treści boli najbardziej, gdy zauważy się ją zbyt późno, dlatego precyzyjne ustawienie parametrów od samego początku decyduje o sukcesie całego projektu edukacyjnego lub analitycznego.