Nowa era generowania wideo
Wprowadzenie wersji 1.30 do publicznej bety w Qwen Cloud to moment, który obserwujemy z dużym zainteresowaniem. Nie jest to zwykła poprawka, lecz znaczący skok jakościowy w możliwościach chińskiego modelu sztucznej inteligencji. Alibaba przedstawiła dwie kluczowe funkcje, które zmieniają zasady gry na rynku AI do generowania multimediów.
30 sekund wolności twórczej
Pierwszą z tych zmian jest natywna generacja filmów o długości 30 sekund. Wszystkie poprzednie wersje, takie jak 1.2.5, 1.2.6 czy 1.2.7, były ograniczone do sztywnego limitu 15 sekund. Było to wystarczające na krótki klip, ale całkowicie niewystarczające na pełną reklamę lub spójną narrację.
Podwojenie tego czasu pozwala nam tworzyć bardziej złożone historie w jednym generowaniu. Nie musimy już sklejać fragmentów, co często prowadziło do utraty spójności wizualnej i dźwiękowej. To prosta, ale niezwykle skuteczna zmiana, która otwiera nowe możliwości storytellingu.
Omni-Reference: więcej niż tylko tekst
Drugą, a naszym zdaniem jeszcze ważniejszą innowacją, jest funkcja Omni-Reference. Dawniej oznaczała ona możliwość przekazania modelowi obrazu, wideo lub dźwięku jako punktu odniesienia. Teraz lista ta została znacznie poszerzona o dokumenty, arkusze kalkulacyjne, slajdy prezentacji oraz strony internetowe.
To właśnie ta funkcja sprawia, że narzędzie przestaje być ciekawostką technologiczną, a staje się praktycznym pomocnikiem w codziennej pracy. Możemy teraz podać modelowi surowe dane lub strukturę treści, a on samodzielnie zinterpretuje je i zamieni w materiał filmowy.
Od arkusza do filmu
Wyobraźmy sobie sytuację, w której mamy gotowe slajdy prezentacyjne. Zamiast ręcznie nagrywać ekran lub montować wideo, przekazujemy te slajdy modelowi. AI analizuje ich treść i strukturę, tworząc na ich podstawie dynamiczny film. Podobnie dzieje się z arkuszami kalkulnymi – surowe dane zamieniają się w wizualizacje.
Podanie strony internetowej jako źródła pozwala sztucznej inteligencji pobrać jej przesłanie i strukturę, tworząc ruchomy materiał, który oddaje istotę treści. To eliminuje potrzebę zatrudniania projektantów do każdej konwersji tekstu na wideo.
Ewolucja modelu Qwen
Warto przytoczyć historię rozwoju tego modelu, aby zrozumieć skalę zmian. Rok temu ograniczaliśmy się do prostego przekształcania tekstu na wideo. Wersja 1.2.5 dodała synchronizację dźwięku i ruchu warg w czasie rzeczywistym. Następnie pojawiło się opowiadanie historii wieloklatkowej oraz tryb myślenia, który eliminował artefakty.
Każda z tych zmian wymagała ogromnego wysiłku inżynieryjnego, ale zawsze operowała na tej samej, wąskiej liście wejściowych formatów danych. Wersja 1.30 łamie ten schemat, łącząc dłuższy czas generowania z szerokim spektrum źródeł danych.
Praktyczne zastosowania
Rozumiemy sceptycyzm wobec samego wydłużenia czasu trwania klipu. Dłuższy film sam w sobie nie jest gwarancją jakości. Jednak połączenie 30-sekundowego limitu z możliwością czytania złożonych dokumentów zmienia wszystko. Zyskujemy narzędzie, które potrafi przetworzyć pisemny raport i wygenerować jego wideo-wersję gotową do publikacji.
To podejście oszczędza czas i zasoby, pozwalając skupić się na strategii zamiast technicznego montażu. Sztuczna inteligencja staje się pełnoprawnym członkiem zespołu kreatywnego, zdolnym do interpretacji złożonych źródeł informacji.