W świecie coraz bardziej zdominowanym przez wideo, narzędzia do tworzenia i edycji filmów zyskują na znaczeniu. Jednak edycja wideo wciąż może być skomplikowana i czasochłonna, szczególnie dla początkujących.
Rozwój sztucznej inteligencji (AI) przyśpieszył do takiego stopnia, że trudno go pojąć. Sora firmy OpenAI, która zamienia komunikaty tekstowe na wideo, jest najnowszą technologią AI, która szokuje świat, uświadamiając mu, że rzeczy dzieją się szybciej, niż ktokolwiek się spodziewał.
OpenAI Sora to innowacyjna technologia, której celem jest transformacja i edycja filmów w wydajny i innowacyjny sposób. Ten model rodzi pytania o jego wpływ na branżę wideo i czy przyczyni się do trwałej zmiany sposobu produkcji i edycji filmów? W tym artykule przyjrzymy się koncepcji i potencjałowi OpenAI Sora, przyjrzymy się jego wpływowi na branżę wideo i temu, co ta innowacja może oznaczać zarówno dla użytkowników, jak i twórców. Sprawdź Najlepsze generatory wideo oparte na sztucznej inteligencji (tekst na wideo).

Szybkie linki
Czym jest OpenAI Sora?
Podobnie jak inne generatywne modele sztucznej inteligencji, takie jak DALL-E i MidJourney, Sora przetwarza podpowiedzi tekstowe na medium wizualne. Jednak w przeciwieństwie do wspomnianych powyżej generatorów obrazu opartych na sztucznej inteligencji, Sora generuje pełne wideo z ruchem, różnymi kątami kamery, orientacją i wszystkim, czego można oczekiwać od tradycyjnie produkowanego filmu.

Biorąc pod uwagę przykłady na Strona internetowa SoraRezultaty często są nie do odróżnienia od prawdziwych, profesjonalnie wyprodukowanych filmów. Od zaawansowanych ujęć z drona po pełnometrażowe, wielomilionowe produkcje filmowe z aktorami, efektami specjalnymi generowanymi przez sztuczną inteligencję i nie tylko.

Oczywiście, Sora nie jest pierwszą technologią, która to robi. Jak dotąd najbardziej oczywistym liderem w tej dziedzinie jest Pas startowyML, która oferuje swoje usługi publicznie za opłatą. Jednak nawet w najlepszych okolicznościach filmy z Runway są bliższe pierwszym generacjom MidJourney StillsNie ma stabilizacji obrazu, fizyka nie ma sensu, a w chwili pisania tego tekstu najdłuższy klip trwa około 16 sekund.
Z kolei najlepszą wartością, jaką oferuje Sora, jest pełna stabilność, fizyka, która wydaje się poprawna (przynajmniej dla naszego mózgu), i klipy, które mogą trwać nawet minutę. Klipy są całkowicie pozbawione dźwięku, ale istnieją już inne systemy sztucznej inteligencji, które potrafią… Generacja muzyki oraz efekty dźwiękowe i dialogi. Nie mam więc wątpliwości, że te narzędzia można zintegrować z procesem pracy Sory, a w najgorszym przypadku z tradycyjnym podkładem głosowym i efektami dźwiękowymi. Sprawdź Najciekawsze i najzabawniejsze narzędzia AI, które warto sprawdzić.
Nie sposób przecenić, jak ogromny skok reprezentuje Sora w porównaniu z koszmarnym nagraniem wideo z AI sprzed zaledwie roku. Podobnie jak głęboko niepokojące nagranie z AI Will Smith je spaghettiMyślę, że jest to dla systemu większy szok niż moment, w którym generatory obrazów oparte na sztucznej inteligencji przestały być żartem i stały się źródłem egzystencjalnego strachu w sercach artystów wizualnych.
Sora prawdopodobnie wpłynie na całą branżę wideo, od twórców pojedynczych ujęć po megabudżetowe projekty Disneya i Marvela. Nic temu nie umknie. Myślę, że jest to szczególnie prawdziwe, ponieważ Sora nie musi tworzyć niczego z powietrza, ale może pracować z istniejącym materiałem, na przykład animując dostarczony przez ciebie statyczny obraz. To może być prawdziwy początek filmowania z wykorzystaniem sztucznej inteligencji.
Jak działa Sora?
Zagłębimy się w postać Sory tak głęboko, jak to możliwe, ale nie możemy wchodzić w tak wiele szczegółów. Po pierwsze, ironią jest, że OpenAI nie ujawnia szczegółów dotyczących wewnętrznego działania swojej technologii. Jest ona zastrzeżona, więc sekretny składnik, który wyróżnia Sorę na tle konkurencji, nie jest nam znany. Po drugie, nie jestem informatykiem i ty prawdopodobnie też nie, więc możemy zrozumieć, jak działa ta technologia, jedynie w ogólnych zarysach.
Dobrą wiadomością jest to, że istnieje doskonałe wyjaśnienie Sora (subskrypcja chroniona) Mike Young Na Medium, na podstawie: Raport techniczny z OpenAI Zostało to szczegółowo opisane, abyśmy my, przeciętni ludzie, mogli to zrozumieć. Chociaż oba dokumenty są warte przeczytania, możemy tutaj wyłuskać najważniejsze fakty.
Sora opiera się na doświadczeniach zdobytych przez OpenAI podczas tworzenia modeli takich jak ChatGPT czy DALL-E. OpenAI wprowadziło innowację w sposobie trenowania Sora na modelach wideo, dzieląc te klipy wideo na „łatki”, które są podobne do „tokenów” używanych w modelu treningowym ChatGPT. Ponieważ wszystkie te tokeny mają jednakowy rozmiar, takie rzeczy jak długość klipu, proporcje obrazu i rozdzielczość nie mają dla Sora znaczenia.
Sora wykorzystuje to samo szerokie podejście transformatorowe, które napędza GPT, wraz z metodą dyfuzji stosowaną przez generatory obrazów AI. Podczas treningu analizuje częściowo rozproszone tokeny łat z nagrania wideo i próbuje przewidzieć, jak wyglądałby token bez szumu. Porównując to z rzeczywistością, model uczy się „języka” nagrania wideo. Właśnie dlatego przykłady z Strona internetowa Sora Wygląda bardzo oryginalnie.
Oprócz tej niezwykłej umiejętności Sora posiada również bardzo szczegółowe adnotacje wbudowane w klatki wideo, na których jest szkolony. To w dużej mierze dzięki temu może edytować filmy tworzone na podstawie komunikatów tekstowych.
Zdolność Sory do dokładnego symulowania fizyki w filmach wydaje się być nową cechą, wynikającą po prostu z trenowania jej na milionach filmów zawierających ruch oparty na fizyce świata rzeczywistego. Sora charakteryzuje się doskonałą stabilnością obiektów; nawet gdy obiekt opuści kadr lub zostanie zasłonięty przez coś innego w kadrze, pozostaje w nim i powraca niezakłócony.
Nadal jednak pojawiają się sporadyczne problemy z interakcją obiektów w filmie z przyczynowością i automatycznym tworzeniem obiektów. Co więcej, co nieco zabawne, Sora od czasu do czasu myli lewą stronę z prawą. Niemniej jednak to, co zostało do tej pory zademonstrowane, jest nie tylko użyteczne, ale z pewnością znajduje się w czołówce technologii.
Kiedy mogę dotrzeć do Sory?
Wszyscy jesteśmy bardzo podekscytowani możliwością przetestowania Sory. Możecie być pewni, że będę z niej korzystał i pisał o tym, jak dobra jest ta technologia, nawet gdy nie da nam selektywnych rezultatów. Ale kiedy, jeśli w ogóle, to nastąpi?
W chwili pisania tego tekstu nie jest jasne, ile czasu upłynie, zanim Sora stanie się dostępna dla ogółu społeczeństwa, ani ile będzie kosztować dostęp do niej. OpenAI oświadczyło, że model znajduje się w rękach „czerwonego zespołu”, grupy osób, których zadaniem jest skłonienie Sory do robienia wszystkich złych rzeczy, których nie powinna robić, a następnie pomoc w budowaniu zabezpieczeń przed tego typu zachowaniami. Dzieje się tak, gdy korzystają z niego prawdziwi użytkownicy. Obejmuje to możliwość generowania dezinformacji, tworzenia obraźliwych lub poniżających treści i wielu innych nadużyć, jakie tylko można sobie wyobrazić.
W chwili pisania tego tekstu jest on także w rękach wybranych twórców treści. Sądzę, że służy to celom testowym oraz potrzebie uzyskania recenzji i zatwierdzeń od stron trzecich, zanim przystąpimy do prac nad ostateczną wersją.
Sedno sprawy jest takie, że tak naprawdę nie wiemy, kiedy będzie dostępny, tak jak można płacić za korzystanie z DALL-E 3. W rzeczywistości nawet OpenAI nie ma jeszcze konkretnej daty. Dzieje się tak po prostu dlatego, że jeśli trafi on w ręce testerów bezpieczeństwa, mogą oni odkryć problemy, których naprawa zajmie więcej czasu niż zakładano, co opóźni publiczne udostępnienie.
Fakt, że OpenAI czuje się gotowe do zaprezentowania Sory i nawet opublikowało kilka skoordynowanych publicznych ogłoszeń za pośrednictwem X (dawniej Twittera), oznacza po prostu, że firma uważa, że jakość finalnego produktu jest w dużej mierze gotowa. Ale dopóki nie pojawi się lepszy obraz publiczny zgłoszonych problemów bezpieczeństwa, a także tych odkrytych, nikt nie może być tego pewien. Myślę, że mówimy o miesiącach, a nie latach, ale nie spodziewajcie się tego w przyszłym tygodniu. Możecie to sprawdzić już teraz. Etyczne narzędzia AI dla artystów i twórców.









