W ostatnich latach dziedzina przetwarzania języka naturalnego (NLP) przeszła ogromną rewolucję wraz z pojawieniem się dużych modeli językowych (LLM), które oferują wyjątkowe możliwości w zakresie rozumienia i przetwarzania języka ludzkiego. Jeden z najnowszych modeli, Gemini 1.5, oferuje ogromne możliwości kontekstowe. Model Gemini 1.5 firmy Google oferuje teraz ogromne okno kontekstowe zawierające milion tokenów, przyćmiewając swoich bezpośrednich konkurentów, takich jak ChatGPT, Claude i inne chatboty oparte na sztucznej inteligencji.
Okno kontekstowe o pojemności 1.5 miliona tokenów w Gemini XNUMX to przełom, który pozwala modelowi uzyskać głębsze i dokładniejsze zrozumienie języka. Dzięki większej pojemności kontekstowej model może analizować więcej słów i fraz otaczających dane słowo lub zdanie, co pomaga mu lepiej wnioskować o jego znaczeniu. Sprawdź Gemini AI od Google’a już dostępne. Czy okaże się skuteczniejszym rozwiązaniem niż ChatGPT w świecie sztucznej inteligencji?

Szybkie linki
Czym jest okno kontekstowe?
Odpowiadając na zapytania, takie jak wyjaśnienie koncepcji lub streszczenie tekstu, modele sztucznej inteligencji mają ograniczenia co do ilości danych, które mogą uwzględnić w celu wygenerowania odpowiedzi. Maksymalna ilość tekstu, jaką mogą uwzględnić, nazywana jest oknem kontekstowym.
Oto inny sposób spojrzenia na tę koncepcję. Załóżmy, że idziesz do sklepu spożywczego, aby kupić warzywa i artykuły gospodarstwa domowego bez listy zakupów. Maksymalna liczba artykułów spożywczych, które możesz zapamiętać podczas zakupów, to Twoje okno kontekstowe. Im więcej artykułów spożywczych uda Ci się zapamiętać, tym większa szansa, że nie zrujnujesz swoich spersonalizowanych planów zakupowych. Analogicznie, im większe okno kontekstowe modelu sztucznej inteligencji, tym większa szansa, że zapamięta on wszystko, czego potrzebuje, aby zapewnić Ci najlepsze rezultaty.
W chwili pisania tego tekstu okno kontekstowe Claude 2.1 firmy Anthropic, liczące 200 4 tokenów, jest największym oknem kontekstowym spośród wszystkich publicznie dostępnych modeli sztucznej inteligencji. GPT-128 Turbo plasuje się tuż za nim, oferując okno kontekstowe o pojemności 1.5 XNUMX tokenów. Gemini XNUMX firmy Google oferuje okno kontekstowe o pojemności XNUMX miliona tokenów, cztery razy większe niż jakikolwiek inny model dostępny na rynku. To prowadzi do kluczowego pytania: co jest takiego wyjątkowego w oknie kontekstowym o pojemności XNUMX miliona tokenów? Sprawdź Jaki jest limit tokena ChatGPT i czy można go przekroczyć?
Dlaczego okno kontekstowe w Gemini 1.5 jest tak ważne

Mówiąc bardziej szczegółowo, 200 150-wyrazowe okno kontekstowe Claude AI oznacza, że może on wczytać i udzielić odpowiedzi do książki liczącej około 1.5 700000 słów. To już jest ogromna kwota. Ale Google Gemini XNUMX będzie w stanie wczytać XNUMX XNUMX słów naraz!
Kiedy wprowadzasz dużą porcję tekstu do chatbotów opartych na sztucznej inteligencji, takich jak ChatGPT lub Gemini, starają się one przyswoić jak najwięcej tekstu, ale ilość, jaką są w stanie przyswoić, zależy od ich okna kontekstowego. Jeśli więc prowadzisz rozmowę liczącą do 100 28 słów w modelu, który obsługuje tylko 100 XNUMX słów, a następnie zaczynasz zadawać pytania, które wymagają pełnego zrozumienia całości XNUMX XNUMX słów rozmowy, skazujesz go na porażkę.
Wyobraź sobie, że oglądasz tylko 20 minut godzinnego filmu, ale zostajesz poproszony o wyjaśnienie całości. Jak dobry byłby Twój wynik? Albo odmówiłbyś odpowiedzi, albo po prostu zmyślał, co dokładnie zrobiłby chatbot oparty na sztucznej inteligencji, prowadząc do… Halucynacje AI.
Jeśli myślałeś, że nigdy nie będziesz musiał wprowadzać 100 XNUMX słów do chatbota, to nie wszystko. Okno kontekstowe wykracza poza tekst, który podajesz modelowi AI w jednym komunikacie. Modele AI biorą pod uwagę całą rozmowę, którą przeprowadziłeś podczas sesji czatu, aby zapewnić, że ich odpowiedzi będą jak najbardziej trafne.
Zatem, nawet jeśli nie wkładasz do modelu książki liczącej 100 XNUMX słów, wasze rozmowy i odpowiedzi, które on udziela, sumują się w obliczeniach okna kontekstowego. Zastanawiasz się, dlaczego ChatGPT lub Google Gemini ciągle zapominają rzeczy, które powiedziałeś wcześniej w rozmowie? Prawdopodobnie w oknie kontekstowym zabrakło miejsca i zaczyna ono zapominać o pewnych rzeczach.
Szersze okno kontekstowe jest szczególnie ważne w przypadku zadań wymagających dogłębnego zrozumienia kontekstu, takich jak streszczanie długich artykułów, odpowiadanie na złożone pytania czy utrzymywanie spójnej narracji w generowanym tekście. Chcesz napisać powieść liczącą 50 XNUMX słów i spójną narrację? Potrzebujesz modelu, który potrafi „oglądać” i odpowiadać na pytania w godzinnym filmie? Potrzebujesz szerszego okna kontekstowego!
Krótko mówiąc, większe okno kontekstowe Gemini 1.5 może znacząco poprawić wydajność jego modelu sztucznej inteligencji, zmniejszając halucynacje i wyraźnie zwiększając dokładność oraz zdolność do lepszego wykonywania instrukcji.
Czy Gemini 1.5 spełni oczekiwania?

Jeśli wszystko pójdzie zgodnie z planem, Gemini 1.5 prawdopodobnie przewyższy najlepsze modele AI na rynku. Jednak biorąc pod uwagę liczne niepowodzenia Google w budowaniu stabilnego modelu AI, należy zachować ostrożność. Samo zwiększenie okna kontekstowego modelu nie poprawia go automatycznie.
Od kilku miesięcy od momentu premiery korzystam z okna kontekstowego Claude 2.1 o rozmiarze 200 XNUMX i jedno jest dla mnie jasne — większe okno kontekstowe może faktycznie poprawić wrażliwość na kontekst, ale problemy z wydajnością podstawowego modelu mogą sprawić, że większy kontekst będzie problematyczny.
Czy Google Gemini 1.5 zmieni zasady gry? Media społecznościowe są obecnie zalewane entuzjastycznymi recenzjami Gemini 1.5 od użytkowników z wczesnym dostępem. Jednak większość pięciogwiazdkowych recenzji pochodzi z pośpiesznych lub uproszczonych przypadków użycia. Dobrym miejscem do sprawdzenia wydajności Gemini 1.5 w praktyce jest raport techniczny. Google Bliźnięta 1.5 [PDF]. Raport pokazuje, że nawet podczas „kontrolowanych testów” model nie był w stanie pobrać wszystkich drobnych szczegółów dokumentów mieszczących się w rozmiarze okna kontekstowego.
Okno kontekstowe z milionem tokenów to już imponujące osiągnięcie techniczne, ale bez możliwości niezawodnego pobierania szczegółów dokumentu, większe okno kontekstowe ma niewielką wartość praktyczną i może prowadzić do zmniejszenia dokładności i dodatkowego zamieszania. Teraz możesz zobaczyć Poza ChatGPT: wizja przyszłości chatbotów i generatywnej sztucznej inteligencji?










