Jak przekonwertować głos na tekst za pomocą Whisper firmy OpenAI dla systemu Windows

Whisper od OpenAI to nowe rozwiązanie oparte na sztucznej inteligencji, które pomoże Ci przepisać Twój głos na tekst w niepowtarzalny sposób. Co najważniejsze, jest darmowe.

Istnieje jednak stosunkowo niewielki problem: instalacja i obsługa są trudniejsze niż w przypadku standardowego narzędzia Windows, zwłaszcza jeśli chcesz wykorzystać rdzenie Tensor karty graficznej Nvidia, aby zapewnić jej odpowiednią moc. Sprawdź Najlepsze narzędzia oparte na sztucznej inteligencji, które pozwolą Ci bezpłatnie stworzyć artystyczny obraz na podstawie Twojego tekstu.

Ale nie traćcie nadziei. Właśnie dlatego tu jesteśmy! Czytajcie dalej, aby dowiedzieć się, jak go zainstalować i używać. A jeśli posiadacie kartę graficzną Nvidia, pokażemy Wam, jak Whisper może z niego skorzystać.

Czym jest Whisper firmy OpenAI?

ChatGPT szybko zyskał popularność wśród użytkowników. Już widzieliśmy, jak można go wykorzystać. ChatGPT firmy OpenAIJednak nie jest to jedyny ciekawy projekt OpenAI.

Oparty na uczeniu głębokim i sieciach neuronowych, Whisper to system przetwarzania języka naturalnego, który potrafi „rozumieć” mowę i konwertować ją na tekst. Oferuje jednak również kilka niestandardowych konfiguracji, przewyższając podobne rozwiązania dzięki:

  1. Whisper to rozwiązanie oparte na sztucznej inteligencji „wyszkolone” w zakresie języka naturalnego, dzięki czemu lepiej rozumie „naturalną” mowę ludzką niż starsze rozwiązania.
  2. Whisper nie posiada interfejsu i nie może nagrywać dźwięku. Obsługuje jedynie istniejące pliki audio i generuje pliki tekstowe.
  3. Ponieważ Whisper tak dobrze radzi sobie z „rozumieniem języka”, jest również bezkonkurencyjny w automatycznym tłumaczeniu.
  4. Whisper nie jest usługą online i może działać całkowicie offline.
  5. Jeśli posiadasz kartę graficzną Nvidia (GTX970 lub nowszą), Whisper można uruchomić w „trybie przyspieszania sprzętowego”, aby zwiększyć jego szybkość reakcji.
  6. Nie ma wymogu rejestracji, zakupu licencji ani wykupienia subskrypcji.

Dlaczego karta graficzna AMD nie jest obsługiwana?

Aby procesory GPU mogły być użyteczne nie tylko do generowania grafiki, muszą działać jako w pełni programowalne procesory. Właśnie dlatego Nvidia stworzyła architekturę CUDA, oficjalnie „platformę obliczeń równoległych i model programowania”.

CUDA to zastrzeżona technologia firmy Nvidia, kompatybilna wyłącznie z procesorami graficznymi Nvidia. Jej najbliższymi alternatywami od AMD są OpenCL i Radeon Compute Platform.

W porównaniu z alternatywami, CUDA jest uważana za bardziej dojrzałą, wydajną i łatwiejszą w obsłudze. W związku z tym większość programistów koncentruje się wyłącznie na CUDA, co z kolei oznacza, że ich aplikacje wykorzystują wyłącznie funkcje sprzętowe procesorów graficznych Nvidia. Dotyczy to również Whisper. Sprawdź Karty graficzne AMD kontra NVIDIA w systemie Linux: Której powinieneś używać?

Jak pobrać i zainstalować Whisper

Niestety, Whisper nie jest samodzielną aplikacją, którą można pobrać, zainstalować i normalnie uruchomić. Opiera się na innych zależnościach, które również muszą zostać zainstalowane.

W systemie Windows, aby uprościć ten przewodnik, do zainstalowania większości niezbędnych elementów aplikacji użyjemy popularnego programu Chocolatey. Zobacz nasz przewodnik Najszybszy sposób instalacji aplikacji Windows Więcej informacji o Chocolatey.

Zarówno w przypadku systemu Linux, jak i Mac proces instalacji (poza zmienną ścieżki Windows i przydatnymi plikami wsadowymi, które utworzymy) powinien być podobny.

  • Aby zainstalować i używać Whisper, należy zainstalować Pythona i jego narzędzie PIP oraz dodać je do zmiennej „Path” systemu Windows. Więcej informacji na ten temat można znaleźć w naszym artykule na temat Jak zainstalować Python PIP w systemie Windows و Mac i Linux.
  • zainstalować FFMPEG Za pomocą Chocolatey użyj tego polecenia:
choco install ffmpeg

  • Można również zainstalować wersję Pythona za pomocą:
instalacja pip3 python-ffmpeg
  • Na koniec zainstaluj Whisper ze strony Github, używając:
Instalacja pip3 git+https://github.com/openai/whisper.git

Pobierz wersję Whisper obsługującą technologię CUDA

Chociaż Whisper nie korzysta głównie z procesorów graficznych Nvidia, pakiet Torch, na którym się opiera, oferuje wersję z akceleracją CUDA. Korzystanie z niego zamiast „standardowej” wersji Whisper może pomóc w szybszym wykonywaniu transkrypcji z pomocą karty graficznej Nvidia.

Aby pobrać Whisper, który wykorzystuje technologię CUDA firmy Nvidia:

  • Jeśli masz już zainstalowaną wersję podstawową programu Torch, odinstaluj ją i pozbądź się pozostałych plików za pomocą:
odinstaluj pip3 torch
  • Po wykonaniu tej czynności należy wykonać następujące polecenie:
czyszczenie pamięci podręcznej pip
  • Zainstaluj wersję Torch obsługującą CUDA, korzystając z polecenia:
pip3 install torch torchvision torchaudio — extra-index-url https://download.pytorch.org/whl/cu117

  • Aby sprawdzić, czy Whisper może wykorzystać Twój procesor graficzny Nvidia, użyj:
szept — pomoc | findstr -i pytorch

Powinieneś zobaczyć (domyślnie: cuda) zamiast (domyślnie: cpu). Sprawdź 5 powodów, dla których ChatGPT nie odbierze Ci pracy związanej z pisaniem treści.

Co zrobić, jeśli instalacja Torch się nie powiedzie

Jeśli podczas instalacji Torch pojawi się błąd „nie znaleziono wersji”, może być konieczne zainstalowanie starszej wersji Pythona, równoległej do obecnej wersji.

Aby to zrobić, użyj tego polecenia:

choco install python — wersja STARSZA_WERSJA — obok siebie

Zastąp „OLDER_VERSION” wersją taką jak 3.10.

Następnie użyj ścieżki wersji drugorzędnej dla wszystkich „ogólnych” poleceń Whisper (np. „c:\Python310\Scripts\pip.exe"zamiast po prostu "pip").

Jak nagrać swój głos

Możesz użyć dowolnej aplikacji do nagrywania dźwięku, aby przekonwertować swój głos do pliku WAV lub MP3. System Windows zawiera taką aplikację — więcej informacji znajdziesz w artykule „Jak korzystać z aplikacji”. Aplikacja Rejestrator głosu w systemie Windows 10.

Aby skorzystać z pełnej funkcjonalności, wypróbuj Audacity. Dowiedz się, jak to zrobić, korzystając z naszego przewodnika. Jak korzystać z Audacity Nagrywanie dźwięku w systemach Windows i Mac.

Jak zacząć pisać szeptem

Mimo że Whisper nie posiada prostego interfejsu graficznego, korzystanie z niego jest bardzo płynne.

Załóżmy, że mamy plik LatestNote.mp3 zawierający wypowiedź w języku greckim w folderze c:\MyAudioFiles i chcemy go przetłumaczyć na język angielski, a następnie skopiować do pliku tekstowego.

cd C:\MojePlikiAudio
  • Uruchamiamy Whisper w pliku za pomocą:
szept — baza modelu — język gr — zadanie przetłumacz LatestNote.mp3

Po przetworzeniu plik tekstowy (o nazwie „LatestNote.mp3.txt”) pojawi się w tym samym folderze. Otwórz go w edytorze tekstu, takim jak Notatnik, aby wyświetlić przetłumaczony tekst.

Użyliśmy przykładowego tłumaczenia, ponieważ transkrypcja angielska jest prostsza: wystarczy użyć tagów „lose”, „-language” i „-task”. Zatem w przypadku prostej transkrypcji powyższe polecenie wyglądałoby następująco:

szept — model bazowy LatestNote.mp3

Tag „model” jest wymagany, ponieważ Whisper korzysta z jednej z kilku różnych opcji. Rozwińmy ją, aby pomóc Ci wybrać tę, która najlepiej odpowiada Twoim potrzebom. Sprawdź Jaka jest funkcja transkrypcji audio? Jaka jest jej rola i jak działa?

Który model wybierasz?

Whisper oferuje różne modele językowe. Im większy model, tym jest dokładniejszy, ale jednocześnie tym wyższe są jego wymagania sprzętowe. Oto one:

  • Malutki.
  • Baza.
  • Mały.
  • Średni.
  • Duży.

Modele Tiny i Base powinny być odpowiednie dla większości osób anglojęzycznych. Osoby, dla których angielski nie jest językiem ojczystym, mogą uzyskać lepsze rezultaty w przypadku większych modeli, takich jak Medium i Large.

Należy jednak pamiętać, że modele średnie i duże wymagają więcej niż 8 GB pamięci VRAM (tj.Pamięć Twojego GPU").

Aby wybrać jeden, określ model po przełączniku „—model” w poleceniu:

whisper — model mały/mały/średni/duży [plik]

Na przykład:

szept — mały model My_Voice_Note.mp3

Jak uprościć transkrypcję audio

Wpisywanie całego polecenia Whisper za każdym razem, gdy chcesz transkrybować dźwięk, może szybko stać się uciążliwe. Stwórzmy globalnie dostępny plik wsadowy, aby uprościć ten proces.

  • Uruchom Eksploratora Windows i przejdź do dysku. C:.
  • Utwórz folder na teksty i skopiuj jego ścieżkę do schowka.
  • W menu Start systemu Windows wyszukaj „Ścieżka” i wybierz Modyfikuj zmienne środowiskowe systemu.

  • Szukać Zmieniacz ścieżki W sekcji Zmienne użytkownika wybierz TWOJĄ_NAZWĘ_UŻYTKOWNIKA. Kliknij ją dwukrotnie, aby ją edytować. Kliknij جديد Wklej ścieżkę do folderu ze skryptami. Kliknij OK, aby zaakceptować zmiany.

  • Wróć do folderu Skrypty w Eksploratorze Windows. Utwórz tam nowy plik wsadowy o nazwie „wht.bat”. Dodaj do niego to polecenie:
szept — mały model — język w %1

  • Utwórz dwa pliki wsadowe: „whs” i „whm”.
  • Dodaj to polecenie w pierwszym pliku:
szept — mały model — język w %1
  • Dodaj to polecenie w drugim pliku:
szept — model średni — język en %1

Gratulacje, masz teraz trzy pliki, dzięki którym możesz łatwo korzystać z małych, średnich i podstawowych modeli Whisper w swoich plikach audio! Przekonwertuj dowolny plik audio na tekst:

  • Znajdź plik za pomocą Eksploratora plików systemu Windows.
  • Kliknij prawym przyciskiem myszy w pustym miejscu i wybierz Otwórz w terminalu.
  • Wpisz to polecenie, zastępując „wht” słowem „whs” lub „whm”, aby użyć małych lub średnich modeli językowych:
co to jest TWÓJ_PLIK_AUDIO.mp3

Szybkie pisanie treści audio za pomocą Whisper

Nawet najszybsi maszyniści nie dorównują szybkością naszemu mówieniu. Jednak do niedawna mówienie zamiast pisania nie było optymalnym sposobem tworzenia dokumentów.

Większość rozwiązań zamiany mowy na tekst dawała przeciętne rezultaty. Można było znaleźć takie, które były warte wypróbowania, ale były skomplikowane w obsłudze lub drogie. Na szczęście Whisper to zmienił.

Po wykonaniu powyższych kroków powinieneś być gotowy do transkrypcji lub tłumaczenia swojego głosu z dużą dokładnością, używając tylko jednego polecenia. Możesz teraz przeglądać Najlepsze aplikacje do zamiany dźwięku na tekst do robienia notatek, spotkań i wykładów.

Idź do góry przycisk