Generatywna sztuczna inteligencja i deepfake zostały głęboko zintegrowane, aby stworzyć zaawansowane narzędzia audio. Pomysł jest prosty: weź głos i zmanipuluj go, aby model wymówił podane przez Ciebie słowa.
Technologia syntezy głosu to jedno z najwspanialszych osiągnięć współczesnej technologii, umożliwiające tworzenie niezwykle ludzkiego, sztucznego głosu za pomocą komunikatów tekstowych. Wśród innowacyjnych narzędzi i platform umożliwiających to imponujące osiągnięcie znajduje się ElevenLabs, oferujący darmowy pakiet oraz imponujące opcje płatne.
W tym artykule zagłębimy się w temat wykorzystania technologii syntezy głosu w ElevenLabs i korzyści, jakie ona przynosi. Przeprowadzimy Cię przez kluczowe kroki tworzenia głosu, który może być przydatny w różnych zastosowaniach, od audio i reklamy po aplikacje AI i uczenia maszynowego. Sprawdź Czy technologia immersyjna to wygrana czy przegrana dla cyberbezpieczeństwa?

Szybkie linki
Czym jest ElevenLabs?
Firma ElevenLabs została założona przez byłego inżyniera Google ds. uczenia maszynowego i byłego stratega w Palantir Technologies, firmie badawczej zajmującej się technologiami głosowymi. Model mowy jest kluczowym elementem strategii firmy, ale ostatecznym celem jest stworzenie narzędzia, które „natychmiast konwertuje dźwięk mówiony między różnymi językami”.
ElevenLabs Voice AI to oparty na sztucznej inteligencji model zamiany tekstu na mowę, który potrafi generować realistycznie brzmiące głosy ludzkie. Na stronie internetowej czytamy:
„Naszą misją jest zapewnienie wielojęzycznej pomocy głosowej na żądanie w zakresie edukacji, streamingu, audiobooków, gier, filmów, a nawet czatów w czasie rzeczywistym”.
Tłumacz Google i jego alternatywy już oferują wartość, ale czy potrafisz sobie wyobrazić narzędzie, które potrafi natychmiast przetłumaczyć to, co słyszysz, na język mówiony? Odtworzenie głosu mówcy, abyś słyszał dokładnie to, co mówi, to ważny punkt wyjścia do osiągnięcia tego celu.
Czym jest generowanie głosu przez sztuczną inteligencję?
Mówiąc prościej, AI VoiceOver pozwala Ci nagrać głos i sprawić, by mówił to, co chcesz usłyszeć. Wystarczy wybrać głos i dodać dialog, a niestandardowy model zajmie się resztą.
Można by powiedzieć: „No cóż, Microsoft Sam robił to w latach 90.” i miałbyś absolutną rację. Ale Microsoft Sam i podobne narzędzia wyglądały jak roboty. Tymczasem narzędzie ElevenLabs wygląda znacznie bardziej jak człowiek.
ElevenLabs oferuje trzy opcje sztucznej inteligencji mowy: całkowicie darmowe „gotowe” głosy, generator głosu oparty na sztucznej inteligencji (umożliwiający wybór płci, wieku i akcentu) oraz dostępne wyłącznie w ramach subskrypcji „klony” głosów, które można pobrać.
Oto przykład:
notatka: Wykorzystywanie sztucznej inteligencji (AI) do celów kreatywnych wiąże się z pewnymi obowiązkami etycznymi i dotyczącymi własności intelektualnej, a tworzenie głosów za pomocą narzędzia do rozpoznawania mowy AI firmy ElevenLabs nie jest wyjątkiem. Krótko mówiąc, nie używaj czyjegoś głosu bez jego zgody. Chociaż nie jest to nielegalne, może to kogoś zdenerwować.
Zanim przejdziesz dalej, pamiętaj, że w momencie pisania tego tekstu narzędzie do rozpoznawania mowy AI firmy ElevenLabs jest w fazie beta. Oznacza to, że nie jest to produkt finalny. Sprawdź Poznaj fascynujące projekty AI, które można zrealizować przy użyciu Raspberry Pi..
Utwórz podstawowy dialog AI
Najprostszym sposobem na rozpoczęcie pracy jest skorzystanie z bezpłatnego narzędzia do rozpoznawania mowy opartego na sztucznej inteligencji od ElevenLabs.
Aby z niego skorzystać, przejdź do beta.elevenlabs.io Załóż konto (możesz użyć swojego adresu e-mail, konta Google lub Facebooka).
Oto kolejne kroki:
- Kliknij Synteza mowy.
- Wybierz jeden z predefiniowanych głosów w Ustawieniach (dostępne są głosy męskie i żeńskie).
- Rozwiń Ustawienia dźwięku, aby ustawić suwaki Stabilność i Wyrazistość + Wzmocnij podobieństwo (wysoka stabilność jest zazwyczaj monotonna, wysoka wyrazistość jest bliższa zamierzonemu brzmieniu).

- Wybierać Jedenaście jednojęzycznych (Standardowy angielski).
- Wprowadź tekst, który chcesz zamienić na mowę.
- Kliknij budowa.

- Po zakończeniu procesu dźwięk powinien zostać odtworzony automatycznie; jeśli nie, kliknij zatrudnienie.
Można również pobrać wygenerowany przykład.
Jak stworzyć głos sztucznej inteligencji za pomocą ElevenLabs
Jeśli wolisz utworzyć nowy głos, możesz użyć przycisku „Dodaj głos”, aby przejść do ekranu VoiceLab. Aby utworzyć nowy głos na podstawie ustawień wstępnych ElevenLabs:
- Kliknij Dodaj dźwięk -> Projekt dźwięku.

- Ustaw pola dotyczące płci, wieku i akcentu.
- Dostosuj suwak siły ostrości według potrzeb.
- Wprowadź tekst, który chcesz przekonwertować.
- Kliknij budowa.

- Kiedy skończysz, posłuchaj.
Podczas testów odkryłem, że akcenty kobiet/młodych/Australijek i mężczyzn/starych/Australijek są wyraźnie „amerykańskie”. Problem ten prawdopodobnie zostanie rozwiązany wraz z rozwojem technologii.
Stwórz własny głos AI
Chociaż wstępnie ustawione i konfigurowalne opcje są interesujące, naprawdę ekscytującym elementem technologii ElevenLabs jest opcja „Instant Voice Cloning”.
W przeciwieństwie do innych opcji, usługa Instant Voice Transcription wymaga wykupienia subskrypcji. Dostępnych jest kilka opcji, z których najtańsza kosztuje 5 dolarów miesięcznie. W momencie pisania tego tekstu, usługa ta jest objęta 80% zniżką na pierwszy miesiąc, co oznacza, że kosztuje tylko XNUMX dolara.
Inne opcje kosztują odpowiednio 22, 99 i 330 dolarów miesięcznie, a dają możliwość wygenerowania do 40 godzin nagrań audio miesięcznie.
Aby skorzystać z klonowania głosu ElevenLabs, potrzebujesz dialogu i próbki swojego głosu. Wszystko się nada, o ile będzie wyraźne i w formacie MP3. Im dłuższa próbka, tym lepiej – do 5 minut.
Z ekranu VoiceLab:
- Kliknij Dodaj dźwięk -> Natychmiastowa transkrypcja.
- W wyświetlonym oknie wpisz nazwę.
- Kliknij lub przeciągnij odpowiedni plik, aby przesłać próbkę audio (w celu zwiększenia dokładności można dodać maksymalnie 25 próbek).
- Kliknij etykiety i wybierz klucz + wartość (na przykład Akcent/Brytyjski) — powtórz tę czynność maksymalnie 5 razy.

- Wprowadź krótki opis dźwięku.
- Zaznacz pole wyboru Potwierdź zgodę, a następnie dodaj dźwięk.
Po dodaniu głosu możesz go dostosować na ekranie syntezy mowy, jak wspomniano powyżej. Sprawdź Ocena wykorzystania technologii klonowania dźwięku w tworzeniu treści na dużą skalę.
Co można zrobić przy pomocy głosu sztucznej inteligencji?
Głosy AI składają się z wielu wstępnie skonfigurowanych i sklonowanych głosów. Jak wspomniano wcześniej, ostatecznym celem ElevenLabs jest bezpośrednie tłumaczenie, ale ma ono wiele innych zastosowań.
Audiobooki (być może czytane przez dawno zmarłą gwiazdę filmową) są wymieniane obok gier wideo (wykorzystanie głosu AI pozwoliłoby zaoszczędzić na lektorach). Mają one jednak znacznie szersze zastosowanie – od muzyki, przez satyrę, po poradniki, a może nawet dalej.
Możesz również tworzyć podcasty, wykorzystując głos sztucznej inteligencji, jednak efekty mogą wydawać się płaskie i nudne.
Wprowadzenie do odcinka podcastu Really Helpful zostało wyprodukowane we współpracy z ElevenLabs:
Mimo że rezultaty nie były takie, jakich oczekiwaliśmy, były na tyle dobre, że można było z nich korzystać, a technologia ta może być tylko udoskonalana.
Tymczasem ElevenLabs planuje wprowadzić funkcję czatu głosowego w późniejszym terminie.
często zadawane pytania
P1: Czym jest technologia syntezy dźwięku?
Technologia syntezy głosu wykorzystuje sztuczną inteligencję i techniki przetwarzania dźwięku, aby stworzyć syntetyczny głos przypominający głos ludzki. Może być wykorzystywana w różnych zastosowaniach, takich jak audio, reklama i aplikacje wykorzystujące sztuczną inteligencję.
P2: Czym jest ElevenLabs i co oferuje?
ElevenLabs to zaawansowana platforma oparta na technologiach syntezy głosu. Oferuje użytkownikom potężne narzędzia do tworzenia syntetycznego głosu, który może być wiernie odwzorowany w ich własnym. ElevenLabs pomaga personalizować głosy i wykorzystywać je do różnych celów.
P3: Jak mogę zacząć korzystać z ElevenLabs?
Możesz łatwo zacząć, rejestrując się na platformie ElevenLabs i poznając jej prosty i przyjazny dla użytkownika interfejs. Będziesz mógł stworzyć i dostosować własny głos syntetyczny, a następnie wykorzystać go w swoim projekcie.
P4: Czy istnieją jakieś specjalne wymagania dotyczące korzystania z technologii syntezy głosu?
Do korzystania z ElevenLabs nie jest wymagana zaawansowana wiedza techniczna, ale znajomość podstawowych pojęć dotyczących przetwarzania dźwięku i stosowania podstawowych technik będzie pomocna. Interfejs użytkownika i instrukcje są łatwe w obsłudze i pomogą Ci rozpocząć pracę.
P5: Jakie są typowe zastosowania technologii syntezy głosu wykorzystującej ElevenLabs?
Do popularnych aplikacji należą spersonalizowane reklamy audio, spersonalizowane usługi głosowe oraz aplikacje AI obsługujące syntetyczne głosy. ElevenLabs umożliwia personalizację głosów, aby idealnie dopasować je do Twojego projektu.
Wykorzystaj swój głos w nowy sposób dzięki sztucznej inteligencji ElevenLabs
Sztuczna inteligencja przyniosła nam w ciągu ostatnich kilku lat niesamowite nowe narzędzia. Chat-GPT może być używany do generowania tekstu, odpowiadania na pytania, planowania raportów i nie tylko. W połowie drogi To niesamowity model, który generuje sztukę na podstawie podpowiedzi.
Teraz narzędzie ElevenLabs oparte na sztucznej inteligencji ułatwia manipulowanie głosami. To jak naśladowanie, ale z kopią oryginalnego głosu.
Choć istnieją etyczne argumenty przeciwko wykorzystywaniu głosów bez zgody, to potężne narzędzie o kilku interesujących zastosowaniach. Co najważniejsze, jest zaskakująco łatwe w użyciu i przynosi imponujące rezultaty. Możesz je sprawdzić już teraz. Najlepsze generatory sztuki oparte na sztucznej inteligencji (AI) umożliwiające tworzenie innowacyjnych dzieł sztuki ze zdjęć..










