Whisper

Whisper to model rozpoznawania mowy opracowany przez OpenAI, udostępniony z otwartymi wagami. Zamienia nagranie audio na tekst, obsługuje wiele języków — w tym polski — i radzi sobie z nagraniami o niższej jakości oraz akcentami.

Whisper — porozmawiajmy o tym, gdzie ma sens w Twoim projekcie.

Maksymalnie 5 MB — dokumenty i obrazy

lub wyślij maila bezpośrednio na
[email protected]

Model można uruchomić na własnym sprzęcie albo korzystać z niego przez API. Wariant lokalny bywa wybierany tam, gdzie nagrania nie mogą opuścić organizacji — na przykład przy rozmowach z klientami lub dokumentacji medycznej.

Typowe zastosowania to transkrypcje spotkań, napisy do materiałów wideo, indeksowanie treści audio pod wyszukiwanie oraz wejście głosowe w aplikacjach.

Porozmawiajmy