Speech-to-Text

Transforme voz em texto com a IA do Google

Converta áudio em transcrições de texto e integre o reconhecimento de fala em aplicativos com APIs fáceis de usar.

Clientes novos também ganham até US$ 300 em créditos para testar a Speech-to-Text e outros produtos do Google Cloud.

Recursos

IA de fala avançada

A Speech-to-Text pode usar o Chirp, o modelo de fundação do Google Cloud para fala treinado com milhões de horas de dados de áudio e bilhões de frases de texto.Isso contrasta com as técnicas tradicionais de reconhecimento de fala que se concentram em grandes quantidades de dados supervisionados específicos de um idioma. Essas técnicas melhoram o reconhecimento e a transcrição de mais idiomas e sotaques falados.

Suporte para mais de 85 idiomas e variantes

Crie uma base global de usuários com amplo suporte a idiomas. Transcreva dados de áudio curtos, longos e até mesmo de streaming. A Speech-to-Text também oferece aos usuários implantações mais precisas e disponibilizadas globalmente para transcrição com o Chirp 3, a próxima geração de modelos de fala universais.

Chirp 3: a transcrição foi desenvolvida usando treinamento autossupervisionado em milhões de horas de áudio e 28 bilhões de frases de texto em mais de 100 idiomas.

Streaming de reconhecimento de fala

Receba resultados de reconhecimento de fala em tempo real conforme a API processa a entrada de áudio transmitida com o microfone do seu aplicativo ou enviada em um arquivo de áudio pré-gravado (in-line ou com o Cloud Storage).

Reconhecimento de fala e transcrição com tecnologia de IA

O Speech-to-Text usa a adaptação de modelos para melhorar a precisão de palavras usadas com frequência, expandir o vocabulário disponível para transcrição e melhorar a transcrição de áudios barulhentos. A adaptação de modelos permite que os usuários personalizem a Speech-to-Text para reconhecer palavras ou frases específicas com mais frequência do que outras opções sugeridas. Por exemplo, é possível direcionar a conversão de voz em texto para a transcrição de "clima" em vez de "se".

Compliance regulamentar e de segurança pronta para uso

A API Speech-to-Text v2 oferece aos clientes empresariais e corporativos requisitos regulatórios e de segurança adicionais prontos para uso. A residência de dados possibilita a invocação de modelos de transcrição por meio de um serviço totalmente regionalizado que acessa regiões do Google Cloud, como Singapura e Bélgica. Os registros para geração e transcrição de recursos são disponibilizados facilmente no console do Google Cloud. Já a API Speech-to-Text v2 oferece criptografia de nível empresarial com chaves de criptografia gerenciadas pelo cliente para todos os recursos, além de transcrição em lote.

Adaptação de fala

Forneça dicas para personalizar o reconhecimento de fala e transcrever termos específicos de uma área e palavras raras. Assim você também poderá melhorar a precisão da sua transcrição de palavras ou frases específicas. Converta automaticamente números falados em endereços, anos, moedas e muito mais usando classes.

Speech-to-Text On-Prem

Tenha controle total sobre sua infraestrutura e dados de fala protegidos ao usar a tecnologia de reconhecimento de fala do Google no local, diretamente nos seus data centers particulares. Entre em contato com a equipe de vendas para começar.

Reconhecimento de diversos canais

A Speech-to-Text pode reconhecer diferentes canais em uma situação com diversos locutores (como uma videoconferência) e anotar as transcrições para preservar a ordem.

Robustez de ruído

A Speech-to-Text é capaz de gerenciar áudios com ruídos de vários ambientes sem precisar de um cancelamento de ruído extra.

Modelos de áreas específicas

Escolha dentre uma variedade de modelos treinados para chamadas telefônicas, transcrição de vídeo e controle de voz otimizados para requisitos de qualidade de áreas específicas. Por exemplo, nosso modelo aprimorado de chamada telefônica é ajustado para áudios originados da telefonia, como ligações gravadas em uma taxa de amostragem de 8 khz.

Filtragem de conteúdo

O filtro de linguagem obscena ajuda você a detectar conteúdo inapropriado ou não profissional nos seus dados de áudio, além de remover palavras obscenas nos resultados em texto.

Avaliação de transcrição

Faça upload dos seus dados de voz, e eles serão transcritos sem códigos. Avalie a qualidade ao iterar na sua configuração.

Pontuação automática (Beta)

A Speech-to-Text pontua com precisão as transcrições, por exemplo, fornecendo vírgulas, pontos de interrogação e pontos finais.

Diarização de locutor

Saiba quem disse o quê com as previsões automáticas das falas de cada locutor em uma conversa.

Compare o modelo Chirp da Speech-to-Text na API e no Agent Studio

ProdutoO que éIdeal para Principais recursos

Chirp 3: transcrição na Plataforma de Agentes