Reconnaissance vocale

Fish Audio

Transcribe 1 Pro

Modèle de reconnaissance vocale (speech-to-text) adapté aux réunions et entrevues, intégrant l'identification des locuteurs, la capture des émotions vocales et l'horodatage au mot.

Dernière version
fish-audio/transcribe-1-pro
Numéro de version
1
Type
Reconnaissance vocale
Versions recensées
1

Ce que fait ce modèle

Transcribe 1 Pro est un modèle de transcription automatique de la parole (Speech-to-Text) conçu par Fish Audio. Il est calibré pour traiter des enregistrements conversationnels tels que les réunions, les balados et les entrevues, avec une prise en charge de la détection automatique de la langue source.

Le système se démarque par sa capacité à effectuer une diarisation fluide en insérant des balises de locuteurs directement dans le texte généré. Il préserve également les événements vocaux et nuances émotionnelles (comme les rires) sous forme d'annotations intégrées, et propose une segmentation temporelle précise jusqu'à l'échelle du mot.

En matière d'exploitation, le modèle reçoit l'audio en entrée pour restituer la transcription enrichie. Une attention particulière doit être portée à la clarté acoustique de l'enregistrement, les chevauchements de voix multiples et les environnements sonores très dégradés pouvant altérer la précision du repérage des locuteurs.

Capacités

Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.

Reconnaissance vocale

Type principal de contenu traité ou produit par ce modèle.

Fichiers

Peut s'appuyer sur des fichiers joints (documents, extraits) en plus du texte.

Reconnaissance vocale

Transcrit la parole en texte.

Audio

Traite ou produit de l'audio (voix, musique, effets).

Historique des versions

1 version reconstituée à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.

  1. Date non communiquée

    Transcribe 1 Pro

    Dernière version

    fish-audio/transcribe-1-pro

    FichiersReconnaissance vocaleAudio
    Type principal
    Reconnaissance vocale (STT)
    Modalités
    Entrée audio, sortie texte
    Diarisation
    Balisage multi-locuteurs en ligne
    Horodatage
    Segments horodatés au niveau du mot
    Indices vocaux
    Détection d'événements et d'émotions (ex. rires)

    Tarif annoncé : 100.00 $ en entrée, 0.00 $ en sortie, par million de jetons (USD)

Liste de modèles fournie par la plateforme ProductivIA

productivia.ca