Ce que fait ce modèle
Le modèle universal-3-pro d'AssemblyAI est conçu pour la transcription et l'analyse avancée de fichiers audio (Speech-to-Text). Il se positionne comme une solution de choix pour convertir la parole en texte avec une grande précision, capable de gérer des environnements sonores complexes et d'extraire des informations structurées grâce à sa compatibilité avec l'appel d'outils (tool calling).
Dans le cadre d'un déploiement via des plateformes souveraines telles que ProductivIA, l'utilisation de cette API externe implique le traitement de flux audio hors site. Il convient de valider la conformité avec les exigences réglementaires applicables, notamment les lois québécoises sur la protection des données personnelles, lors du traitement d'enregistrements sensibles.
Ce modèle est particulièrement adapté aux tâches de transcription enrichie, de comptes rendus automatisés, d'analyse de conversations et d'intégration de workflows automatisés basés sur la voix grâce à ses capacités d'interaction avec des outils tiers.
Capacités
Ce que les versions de cette famille savent faire, d'après les annonces du fournisseur et les observations de la veille.
Audio
Type principal de contenu traité ou produit par ce modèle.
Outils
Peut appeler des outils ou des fonctions (recherche, calcul, actions).
Reconnaissance vocale
Transcrit la parole en texte.
Audio
Traite ou produit de l'audio (voix, musique, effets).
Historique des versions
2 versions reconstituées à partir des identifiants techniques et des dates de sortie, de la plus récente à la plus ancienne.
- septembre 2025
Universal-3-Pro
Dernière versionassemblyai:universal-3-proOutils- Type de modèle
- Audio / Parole-texte
- Tarif d'entrée
- 0,0035 $
- Tarif de sortie
- 0,00 $
- Capacités
- Support des outils (supports_tools)
- Identifiant
- universal-3-pro
Tarif annoncé : 0.01 $ en entrée, 0.00 $ en sortie, par million de jetons (USD)
- Date non communiquée
AssemblyAI Universal-3.5 Pro
assemblyai/universal-3-5-proUn modèle ASR haute précision axé sur le code-switching, le guidage contextuel et la diarisation avancée.
- Modalités d'entrée / sortie
- Entrée audio (ou piste vidéo) / Sortie texte avec horodatages
- Couverture linguistique
- 18 langues natives (avec prise en charge du code-switching intra-phrase)
- Limites de traitement par fichier
- Jusqu'à 10 heures et 5 Go (upload local limité à 2,2 Go)
- Guidage contextuel
- Prompt (2 à 50 mots) et liste de termes prioritaires (jusqu'à 1 000 entrées)
- Options spécialisées
- Diarisation des locuteurs et mode médical
Tarif annoncé : 62.50 $ en entrée, 0.00 $ en sortie, par million de jetons (USD)