technologie

Google dévoile Gemini 3.5 Transcribe : une IA de transcription audio révolutionnaire

Google a lancé Gemini 3.5 Transcribe, un modèle d’intelligence artificielle dédié à la transcription audio, offrant une précision et une fluidité sans précédent. Contrairement aux modèles traditionnels, il parvient à transcrire l’audio brut en texte précis, même en présence de bruit de fond, de jargon complexe ou de hésitations.

Améliorations significatives et fonctionnalités clés

Cette nouvelle IA est capable de capturer le style de parole naturel des utilisateurs, de comprendre leur intention et de reconnaître un vocabulaire personnalisé. Elle gère également les autocorrections, les mots vides et formate automatiquement le texte pour une meilleure fluidité.

Gemini 3.5 Transcribe excelle également dans des environnements bruyants, identifiant avec précision les entités alnumériques comme les codes postaux et les identifiants de commande. Il reconnaît la terminologie spécialisée et l’orthographe particulière, adaptant les transcriptions au vocabulaire de chaque utilisateur.

Intégration et applications

Intégration et applications

La technologie prend en charge plus de 85 langues et gère les accents et les dialectes. De plus, elle identifie les différents locuteurs dans les conversations, avec des marques de temps pour jusqu’à trois personnes, bien que cette fonctionnalité soit encore en phase expérimentale.

Gemini 3.5 Transcribe est désormais disponible pour les développeurs via deux API : une pour le traitement audio programmé (enregistrements, réunions, etc.) et une autre pour la transcription en temps réel.