Ia : google gemini accuse de « hallucinations », siri en danger ?
Le monde de l'intelligence artificielle est en effervescence. Une récente étude révèle que Google Gemini, le modèle linguistique censé propulser Siri, le futur assistant vocal d'Apple, est le chatbot le plus enclin aux « hallucinations », ces erreurs factuelles déguisées en réponses plausibles. Une nouvelle qui pourrait bien faire trembler la californienne, qui aurait déjà investi plus d'un milliard de dollars dans la Technologie de Google.

L'ia, une illusion de certitude ?
Le phénomène des « hallucinations » est inhérent aux grands modèles de langage (LLM). Programmés pour prédire le mot suivant en se basant sur des schémas statistiques, ils peuvent inventer des informations lorsqu'ils ne trouvent pas de correspondance exacte. Imaginez un LLM qui, face à une question complexe, tente de combler les lacunes en assemblant des mots qui, pris isolément, ont du sens, mais qui, ensemble, construisent une fiction. C'est pourquoi, même les modèles les plus sophistiqués nécessitent une vérification humaine, particulièrement pour les données chiffrées comme les cours de bourse ou les dates.
L'étude menée par Legal Guardian Digital, spécialisée en référencement pour cabinets d'avocats, a analysé la propension à l'erreur de plusieurs chatbots populaires. Le résultat est sans appel : Gemini affiche un taux de « trips » de 32%, soit plus du double de DeepSeek (14%), un modèle d'origine chinoise, et bien plus que ChatGPT, qui s'égare dans trois réponses sur dix.
Le classement complet met en lumière des disparités importantes : Perplexity AI se distingue comme le modèle le plus fiable, avec seulement 13% de réponses erronées. Grok, la création d'Elon Musk, suit de près avec 15%. Mais au-delà de la précision, la disponibilité est un facteur clé. Deux chatbots, Perplexity AI et Grok, ont affiché un taux de disponibilité à 100% durant la période de test, une performance cruciale pour toute application commerciale.
Les scores de satisfaction client, mesurés sur une échelle de 5, révèlent également des nuances intéressantes. ChatGPT et DeepSeek se partagent la première place avec un score de 4.7, tandis que Perplexity AI arrive juste derrière avec 4.6. Meta AI, quant à lui, a obtenu le score le plus bas, 3.4, témoignant d'un besoin d'amélioration.
La cohérence et la qualité des réponses, évaluées sur 5, sont dominées par Kimi AI, avec un score de 4.3. ChatGPT, Copilot et Gemini se partagent la deuxième place avec 4, tandis que Meta AI reste en queue de peloton avec 3.4. L'uptime, un indicateur de la fiabilité d'un service, est excellent pour Perplexity AI et Grok, mais Claude affiche un score de 99.68%, un signe de robustesse.
L'indice composite, qui agrège tous ces paramètres, place Perplexity AI en tête avec 85 points, suivi par Grok (79) et DeepSeek (76). ChatGPT se classe sixième avec 50 points, et Gemini se retrouve en huitième position avec seulement 41 points. Les chiffres parlent d'eux-mêmes : un investissement massif ne garantit pas la performance.
L'avenir de Siri, et plus largement, de l'intégration de l'IA dans nos appareils quotidiens, dépendra de la capacité des développeurs à dompter ces « hallucinations » et à garantir une fiabilité irréprochable. La course est lancée, et les consommateurs sont les juges.