Grok 3 is out of control

Grok 3 is out of control

Grok 3 est hors de contrôle

🎙 AI Search 👥 727K 📅 21 février 2025 ⏱ 24 min 👁 590K 📄 Test pratique et évaluation comparative d'un modèle d'IA 🧭 2026-09-07
Disponible en : Français (actuel) English

Mots-clés

Grok 3IAgénération d'imagescodagedeep research

Résumé

Cette vidéo de la chaîne AI Search propose un test complet de Grok 3, le nouveau modèle d’IA de xAI, disponible gratuitement au moment du tournage. Le créateur explore successivement la génération d’images, le codage, la résolution de problèmes scientifiques, l’analyse d’images et la fonction Deep Search. Pour la génération d’images, il montre des exemples de photos réalistes de célébrités dans des situations absurdes, soulignant le caractère peu censuré de l’outil. En codage, il teste plusieurs prompts (jeu de serpent autonome, simulation de liaisons hydrogène, tableau périodique interactif, etc.) et compare les résultats avec ceux d’autres modèles comme o3-mini. Il constate que Grok 3 est performant mais parfois en deçà de o3-mini sur certains exercices. Pour la résolution de problèmes, il soumet un problème de physique de niveau universitaire que Grok 3 résout correctement. L’analyse d’images est également réussie. La fonction Deep Search, similaire à celle d’OpenAI, produit un rapport complet sur un sujet donné, mais le créateur note que le taux d’hallucinations n’est pas encore connu pour Grok 3. Enfin, il présente les benchmarks : Grok 3 est en tête du classement LMArena, mais les résultats sur d’autres évaluations sont plus nuancés. La vidéo se termine par une comparaison générale et des conseils d’utilisation.

205 mots

Évaluation critique

Valeur des informations & solidité de l’argumentation

La vidéo apporte une valeur pratique certaine en montrant des tests concrets et reproductibles, avec des exemples de prompts et de résultats. L’argumentation est basée sur l’expérience directe, ce qui est appréciable, mais elle reste subjective et manque de rigueur méthodologique : les tests ne sont pas standardisés, les comparaisons avec d’autres modèles sont parfois approximatives, et les benchmarks cités ne sont pas analysés en profondeur. Le créateur reconnaît d’ailleurs les limites de son évaluation, notamment pour la qualité scientifique des résultats.

Rigueur scientifique, qualité des sources, adéquation du titre

La rigueur scientifique est moyenne : les sources citées sont principalement les plateformes de test (grok.com, p5.js, html.onlineviewer.net) et des benchmarks tiers (LMArena, Artificial Analysis), mais aucune source académique n’est mentionnée. Le titre est en adéquation avec le contenu, qui met en avant des capacités surprenantes et parfois controversées de Grok 3. La vidéo ne prétend pas à une analyse scientifique exhaustive, mais plutôt à un test pratique, ce qui est cohérent avec le format.

172 mots

Adéquation titre / contenu

Le titre est accrocheur et reflète le contenu : la vidéo montre des capacités impressionnantes et parfois surprenantes de Grok 3, notamment en génération d'images.

Qualité & fiabilité

7/10

La vidéo est un test pratique détaillé, avec des exemples concrets et reproductibles, mais repose sur des observations subjectives et des benchmarks non vérifiés de manière indépendante.

Chapitres

Sources concordantes

  • LMArena — Classement où Grok 3 est en tête selon les votes des utilisateurs.
  • Artificial Analysis — Benchmarks indépendants montrant des performances variables de Grok 3.

Sources discordantes

  • Commentaires d'utilisateurs — Certains commentaires signalent des comportements inattendus ou des erreurs dans les tests, ce qui contraste avec l'impression générale positive de la vidéo.

Références externes

Apport & nouveautés

La vidéo apporte un aperçu pratique des capacités de Grok 3, notamment sa génération d’images peu censurée et sa fonction Deep Search. Elle met en lumière les forces et faiblesses du modèle par rapport à ses concurrents.

Pour aller plus loin :

  • LMArena — Plateforme de classement par vote des utilisateurs, où Grok 3 est en tête.
  • Artificial Analysis — Évaluations indépendantes de modèles d’IA.
  • Deep Research d’OpenAI — Fonctionnalité similaire à Deep Search de Grok.

76 mots

Profil radar

Le profil radar montre une bonne quantité d'informations et une qualité correcte, mais une fiabilité globale moyenne et un niveau technique modéré. Cela reflète une vidéo de test pratique, utile mais non exhaustive.

Fiabilité 6/10

💬 Positif. Sur les 30 commentaires analysés, la majorité exprime de l'enthousiasme pour les capacités de Grok 3, avec quelques réserves sur des détails techniques et des comparaisons avec d'autres modèles.