
Let's Run Devstral-2 123B & 24B - France's LOCAL Coding AI REVIEW
Testons Devstral-2 123B et 24B - Test de l'IA de programmation locale française
Mots-clés
Résumé
166 mots
Évaluation critique
Valeur des informations & solidité de l’argumentation
La vidéo apporte une valeur pratique indéniable en montrant comment exécuter ces modèles localement et en fournissant des mesures réelles de vitesse et de mémoire. L’argumentation s’appuie sur des démonstrations concrètes, mais reste subjective et ne valide pas scientifiquement les performances annoncées par Mistral. Le créateur présente honnêtement les limites et les succès, ce qui renforce la crédibilité de la démonstration.
Rigueur scientifique, qualité des sources, adéquation du titre
La rigueur scientifique est modérée : le test est empirique et sans protocole strict. Les sources citées dans la description (Hugging Face, Inferencer) sont pertinentes et permettent de reproduire les essais. Le titre correspond bien au contenu, qui est une revue pratique des modèles. Aucune analyse de commentaires n’est fournie, mais les réactions du public semblent généralement positives sur la base des likes élevés.
140 mots
Adéquation titre / contenu
Le titre reflète exactement le contenu : lancement et test de deux modèles de codage locaux de Mistral.
Qualité & fiabilité
6/10
Test pratique et démonstrations concrètes, mais sans vérification indépendante des benchmarks annoncés.
Moments clés
Repères établis par PSI à partir de la transcription : le créateur n'a pas défini de chapitres.
- Présentation de Devstral-2 123B et 24B, et des licences.
- Comparaison des benchmarks avec Kimi K2 et DeepSeek.
- Lancement du modèle 123B sur Mac Studio et mesure de vitesse (6,4 tokens/s).
- Test de batching sur deux requêtes, augmentation du débit total.
- Premier résultat de génération 3D (décevant, capture d'écran trop petite).
- Amélioration du prompt et test du simulateur de vol spatial.
- Passage au modèle Devstral Small 24B, vitesse élevée (32 tokens/s).
- Génération d'un jeu de snooker 3D et d'un éditeur d'images (Photoshop-like).
- Conclusion et comparaison finale des deux modèles.
Sources citées
- Devstral-2 123B Instruct 2512 – MLX 6.5bit (Hugging Face) — Modèle 123B quantifié au format MLX utilisé pour les tests.
- Devstral Small 2 24B Instruct 2512 – MLX 6.5bit (Hugging Face) — Modèle 24B quantifié sous licence Apache 2, également testé.
- Inferencer App v1.7.3 — Application utilisée pour lancer les modèles et gérer les requêtes.
- DeepSeek V3.2 Review (vidéo associée) — Vidéo précédente comparant DeepSeek V3.2, référence pour la comparaison.
- Kimi K2 Thinking Review (vidéo associée) — Vidéo précédente sur Kimi K2, mentionnée dans les benchmarks.
Références externes
Apport & nouveautés
Cette vidéo apporte une évaluation concrète et accessible des nouveaux modèles Devstral-2 de Mistral, en mettant l’accent sur leur exécution locale sur Mac. Elle offre des mesures de vitesse et de mémoire utiles pour les développeurs, et démontre l’impact du batching sur le débit. L’accent est mis sur l’aspect pratique, complétant les benchmarks officiels souvent optimistes.
Pour aller plus loin :
- Mistral AI (Wikipédia) — Contexte sur l’entreprise et ses modèles.
- MLX (dépôt GitHub d’Apple) — Framework utilisé pour optimiser les modèles sur Apple Silicon.
- Mixture of experts (Wikipédia) — Comparaison des architectures denses et à base de mélange d’experts.
- Quantification (informatique) (Wikipédia) — Notion de précision réduite (Q6) en traitement des modèles.
113 mots
Profil radar
Le profil radar montre un bon équilibre entre information, technique et fiabilité, avec une légère faiblesse sur la fiabilité due au caractère empirique du test. La quantité et la qualité de l'information sont correctes pour une revue pratique.