Tech • IA • Robotique • Jeu

VIDÉO
ENFR

J’en ai eu un… et c’est rapide !!!

5/10
IANetworkChuck23 septembre 2026 à 14:0521:52
Lecteur audio
0:00 / 0:00

INTRO

La M5 Ultra d’Apple a montré des gains majeurs par rapport à la M3 Ultra dans les charges de travail d’IA locales, avec un traitement des prompts bien plus rapide, ainsi que la transcription, la génération d’images et de vidéos, et même un montage vidéo basique piloté par agent.

POINTS CLÉS

Cas d’usage de type serveur

La M5 Ultra a été testée non pas comme une station de travail de bureau, mais comme une machine d’IA locale dédiée dans une configuration de salle serveur. L’accent était mis sur des charges de travail entièrement hors ligne, sans appel à OpenAI ni Anthropic, couvrant les modèles de langage, la transcription, la génération visuelle, les tâches d’agent et l’analyse de médias.

Principales évolutions matérielles

Les M3 Ultra et M5 Ultra comparées utilisaient toutes deux 80 cœurs GPU, mais la puce plus récente ajoute un Neural Accelerator sur chaque cœur et fait passer la bande passante mémoire de 819 Go/s à 1,2 To/s. Ces deux changements ont semblé compter davantage que le simple nombre de cœurs dans les tests d’inférence IA.

Gains sur les grands prompts avec les modèles de langage

Avec Qwen3.8 27B 4-bit et un prompt de 32 000 tokens, la M5 Ultra a affiché un time to first token de 21,66 secondes, contre 82,85 secondes sur la M3 Ultra. La nouvelle machine était donc environ 3,8 fois plus rapide lors de l’étape initiale de traitement du prompt, tandis que la vitesse de génération est passée de 28,1 à 43,3 tokens par seconde, soit environ 1,5 fois plus rapide.

Pourquoi ce gain de vitesse compte

L’ingestion du prompt sollicite fortement le calcul, car le modèle doit traiter tout le contexte d’un coup, tandis que la génération de tokens est davantage limitée par les mouvements de mémoire. Dans ce test, le modèle 27B occupait environ 15 Go, et ces poids devaient être déplacés à répétition depuis la mémoire unifiée pour chaque token généré. L’augmentation de près de 50 % de la bande passante correspondait étroitement au gain observé de 1,5x en génération.

Les modèles plus petits ont creusé l’écart

Avec un modèle 14B à la même longueur de contexte de 32K, la M5 Ultra a réduit l’attente à 14 secondes, contre 57 secondes sur la M3 Ultra. Cela correspondait à un traitement du prompt environ 4x plus rapide et à une génération 1,7x plus rapide, ce qui suggère que le système plus récent conserve son avantage quelle que soit la taille du modèle.

Performances en transcription

La transcription locale avec les modèles Whisper a constitué l’un des résultats pratiques les plus marquants. Sur un enregistrement de 13,8 minutes, la M5 Ultra était 1,8x plus rapide avec large-v3 et 2,3x plus rapide avec turbo. Sur un enregistrement de 2 h 5 min, elle a terminé large-v3 en 89,4 secondes et turbo en 24,4 secondes, le plus petit modèle finissant en environ 12 secondes.

Compréhension vidéo et potentiel d’archivage

En exécutant Qwen3-VL 32B 4-bit MLX sur de la vidéo à environ une image par seconde, la M5 Ultra a analysé les séquences et généré des descriptions détaillées des scènes en environ 22 secondes, soit environ 2,6x plus vite que la M3 Ultra. Ce résultat indique un cas d’usage pratique pour indexer de grandes archives personnelles, comme d’anciennes vidéos familiales VHS, sans payer de frais d’API à la minute.

Génération d’images et de vidéos

La génération locale d’images avec FLUX.2 klein 4B s’est terminée en 2,6 secondes sur la M5 Ultra contre 10,2 secondes sur la M3 Ultra, soit un gain d’environ 4x. La génération vidéo avec LTX-2.5 22B s’est aussi améliorée, la machine plus récente étant environ 1,7x plus rapide sur un court clip et 2,5x plus rapide sur un clip plus long.

Charges agentiques et contexte long

Le système a aussi servi de backend pour Hermes avec Qwen et une fenêtre de contexte d’environ 131 000 tokens. Sans être présenté comme le meilleur modèle d’agent principal, l’environnement local a bien récupéré le contexte et traité des requêtes basiques liées aux connaissances personnelles, ce qui montre que les assistants locaux à grand contexte deviennent plus viables sur le matériel Apple à grande mémoire.

Modèles de décision binaire et outils de montage

Dans un test de classification de spam utilisant l’approche open source Laya sur 300 messages étiquetés, les deux systèmes étaient précis, mais la M5 Ultra était environ 1,4x plus rapide. Un autre test a relié Qwen3.8 27B via LM Studio et le MCP de DaVinci Resolve pour effectuer localement des actions de montage automatisées; le processus était lent, prenant environ 13 minutes, mais il a bien produit un montage fonctionnel.

Coût et perspectives d’évolution

La configuration testée, avec 256 Go de mémoire unifiée et 8 To de stockage, était proposée à environ 14 000 $. Une version 512 Go est attendue plus tard, et la machine était présentée moins comme un ordinateur de bureau de luxe polyvalent que comme un nœud d’IA auto-hébergé, pouvant à terme être mis en cluster pour des modèles locaux plus grands.

CONCLUSION

La M5 Ultra semble faire du haut de gamme Apple silicon une véritable plateforme d’IA locale, surtout pour les utilisateurs qui privilégient l’inférence hors ligne, la transcription et les flux de travail multimédias. Ses principaux atouts viennent de la rapidité du traitement des prompts et de la bande passante mémoire, même si son prix la réserve clairement à des usages spécialisés.

Poser une question
Transcription complète

Sur le même sujet : IA