Apple est en pourparlers actifs avec PrismML, une entreprise dérivée de Caltech soutenue par Khosla Ventures, pour évaluer une technologie capable de réduire suffisamment les modèles d'IA puissants pour les exécuter directement sur un iPhone, transformant potentiellement la façon dont Apple Intelligence traite les requêtes sur ses appareils.
CNBC a rapporté pour la première fois le 14 juillet 2026 qu'Apple évaluait la technologie de compression de modèles de PrismML, qui, selon la startup, peut réduire la taille des modèles d'IA par des facteurs d'ordre de grandeur en utilisant des architectures de précision extrêmement faible. PrismML a confirmé les discussions dans une déclaration à AppleInsider le même jour.
Pour les derniers développements de l'industrie de l'IA et l'analyse technologique, AI Buzz Wire couvre les outils qui remodèlent le paysage.
La percée : exécuter Qwen 3.6 sur un iPhone
Selon Seeking Alpha, PrismML a compressé avec succès le grand modèle de langage open source Qwen 3.6 d'Alibaba pour fonctionner sur l'iPhone 17 Pro – une étape décrite comme l'exécution du plus grand modèle d'IA jamais réalisé sur un smartphone grand public. La startup affirme que sa technologie utilise jusqu'à 15 fois moins de mémoire que les architectures modèles conventionnelles.
L'approche de PrismML se concentre sur les architectures de réseaux neuronaux 1 bit et ternaires. Dans les modèles d'IA traditionnels, chaque paramètre de pondération est stocké sous forme de nombre à virgule flottante de 16 ou 32 bits. PrismML stocke à la place les poids avec une précision extrêmement faible - sous forme de valeurs binaires (+1, -1) ou de valeurs ternaires (+1, 0, -1) - réduisant considérablement l'empreinte mémoire sans sacrifier sévèrement le raisonnement ou les capacités génératives.
Il ne s’agit pas d’une simple quantification, la technique largement utilisée pour réduire la précision sur un modèle déjà entraîné. Les architectures de PrismML sont conçues dès le départ pour un fonctionnement à faible débit, ce qui, selon la société, préserve bien mieux la qualité du modèle que les méthodes de compression post-formation.
Pourquoi Apple veut une IA sur l'appareil
La percée signalée a attiré l'attention d'Apple alors que la société étend sa plateforme Apple Intelligence. L'exécution de modèles d'IA plus grands directement sur les iPhones permettrait à davantage de fonctionnalités de fonctionner sur l'appareil plutôt que via les serveurs Private Cloud Compute d'Apple, qui gèrent actuellement les requêtes d'IA complexes.
Les avantages sont doubles. Premièrement, le traitement sur l’appareil améliore la confidentialité des utilisateurs en conservant les données sur le téléphone plutôt qu’en les transmettant aux serveurs cloud – un différenciateur essentiel qu’Apple a souligné depuis le lancement d’Apple Intelligence. Deuxièmement, cela réduit les coûts d'exploitation d'Apple en réduisant la dépendance à l'égard d'une infrastructure cloud coûteuse et de la capacité du centre de données requise pour servir des centaines de millions d'utilisateurs d'iPhone.
MacRumors note que la technologie pourrait permettre à Apple d'offrir des fonctionnalités d'IA plus sophistiquées, telles que la génération de texte avancée, des tâches de raisonnement complexes et des interactions Siri plus riches, sans nécessiter de connexion réseau ni consommer une autonomie importante de la batterie.
Impact potentiel sur le marché des puces IA
Si les affirmations de PrismML se confirment lors de tests réels, les implications pourraient s'étendre bien au-delà d'Apple. CNBC rapporte que la technologie pourrait remodeler la demande de puces mémoire et de calcul pour centres de données, à mesure que le traitement de l'IA passe du cloud aux appareils grand public.
Actuellement, l’industrie de l’IA dépense des centaines de milliards de dollars en infrastructures de centres de données, en GPU Nvidia et en mémoire à large bande passante pour former et servir de grands modèles de langage. Si les modèles peuvent être considérablement compressés pour être utilisés sur les appareils, une partie de cette demande pourrait se déplacer vers les puces informatiques de pointe et s'éloigner des centres de données centralisés.
Cependant, les analystes préviennent que la formation des modèles d’IA nécessitera toujours d’énormes ressources de calcul, quelle que soit l’efficacité avec laquelle ils peuvent être compressés à des fins d’inférence. La technologie de compression concerne le déploiement et l'inférence, et non la phase de formation, qui reste la partie la plus gourmande en calcul du pipeline d'IA.
Contexte et financement de PrismML
PrismML est une startup et un laboratoire de recherche en IA issus du California Institute of Technology. La société a été pionnière en matière d'architectures de réseaux neuronaux à faible débit commercialement viables, un domaine qui a suscité un intérêt académique important mais un déploiement commercial limité jusqu'à présent.
La startup est soutenue par Khosla Ventures, l'éminente société de capital-risque connue pour ses investissements précoces dans des entreprises de technologies transformatrices. The Information a fait état pour la première fois de la percée de PrismML le 9 juillet, le décrivant comme exécutant le plus grand modèle d'IA jamais conçu sur un iPhone.
La connexion avec Caltech est significative. La recherche universitaire sur les réseaux neuronaux binaires et ternaires est active depuis des années, mais traduire ces techniques en systèmes de qualité de production qui correspondent aux performances des modèles standards s'est avérée extrêmement difficile. L'affirmation de PrismML concernant la viabilité commerciale – validée par l'exécution d'un modèle aussi grand que Qwen 3.6 sur du matériel grand public – représente un pas en avant significatif.
Paysage concurrentiel
Apple n'est pas le seul à poursuivre l'IA sur les appareils. Qualcomm a fait progresser les capacités d'IA sur les appareils grâce à ses processeurs Snapdragon, Google a intégré des modèles sur les appareils dans les téléphones Pixel et Samsung s'est associé à Google pour amener Gemini Nano sur les appareils Galaxy. Cependant, la plupart des modèles actuels sur appareil sont relativement petits, généralement compris entre 1 et 3 milliards de paramètres.
La technologie de PrismML, si elle est éprouvée à grande échelle, pourrait permettre à des modèles beaucoup plus grands – potentiellement comprenant des dizaines de milliards de paramètres – de fonctionner sur des smartphones, modifiant fondamentalement la dynamique concurrentielle. Cela donnerait à Apple un avantage significatif sur ses concurrents qui dépendent davantage du traitement de l’IA basé sur le cloud.
TrendForce note que l'étape franchie par PrismML "reflète la volonté plus large d'Apple d'exécuter l'IA directement sur les appareils plutôt que de s'appuyer sur l'infrastructure cloud". La société d’études de marché suggère qu’une compression réussie sur l’appareil pourrait accélérer la transition vers l’IA de pointe dans l’industrie de l’électronique grand public.
Ce qui vient ensuite
Les discussions d'Apple avec PrismML seraient en phase d'évaluation, ce qui signifie que les sociétés évaluent si la technologie répond aux normes de performance et de fiabilité d'Apple. Rien ne garantit que le partenariat aboutira à un produit commercial et Apple n'a pas commenté publiquement les discussions.
Si la technologie est intégrée aux futurs produits Apple, elle pourrait apparaître dans les mises à jour iOS ou les nouvelles générations de matériel. L'iPhone 17 Pro, que PrismML a utilisé pour sa démonstration, dispose déjà d'importantes capacités de traitement neuronal grâce au Neural Engine d'Apple.
La question plus large est de savoir si les architectures d’IA low-bit deviendront un standard de l’industrie ou resteront une optimisation de niche. Pour l'instant, les résultats de PrismML suggèrent que l'approche a franchi un seuil critique – et l'intérêt d'Apple indique que la technologie est prise au sérieux aux plus hauts niveaux de l'industrie de l'électronique grand public.
Gardez une longueur d'avance sur l'IA
Pour une couverture complète du matériel d'IA, de l'optimisation des modèles et des développements de l'industrie, visitez AI Buzz Wire.
Lire plus d'actualités sur l'IA →
