L’inférence embarquée remodèle la pile de capteurs

Adam J. Fleischer
|  Créé: Août 12, 2026
At a Glance
Cet article examine comment l’inférence sur l’appareil transforme le mode de fonctionnement des capteurs, en mettant l’accent sur le passage du streaming traditionnel au traitement local afin d’améliorer l’efficacité et les performances. Grâce à des avancées telles que les systèmes de réveil à plusieurs niveaux et les techniques de quantification améliorées, les capteurs sont désormais évalués sur la qualité des données qu’ils fournissent aux modèles locaux, et non plus seulement sur la pureté de leurs signaux.
Go Deeper with AI:
L’inférence sur l’appareil remodèle la pile de capteurs

Points clés

  • Avec l’inférence embarquée sur l’appareil, un capteur est davantage jugé sur ce qu’il transmet à un modèle voisin que sur la pureté de son flux de données. 
  • La bande passante mémoire, et non le TOPS maximal, limite la plupart des conceptions edge, et la quantification sur 8 bits est le levier qui permet de faire tenir un modèle dans la mémoire sur puce.
  • Dans les conceptions toujours actives, la maîtrise de la consommation repose sur un réveil hiérarchisé : il faut confier chaque décision à l’étage le moins coûteux capable de la prendre, car déplacer les données coûte plus cher que le calcul.

L’inférence se déplace vers l’appareil

L’edge AI est en train de passer des pilotes aux produits grand public en 2026. Sur les quelque 21 milliards d’appareils IoT connectés en service, la plupart envoient encore leurs données hors de l’appareil pour traitement. Mais des circuits intégrés conçus à cet effet rapatrient désormais ce travail à bord : les premiers microcontrôleurs STM32 dotés d’une unité de traitement neuronal dédiée (NPU) sont entrés en production de volume fin 2024, et les modules edge-AI d’entrée de gamme ont atteint des niveaux de prix qui font de l’inférence locale un choix économiquement naturel.

Les capteurs alimentent désormais un modèle

Une fois que l’inférence s’exécute localement, un capteur est évalué moins sur la qualité avec laquelle il numérise un signal que sur l’utilité de sa sortie pour le modèle qui l’accompagne. Cela a trois conséquences :

Ces évolutions contribuent aussi à protéger la vie privée. Les capteurs time-of-flight et les radars rapportent des distances et des mouvements, non des images, et la vision intégrée au capteur conserve les pixels bruts sur la puce, de sorte qu’un capteur de présence peut remplir sa fonction sans qu’aucun flux caméra ne quitte jamais le composant.

La bande passante, pas les TOPS, fixe le plafond

Le chiffre mis en avant pour un composant edge AI est généralement sa valeur en TOPS (billions d’opérations par seconde), et c’est un mauvais critère pour dimensionner une conception. Deux accélérateurs affichant le même nombre de TOPS peuvent présenter un débit réel très différent, car les performances dépendent de la bande passante mémoire, des opérateurs pris en charge par le silicium et de la manière dont le compilateur du fournisseur projette votre réseau sur celui-ci. 

Dans la plupart des conceptions edge, c’est le déplacement des tenseurs qui constitue le facteur limitant, de sorte que le processeur attend la mémoire bien avant de manquer de capacité de calcul. L’énergie par inférence, et non le TOPS maximal, est la mesure qui reflète ce que voit réellement une batterie. Il est utile de raisonner en deux régimes, selon l’emplacement du modèle : SRAM sur puce ou DRAM externe.

Le régime microcontrôleur

Sur un microcontrôleur, la limite est la SRAM sur puce : souvent seulement 256 Ko à 512 Ko. Ce budget doit contenir les activations du modèle et les buffers de travail (les tenseurs d’exécution), le modèle doit donc être petit et quantifié pour tenir, tandis que ses poids sont conservés en mémoire flash. La quantification est le levier : convertir les poids de nombres flottants 32 bits en entiers 8 bits réduit la taille d’un modèle d’environ trois à quatre fois avec peu de perte de précision, suffisamment pour qu’un réseau de type MobileNet quantifié tienne dans environ 1 Mo de flash là où la version en flottant ne tiendrait pas.

Le régime SoC edge

Sur un SoC edge plus important exécutant des pipelines de vision ou un petit modèle de langage, la contrainte se déplace vers la LPDDR externe, où la capacité compte moins que la vitesse à laquelle les poids et les activations peuvent être transmis en flux. La mémoire est aussi une question d’approvisionnement. La réaffectation en 2026 des capacités de DRAM vers les centres de données d’IA a fait monter les prix de la LPDDR et resserré l’offre. Les fournisseurs mènent la même bataille du côté de la bande passante : en mai, Synaptics a qualifié la bande passante mémoire de principal goulet d’étranglement pour l’inférence embarquée de modèles de langage et a indiqué qu’une compression agressive des poids était le moyen de regagner du débit.

Réveillez la grosse puce en dernier

Rester toujours actif sans vider la batterie revient à empiler les détecteurs par coût : les étages les plus coûteux restent éteints jusqu’à ce qu’un étage moins cher gagne le droit de les réveiller. Tout ce qui fonctionne en continu détermine la consommation au repos du système ; l’objectif est donc de rendre cet étage inférieur aussi peu coûteux que possible et de lui faire piloter tout ce qui se trouve au-dessus.

Le niveau microphone

Un microphone MEMS intelligent exécute un minuscule réseau de neurones pour la détection d’activité vocale avec des dizaines de microampères, puis passe à un modèle plus profond pour la détection de mot-clé uniquement lorsqu’il entend de la parole, et ne réveille l’hôte qu’ensuite.

Le niveau mouvement

Le cœur de machine learning d’une IMU classe l’activité dans le capteur et déclenche une interruption. Le processeur hôte et tout accélérateur restent en veille profonde jusqu’à l’apparition d’une classe d’intérêt.

Le niveau présence

Un radar 60 GHz, tel que Infineon’s BGT60LTR11AIP, ou un capteur time-of-flight multizone gère la détection de présence grâce à un traitement sur puce, ne réveillant une caméra ou un pipeline de vision complet qu’une fois la présence d’une personne confirmée.

Les gains apparaissent dans la manière dont ces produits passent l’essentiel de leur temps : au repos. Pour donner un ordre de grandeur, un système qui maintient un hôte éveillé pour écouter consomme des milliampères, tandis qu’une chaîne frontale hiérarchisée reste au repos à quelques dizaines de microampères et ne consomme des milliampères que pendant une fraction de seconde lorsqu’un événement se produit. Avec une pile bouton, la différence entre un fonctionnement toujours actif et un fonctionnement hiérarchisé est celle qui sépare quelques jours de plusieurs années d’autonomie.

Placez l’intelligence à l’étage le moins coûteux

À travers les capteurs, la mémoire et l’alimentation, la logique de conception se résume à deux principes qui doivent guider votre choix de composants :

  • Résolvez chaque décision aussi bas que possible dans la pile. Chaque classification qu’une IMU, un microphone ou un capteur de présence peut effectuer seul est une classification pour laquelle l’hôte n’a jamais besoin d’être réveillé.
  • Déplacer les données coûte plus cher que le calcul. Les octets envoyés sur un bus ou vers le cloud consomment plus d’énergie que le calcul lui-même ; privilégiez donc les composants qui remontent des résultats plutôt que des échantillons bruts. 

Chaque fonction que vous intégrez au capteur est une fonction que le processeur hôte, la mémoire et l’interface n’ont plus à prendre en charge. Le compromis, c’est la flexibilité. Intégrez l’intelligence dans le capteur lorsque la tâche est stable et bien comprise. Conservez-la sur l’hôte lorsque le modèle changera souvent ou nécessitera un réentraînement sur le terrain, où reflasher le firmware vaut mieux que refabriquer un moteur fixe. 

Pour savoir à quel niveau de la pile placer chaque brique d’intelligence, voir The Edge-Sensing BOM: What to Spec, from IMUs to Interfaces, qui passe en revue la nomenclature ligne par ligne : IMU, time-of-flight, radar, microphones, hubs de capteurs, mémoire et interfaces.

A propos de l'auteur

A propos de l'auteur

Adam Fleischer is a principal at etimes.com, a technology marketing consultancy that works with technology leaders – like Microsoft, SAP, IBM, and Arrow Electronics – as well as with small high-growth companies. Adam has been a tech geek since programming a lunar landing game on a DEC mainframe as a kid. Adam founded and for a decade acted as CEO of E.ON Interactive, a boutique award-winning creative interactive design agency in Silicon Valley. He holds an MBA from Stanford’s Graduate School of Business and a B.A. from Columbia University. Adam also has a background in performance magic and is currently on the executive team organizing an international conference on how performance magic inspires creativity in technology and science. 

Related Technical Documentation

Ressources associées

Retournez à la Page d'Accueil
Thank you, you are now subscribed to updates.