Mobile menu

On-device inference меняет стек датчиков

Adam J. Fleischer
|  Создано: 12 Августа, 2026
At a Glance
В этой статье рассматривается, как inference на устройстве меняет принципы работы датчиков, с акцентом на переход от традиционной потоковой передачи данных к локальной обработке ради повышения эффективности и улучшения производительности. Благодаря таким достижениям, как многоуровневые системы пробуждения и усовершенствованные методы квантования, датчики теперь оцениваются по качеству данных, которые они предоставляют локальным моделям, а не только по чистоте их сигналов.
Go Deeper with AI:
Выполнение вывода на устройстве меняет архитектуру стека датчиков

Ключевые выводы

  • При инференсе на самом устройстве датчик оценивается уже не столько по тому, насколько чисто он передает поток данных, сколько по тому, насколько полезные данные он подает расположенной рядом модели. 
  • Пропускная способность памяти, а не пиковые TOPS, ограничивает большинство edge-конструкций, а 8-битная квантизация — это тот рычаг, который позволяет уместить модель во встроенной памяти.
  • В системах с режимом always-on энергопотребление снижается за счет многоуровневого пробуждения: каждое решение нужно передавать на самый дешевый по стоимости этап, который способен его принять, потому что перемещение данных обходится дороже, чем сами вычисления.

Инференс перемещается на устройство

Edge AI в 2026 году переходит из пилотных проектов в массовые продукты. Из примерно 21 миллиарда подключенных IoT-устройств, находящихся в эксплуатации, большинство по-прежнему отправляет свои данные с устройства для обработки. Но специализированный кремний переносит эту работу на борт: первые микроконтроллеры STM32 с выделенным нейропроцессорным блоком (NPU) вышли в массовое производство в конце 2024 года, а модули edge AI начального ценового уровня подешевели до такой степени, что локальный инференс становится экономически оправданным вариантом по умолчанию.

Теперь датчики работают на модель

Когда инференс выполняется локально, датчик оценивают уже не столько по тому, насколько чисто он оцифровывает сигнал, сколько по тому, насколько полезен его выход для модели, работающей рядом с ним. Это приводит к трем последствиям:

  • Более чистые данные и более широкий динамический диапазон. Модели чувствительны к шуму и клиппингу, поэтому входные каскады получают больший запас по диапазону. Инерциальные измерительные модули с двойным диапазоном (IMU) одновременно фиксируют слабые вибрации и сильные удары без потери данных между диапазонами. Производители микрофонов теперь повышают не только отношение сигнал/шум, но и порог акустической перегрузки, чтобы громкое событие не насыщало тракт до того, как его увидит модель.
  • Вычисления внутри датчика. Ядра машинного обучения и блоки обработки внутри датчика в IMU, AI-движки внутри MEMS-микрофонов и зрение на кристалле позволяют компоненту выдавать решение или признак вместо сырого потока данных, так что хост может оставаться в спящем режиме.
  • Разреженный, событийно-управляемый выход. Сенсоры событийного зрения и микрофоны с wake-on-sound используют полосу пропускания и вычислительные ресурсы только тогда, когда что-то меняется, вместо непрерывной потоковой передачи 24/7.

Эти разработки также помогают защищать приватность. Датчики time-of-flight и радары сообщают о расстоянии и движении, а не об изображениях, а внутрисенсорное зрение удерживает сырые пиксели на кристалле, поэтому датчик присутствия может выполнять свою задачу без того, чтобы видеопоток вообще покидал компонент.

Предел задают не TOPS, а пропускная способность

Основной показатель, который обычно указывают для компонента edge AI, — это TOPS (триллионы операций в секунду), и именно на него не стоит опираться при выборе масштаба проекта. Два ускорителя с одинаковым рейтингом TOPS могут показывать очень разную реальную пропускную способность, потому что производительность зависит от пропускной способности памяти, поддерживаемых кремнием операторов и от того, насколько хорошо компилятор поставщика отображает вашу сеть на эту архитектуру. 

В большинстве edge-проектов ограничивающим фактором становится перемещение тензоров, поэтому процессор простаивает в ожидании памяти задолго до того, как ему перестает хватать вычислительной мощности. Для батареи важнее энергия на один инференс, а не пиковые TOPS. Удобно рассматривать две области, разделенные по тому, где живет модель: во встроенной SRAM или во внешней DRAM.

Режим микроконтроллера

В микроконтроллере предел задает встроенная SRAM: зачастую это всего 256–512 КБ. В этот бюджет должны поместиться активации модели и рабочие буферы (тензоры времени выполнения), поэтому модель должна быть небольшой и квантизованной, а ее веса — храниться во flash-памяти. Квантизация здесь — главный рычаг: перевод весов из 32-битного формата с плавающей точкой в 8-битные целые числа уменьшает модель примерно в три-четыре раза при незначительной потере точности, так что квантизованная сеть класса MobileNet занимает около 1 МБ flash, тогда как версия с float-представлением туда бы не поместилась.

Режим edge SoC

В более крупной edge SoC, выполняющей конвейеры компьютерного зрения или небольшую языковую модель, ограничение смещается к внешней LPDDR, где важна не столько емкость, сколько скорость потоковой передачи весов и активаций. Память — это еще и вопрос поставок. Перераспределение DRAM-мощностей в 2026 году в пользу AI ЦОДов повысило цены на LPDDR и ужесточило предложение. Поставщики ведут ту же борьбу и на стороне пропускной способности: в мае Synaptics назвала пропускную способность памяти главным узким местом для инференса языковых моделей на устройстве и указала на агрессивное сжатие весов как на способ вернуть пропускную способность.

Пробуждайте большой чип в последнюю очередь

Чтобы система могла постоянно оставаться включенной и не разряжать батарею, нужно выстроить детекторы по стоимости: дорогие этапы остаются выключенными, пока более дешевый не даст им право проснуться. То, что работает непрерывно, и определяет ток покоя системы, поэтому задача — сделать нижний уровень как можно дешевле и позволить ему управлять всем, что выше.

Уровень микрофона

Интеллектуальный MEMS-микрофон запускает крошечную нейросеть для обнаружения речевой активности при токах в десятки микроампер, затем повышает уровень до более глубокой модели для распознавания ключевых слов только тогда, когда слышит речь, и лишь после этого будит хост.

Уровень движения

Ядро машинного обучения в IMU классифицирует активность прямо в датчике и подает прерывание. Хост-процессор и любые ускорители остаются в глубоком сне, пока не появится интересующий класс событий.

Уровень присутствия

Радар 60 ГГц, такой как Infineon’s BGT60LTR11AIP, или многозонный датчик time-of-flight выполняет обнаружение присутствия с помощью обработки на кристалле, пробуждая камеру или полноценный конвейер зрения только после подтверждения того, что человек действительно присутствует.

Экономия особенно заметна, если посмотреть, как такие продукты проводят большую часть времени: в простое. Для грубой оценки масштаба: система, которая держит хост бодрствующим для прослушивания, потребляет миллиамперы, тогда как многоуровневый входной тракт в простое укладывается в десятки микроампер и выходит на миллиамперы лишь на долю секунды, когда что-то происходит. Для батарейки-таблетки разница между always-on и многоуровневой архитектурой — это разница между днями и годами работы.

Размещайте интеллект на самом дешевом уровне

Если смотреть на датчики, память и питание, логика проектирования сводится к двум принципам, которые должны определять выбор компонентов:

  • Разрешайте каждое решение как можно ниже по стеку. Каждая классификация, которую IMU, микрофон или датчик присутствия способен выполнить самостоятельно, — это классификация, ради которой не придется будить хост.
  • Перемещение данных стоит дороже вычислений. Байты, передаваемые по шине или отправляемые в облако, сжигают больше энергии, чем сами вычисления, поэтому предпочтительнее компоненты, которые выдают результаты, а не сырые отсчеты. 

Каждая функция, перенесенная в датчик, — это функция, которую больше не должны нести хост-процессор, память и интерфейс. Обратная сторона — гибкость. Переносите интеллект в датчик, когда задача стабильна и хорошо понятна. Оставляйте его на хосте, когда модель будет часто меняться или потребует дообучения в полевых условиях, где перепрошивка firmware предпочтительнее, чем переработка фиксированного вычислительного блока. 

Рекомендации о том, на каком уровне стека должно находиться каждое звено интеллекта, см. в The Edge-Sensing BOM: What to Spec, from IMUs to Interfaces, где BOM разбирается построчно: IMU, time-of-flight, радары, микрофоны, сенсорные хабы, память и интерфейсы.

Об авторе

Об авторе

Adam Fleischer is a principal at etimes.com, a technology marketing consultancy that works with technology leaders – like Microsoft, SAP, IBM, and Arrow Electronics – as well as with small high-growth companies. Adam has been a tech geek since programming a lunar landing game on a DEC mainframe as a kid. Adam founded and for a decade acted as CEO of E.ON Interactive, a boutique award-winning creative interactive design agency in Silicon Valley. He holds an MBA from Stanford’s Graduate School of Business and a B.A. from Columbia University. Adam also has a background in performance magic and is currently on the executive team organizing an international conference on how performance magic inspires creativity in technology and science. 

Related Technical Documentation

Связанные ресурсы

Вернуться на главную
Thank you, you are now subscribed to updates.