Edge AI в 2026 году переходит из пилотных проектов в массовые продукты. Из примерно 21 миллиарда подключенных IoT-устройств, находящихся в эксплуатации, большинство по-прежнему отправляет свои данные с устройства для обработки. Но специализированный кремний переносит эту работу на борт: первые микроконтроллеры STM32 с выделенным нейропроцессорным блоком (NPU) вышли в массовое производство в конце 2024 года, а модули edge AI начального ценового уровня подешевели до такой степени, что локальный инференс становится экономически оправданным вариантом по умолчанию.
Когда инференс выполняется локально, датчик оценивают уже не столько по тому, насколько чисто он оцифровывает сигнал, сколько по тому, насколько полезен его выход для модели, работающей рядом с ним. Это приводит к трем последствиям:
Эти разработки также помогают защищать приватность. Датчики time-of-flight и радары сообщают о расстоянии и движении, а не об изображениях, а внутрисенсорное зрение удерживает сырые пиксели на кристалле, поэтому датчик присутствия может выполнять свою задачу без того, чтобы видеопоток вообще покидал компонент.
Основной показатель, который обычно указывают для компонента edge AI, — это TOPS (триллионы операций в секунду), и именно на него не стоит опираться при выборе масштаба проекта. Два ускорителя с одинаковым рейтингом TOPS могут показывать очень разную реальную пропускную способность, потому что производительность зависит от пропускной способности памяти, поддерживаемых кремнием операторов и от того, насколько хорошо компилятор поставщика отображает вашу сеть на эту архитектуру.
В большинстве edge-проектов ограничивающим фактором становится перемещение тензоров, поэтому процессор простаивает в ожидании памяти задолго до того, как ему перестает хватать вычислительной мощности. Для батареи важнее энергия на один инференс, а не пиковые TOPS. Удобно рассматривать две области, разделенные по тому, где живет модель: во встроенной SRAM или во внешней DRAM.
В микроконтроллере предел задает встроенная SRAM: зачастую это всего 256–512 КБ. В этот бюджет должны поместиться активации модели и рабочие буферы (тензоры времени выполнения), поэтому модель должна быть небольшой и квантизованной, а ее веса — храниться во flash-памяти. Квантизация здесь — главный рычаг: перевод весов из 32-битного формата с плавающей точкой в 8-битные целые числа уменьшает модель примерно в три-четыре раза при незначительной потере точности, так что квантизованная сеть класса MobileNet занимает около 1 МБ flash, тогда как версия с float-представлением туда бы не поместилась.
В более крупной edge SoC, выполняющей конвейеры компьютерного зрения или небольшую языковую модель, ограничение смещается к внешней LPDDR, где важна не столько емкость, сколько скорость потоковой передачи весов и активаций. Память — это еще и вопрос поставок. Перераспределение DRAM-мощностей в 2026 году в пользу AI ЦОДов повысило цены на LPDDR и ужесточило предложение. Поставщики ведут ту же борьбу и на стороне пропускной способности: в мае Synaptics назвала пропускную способность памяти главным узким местом для инференса языковых моделей на устройстве и указала на агрессивное сжатие весов как на способ вернуть пропускную способность.
Чтобы система могла постоянно оставаться включенной и не разряжать батарею, нужно выстроить детекторы по стоимости: дорогие этапы остаются выключенными, пока более дешевый не даст им право проснуться. То, что работает непрерывно, и определяет ток покоя системы, поэтому задача — сделать нижний уровень как можно дешевле и позволить ему управлять всем, что выше.
Интеллектуальный MEMS-микрофон запускает крошечную нейросеть для обнаружения речевой активности при токах в десятки микроампер, затем повышает уровень до более глубокой модели для распознавания ключевых слов только тогда, когда слышит речь, и лишь после этого будит хост.
Ядро машинного обучения в IMU классифицирует активность прямо в датчике и подает прерывание. Хост-процессор и любые ускорители остаются в глубоком сне, пока не появится интересующий класс событий.
Радар 60 ГГц, такой как Infineon’s BGT60LTR11AIP, или многозонный датчик time-of-flight выполняет обнаружение присутствия с помощью обработки на кристалле, пробуждая камеру или полноценный конвейер зрения только после подтверждения того, что человек действительно присутствует.
Экономия особенно заметна, если посмотреть, как такие продукты проводят большую часть времени: в простое. Для грубой оценки масштаба: система, которая держит хост бодрствующим для прослушивания, потребляет миллиамперы, тогда как многоуровневый входной тракт в простое укладывается в десятки микроампер и выходит на миллиамперы лишь на долю секунды, когда что-то происходит. Для батарейки-таблетки разница между always-on и многоуровневой архитектурой — это разница между днями и годами работы.
Если смотреть на датчики, память и питание, логика проектирования сводится к двум принципам, которые должны определять выбор компонентов:
Каждая функция, перенесенная в датчик, — это функция, которую больше не должны нести хост-процессор, память и интерфейс. Обратная сторона — гибкость. Переносите интеллект в датчик, когда задача стабильна и хорошо понятна. Оставляйте его на хосте, когда модель будет часто меняться или потребует дообучения в полевых условиях, где перепрошивка firmware предпочтительнее, чем переработка фиксированного вычислительного блока.
Рекомендации о том, на каком уровне стека должно находиться каждое звено интеллекта, см. в The Edge-Sensing BOM: What to Spec, from IMUs to Interfaces, где BOM разбирается построчно: IMU, time-of-flight, радары, микрофоны, сенсорные хабы, память и интерфейсы.