Inferencja na urządzeniu zmienia architekturę stosu czujników

Adam J. Fleischer
|  Utworzono: sierpień 12, 2026
At a Glance
Ten artykuł omawia, jak inferencja na urządzeniu zmienia sposób działania czujników, podkreślając przejście od tradycyjnego strumieniowania danych do lokalnego przetwarzania w celu zwiększenia efektywności i poprawy wydajności. Dzięki postępom, takim jak wielopoziomowe systemy wybudzania oraz udoskonalone techniki kwantyzacji, czujniki są dziś oceniane na podstawie jakości danych, które dostarczają do lokalnych modeli, a nie wyłącznie czystości ich sygnałów.
Go Deeper with AI:
Inferencja na urządzeniu na nowo kształtuje stos czujników

Najważniejsze wnioski

  • W przypadku inferencji na urządzeniu sensor ocenia się dziś bardziej po tym, co przekazuje pobliskiemu modelowi, niż po tym, jak czysto strumieniuje dane. 
  • Przepustowość pamięci, a nie szczytowe TOPS, ogranicza większość projektów edge, a kwantyzacja 8-bitowa jest kluczowym narzędziem pozwalającym zmieścić model w pamięci układu.
  • W konstrukcjach always-on oszczędność energii osiąga się dzięki wielopoziomowemu wybudzaniu: każdą decyzję należy przesunąć do najtańszego etapu, który potrafi ją podjąć, ponieważ przesyłanie danych kosztuje więcej niż same obliczenia.

Inferencja przenosi się na urządzenie

Edge AI przechodzi w 2026 roku z etapu pilotaży do produktów głównego nurtu. Spośród około 21 miliardów podłączonych urządzeń IoT będących w użyciu większość nadal wysyła swoje dane poza urządzenie do przetwarzania. Jednak krzem projektowany specjalnie do tych zastosowań przenosi tę pracę na pokład: pierwsze mikrokontrolery STM32 z dedykowaną jednostką przetwarzania neuronowego (NPU) weszły do produkcji masowej pod koniec 2024 roku, a moduły edge AI z niższego segmentu cenowego spadły do poziomu, przy którym lokalna inferencja staje się ekonomicznie uzasadnionym wyborem domyślnym.

Sensory zasilają teraz model

Gdy inferencja działa lokalnie, sensor ocenia się w mniejszym stopniu pod kątem tego, jak czysto digitalizuje sygnał, a bardziej pod kątem tego, jak użyteczny jest jego sygnał wyjściowy dla modelu działającego obok. Pociąga to za sobą trzy konsekwencje:

Rozwój ten wspiera również ochronę prywatności. Czujniki time-of-flight i radar raportują odległość oraz ruch, a nie obrazy, a wizja realizowana w sensorze zatrzymuje surowe piksele w obrębie układu, dzięki czemu czujnik obecności może wykonać swoje zadanie bez konieczności opuszczania elementu przez strumień z kamery.

To przepustowość, a nie TOPS, wyznacza górny pułap

Wyróżnianym w nagłówkach parametrem komponentu edge AI jest zwykle jego wartość TOPS (biliony operacji na sekundę), i to niewłaściwa wielkość do wymiarowania projektu. Dwa akceleratory o tej samej wartości TOPS mogą osiągać bardzo różną rzeczywistą przepustowość, ponieważ wydajność zależy od przepustowości pamięci, operatorów obsługiwanych przez krzem oraz od tego, jak dobrze kompilator dostawcy mapuje na niego Twoją sieć. 

W większości projektów edge ograniczeniem jest przenoszenie tensorów, więc procesor zatrzymuje się, czekając na pamięć, na długo przed tym, zanim zabraknie mu mocy obliczeniowej. Energia na jedną inferencję, a nie szczytowe TOPS, jest wartością, która najlepiej odzwierciedla to, co widzi bateria. Pomocne jest myślenie o dwóch reżimach, rozdzielonych miejscem przechowywania modelu: wewnętrzna pamięć SRAM układu albo zewnętrzna pamięć DRAM.

Reżim mikrokontrolera

W mikrokontrolerze ograniczeniem jest wewnętrzna pamięć SRAM: często zaledwie 256 KB do 512 KB. Ten budżet musi pomieścić aktywacje modelu i bufory robocze (tensory środowiska wykonawczego), więc model musi być mały i skwantyzowany, aby się zmieścić, a jego wagi są przechowywane we flashu. Kwantyzacja jest tutaj kluczowa: konwersja wag z 32-bitowego formatu zmiennoprzecinkowego do 8-bitowych liczb całkowitych zmniejsza model mniej więcej trzykrotnie do czterokrotnie przy niewielkiej utracie dokładności, na tyle, że skwantyzowana sieć klasy MobileNet mieści się w około 1 MB pamięci flash, podczas gdy wersja zmiennoprzecinkowa już nie.

Reżim edge SoC

W większym edge SoC uruchamiającym potoki przetwarzania wizyjnego lub mały model językowy ograniczenie przenosi się do zewnętrznej pamięci LPDDR, gdzie pojemność ma mniejsze znaczenie niż szybkość strumieniowania wag i aktywacji. Pamięć to również kwestia sourcingu. Przesunięcie w 2026 roku mocy produkcyjnych DRAM w stronę centrów danych AI podniosło ceny LPDDR i zaostrzyło problemy z dostępnością. Dostawcy toczą tę samą walkę po stronie przepustowości: w maju Synaptics określił przepustowość pamięci jako podstawowe wąskie gardło dla inferencji modeli językowych na urządzeniu i wskazał agresywną kompresję wag jako sposób na odzyskanie przepustowości.

Duży układ wybudzaj na końcu

Utrzymanie trybu always-on bez drenowania baterii sprowadza się do ułożenia detektorów według kosztu: drogie etapy pozostają wyłączone, dopóki tańszy nie uzyska prawa do ich wybudzenia. To, co działa nieprzerwanie, wyznacza pobór prądu w stanie bezczynności całego systemu, więc zadanie polega na tym, by ten najniższy poziom był możliwie najtańszy i sterował wszystkim, co znajduje się wyżej.

Warstwa mikrofonu

Inteligentny mikrofon MEMS uruchamia małą sieć neuronową do detekcji aktywności głosowej przy poborze rzędu dziesiątek mikroamperów, następnie przechodzi do głębszego modelu do rozpoznawania słów kluczowych tylko wtedy, gdy wykryje mowę, a host wybudza dopiero potem.

Warstwa ruchu

Rdzeń uczenia maszynowego IMU klasyfikuje aktywność bezpośrednio w sensorze i generuje przerwanie. Procesor hosta oraz wszelkie akceleratory pozostają w głębokim uśpieniu do chwili pojawienia się klasy zdarzeń będącej przedmiotem zainteresowania.

Warstwa obecności

Radar 60 GHz, taki jak Infineon’s BGT60LTR11AIP, lub wielostrefowy sensor time-of-flight realizuje detekcję obecności z użyciem przetwarzania na chipie, wybudzając kamerę lub pełny potok wizyjny dopiero po potwierdzeniu, że człowiek rzeczywiście się tam znajduje.

Oszczędności widać w tym, jak te produkty spędzają większość czasu: w bezczynności. Dla przybliżonego zobrazowania skali system, który utrzymuje host w stanie czuwania, aby nasłuchiwał, pobiera prąd rzędu miliamperów, podczas gdy wielopoziomowy front-end w stanie bezczynności pobiera dziesiątki mikroamperów, a do miliamperów dochodzi tylko przez ułamek sekundy, gdy coś się dzieje. W przypadku baterii pastylkowej różnica między always-on a architekturą wielopoziomową to różnica między czasem pracy liczonym w dniach a latami.

Umieść inteligencję na najtańszym etapie

W obszarach sensoryki, pamięci i zasilania logika projektowa sprowadza się do dwóch zasad, które powinny kierować doborem komponentów:

  • Rozstrzygaj każdą decyzję jak najniżej w stosie. Każda klasyfikacja, którą IMU, mikrofon lub czujnik obecności może wykonać samodzielnie, to jedna mniej sytuacja, w której trzeba wybudzać host.
  • Przenoszenie danych kosztuje więcej niż obliczenia. Bajty przesyłane magistralą lub do chmury zużywają więcej energii niż samo przetwarzanie, dlatego warto preferować komponenty, które raportują wyniki, a nie surowe próbki. 

Każda funkcja przeniesiona do sensora to funkcja, której procesor hosta, pamięć i interfejs nie muszą już obsługiwać. Ceną jest elastyczność. Inteligencję warto przenosić do sensora wtedy, gdy zadanie jest stabilne i dobrze zrozumiane. Należy pozostawić ją po stronie hosta, gdy model będzie się często zmieniał lub wymagał ponownego trenowania w terenie, gdzie przeprogramowanie firmware’u jest lepszym rozwiązaniem niż przeprojektowywanie stałego silnika. 

Wskazówki dotyczące tego, gdzie w stosie powinien znaleźć się każdy element inteligencji, znajdziesz w The Edge-Sensing BOM: What to Spec, from IMUs to Interfaces, gdzie BOM jest omawiany pozycja po pozycji: IMU, time-of-flight, radar, mikrofony, huby sensorów, pamięć i interfejsy.

About Author

About Author

Adam Fleischer is a principal at etimes.com, a technology marketing consultancy that works with technology leaders – like Microsoft, SAP, IBM, and Arrow Electronics – as well as with small high-growth companies. Adam has been a tech geek since programming a lunar landing game on a DEC mainframe as a kid. Adam founded and for a decade acted as CEO of E.ON Interactive, a boutique award-winning creative interactive design agency in Silicon Valley. He holds an MBA from Stanford’s Graduate School of Business and a B.A. from Columbia University. Adam also has a background in performance magic and is currently on the executive team organizing an international conference on how performance magic inspires creativity in technology and science. 

Powiązane zasoby

Related Technical Documentation

Powrót do strony głównej
Thank you, you are now subscribed to updates.