Edge AIは、2026年に実証段階から主流製品へと移行しつつあります。現在稼働しているおよそ210億台の接続IoTデバイスの大半は、依然としてデータをデバイス外に送って処理しています。しかし、専用シリコンによってその処理はオンボード化されつつあります。専用のニューラル処理ユニット(NPU)を搭載した最初のSTM32マイクロコントローラーは2024年末に量産に入り、低価格帯のエッジAIモジュールも、ローカル推論を経済的な標準選択肢にできる価格帯まで下がってきました。
推論がローカルで実行されるようになると、センサーは「どれだけ正確に信号をデジタル化できるか」よりも、「隣接するモデルにとって出力がどれだけ有用か」で評価されるようになります。これには3つの帰結があります。
こうした進展は、プライバシー保護にも役立ちます。Time-of-Flightやレーダーは画像ではなく距離と動きを報告し、センサー内ビジョンでは生のピクセルデータをダイ上に保持するため、プレゼンスセンサーはカメラ映像を部品外へ出すことなく役割を果たせます。
エッジAIデバイスで見出しになりやすい指標は通常TOPS(1秒あたり1兆回演算)ですが、設計規模を決めるうえでは適切な指標ではありません。同じTOPS定格の2つのアクセラレーターでも、実際のスループットは大きく異なることがあります。性能はメモリ帯域幅、シリコンがサポートする演算子、そしてベンダーのコンパイラがネットワークをどれだけうまくマッピングできるかに左右されるからです。
多くのエッジ設計では、制約となるのはテンソルの移動であり、プロセッサは演算能力を使い切るより前に、メモリ待ちで停止してしまいます。バッテリーにとって意味を持つ指標はピークTOPSではなく、1回の推論あたりのエネルギーです。考え方としては、モデルがどこに置かれるか、つまりオンチップSRAMか外部DRAMかで、2つの領域に分けるとわかりやすくなります。
マイクロコントローラーでは、上限を決めるのはオンチップSRAMで、容量は256 KB~512 KB程度しかないことが一般的です。この予算の中に、モデルの活性値と作業用バッファ(ランタイムテンソル)を収める必要があるため、モデルは収まるように小型化・量子化され、重みはフラッシュに保持されます。ここで鍵となるのが量子化です。重みを32ビット浮動小数点から8ビット整数へ変換すると、精度低下をほとんど伴わずにモデルサイズをおよそ3~4分の1に縮小できるため、浮動小数点版では収まらないMobileNetクラスのネットワークでも、量子化版なら約1 MBのフラッシュに収められます。
ビジョンパイプラインや小規模言語モデルを実行する、より大きなエッジSoCでは、制約は外部LPDDRへ移ります。ここでは容量そのものよりも、重みや活性値をどれだけ高速にストリーミングできるかが重要です。メモリは調達の問題でもあります。2026年にAIデータセンター向けへDRAM容量が再配分されたことにより、LPDDR価格は上昇し、供給も逼迫しています。ベンダー各社は帯域幅の面でも同じ課題に直面しています。5月には、Synapticsが、デバイス上での言語モデル推論における主要なボトルネックはメモリ帯域幅であると述べ、スループットを取り戻す手段として積極的な重み圧縮を挙げました。
バッテリーを消耗させずに常時稼働を維持するには、検出器をコスト順に積み重ねることが重要です。高コストな段は、より低コストな段が起動の必要性を認めるまで休止したままにします。連続動作するものがシステムのアイドル時消費電流を決めるため、最下段をできるだけ低コストにし、それより上のすべてをそこでゲートすることが設計の要になります。
スマートMEMSマイクロフォンは、音声活動検出のためにごく小さなニューラルネットワークを数十マイクロアンペアで実行し、音声を検出した場合にのみ、より深いモデルへ処理を引き上げてキーワードスポッティングを行い、その後にホストを起動します。
IMUの機械学習コアは、センサー上で活動を分類して割り込みを発生させます。ホストプロセッサやアクセラレーターは、関心のあるクラスの動きが現れるまでディープスリープのままです。
InfineonのBGT60LTR11AIPのような60 GHzレーダー、またはマルチゾーンTime-of-Flightセンサーは、オンチップ処理でプレゼンス検出を行い、人の存在を確認した時点で初めてカメラや本格的なビジョンパイプラインを起動します。
この省電力効果は、こうした製品の大半の時間がアイドル状態であることに表れます。おおまかな規模感として、ホストを起こしたまま待機して音を聞かせるシステムはミリアンペア単位で電流を消費しますが、多段フロントエンドではアイドル時は数十マイクロアンペアに抑えられ、何かが起きたときだけごく短時間ミリアンペア単位になります。コイン電池では、常時オン方式と多段方式の差は、寿命が数日か数年かを分けるほど大きくなります。
センシング、メモリ、電力にまたがって、設計の論理は最終的に、部品選定を導く2つの原則に集約されます。
センサーに押し込める機能が1つ増えるごとに、ホストプロセッサ、メモリ、インターフェースが担う負荷は1つ減ります。トレードオフは柔軟性です。タスクが安定しており十分に理解されている場合は、知能をセンサーに持たせるべきです。一方、モデルが頻繁に変わる、あるいは現場で再学習が必要な場合はホスト側に残すべきです。その場合、固定機能エンジンを再設計するより、ファームウェアの再書き込みのほうが適しています。
スタックのどこに各種の知能を配置すべきかについての指針は、The Edge-Sensing BOM: What to Spec, from IMUs to Interfacesを参照してください。ここでは、IMU、Time-of-Flight、レーダー、マイクロフォン、センサーハブ、メモリ、インターフェースといったBOM項目を1行ずつ検討しています。