本文へスキップ

AIモデルのデプロイ
と最適化

AIモデルのデプロイと最適化

NVIDIA・Qualcomm・TIをはじめとする主要な車載SoCへ、AIモデルを最適化してデプロイします。SoCのアーキテクチャを深く理解し、GPU/DLA/DSP/VIC等のハードウェアIPへ適切にタスクを割り当てることで、ハードウェアの性能を限界まで引き出します。数百TOPSの上位SoCから数TOPSのエッジSoCまで、実用的な認識システムを実現します。

主な活用技術

  • 各種プロファイリングツールによるボトルネック特定と解消
  • AIモデルと前後処理の特性を踏まえた、H/W IPへのタスク割り当てとパイプライン設計の最適化
  • NVIDIA(DRIVE AGX Xavier/Orin/Thor、Jetson等):ONNX→TensorRT変換、CUDA実装による最適化
  • Qualcomm(QRB5165、QCS6490等):ONNX→SNPE変換、GPU/DSP分散実行
  • TI(TDA4VM、TDA4VEN、AM62A等):ONNX→TIDL変換、DSP活用による最適化

特徴FEATURES

主要車載3ベンダーSoCへのデプロイ実績

NVIDIA・Qualcomm・TIという主要な車載SoCベンダーそれぞれの環境で、AIモデルのデプロイ実績を有します。ONNXを起点にTensorRT・SNPE・TIDLといった各ベンダー固有の変換・最適化技術を使い分け、評価ボードの立ち上げからBSWインストール、システムレベルでの評価・最適化、ベンチマーキングまでを一貫して対応します。

ハードウェアIPを活かした処理最適化

AIモデルとその前後処理を、その特性を考慮してGPU/DLA/DSP/VIC等の複数のハードウェアIPへ適切にオフロードします。パイプラインの全体最適を図ることでリアルタイム性の高いシステムを実現します。オープンソースや各種ベンダーが提供する解析ツールを駆使してCPUコア負荷・割り込み・メモリ転送のボトルネックを特定・解消し、SoCが本来持つ性能を最大限に引き出します。

リソース制約のある環境での実用化

自動運転用SoCの数百分の1にあたる2TOPSクラスのSoCでも、実用的な認識システムを構築します。TI AM62A74(2TOPS)上で物体認識・走路認識・標識/信号認識・測距等の複数タスクを15FPSで動作させた実績を持ち、推論コストから逆算した設計と蒸留により、厳しいコスト制約下での製品化を可能にします。