Tüm Vaka Analizleri

Edge AI & Computer Vision

Saha Yükü Altında Ölçüldü

Edge AI Çıkarımını 31 fps'den 127 fps'ye Çıkarma

+310% çıkarım hızı · −41% güç · NVIDIA Jetson Orin NX 16GB

NVIDIA Jetson Orin NX 16GB · TensorRT 8.6 · JetPack 6

31 → 127 fpsÇıkarım Hızı
−41%Güç Tüketimi
8.4 WÇalışma Gücü
15.1 fps/WVerimlilik
PlatformJetson Orin NX 16GB · TensorRT 8.6 · JetPack 6
ProblemFP32 ONNX çıkarımı 31 fps — gerçek zamanlı tespit için yetersiz
MüdahaleINT8 kuantizasyon + CUDA graphs + DLA co-execution
Sonuç127 fps · 8.4 W · 15.1 fps/W verimlilik

01Problem

Problem: SWaP-C Kısıtlı Platformda 31 fps

Otonom bir insansız hava aracı sisteminde, standart FP32 ONNX runtime çıkarımı yalnızca 31 fps üretiyordu. Boyut, ağırlık, güç ve maliyet (SWaP-C) kısıtlı platformda gerçek zamanlı nesne tespiti ve takibi için bu hız yetersizdi; güç bütçesi de batarya ömrünü doğrudan sınırlıyordu.

  • 0131 fps, hızlı hareket eden nesnelerin takibinde kare atlamasına ve takip kaybına yol açıyordu
  • 02FP32 çıkarımı GPU'yu doygunluğa götürüyor, eş zamanlı görüntü ön işleme için kaynak bırakmıyordu
  • 03~14 W'lık güç tüketimi, hedef uçuş süresinin altında kalınmasına neden oluyordu
  • 04Model her açılışta ONNX'ten yeniden derleniyordu — başlatma süresi operasyonu geciktiriyordu
  • 05Pipeline'daki CPU-GPU kopyaları ve launch overhead'i ölçülmemişti

02Sistem Bağlamı

DonanımNVIDIA Jetson Orin NX 16GB (Ampere GPU + 2× DLA)
YazılımJetPack 6 · TensorRT 8.6 · CUDA 12
ModelYOLOv8-m (nesne tespiti)
ÖnceFP32 ONNX Runtime · 31 fps
SonraINT8 TensorRT engine · 127 fps
Ölçüm yöntemiUçtan uca pipeline fps + harici güç ölçümü, sürekli yük altında
Test koşuluGerçek görev senaryosu video akışı · termal denge sonrası

03Kök Neden Analizi

  1. 01Model FP32 hassasiyette koşuyordu — Orin NX'in INT8 Tensor Core ve DLA kapasitesi tamamen atıl durumdaydı
  2. 02ONNX Runtime genel amaçlı yürütme kullanıyordu; TensorRT'nin katman füzyonu ve kernel otomatik seçimi devre dışıydı
  3. 03Her kare için ayrı kernel launch zinciri CPU overhead'i üretiyordu — GPU bekleme döngüleri ölçümde görünür haldeydi
  4. 04Engine her açılışta yeniden derleniyordu; serialization kullanılmıyordu
  5. 05Tüm yük GPU üzerindeydi — DLA çekirdekleri hiç kullanılmıyor, güç verimliliği fırsatı kaçırılıyordu

04Ne Değiştirdik

01

YOLOv8-m modeline temsilî veri kümesiyle kalibre edilmiş INT8 kuantizasyonu uygulandı

Çıkarım hızı FP32'ye göre ~4 kat arttı; tespit doğruluğu görev gereksinimleri içinde doğrulandı

02

TensorRT engine serialization devreye alındı

Açılışta yeniden derleme ortadan kalktı — model yükleme süresi optimize edildi

03

CUDA graphs ile kare başına kernel launch zinciri tek grafa indirildi

CPU launch overhead'i minimize edildi; GPU besleme sürekliliği sağlandı

04

DLA co-execution: uygun katmanlar DLA'ya, kalanlar GPU'ya dağıtıldı

Güç tüketimi 8.4 W'a düştü (−41%) — batarya ömrü hedefi karşılandı

05

Ön işleme GPU'ya taşındı (CUDA ile resize/normalize), CPU-GPU kopyaları azaltıldı

Pipeline darboğazı kalktı — uçtan uca 127 fps sürdürülebilir hale geldi

05Benchmark Sonuçları

MetrikÖnceSonraΔ
Çıkarım hızı (uçtan uca)31 fps127 fps+310%
Güç tüketimi~14.2 W8.4 W−41%
Verimlilik (fps/W)2.215.1+586%
HassasiyetFP32INT8 (kalibre)görev doğruluğu korundu

06Bu Neden Önemliydi?

fps tek başına anlamsızdır; SWaP-C kısıtlı platformda anlamlı metrik fps/W'tır. 15.1 fps/W, aynı batarya ile hem daha uzun uçuş hem de daha fazla eş zamanlı algı görevi anlamına geliyordu.

  • 01Gerçek zamanlı çoklu nesne tespiti ve takibi tek cihazda mümkün hale geldi
  • 02−41% güç tüketimi batarya ömrünü ve görev süresini doğrudan uzattı
  • 03Açığa çıkan GPU kapasitesi, ek algı görevleri (sensör füzyonu) için kullanılabilir hale geldi
  • 04INT8 kalibrasyon ve doğrulama akışı yeniden kullanılabilir bir pipeline olarak teslim edildi — model güncellemeleri aynı yoldan geçiyor

Edge AI & Computer Vision ihtiyacınızı kendi platformunuzda değerlendirmek için gömülü sistem mimari denetimi planlayabilir ya da sistem gereksinim hesaplayıcısı ile platform sınıfınızı belirleyebilirsiniz.

Metodoloji Notu

  • fps değerleri izole model benchmark'ı değil, uçtan uca pipeline (görüntü alma → tespit → çıktı) üzerinden raporlandı
  • Güç ölçümleri harici ölçümle, termal denge sonrası sürekli yük altında alındı
  • INT8 doğruluk kaybı, görev temsilî doğrulama kümesiyle FP32 referansa karşı ölçüldü
  • Karşılaştırmalar özdeş donanım, özdeş giriş akışı ve özdeş güç modu ile yapıldı
  • Proje detayları NDA kapsamında gizli tutulmaktadır — müşteri ismi anonimleştirilmiştir

Edge AI pipeline'ınız hedef fps veya güç bütçesini karşılamıyor mu?

Ücretsiz teknik değerlendirme ile sisteminizdeki gecikme ve deterministik kontrol sorunlarını birlikte inceleyelim.

Tüm performans verileri kendi laboratuvar ortamımızda, tekrarlanabilir koşullarda elde edilmiştir. Proje spesifik detaylar NDA kapsamında gizlidir. Metodoloji dokümanı talep üzerine paylaşılır.