AI Models mit Raspberry Pi CNN-, VLM- und SLM-Workloads auf dem Raspberry Pi 5

Von Ashley Whittaker* 5 min Lesedauer

Anbieter zum Thema

Die meisten Edge-AI/ML-Workloads werden auf der CPU ausgeführt, doch einige kann die CPU nicht bewältigen und ergänzende Beschleunigerlösungen sind gefordert. Sixfab bietet einen AI HAT+ für Raspberry Pi 5 an. Der Beitrag informiert über Bildverarbeitungs- und Sprach-KI-Anwendungen auf dem Pi 5 und was eine 3-Watt-NPU am Edge ermöglichen kann.

Raspberry Pi 5 mit Sixfabs AI HAT+ huckepack: Die DX-M1M-NPU von Deepx dient als KI-Beschleuniger, während die Raspberry-Pi-CPU Steuerungs- und Konnektivitätsaufgaben übernimmt.(Bild:  Sixfab/Raspberry Pi)
Raspberry Pi 5 mit Sixfabs AI HAT+ huckepack: Die DX-M1M-NPU von Deepx dient als KI-Beschleuniger, während die Raspberry-Pi-CPU Steuerungs- und Konnektivitätsaufgaben übernimmt.
(Bild: Sixfab/Raspberry Pi)

Das AI HAT+ von Sixfab für den Raspberry Pi 5 ist eine KI-Beschleunigerplatine, die auf der DX-M1M-NPU von Deepx basiert. Sie bietet 25 TOPS dedizierte KI-Beschleunigung bei einer typischen Dauerleistung der NPU von circa 3 W, während die CPU des Raspberry Pi für die Kamerasteuerung, Anwendungslogik, Konnektivität und Gerätesteuerung frei bleibt.

Warum drei Watt und nicht der TOPS-Wert entscheidend ist

Spitzenwerte bei TOPS eignen sich gut für das Marketing, doch für die meisten Edge-Produkte sind Leistungs- und Wärmehaushalt entscheidend. Das eigentliche System benötigt weiterhin Spielraum für den Raspberry Pi selbst, eine Kamera, Speicher, Netzwerkfunktionen und alles, was das Gerät tatsächlich steuert. Ein Beschleuniger, der unter Dauerlast bei etwa 3 W bleibt, ermöglicht kleinere Gehäuse, einfachere (oft passive) Kühlung und eine KI, die kontinuierlich statt nur in kurzen Intervallen laufen kann.

Bildergalerie

Genau diese Effizienz macht lokale KI dort praktisch, wo es am wichtigsten ist: bei intelligenten Kameras, Robotern, Industrieanlagen und verteilten Sensoren, wo Cloud-Latenz, Konnektivität oder Datenschutz andernfalls zu einem limitierenden Faktor würden.

Technischer Hinweis: Der Wert von ~3 W bezieht sich auf die typische Dauerleistungsaufnahme der NPU bei der 25-TOPS-DX-M1M-Option, nicht auf die gesamte Leistungsaufnahme des Systems. Anwender sollten die endgültige Raspberry-Pi-Konfiguration stets unter Berücksichtigung der tatsächlich verwendeten Kamera, des Speichers, der Arbeitslast und der Kühlung messen.

Eine NPU für drei Intelligenzklassen

Bild 2: Eine NPU für drei Intelligenzklassen.(Bild:  Raspberry Pi)
Bild 2: Eine NPU für drei Intelligenzklassen.
(Bild: Raspberry Pi)

Die meisten Edge-Produkte beginnen mit der Wahrnehmung: Ein CNN erkennt ein Objekt, segmentiert einen Arbeitsbereich, schätzt eine Pose ein oder meldet ein ungewöhnliches Ereignis. Die nächste Generation von Edge-Systemen muss zudem den Kontext verstehen und kommunizieren können, was sie sieht. Der DX-M1M wurde entwickelt, um diesen gesamten Prozess auf einem einzigen Chip und mit einer einzigen Toolchain zu unterstützen.

CNN: effiziente visuelle Wahrnehmung

Objekterkennung, Klassifizierung, Segmentierung, Posenabschätzung, Tiefenbestimmung und Bildverbesserung verwandeln Kamerapixel in strukturierte Ereignisse. Der Deepx ModelZoo enthält voroptimierte Beispiele – darunter Detektoren der Yolo-Familie sowie Segmentierungs- und Posenmodelle –, und DX-Stream hilft Anwendern dabei, diese zu GStreamer-basierenden Kamerapipelines zusammenzustellen.

Kompaktes VLM: Verbindung von Bild und Bedeutung

Ein kompaktes Bild-Sprach-Modell ergänzt visuelle Ergebnisse um kontextuelles Verständnis: Es beschreibt eine Szene, beantwortet eine gezielte Frage zu einem Bild oder interpretiert ein Ereignis in natürlicher Sprache – lokal, ohne dass Daten das Gerät verlassen.

SLM: Kommunikation mit dem Edge-System

Ein kleines Sprachmodell kann einen Benutzerbefehl interpretieren, lokale Ereignisse zusammenfassen oder eine prägnante Erklärung generieren und schafft so eine natürliche Schnittstelle für Kameras, Roboter und Maschinen, ohne dass jede Interaktion über die Cloud geleitet werden muss.

Das DX-M1M-Modul bietet 2-GB-Speicher

Die erste Frage, die sich jeder Entwickler zu Sprachmodellen am Edge stellt, ist, wie viel Speicher verfügbar ist und wie groß ein Modell sein darf. Das DX-M1M-Modul verfügt über 2 GB dedizierten LPDDR4x-Speicher auf dem Modul, der neben Bildverarbeitungsmodellen auch VLM- und SLM-Workloads problemlos unterstützt.

Genauigkeit ist wichtiger als ein Spitzenwert im Benchmark

Die Leistung von Edge-KI ist nur dann von Nutzen, wenn das Modell bei den Bildern und Bedingungen, mit denen Ihre Anwendung tatsächlich konfrontiert ist, genau bleibt. Deepx betrachtet die INT8-Optimierung als einen auf Genauigkeit ausgerichteten Entwicklungsprozess und nicht als einfachen Konvertierungsschritt:

  • Beginnen Sie mit einer bekannten FP32-Genauigkeitsbasis und einer klar definierten Anwendungsmetrik.
  • Führen Sie die Kalibrierung mit repräsentativen Daten aus der tatsächlichen Einsatzumgebung durch – nicht nur mit bereinigten Beispielbildern.
  • Kompilieren und optimieren Sie das Modell mit DX-COM zu einem portablen .dxnn-Bereitstellungsartefakt.
  • Vergleichen Sie Genauigkeit, Latenz, Stromverbrauch und thermisches Verhalten auf dem endgültigen Raspberry-Pi-System.

Bild 3: Genauigkeitsorientierte INT8-Bereitstellung. Optimieren Sie für den Edge-Einsatz und und überprüfen Sie anschließend das Ergebnis anhand repräsentativer Anwendungsdaten.(Bild:  Raspberry Pi)
Bild 3: Genauigkeitsorientierte INT8-Bereitstellung. Optimieren Sie für den Edge-Einsatz und und überprüfen Sie anschließend das Ergebnis anhand repräsentativer Anwendungsdaten.
(Bild: Raspberry Pi)

Dies ist vor allem unter den schwierigen Bedingungen von Bedeutung, denen Edge-Kameras in der Praxis ausgesetzt sind: schlechte Lichtverhältnisse, Blendeffekte, Bewegungsunschärfe, Verdeckungen und ungewöhnliche Blickwinkel. Ein überzeugendes Ergebnis zeigt sowohl den Effizienzgewinn als auch die erhaltene Anwendungsgenauigkeit.

Jetzt Newsletter abonnieren

Verpassen Sie nicht unsere besten Inhalte

Mit Klick auf „Newsletter abonnieren“ erkläre ich mich mit der Verarbeitung und Nutzung meiner Daten gemäß Einwilligungserklärung (bitte aufklappen für Details) einverstanden und akzeptiere die Nutzungsbedingungen. Weitere Informationen finde ich in unserer Datenschutzerklärung. Die Einwilligungserklärung bezieht sich u. a. auf die Zusendung von redaktionellen Newslettern per E-Mail und auf den Datenabgleich zu Marketingzwecken mit ausgewählten Werbepartnern (z. B. LinkedIn, Google, Meta).

Aufklappen für Details zu Ihrer Einwilligung

Wie schnell ist es wirklich?

Zahlen sagen mehr als Adjektive. Die Werte in Tabelle 1 wurden auf einem Raspberry Pi 5 (8 GB) gemessen, auf dem die serienmäßige Sixfab-Softwareversion lief, wobei die NPUs DX-M1M und DX-M1 verglichen wurden.

Tabelle 1: Zahlen sagen mehr als Adjektive. (Bild:  Raspberry Pi)
Tabelle 1: Zahlen sagen mehr als Adjektive.
(Bild: Raspberry Pi)

* Der DX-M1 nutzt LPDDR5-Speicher, während der DX-M1M mit LPDDR4X arbeitet, was aufgrund der unterschiedlichen Speicherbandbreiten zu einem Leistungsunterschied führt.

Vom ersten Start bis zur ersten Inferenz

Der schnellste Weg, sich mit der Plattform vertraut zu machen, besteht darin, die Hardware zu überprüfen, ein vorgefertigtes Modell auszuführen und die Arbeit der NPU zu beobachten. Unter Raspberry Pi OS:

sudo apt update && sudo apt install apt-repo-sixfab

sudo apt update && sudo apt install sixfab-dx

dxrt-cli -s # confirm device and software status

run_hello_world # run a packaged example

dxtop # observe the NPU in real time

Wählen Sie anschließend eine optimierte ModelZoo-Workload aus oder stellen Sie Ihr eigenes, unterstütztes ONNX-Modell über DX-COM bereit. Die daraus resultierende .dxnn-Datei wird über die C++- oder Python-APIs von DX-RT ausgeführt, während Ihre Raspberry-Pi-Anwendung weiterhin die Kameras, die Geschäftslogik, die Benutzeroberflächen, die Netzwerkfunktionen und die Steuerung übernimmt.

Tabelle 2: Der Software-Stack auf einen Blick. (Bild:  Raspberry Pi)
Tabelle 2: Der Software-Stack auf einen Blick.
(Bild: Raspberry Pi)

Was sich damit bauen lässt

Fangen Sie zu Hause an. Eine Kamera auf Ihrer Werkbank, die erkennt, wenn Ihr 3D-Druck fehlgeschlagen ist, und Ihnen einen Schnappschuss mit einer einzeiligen Beschreibung sendet. Eine Kamera an der Haustür, die zwischen einem Zusteller, der Katze des Nachbarn und jemandem, der herumlungert, unterscheidet – und jeden Abend die Ereignisse des Tages zusammenfasst, ganz lokal. Ein Garten- oder Haustiermonitor, der Sie nur auf Dinge aufmerksam macht, die es wert sind, gesehen zu werden.

All dies folgt dem gleichen Ablauf: Ein CNN erkennt das Ereignis, ein kompaktes VLM fügt Kontext hinzu, ein SLM erklärt es oder interpretiert Ihren nächsten Befehl, und Ihre Raspberry-Pi-Anwendung entscheidet und handelt.

Derselbe Regelkreis lässt sich auch auf anspruchsvolle Einsatzszenarien skalieren: kontinuierliche lokale Erkennung in intelligenten Kameras mit geringerer Abhängigkeit von der Cloud; energieeffiziente Überwachung der Bildqualität und Sicherheit neben einer Produktionslinie; Wahrnehmung und kompakte multimodale Intelligenz bei Robotern, während der Raspberry Pi ROS 2 und die Steuerungslogik ausführt; sowie datenschutzkonforme Belegungs- und Verhaltensanalysen im Einzelhandel und in intelligenten Räumen.

Wofür es nicht gedacht ist

Wie jeder Edge-Accelerator versucht auch der AI HAT+ nicht, mit der Cloud-Inferenz zu konkurrieren. Anwendungen, die umfassendes Allgemeinwissen, sehr lange Konversationskontexte oder kontinuierliches Lernen erfordern, laufen immer besser dort, wo Rechenleistung und Speicher praktisch unbegrenzt zur Verfügung stehen.

Der DX-M1M spielt seine Stärken am besten bei eng begrenzten, ständig aktiven Intelligenzfunktionen neben einer Kamera oder einem Sensor aus – dort, wo Datenschutz, Latenz, Offline-Betrieb und ein Leistungsbedarf im einstelligen Wattbereich die Anforderungen sind, die das Design tatsächlich bestimmen. Genau diese ehrliche Einsicht in diese Grenzen macht die Plattform innerhalb dieses Rahmens so vertrauenswürdig.

Community und Datenblätter

Alles, was Interessenten brauchen, um tiefer in die Materie einzusteigen, ist öffentlich zugänglich: DX-AllSuite und ModelZoo sind auf GitHub verfügbar. Weitere Unterstützung bietet das DEEPX Developer Portal , Sixfab AI HAT+ for Raspberry Pi 5 (product page), Sixfab AI HAT+ Quickstart und das DEEPX DX-M1 product page. (mk)

*Ashley Whittaker ist Head of Social und Content-Autorin bei Raspberry Pi

(ID:50980475)