Stadt Kaohsiung

Smart Cities/Spaces

Linker Vision nutzt Vision-KI, um den städtischen Betrieb zu optimieren

Kaohsiung City Government

Ziel

Linker Vision bietet datenzentrierte Lösungen mit Computer Vision, die für die schnelle Bereitstellung und effiziente Skalierung von Vision-AI-Anwendungen optimiert sind, von der Cloud bis zum Edge. Kaohsiung, eine der größten Städte Taiwans, ist zu einem wichtigen Endkunden für Linker Vision geworden und hat fortschrittliche Smart-City-Lösungen mit NVIDIA Metropolis implementiert, um eine kritische städtische Herausforderung mit abteilungsbezogenen Silos zu meistern. Diese fragmentierten staatlichen Infrastrukturen erschweren den schnellen und effizienten Austausch wichtiger Informationen erheblich und behindern so koordinierte Reaktionen auf stadtweite Probleme. Linker Vision nutzt die Drei-Computer-Strategie von NVIDIA – simuliert digitale Zwillinge mit NVIDIA Omniverse™, optimiert KI-Modelle wie Cosmos 3 und setzt KI-Agenten mit NVIDIA Metropolis Blueprint für Videosuche und Zusammenfassung (VSS) ein –, um Städten zu helfen, das Situationsbewusstsein zu verbessern und proaktive, datengestützte Entscheidungen zu treffen. Dies trägt auch dazu bei, organisatorische Silos aufzubrechen und den Grundstein für eine wirkliche Smart City zu legen.

Kunde

Stadt Kaohsiung

Partner

Linker Vision

Anwendungsbeispiel

Computer Vision / Videoanalyse
Simulation / Modellierung / Design

  • Reduzierung des Entwicklungsaufwands um 85 % durch den Einsatz des VSS-Blueprint, um visuelle KI-Agenten zu entwickeln.
  • Verkürzung der Reaktionszeiten um bis zu 80 %, sodass Notfalldienste schneller an den Einsatzort gelangen können.
  • Ermöglicht die einfache Erstellung von Vorfallberichten mithilfe von VLMs mit detaillierten Informationen zur Bewertung des Risikos.

  • Entwickelte eine einheitliche Plattform mit VLMs und einem VSS-Blueprint, um Informationsbarrieren abzubauen und die Effektivität bei minimalen Kosten zu maximieren.

Verbesserung des städtischen Situationsbewusstseins mit Visuellen Sprachmodellen

Eine der wichtigsten Herausforderungen bei der Anwendung von visueller KI in Städten ist die hohe Variabilität und Unvorhersehbarkeit abnormaler Ereignisse. Herkömmliche Computer-Vision-Systeme sind darauf trainiert, Standardobjekte wie Autos, Gebäude oder Menschen zu erkennen. Sie haben jedoch oft Schwierigkeiten, die Gesamtsituation zu interpretieren oder kritische Ereignisse wie einen Verkehrsunfall, eine Überschwemmung oder einen umgestürzten Baum zu verstehen.

Um diese Einschränkung zu überwinden, nutzt Linker Vision VLMs und ordnet das Referenzbeispiel für NVIDIA VSS Blueprint für Smart City zu, um über die einfache Objekterkennung hinauszugehen, indem die Beziehungen zwischen visuellen Elementen interpretiert und beschreibende Erzählungen der Szene generiert werden. Durch die Aufforderung an NVIDIA Cosmos, das Geschehen zu beschreiben, ermöglicht Linker Vision dem System, intelligente Erklärungen für komplexe Szenarien zu liefern. So können Einsatzkräfte und Entscheidungsträger in Städten die Situation in Echtzeit besser verstehen. Dieser Ansatz verbessert das Situationsbewusstsein und die Wirksamkeit der Reaktion erheblich, insbesondere in dynamischen, unvorhersehbaren städtischen Umgebungen.

„Mit den Neuerungen der generativen KI und dem VLM möchten wir das immense Potenzial der visuellen KI für die Entwicklung intelligenter Städte aufzeigen. Durch die Integration von NVIDIA-Technologien werden unsere Lösungen immer effizienter und hochwertiger. Die Zusammenarbeit mit NVIDIA verdeutlicht, wie intelligente Technologien mit städtischen Visionen in Einklang gebracht können, um sinnvolle und wirksame Veränderungen zu bewirken.“

Willy Kuo
CTO und Mitbegründer von Linker Vision

Wie Videoanalysen eine intelligentere, besser vernetzte städtische Infrastruktur vorantreiben

Städte stehen vor einer großen Herausforderung: Abteilungsgrenzen. In der Vergangenheit arbeiteten verschiedene städtische Abteilungen wie das Wasserressourcenbüro und das Transportbüro mit isolierten Systemen, die von verschiedenen Systemintegratoren (SIs) und Anbietern entwickelt wurden. Hierdurch wird die rechtzeitige Koordinierung von Reaktionen auf Probleme erheblich erschwert. Stellen Sie sich beispielsweise eine Überschwemmung vor, die vom Amt für Wasserwirtschaft erkannt wurde. Während diese Daten für das Transportbüro von entscheidender Bedeutung sind, da Überschwemmungen den Verkehrsfluss und die öffentliche Sicherheit erheblich beeinträchtigen können, führte das Fehlen eines einheitlichen Systems dazu, dass diese Informationen nicht automatisch oder schnell weitergegeben werden konnten. Infolgedessen arbeiteten die Abteilungen häufig isoliert voneinander und verpassten die Möglichkeit, Maßnahmen zu ergreifen, die die Auswirkungen auf die Bürger und die Infrastruktur hätten mindern können.

Um diese Lücke zu schließen, entwickelte und stellte Linker Vision eine integrierte, KI-gestützte Plattform bereit. Es nutzt den NVIDIA VSS Blueprint, um KI-Agenten für die Videoanalyse zu entwickeln, die Tausende von Live-Kamerastreams in der Stadt verarbeiten und tiefere Einblicke in Verkehrsereignisse liefern können. Diese Erkenntnisse helfen Einsatzkräften, schnell zu reagieren und Abläufe in der Stadt zu verbessern. Ein Beispiel: KI-Agenten erkennen eine Überschwemmung auf einer Hauptverkehrsstraße und alarmieren automatisch die zuständigen Behörden und betroffenen Bürger mit wichtigen Informationen zum Ort sowie Zeitpunkt und schlagen entsprechende Maßnahmen vor. Die KI-Plattform dient als einheitliche Grundlage für Echtzeitdaten, die abteilungsübergreifende Zusammenarbeit ermöglicht und zu einem höheren Maß an Situationsbewusstsein und Entscheidungsfindung in der gesamten Stadt führt.

Die Drei-Computer-Strategie von NVIDIA in Aktion

Linker Vision strukturiert seine Lösung der visuellen KI (Vision AI) für Städte um die Drei-Computer-Strategie von NVIDIA, die jede Phase der Pipeline – Simulation, Training und Laufzeit – unterstützt.

Zunächst wandelt Linker Vision Satelliten- und Luftbilder in OpenUSD-Szenen um und erstellt einen digitalen Zwilling der Stadt mithilfe von NVIDIA Omniverse, das auf NVIDIA OVX™-Servern ausgeführt wird. Mit NVIDIA Cosmos werden vielfältige synthetische Videodaten für komplexe Szenarien wie Infrastrukturschäden oder Überschwemmungen generiert, um so Randfälle abzudecken, die in der realen Welt nur schwer zu erfassen sind.

Für das Training von KI-Modellen nutzt Linker Vision NVIDIA NeMo™ Curatorund nv-grounding-dino für die Datenkuration, Annotation und Kennzeichnung realer Daten. Diese echten und synthetischen Datensätze werden zur Feinabstimmung von VLMs verwendet, um die Genauigkeit zu erhöhen und bessere Einblicke in komplexe städtische Aktivitäten zu gewinnen.

Für die Bereitstellung nutzt Linker Vision den VSS-Blueprint, der NVIDIA Metropolis Vision-Pipelines mit generativen KI-Modellen kombiniert, einschließlich Cosmos VLMs auf NVIDIA DGX-Servern. So können KI-Agenten reale Ereignisse erkennen, verstehen und darauf reagieren, indem sie aussagekräftige, zeitnahe Erkenntnisse für den Betrieb intelligenter Städte liefern.

Schließlich verbindet Linker Vision seine Pipeline für visuelle KI mit einer Echtzeit-Umgebung für digitale Zwillinge, die von Omniverse unterstützt wird. Durch die Integration von Ergebnissen aus der Pipeline für visuelle Analysen wird eine interaktive Kommandozentrale geschaffen, in der die Stadtbeamten Ereignisse in der ganzen Stadt intuitiv überwachen und darauf reagieren können.

KI-Weiterentwicklung für den städtischen Betrieb

Linker Vision trägt aktiv zur Entwicklung von KI-Ökosystemen bei, insbesondere in den Bereichen Smart-City-Steuerung, KI-gestützte Infrastruktur und autonome Entscheidungsfindung. In der Stadt Kaohsiung integriert Linker Vision 30.000 verschiedene Smart-City-Kamerastreams, die alle in einer stadtweiten digitalen 3D-Zwillingsplattform verwaltet werden. Das System ist darauf trainiert, mehr als zehn wichtige städtische und geschäftliche Bereiche zu verstehen, darunter Verkehr, Wasserwirtschaft, Gesundheitswesen und Logistik, sowie mehr als 300 Szenarien wie Verkehrsunfälle, Katastrophenhilfe, öffentliche Sicherheit und Infrastrukturmanagement.  

Linker Vision erweitert diesen Ansatz jetzt durch AI-GRID, seine Orchestrierungs- und Laufzeitebene für umfangreiche physische KI-Bereitstellungen. Jüngste Erweiterungen in Taipei City und dem taiwanesischen Verkehrs- und Kommunikationsministerium nutzen NVIDIA NemoClaw, NVIDIA VSS Blueprint und NVIDIA Cosmos, um autonome Video-Reasoning-Agenten in verteilten Stadt- und Verkehrsumgebungen zu unterstützen.

Die Fortschritte von Linker Vision zeigen, wie die Entwicklung von Vision-KI-Agenten die Generierung synthetischer Daten, die Feinabstimmung von Modellen sowie Inferenz/Bereitstellung umfasst, anstatt bei der Modellinferenz zu enden. Entwicklern zeigt Linker Vision, warum Vision-KI-Agenten für die Produktion mehr als einen Inferenz-Endpunkt erfordern. Teams benötigen reproduzierbare Workflows, um Video-KI-Systeme an reale Bedingungen anzupassen und agentenbasierte Funktionen in großem Maßstab bereitzustellen. NVIDIA VSS-Fähigkeiten ergänzen den VSS Blueprint, indem sie dazu beitragen, häufige Video-KI-Aufgaben – einschließlich Bereitstellung, Suche, Zusammenfassung, Berichte, Warnungen, Videoverständnis und Streammanagement – in reproduzierbare, von Agenten ausführbare Workflows zu verwandeln.

Die Vision-KI-Lösungen verbessern die Lebensqualität in Städten und verkürzen die Reaktionszeiten bei Vorfällen um bis zu 80 %. Die Arbeit von Linker Vision, die kürzlich im GTC-Vortrag „City-Scale AI With Digital Twins“ vorgestellt wurde, zeigt, wie das Unternehmen NVIDIA KI-Technologien für die Echtzeit-KI-Verarbeitung für stadtweite KI, das Training großer Modelle und domänenübergreifende KI-Anwendungen in Smart Cities, industrieller Automatisierung und KI-Ökosystemen integriert. 

Nutzen Sie die Leistung von VLMs und beginnen Sie mit der Entwicklung mit NVIDIA AI Blueprints.