Skip to content

Video Language Models in Vaidio – was ist das eigentlich?

woman working on a laptop

Seit Kurzem nutzt die Vaidio-Plattform Video Language Models (VLMs). Das klingt technisch – und das ist es auch – doch die Auswirkungen sind äußerst praktisch. Video wird damit nicht mehr nur auf einzelne Objekte oder einfache Ereignisse analysiert; das System kann nun verstehen was in der Szene passiert und dies beschreiben, durchsuchen und erklären.

Doch was sind Video Language Models eigentlich? Und warum stellen sie den nächsten wichtigen Schritt in Video Analytics und Vision AI dar? In diesem Artikel erklären wir es.

Warum ‚traditionelle‘ Videoanalyse an ihre Grenzen stößt

‚Traditionelle Video-KI‘ (was nach wie vor eine relativ neue Technologie ist und daher eigentlich gar nicht so traditionell) ist stark in der Erkennung. Sie kann feststellen:

  • „Eine Person befindet sich im Bild“
  • „Ein Fahrzeug ist zu sehen“
  • „Jemand überschreitet eine Linie“
  • „Ein Objekt wurde zurückgelassen“

Das ist bereits äußerst wertvoll, hat jedoch auch Einschränkungen. Jede dieser Beobachtungen steht für sich allein. Die KI weiß nicht, ob es sich bei der Person um einen Techniker, einen Patienten oder einen Eindringling handelt. Sie erkennt eine Tasche, aber nicht, ob sie bewusst abgelegt oder versehentlich vergessen wurde. Sie erkennt Bewegung, versteht aber keine Absicht.

In der Praxis bedeutet dies, dass Operatoren und Analysten noch immer viel selbst interpretieren müssen. Sie erhalten Alarme, sichten Videomaterial, ziehen Schlussfolgerungen und erstellen ihre eigenen Berichte. Die KI liefert Daten – Menschen machen daraus Bedeutung.

Video Language Models verändern das grundlegend.

Was ist ein Video Language Model?

Ein Video Language Model kombiniert drei Technologien:

  1. Computer Vision
    Erkennt Objekte, Personen, Fahrzeuge und deren Bewegungen
  2. Temporales Verständnis
    Versteht, was zuerst geschieht und was danach
  3. Large Language Models (LLMs)
    Wandeln das Beobachtete in aussagekräftige Beschreibungen um

Zusammen ermöglichen diese Modelle, dass ein System nicht nur erkennt was im Bild ist, sondern auch was geschieht.

Statt:

„Person erkannt. Objekt erkannt. Person hat den Bereich verlassen.“

kann ein VLM beispielsweise sagen:

„Eine Person stellt eine Tasche neben eine Säule und verlässt den Bereich, ohne sie mitzunehmen.“

Das ist keine Aneinanderreihung einzelner Erkennungen mehr, sondern eine Beschreibung eines Ereignisses.

Video Language Models können Videos verstehen und deren Kontext beschreiben.
Video Language Models können Videos verstehen und deren Kontext beschreiben.

Was bedeutet das innerhalb von Vaidio?

Durch die Integration von Video Language Models in Vaidio verändert sich die Rolle von Video in einer Organisation. Video ist nicht länger nur ein Strom von Bildern, den man ansehen muss, sondern eine Informationsquelle, die man befragen kann.

Anstatt durch Kameras, Zeitachsen oder erkannte Ereignisse zu klicken, können nun Fragen gestellt werden wie:

  • „Zeige mir Situationen, in denen jemand einen Sperrbereich betreten und sich dort länger als zwei Minuten aufgehalten hat.“
  • „Finde Personen, die einen Gegenstand zurückgelassen und den Bereich verlassen haben.“
  • „Welche Fahrzeuge sind nach Geschäftsschluss zum Ladebereich gefahren?“

VLMs übersetzen solche Fragen automatisch in:

  • Objekte
  • Orte
  • Zeit
  • Abfolge
  • Verhalten

und durchsuchen anschließend alle verfügbaren Videodaten, um genau diese Situationen zu finden.

Von Erkennung zu Verständnis

Der zentrale Unterschied zwischen ‚traditioneller‘ Analytik und VLMs liegt im Kontext.

Traditionelle Analytik arbeitet mit Regeln:

  • wenn eine Person Bereich X betritt → Alarm
  • wenn ein Objekt dort liegt → Alarm

Video Language Models verstehen Ereignisse im Zusammenhang:

  • Wer war es?
  • Wohin ging die Person?
  • Was geschah zuerst?
  • Was geschah danach?

Dadurch lassen sich echte Szenarien erkennen statt nur isolierte Auslöser. Das System kann beispielsweise unterscheiden zwischen:

  • einem Mitarbeiter, der etwas kurz ablegt
  • und einer Person, die einen Gegenstand zurücklässt und verschwindet

Diese Nuancierung ist entscheidend, um in komplexen Umgebungen verlässliche Entscheidungen zu unterstützen.

Was bringt das in der Praxis?

Die Integration von VLMs in Vaidio bringt mehrere zentrale Verbesserungen:

  1. Schnellere und bessere Vorfallanalyse

Nach einem Vorfall kann das System automatisch beschreiben, was passiert ist. Statt selbst Videomaterial auszuwerten, erhält man eine Zusammenfassung des Geschehens.

  1. Natürliche Sprache als Schnittstelle

Operatoren, Sicherheitsteams und Analysten müssen keine komplexen Filter mehr erstellen. Sie können ihre Fragen einfach in normaler Sprache stellen.

  1. Weitere Reduzierung von Fehlalarmen

Da das System Verhalten im Kontext versteht, kann es besser zwischen normalem und abweichendem Verhalten unterscheiden.

  1. Neue Erkenntnisse aus bestehenden Kameras

Ohne neue Hardware können Organisationen deutlich tiefere Einblicke gewinnen, was in ihrer Umgebung tatsächlich geschieht.

Ein neuer Schritt in der Vision AI

Mit der Einführung von Video Language Models entwickelt sich Vaidio von Video Analytics zu Vision Intelligence. Es geht nicht mehr nur darum, Objekte zu sehen, sondern Situationen zu verstehen. Video wird damit zu einer Wissensquelle – nicht nur zu Bildmaterial. Genau deshalb spielt diese Technologie eine so wichtige Rolle für die Zukunft von Sicherheit, Schutz und operativer Entscheidungsfindung – und deshalb haben wir diesen Schritt bereits in der Weiterentwicklung der Vaidio-Plattform umgesetzt.

Möchten Sie sehen, wie VLMs innerhalb von Vaidio aussehen? Dann melden Sie sich für das What’s-New-Webinar zu Vaidio 9.2 am Donnerstag, den 22. Januar, über den untenstehenden Button an.

Kasper van Kekem

Entdecken Sie VLM in Vaidio während des Vaidio 9.2 What’s New Webinar!

Auch interessant zu lesen

Bas Commandeur

Sales Support
Contact

Contact

Bas Commandeur

Sales Support
Contact

Demo aanvragen

Bas Commandeur

Sales Support
Contact

Contact (ENG)

*“ zeigt erforderliche Felder an

Bas Commandeur

Sales Support
Contact

Request a demo

*“ zeigt erforderliche Felder an

Bas Commandeur

Sales Support
Contact

Demo aanvragen (DUI)

*“ zeigt erforderliche Felder an

Bas Commandeur

Sales Support
Contact

Contact (DUI)

*“ zeigt erforderliche Felder an

Bas Commandeur

Sales Support
Contact

Word een partner!

*“ zeigt erforderliche Felder an

1Bedrijfsgegevens
2Persoonsgegevens
3Diensten
Bedrijfsnaam
Adres*

Bas Commandeur

Sales Support
Contact

Download de VAIBS Brochure (NL)

*“ zeigt erforderliche Felder an

Bas Commandeur

Sales Support
Contact

Download de VAIBS Brochure (ENG)

*“ zeigt erforderliche Felder an

Bas Commandeur

Sales Support
Contact

Download de VAIBS Brochure (DUI)

*“ zeigt erforderliche Felder an

Bas Commandeur

Sales Support
Contact

Download de whitepaper gezichtsherkenning

*“ zeigt erforderliche Felder an

Bas Commandeur

Sales Support
Contact

Download de VAIBS Brochure Zorg (NL)

*“ zeigt erforderliche Felder an

Bas Commandeur

Sales Support
Contact

Become a Partner!

*“ zeigt erforderliche Felder an

1Company details
2Personal data
3Services
Type of partner
Company name
Address*

Bas Commandeur

Sales Support
Contact

Werden Sie Partner!

*“ zeigt erforderliche Felder an

1Unternehmensdaten
2Persönliche Daten
3Dienstleistungen
Partnerkategorie
Firmenname
Adresse*