Vaidio koppelt nu rechtstreeks met meldkamers via het SIA DC-09-protocol
Sinds kort maken we binnen het Vaidio-platform gebruik van Video Language Models (VLM’s). Dat klinkt technisch, en dat is het ook, maar de impact ervan is juist heel praktisch. Het betekent dat video niet langer alleen wordt geanalyseerd op losse objecten of simpele gebeurtenissen, maar dat het systeem nu ook kan begrijpen wat er in beeld gebeurt en dit kan beschrijven, doorzoeken en verklaren.
Maar wat zijn Video Language Models eigenlijk? En waarom zijn ze zo’n belangrijke volgende stap in Video Analytics en Vision AI? In dit artikel leggen we het uit.
‘Traditionele’ (wat nog steeds een relatief nieuwe technologie is, dus helemaal niet zo traditioneel) Video AI is sterk in detectie. Het kan aangeven:
Dat is al enorm waardevol, maar het heeft ook beperkingen. Elk van deze waarnemingen staat op zichzelf. AI weet in dit geval niet of die persoon een monteur, patiënt of indringer is. Het ziet een tas, maar niet of die bewust is neergelegd of per ongeluk is achtergelaten. Het detecteert beweging, maar begrijpt geen intentie.
In de praktijk betekent dit dat operators en analisten nog steeds veel zelf moeten interpreteren. Ze krijgen meldingen, kijken naar beelden, trekken conclusies en schrijven hun eigen rapportages. AI levert data, mensen maken er vervolgens betekenis van.
Video Language Models veranderen dat fundamenteel.
Een Video Language Model combineert drie technologieën:
Samen zorgen deze modellen ervoor dat een systeem niet alleen kan vaststellen wat er in beeld is, maar ook wat er gebeurt.
In plaats van:
“Persoon gedetecteerd. Object gedetecteerd. Persoon verliet het beeld.”
Kan een VLM bijvoorbeeld zeggen:
“Iemand zet een tas naast een pilaar en verlaat de ruimte zonder de tas mee te nemen.”
Dat is geen losse detectie meer. Het is een beschrijving van een gebeurtenis.

Door Video Language Models te integreren in Vaidio verandert de rol van video in een organisatie. Video wordt niet langer een stroom beelden die je moet bekijken, maar een informatiebron die je kunt bevragen.
In plaats van door camera’s, tijdlijnen of gedetecteerde events te klikken, kun je nu vragen stellen zoals:
VLM’s vertalen zulke vragen automatisch naar:
en doorzoeken vervolgens alle beschikbare videodata om precies die situaties te vinden.
Het grote verschil tussen ‘traditionele’ analytics en VLM’s, zit in context.
Traditionele analytics werken met regels:
Video Language Models begrijpen gebeurtenissen in samenhang:
Dat maakt het mogelijk om echte scenario’s te herkennen in plaats van alleen losse triggers. Het systeem kan bijvoorbeeld onderscheid maken tussen:
Die nuance is precies wat nodig is om betrouwbare beslissingen te ondersteunen in complexe omgevingen.
De toevoeging van VLM’s aan Vaidio zorgt voor een aantal belangrijke verbeteringen:
Na een incident kan het systeem automatisch beschrijven wat er is gebeurd. In plaats van zelf een video terug te kijken, krijg je een samenvatting van het verloop van het incident.
Operators, security teams en analisten hoeven geen filters meer te bouwen. Ze kunnen gewoon vragen stellen in normale taal.
Omdat het systeem gedrag begrijpt in context, kan het beter onderscheid maken tussen normaal en afwijkend gedrag.
Zonder nieuwe hardware kunnen organisaties ineens veel diepere vragen stellen over wat er werkelijk in hun omgeving gebeurt.
Met de introductie van Video Language Models maakt Vaidio een verschuiving van Video Analytics naar Vision Intelligence. Het gaat niet langer alleen om het zien van objecten, maar om het begrijpen van situaties. Video wordt daarmee een bron van kennis, niet alleen van beelden. Dat is precies waarom deze technologie zo’n belangrijke rol speelt in de toekomst van beveiliging, veiligheid en operationeel inzicht en waarom we deze stap al in de ontwikkeling van het Vaidio-platform hebben gezet.
Weten hoe de VLM’s er binnen Vaidio uitzien? Schrijf je dan in voor het What’s New webinar over Vaidio 9.2 op donderdag 22 januari. Inschrijven kan via onderstaande button.