Vaidio koppelt nu rechtstreeks met meldkamers via het SIA DC-09-protocol
Camerasystemen produceren iedere dag enorme hoeveelheden beeldmateriaal. Traditionele Video AI Analytics helpt om daarin automatisch personen, voertuigen, objecten en specifieke gebeurtenissen te herkennen. Een systeem kan bijvoorbeeld signaleren dat iemand een verboden gebied betreedt, dat een voertuig tegen de rijrichting in rijdt of dat een object wordt achtergelaten.
Dat levert waardevolle informatie op. Toch blijven het vaak losse detecties die een operator zelf moet combineren en interpreteren. Video Language Models, ook wel Vision Language Models genoemd, voegen daar een nieuwe laag aan toe. Ze kunnen niet alleen herkennen wat er in beeld verschijnt, maar ook verbanden leggen tussen objecten, bewegingen en gebeurtenissen. Vervolgens kunnen ze die informatie beschrijven in gewone taal. Meer weten over wat Video Language Models precies zijn? Lees dan dit artikel dat we erover schreven.
Daardoor verschuift videoanalyse van de vraag “wat is er gedetecteerd?” naar “wat gebeurt hier precies?”
Traditionele Video AI Analytics is doorgaans ontwikkeld voor duidelijk omschreven taken. Een model wordt bijvoorbeeld getraind om personen, auto’s, tassen, rook, vuur of wapens te herkennen.
Daar kunnen vervolgens regels aan worden gekoppeld, zoals:
Deze gespecialiseerde modellen zijn bijzonder geschikt voor continue monitoring. Ze kunnen grote aantallen camerastreams analyseren en snel reageren wanneer een vooraf gedefinieerde situatie ontstaat.
De beperking is dat de verschillende detecties vaak afzonderlijk worden aangeboden. Een camera kan bijvoorbeeld vaststellen dat er een persoon en een tas aanwezig zijn. Even later wordt gedetecteerd dat de persoon het gebied verlaat. De operator moet vervolgens zelf bepalen of deze waarnemingen met elkaar samenhangen.
Een Video Language Model analyseert niet alleen afzonderlijke objecten of videoframes. Het kijkt ook naar de volgorde waarin gebeurtenissen plaatsvinden.
Daarbij worden verschillende vormen van kunstmatige intelligentie gecombineerd:
Stel dat een camera de volgende afzonderlijke gebeurtenissen registreert:
Traditionele videoanalyse kan deze elementen afzonderlijk detecteren. Een Video Language Model kan daar een samenhangende beschrijving van maken:
Een persoon zet een tas naast een pilaar neer en verlaat vervolgens het gebied zonder de tas mee te nemen.Die beschrijving geeft de operator sneller inzicht in wat er mogelijk is gebeurd.
Dat betekent niet dat een VLM een situatie op dezelfde manier begrijpt als een mens. Het model heeft geen bewustzijn en kent de intentie van de betrokken persoon niet. Het herkent patronen en relaties in het beeld en vertaalt die naar een waarschijnlijke beschrijving.
Een belangrijke verandering is dat gebruikers niet meer uitsluitend afhankelijk zijn van vooraf ingestelde filters en detectieregels.
Bij traditionele video search selecteert een operator bijvoorbeeld:
Dat is al veel sneller dan handmatig camerabeelden terugkijken. Toch moet de gebruiker precies weten welke kenmerken beschikbaar zijn en welke filters moeten worden toegepast.
Met een Video Language Model kan een zoekopdracht uiteindelijk veel natuurlijker worden geformuleerd. Bijvoorbeeld:
De gebruiker beschrijft de situatie waarnaar hij zoekt. Het systeem probeert die omschrijving vervolgens te koppelen aan relevante videobeelden.
Hierdoor wordt geavanceerde videoanalyse toegankelijker voor operators die geen technische kennis hebben van AI-modellen, metadata of zoekfilters.
Video Language Models zullen gespecialiseerde Video AI Analytics waarschijnlijk niet volledig vervangen.
Specifieke detectiemodellen blijven waardevol voor situaties waarin snelheid, consistentie en schaalbaarheid belangrijk zijn. Denk aan realtime perimeterdetectie, kentekenherkenning, personen tellen of het signaleren van rook en vuur.
Een gespecialiseerd model is ontwikkeld om één specifieke taak zo efficiënt mogelijk uit te voeren.
VLM’s zijn vooral interessant wanneer:
De meest logische ontwikkeling is daarom een combinatie van beide technieken.
Traditionele analytics detecteren en classificeren objecten en gebeurtenissen. Een Video Language Model helpt vervolgens om deze informatie te verbinden, te beschrijven en doorzoekbaar te maken.
Je zou kunnen zeggen dat traditionele Video AI de ogen vormt, terwijl een VLM taal en context toevoegt.
De mogelijkheden zijn groot, maar Video Language Models hebben ook beperkingen.
Een VLM kan een situatie verkeerd of onvolledig beschrijven. Bij belangrijke incidenten moet de operator daarom altijd de oorspronkelijke beelden controleren. Een AI-beschrijving is een hulpmiddel, geen definitieve vaststelling.
Een systeem kan herkennen dat iemand een tas neerzet en wegloopt. Het kan niet met zekerheid bepalen waarom iemand dat doet.
Het verschil tussen een onschuldige situatie en een veiligheidsrisico vraagt vaak om menselijke beoordeling.
Slechte verlichting, lage resolutie, een ongunstige camerahoek of gedeeltelijke blokkering van het beeld hebben invloed op de kwaliteit van de analyse.
Ook geavanceerde AI kan niet betrouwbaar interpreteren wat onvoldoende zichtbaar is.
Organisaties moeten duidelijk bepalen:
De inzet van een VLM verandert niets aan de verantwoordelijkheid van de organisatie om zorgvuldig met camerabeelden en persoonsgegevens om te gaan. Meer weten over hoe het zit met Vision AI en wet- en regelgeving? Bekijk dan ons webinar over dit onderwerp.
Binnen het Vaidio-platform kunnen Video Language Models worden gecombineerd met bestaande Video AI Analytics. Daardoor ontstaat een hybride benadering. Gespecialiseerde analytics kunnen continu personen, voertuigen, objecten en gebeurtenissen detecteren. Een VLM kan vervolgens helpen om complexere situaties te beschrijven of beelden in natuurlijke taal te doorzoeken.
Organisaties kunnen daarmee onder andere:
Een belangrijk uitgangspunt is dat hiervoor niet automatisch een volledig nieuw camerasysteem nodig is. De intelligentie kan worden toegevoegd aan een bestaande video-omgeving, afhankelijk van de aanwezige camera’s, infrastructuur en integraties.
De uitdaging van modern cameratoezicht is niet dat er te weinig beelden beschikbaar zijn. Het probleem is juist dat organisaties meer videodata verzamelen dan mensen handmatig kunnen bekijken en beoordelen. Traditionele Video AI Analytics bracht daarin al een belangrijke verandering. Camera’s konden niet alleen opnemen, maar ook automatisch personen, objecten en gebeurtenissen signaleren.
Video Language Models zetten een volgende stap. Ze verbinden afzonderlijke waarnemingen met tijd, context en taal. Daardoor wordt het mogelijk om camerabeelden op een natuurlijkere manier te doorzoeken en sneller te begrijpen welke gebeurtenissen aandacht vragen.
De camera zelf verandert misschien niet. De manier waarop organisaties informatie uit camerabeelden halen, verandert wel fundamenteel. Video verschuift daarmee steeds verder van passieve registratie naar een actieve bron van informatie en beslissingsondersteuning.