Skip to content

Van objectdetectie naar situatiebegrip: waarom Video Language Models cameratoezicht veranderen

neural network, ai algorithm.

Camerasystemen produceren iedere dag enorme hoeveelheden beeldmateriaal. Traditionele Video AI Analytics helpt om daarin automatisch personen, voertuigen, objecten en specifieke gebeurtenissen te herkennen. Een systeem kan bijvoorbeeld signaleren dat iemand een verboden gebied betreedt, dat een voertuig tegen de rijrichting in rijdt of dat een object wordt achtergelaten.

Dat levert waardevolle informatie op. Toch blijven het vaak losse detecties die een operator zelf moet combineren en interpreteren. Video Language Models, ook wel Vision Language Models genoemd, voegen daar een nieuwe laag aan toe. Ze kunnen niet alleen herkennen wat er in beeld verschijnt, maar ook verbanden leggen tussen objecten, bewegingen en gebeurtenissen. Vervolgens kunnen ze die informatie beschrijven in gewone taal. Meer weten over wat Video Language Models precies zijn? Lees dan dit artikel dat we erover schreven.

Daardoor verschuift videoanalyse van de vraag “wat is er gedetecteerd?” naar “wat gebeurt hier precies?”

Traditionele Video AI herkent vooraf bepaalde situaties

Traditionele Video AI Analytics is doorgaans ontwikkeld voor duidelijk omschreven taken. Een model wordt bijvoorbeeld getraind om personen, auto’s, tassen, rook, vuur of wapens te herkennen.

Daar kunnen vervolgens regels aan worden gekoppeld, zoals:

  • waarschuw wanneer een persoon een beveiligde zone betreedt;
  • registreer voertuigen die een virtuele lijn passeren;
  • genereer een melding wanneer iemand langer dan vijf minuten in een gebied blijft;
  • detecteer wanneer een medewerker geen veiligheidshelm draagt;
  • signaleer een object dat gedurende langere tijd onbeheerd blijft staan.

Deze gespecialiseerde modellen zijn bijzonder geschikt voor continue monitoring. Ze kunnen grote aantallen camerastreams analyseren en snel reageren wanneer een vooraf gedefinieerde situatie ontstaat.

De beperking is dat de verschillende detecties vaak afzonderlijk worden aangeboden. Een camera kan bijvoorbeeld vaststellen dat er een persoon en een tas aanwezig zijn. Even later wordt gedetecteerd dat de persoon het gebied verlaat. De operator moet vervolgens zelf bepalen of deze waarnemingen met elkaar samenhangen.

person on laptop showing how vision ai software.

Van losse detecties naar een samenhangende gebeurtenis

Een Video Language Model analyseert niet alleen afzonderlijke objecten of videoframes. Het kijkt ook naar de volgorde waarin gebeurtenissen plaatsvinden.

Daarbij worden verschillende vormen van kunstmatige intelligentie gecombineerd:

  • computer vision om objecten, personen en bewegingen te herkennen;
  • tijdsanalyse om te bepalen wat eerst en wat daarna gebeurt;
  • taaltechnologie om beelden en gebeurtenissen te beschrijven.

Stel dat een camera de volgende afzonderlijke gebeurtenissen registreert:

  • een persoon loopt een stationshal binnen;
  • de persoon draagt een tas;
  • de tas wordt naast een pilaar neergezet;
  • de persoon loopt zonder de tas verder.

Traditionele videoanalyse kan deze elementen afzonderlijk detecteren. Een Video Language Model kan daar een samenhangende beschrijving van maken:

Een persoon zet een tas naast een pilaar neer en verlaat vervolgens het gebied zonder de tas mee te nemen.Die beschrijving geeft de operator sneller inzicht in wat er mogelijk is gebeurd.

Dat betekent niet dat een VLM een situatie op dezelfde manier begrijpt als een mens. Het model heeft geen bewustzijn en kent de intentie van de betrokken persoon niet. Het herkent patronen en relaties in het beeld en vertaalt die naar een waarschijnlijke beschrijving.

Camerabeelden doorzoeken met gewone taal

Een belangrijke verandering is dat gebruikers niet meer uitsluitend afhankelijk zijn van vooraf ingestelde filters en detectieregels.

Bij traditionele video search selecteert een operator bijvoorbeeld:

  • persoon;
  • rode bovenkleding;
  • zwarte broek;
  • richting naar links;
  • tijdstip tussen 14.00 en 15.00 uur.

Dat is al veel sneller dan handmatig camerabeelden terugkijken. Toch moet de gebruiker precies weten welke kenmerken beschikbaar zijn en welke filters moeten worden toegepast.

Met een Video Language Model kan een zoekopdracht uiteindelijk veel natuurlijker worden geformuleerd. Bijvoorbeeld:

  • “Zoek een persoon die een tas neerzet en daarna wegloopt.”
  • “Laat voertuigen zien die na sluitingstijd bij het laadperron stopten.”
  • “Toon situaties waarin iemand valt en niet direct weer opstaat.”
  • “Zoek personen die tegen de normale looprichting in bewegen.”

De gebruiker beschrijft de situatie waarnaar hij zoekt. Het systeem probeert die omschrijving vervolgens te koppelen aan relevante videobeelden.

Hierdoor wordt geavanceerde videoanalyse toegankelijker voor operators die geen technische kennis hebben van AI-modellen, metadata of zoekfilters.

Printscreen of Vaidio software showing virtual language machine ai algorithms

Vervangen VLM’s traditionele videoanalyse?

Video Language Models zullen gespecialiseerde Video AI Analytics waarschijnlijk niet volledig vervangen.

Specifieke detectiemodellen blijven waardevol voor situaties waarin snelheid, consistentie en schaalbaarheid belangrijk zijn. Denk aan realtime perimeterdetectie, kentekenherkenning, personen tellen of het signaleren van rook en vuur.

Een gespecialiseerd model is ontwikkeld om één specifieke taak zo efficiënt mogelijk uit te voeren.

VLM’s zijn vooral interessant wanneer:

  • een situatie uit meerdere stappen bestaat;
  • een gebeurtenis moeilijk in één vaste regel is vast te leggen;
  • gebruikers in gewone taal willen zoeken;
  • beelden moeten worden samengevat;
  • context nodig is om detecties beter te beoordelen;
  • snel nieuwe zoekscenario’s moeten worden onderzocht.

De meest logische ontwikkeling is daarom een combinatie van beide technieken.

Traditionele analytics detecteren en classificeren objecten en gebeurtenissen. Een Video Language Model helpt vervolgens om deze informatie te verbinden, te beschrijven en doorzoekbaar te maken.

Je zou kunnen zeggen dat traditionele Video AI de ogen vormt, terwijl een VLM taal en context toevoegt.

Belangrijke aandachtspunten

De mogelijkheden zijn groot, maar Video Language Models hebben ook beperkingen.

Beschrijvingen kunnen onjuist zijn

Een VLM kan een situatie verkeerd of onvolledig beschrijven. Bij belangrijke incidenten moet de operator daarom altijd de oorspronkelijke beelden controleren. Een AI-beschrijving is een hulpmiddel, geen definitieve vaststelling.

Context is niet hetzelfde als intentie

Een systeem kan herkennen dat iemand een tas neerzet en wegloopt. Het kan niet met zekerheid bepalen waarom iemand dat doet.

Het verschil tussen een onschuldige situatie en een veiligheidsrisico vraagt vaak om menselijke beoordeling.

Beeldkwaliteit blijft bepalend

Slechte verlichting, lage resolutie, een ongunstige camerahoek of gedeeltelijke blokkering van het beeld hebben invloed op de kwaliteit van de analyse.

Ook geavanceerde AI kan niet betrouwbaar interpreteren wat onvoldoende zichtbaar is.

Privacy en governance moeten vooraf worden geregeld

Organisaties moeten duidelijk bepalen:

  • voor welk doel videobeelden worden geanalyseerd;
  • welke camera’s en locaties onderdeel zijn van de analyse;
  • wie toegang krijgt tot beelden en beschrijvingen;
  • hoe lang data wordt bewaard;
  • hoe resultaten worden gecontroleerd;
  • wanneer menselijke beoordeling noodzakelijk is.

De inzet van een VLM verandert niets aan de verantwoordelijkheid van de organisatie om zorgvuldig met camerabeelden en persoonsgegevens om te gaan. Meer weten over hoe het zit met Vision AI en wet- en regelgeving? Bekijk dan ons webinar over dit onderwerp.

Video Language Models binnen Vaidio

Binnen het Vaidio-platform kunnen Video Language Models worden gecombineerd met bestaande Video AI Analytics. Daardoor ontstaat een hybride benadering. Gespecialiseerde analytics kunnen continu personen, voertuigen, objecten en gebeurtenissen detecteren. Een VLM kan vervolgens helpen om complexere situaties te beschrijven of beelden in natuurlijke taal te doorzoeken.

Organisaties kunnen daarmee onder andere:

  • complexere situaties onderzoeken;
  • zoekvragen in gewone taal formuleren;
  • gebeurtenissen laten samenvatten;
  • relevante fragmenten sneller terugvinden;
  • bestaande camerabeelden voor nieuwe toepassingen gebruiken.

Een belangrijk uitgangspunt is dat hiervoor niet automatisch een volledig nieuw camerasysteem nodig is. De intelligentie kan worden toegevoegd aan een bestaande video-omgeving, afhankelijk van de aanwezige camera’s, infrastructuur en integraties.

Van camerabeeld naar bruikbare informatie

De uitdaging van modern cameratoezicht is niet dat er te weinig beelden beschikbaar zijn. Het probleem is juist dat organisaties meer videodata verzamelen dan mensen handmatig kunnen bekijken en beoordelen. Traditionele Video AI Analytics bracht daarin al een belangrijke verandering. Camera’s konden niet alleen opnemen, maar ook automatisch personen, objecten en gebeurtenissen signaleren.

Video Language Models zetten een volgende stap. Ze verbinden afzonderlijke waarnemingen met tijd, context en taal. Daardoor wordt het mogelijk om camerabeelden op een natuurlijkere manier te doorzoeken en sneller te begrijpen welke gebeurtenissen aandacht vragen.

De camera zelf verandert misschien niet. De manier waarop organisaties informatie uit camerabeelden halen, verandert wel fundamenteel. Video verschuift daarmee steeds verder van passieve registratie naar een actieve bron van informatie en beslissingsondersteuning.

Henk-Jan Hop

Slimme camera’s. Slimmere inzichten.

Ook leuk om te lezen

Bas Commandeur

Sales Support
Contact

Contact

Bas Commandeur

Sales Support
Contact

Demo aanvragen

Bas Commandeur

Sales Support
Contact

Contact (ENG)

"*" geeft vereiste velden aan

Bas Commandeur

Sales Support
Contact

Request a demo

"*" geeft vereiste velden aan

Bas Commandeur

Sales Support
Contact

Demo aanvragen (DUI)

"*" geeft vereiste velden aan

Bas Commandeur

Sales Support
Contact

Contact (DUI)

"*" geeft vereiste velden aan

Bas Commandeur

Sales Support
Contact

Word een partner!

"*" geeft vereiste velden aan

1Bedrijfsgegevens
2Persoonsgegevens
3Diensten
Bedrijfsnaam
Adres*

Bas Commandeur

Sales Support
Contact

Download de VAIBS Brochure (NL)

"*" geeft vereiste velden aan

Bas Commandeur

Sales Support
Contact

Download de VAIBS Brochure (ENG)

"*" geeft vereiste velden aan

Bas Commandeur

Sales Support
Contact

Download de VAIBS Brochure (DUI)

"*" geeft vereiste velden aan

Bas Commandeur

Sales Support
Contact

Download de whitepaper gezichtsherkenning

"*" geeft vereiste velden aan

Bas Commandeur

Sales Support
Contact

Download de VAIBS Brochure Zorg (NL)

"*" geeft vereiste velden aan

Bas Commandeur

Sales Support
Contact

Become a Partner!

"*" geeft vereiste velden aan

1Company details
2Personal data
3Services
Type of partner
Company name
Address*

Bas Commandeur

Sales Support
Contact

Werden Sie Partner!

"*" geeft vereiste velden aan

1Unternehmensdaten
2Persönliche Daten
3Dienstleistungen
Partnerkategorie
Firmenname
Adresse*