Loading…
Benchmarking VLM Scene Understanding: How Well Do Vision-Language Models Interpret Video Narratives? · Researchar