Research framework evaluating retrieval-augmented vision-language models for evidence-grounded medical visual question answering.
-
Updated
Aug 11, 2026 - Python
Research framework evaluating retrieval-augmented vision-language models for evidence-grounded medical visual question answering.
[ICPR 2024] The official repo for FIDAVL: Fake Image Detection and Attribution using Vision-Language Model
Vision Question Answering
SCAFFOLD: A Large-Scale Structured Dataset of Computer Science Research Figures with Diagram QA and Chain-of-Thought Reasoning Traces
multimodal-drive-scene-understanding is an ongoing project for driving-scene understanding using multiple cameras, LiDAR, Text, audio data
Extract structured data from images.
To associate your repository with the vision-question-answering topic, visit your repo's landing page and select "manage topics."