Loading…
Dual Text-guided Cross-attention for Global–local Visual Fusion in Vietnamese Visual Question Answering · Researchar