Cite
Notes
Only stored in your browser.
Attribution
World to Code: Multi-modal Data Generation via Self-Instructed Compositional Captioning and Filtering
arXiv 2024
Benchmarking and Improving Detail Image Caption
Seeing the Image: Prioritizing Visual Correlation by Contrastive Alignment
from 3 papers
Haoyuan Guo
Jiacong Wang
Xin Xiao
Xun Zhou
Chunyuan Li
Haiyong Jiang
Hongyuan Dong
Jiawen Li
Jun Xiao
Yuan Zhang