arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-04 至 2025-12-04 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 5 篇

2511.22826 2025-12-04 cs.CV 70%

Some Modalities are More Equal Than Others: Decoding and Architecting Multimodal Integration in MLLMs

某些模态比其他模态更平等:在MLLMs中解码和架构多模态整合

Tianle Chen, Chaitanya Chakka, Arjun Reddy Akula, Xavier Thomas, Deepti Ghadiyaram

机构 * Boston University(波士顿大学) Google DeepMind(谷歌DeepMind)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文研究了多模态大语言模型对矛盾模态的鲁棒性,提出模态对齐调优策略以提升多模态推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15644 2025-12-04 cs.CV cs.AI cs.CR 62%

Can VLMs Detect and Localize Fine-Grained AI-Edited Images?

视觉语言模型能否检测并定位细粒度的人工智能编辑图像?

Zhen Sun, Ziyi Zhang, Zeren Luo, Zhiyuan Zhong, Zeyang Sha, Tianshuo Cong, Zheng Li, Shiwen Cui, Weiqiang Wang, Jiaheng Wei, Xinlei He, Qi Li, Qian Wang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Shandong University(山东大学) Wuhan University(武汉大学)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FragFake基准,首次系统研究VLMs在编辑图像分类和定位中的应用,发现微调模型在准确性上表现优异,同时探索了基于GRPO的RLVR训练方法。

Comments 14pages,19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14332 2025-12-04 cs.LG stat.ML 57%

Accelerating data-driven algorithm selection for combinatorial partitioning problems

加速组合划分问题的数据驱动算法选择

Vaggos Chatziafratis, Ishani Karmarkar, Yingxi Li, Ellen Vitercik

机构 * UC Santa Cruz(加州大学圣克鲁兹分校) Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出了一种理论基础,用于数据驱动算法选择中的大小泛化,通过在较小样本上评估算法性能来预测大规模实例的表现,并验证了三种聚类算法和两种max-cut算法的泛化能力。

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03501 2025-12-04 cs.CY 50%

SocraticAI: Transforming LLMs into Guided CS Tutors Through Scaffolded Interaction

SocraticAI: 通过支架式交互将LLMs转化为指导性计算机科学导师

Karthik Sunil, Aalok Thakkar

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 SocraticAI通过结构化约束将LLMs整合到计算机科学教育中,培养学生战略性的人工智能交互能力。

Comments Presented in the Best Practices Track of COMPUTE 2025 (arXiv:2512.02349)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03289 2025-12-04 cs.HC 50%

DAWZY: A New Addition to AI powered "Human in the Loop" Music Co-creation

DAWZY:一种新的AI驱动的“人机协同”音乐共创工具

Aaron C Elkins, Sanchit Singh, Adrian Kieback, Sawyer Blankenship, Uyiosa Philip Amadasun, Aman Chadha

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 DAWZY是一种基于AI的开源音乐创作工具,通过自然语言交互和LLM代码生成,提升音乐制作效率与用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏