Can Vision-Language Models Answer Face to Face Questions in the Real-World?
视觉-语言模型能否在现实世界中回答面对面问题?
机构 * Qualcomm AI Research(高通人工智能研究)
AI总结 本文提出了一种新的数据集IVD,用于评估视觉-语言模型在现实世界中回答面对面问题的能力,并通过微调减少与人类表现的差距。
Comments ICLR 2026 paper
期刊&会议
International Conference on Learning Representations · 会议 · Machine Learning
视觉-语言模型能否在现实世界中回答面对面问题?
机构 * Qualcomm AI Research(高通人工智能研究)
AI总结 本文提出了一种新的数据集IVD,用于评估视觉-语言模型在现实世界中回答面对面问题的能力,并通过微调减少与人类表现的差距。
Comments ICLR 2026 paper
VideoMind: 一种用于时序 grounded 视频推理的链式 LoRA 代理
机构 * The Hong Kong Polytechnic University(香港理工大学) ; National University of Singapore(新加坡国立大学)
AI总结 VideoMind 提出了一种基于角色的链式 LoRA 机制,用于提升视频时序 grounded 推理的效率与灵活性。
Comments ICLR 2026 Camera Ready
探索通过跨层概念实现的视觉提示调优可解释性
机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) ; Microsoft Research Asia(微软亚洲研究院) ; School of Telecommunication and Engineering, Xidian University(西安电子科技大学电信与工程学院)
AI总结 本文提出可解释视觉提示调优框架,通过跨层概念原型提升视觉提示的可解释性与性能。
Comments ICLR 2026, 21 pages, 13 figures
Ambig-SWE: 交互式代理以克服软件工程中的不充分性
机构 * Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)
AI总结 Ambig-SWE研究LLM代理在交互式代码生成中处理不充分指令的能力,通过检测不充分性、提问澄清和利用交互提升性能,发现交互能显著提高74%的性能。
Comments 22 pages, 7 figures, Accepted at ICLR 2026
我们是否正确地测量图神经网络中的过度平滑现象?
机构 * School of Mathematics and Maxwell Institute University of Edinburgh(数学系和麦克斯韦研究所爱丁堡大学) ; Gran Sasso Science Institute(格兰萨索科学研究所) ; Scuola Normale Superiore(正常大学)
AI总结 本文提出通过特征表示的数值或有效秩来测量图神经网络中的过度平滑现象,而非传统基于能量的指标,并通过实验和理论分析证明了该方法的有效性。
Comments Accepted into ICLR 2026
vCache: 验证的语义提示缓存
机构 * University of California, Berkeley(加州大学伯克利分校) ; Technical University of Munich(慕尼黑技术大学) ; ETH Zurich(苏黎世联邦理工学院) ; Stanford University(斯坦福大学)
AI总结 vCache是一种具有用户定义误差率保证的验证语义缓存,通过在线学习算法动态优化阈值,实现更高的缓存命中率和更低的错误率。
Comments ICLR 2026 (accepted)