arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-26 至 2026-01-26 共收录 9 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 9 篇

2601.16895 2026-01-26 cs.CV cs.AI 84%

Evaluating Large Vision-language Models for Surgical Tool Detection

评估大型视觉-语言模型用于手术工具检测

Nakul Poudel, Richard Simon, Cristian A. Linte

机构 * Rochester Institute of Technology(罗切斯特理工大学) Center for Imaging Science(成像科学中心) Center for Imaging Science and Biomedical Engineering(成像科学与生物医学工程中心)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本研究评估了三种大型视觉-语言模型在手术工具检测任务中的性能,发现Qwen2.5在检测和泛化能力上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16394 2026-01-26 cs.CV cs.AI 84%

ResAgent: Entropy-based Prior Point Discovery and Visual Reasoning for Referring Expression Segmentation

ResAgent:基于熵的先验点发现与视觉推理的指称表达分割

Yihao Wang, Jusheng Zhang, Ziyi Tang, Keze Wang, Meng Yang

机构 * Sun Yat-sen University(中山大学)

专题命中 视觉定位与Grounding :visual reasoning(title);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 ResAgent通过熵引导的点发现和视觉推理方法,提升指称表达分割的准确性与效率。

Comments 23 pages, 7gigures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21862 2026-01-26 cs.CV cs.AI cs.IR 84%

A Multi-Stage Hybrid Framework for Automated Interpretation of Multi-View Engineering Drawings Using Vision Language Model

一种多阶段混合框架用于利用视觉语言模型自动解释多视图工程图

Muhammad Tayyab Khan, Zane Yong, Lequn Chen, Wenhe Feng, Nicholas Yew Jin Tan, Seung Ki Moon

专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多阶段混合框架,利用视觉语言模型自动解析多视图工程图,通过布局分割、方向感知检测和语义解析提升工程图解读效率。

Comments This draft has been accepted in the 13th International Conference on Industrial Engineering and Applications (ICIEA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16519 2026-01-26 cs.LG 57%

DANCE: Dynamic, Available, Neighbor-gated Condensation for Federated Text-Attributed Graphs

DANCE: 动态、可用、邻居门控的联邦文本属性图压缩

Zekai Chen, Haodong Lu, Xunkai Li, Henan Sun, Jia Li, Hongchao Qin, Rong-Hua Li, Guoren Wang

机构 * Department of Computer Science, Beijing Institute of Technology, Beijing, China(北京理工大学计算机科学系) The Hong Kong University of Science and Technology (GZ), Guangzhou, China(香港科技大学(广州))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 DANCE通过动态、可用、邻居门控的图压缩方法,提升联邦文本属性图学习的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16344 2026-01-26 cs.AI 57%

DSGym: A Holistic Framework for Evaluating and Training Data Science Agents

DSGym: 一个全面的框架用于评估和训练数据科学代理

Fan Nie, Junlin Wang, Harper Hua, Federico Bianchi, Yongchan Kwon, Zhenting Qi, Owen Queen, Shang Zhu, James Zou

机构 * Stanford University(斯坦福大学) Together AI Duke University(杜克大学) Harvard University(哈佛大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 DSGym通过标准化框架提升数据科学代理的评估与训练,解决现有基准测试的碎片化和数据不足问题,提供可扩展的任务套件和数据合成管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02979 2026-01-26 cs.HC cs.AI 57%

Systematizing LLM Persona Design: A Four-Quadrant Technical Taxonomy for AI Companion Applications

对LLM人设设计的系统化:面向AI陪伴应用的四象限技术分类

Esther Sun, Zichu Wu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出四象限技术分类系统,系统化LLM人设设计,涵盖虚拟与具身、情感与功能增强,分析不同应用场景的技术挑战与核心问题。

Comments Accepted to Neurips 2025 workshop: LLM Persona Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10931 2026-01-26 cs.AI 57%

Proof-of-Use: Mitigating Tool-Call Hacking in Deep Research Agents

证明-使用:减轻深度研究代理中的工具调用黑客行为

SHengjie Ma, Chenlong Deng, Jiaxin Mao, Jiadeng Huang, Teng Wang, Junjie Wu, Changwang Zhang, Jun wang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 证明-使用通过优化证据依赖关系,减轻深度研究代理中的工具调用黑客行为,并展现出适应性强的工具使用模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16507 2026-01-26 cs.SE 50%

REprompt: Prompt Generation for Intelligent Software Development Guided by Requirements Engineering

REprompt:基于需求工程的智能软件开发提示生成

Junjie Shi, Weisong Sun, Zhenpeng Chen, Zhujun Wu, Xiaohong Chen, Zhi Jin, Yang Liu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 REprompt是一种基于需求工程的多代理提示优化框架,旨在通过根植需求工程原则来优化系统和用户提示,提升智能软件开发中的提示生成效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19469 2026-01-26 cs.SD cs.MM 50%

MusiCRS: Benchmarking Audio-Centric Conversational Recommendation

MusiCRS:面向音频导向的对话推荐基准测试

Rohan Surana, Amit Namburi, Gagan Mundada, Abhay Lal, Zachary Novack, Julian McAuley, Junda Wu

机构 * University of California, San Diego, USA(加州大学圣地亚哥分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 MusiCRS通过链接Reddit用户对话与音乐曲目,为音频导向的对话推荐提供首个基准测试,揭示了跨模态整合的局限性,并释放了相关数据集和代码以促进研究进展。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏