arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-16 至 2026-01-16 共收录 10 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 10 篇

2601.09879 2026-01-16 cs.CV cs.AI 89%

MedVL-SAM2: A unified 3D medical vision-language model for multimodal reasoning and prompt-driven segmentation

MedVL-SAM2:一种统一的3D医学视觉-语言模型,用于多模态推理和基于提示的分割

Yang Xing, Jiong Wu, Savas Ozdemir, Ying Zhang, Yang Yang, Wei Shao, Kuang Gong

机构 * Department of Biomedical Engineering, University of Florida(佛罗里达大学生物医学工程系) Department of Radiology, University of Florida(佛罗里达大学放射学系) Research Computing, University of Florida(佛罗里达大学研究计算中心) Department of Medicine, University of Florida(佛罗里达大学医学系) Department of Radiology, UC San Francisco(旧金山大学放射学系)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);visual reasoning(abstract);visual question answering(abstract)

AI总结 MedVL-SAM2是一种统一的3D医学多模态模型,通过联合训练实现报告生成、VQA和多任务分割的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10551 2026-01-16 cs.CV 83%

Unleashing the Capabilities of Large Vision-Language Models for Intelligent Perception of Roadside Infrastructure

释放大型视觉-语言模型的能力以实现道路基础设施的智能感知

Luxuan Fu, Chong Liu, Bisheng Yang, Zhen Dong

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS)(信息工程测绘遥感国家重点实验室) Wuhan University(武汉大学) Hubei Luojia Laboratory(湖北珞珈实验室)

专题命中 视觉定位与Grounding :vision-language model(title);vision language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出一种领域适应框架,通过数据高效微调和知识引导推理,提升大型视觉语言模型在城市道路基础设施感知中的性能和专业合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09770 2026-01-16 cs.AI 83%

GUI-Eyes: Tool-Augmented Perception for Visual Grounding in GUI Agents

GUI-Eyes: 用于GUI代理视觉接地的工具增强感知

Chen Chen, Jiawei Shao, Dakuan Lu, Haoyi Hu, Xiangcheng Liu, Hantao Yao, Wu Liu

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 GUI-Eyes通过分阶段策略推理和细粒度奖励反馈实现工具感知主动感知,显著提升GUI代理的接地准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10108 2026-01-16 cs.CL cs.AI cs.MM 70%

SIN-Bench: Tracing Native Evidence Chains in Long-Context Multimodal Scientific Interleaved Literature

SIN-Bench:在长上下文多模态科学交织文献中追踪原生证据链

Yiming Ren, Junjie Wang, Yuxin Meng, Yihang Shi, Zhiqiang Lin, Ruihang Chu, Yiran Xu, Ziming Li, Yunfei Zhao, Zihan Wang, Yu Qiao, Ruiming Tang, Minghao Liu, Yujiu Yang

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) KuaiShou Inc.(快手公司) Stanford University(斯坦福大学) Harvard University(哈佛大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 SIN-Bench 通过构建科学交织语料库和四个逐步任务,评估多模态模型在长上下文科学文献中追踪证据链的能力,揭示接地是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09858 2026-01-16 cs.CL cs.AI cs.LG 62%

OUTLINEFORGE: Hierarchical Reinforcement Learning with Explicit States for Scientific Writing

OUTLINEFORGE: 基于显式状态的分层强化学习用于科学写作

Yilin Bao, Ziyao He, Zayden Yang

机构 * UC San Diego(圣迭戈大学) Ohio State University(俄亥俄州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 OUTLINEFORGE通过分层强化学习和显式状态管理,提升科学写作的全局结构和引用一致性,改进文档规划和事实准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10535 2026-01-16 cs.CV 57%

SVII-3D: Advancing Roadside Infrastructure Inventory with Decimeter-level 3D Localization and Comprehension from Sparse Street Imagery

SVII-3D:利用厘米级3D定位与稀疏街道影像的综合理解,推进道路基础设施库存建设

Chong Liu, Luxuan Fu, Yang Jia, Zhen Dong, Bisheng Yang

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS), Wuhan University, Wuhan 430079, China(信息工程测绘遥感国家重点实验室(LIESMARS),武汉大学) Research Institute Ltd, Chengdu 610000, China(四川省公路规划设计研究有限公司)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 SVII-3D通过厘米级3D定位与稀疏影像综合理解,提升道路基础设施库存的自动化创建与细粒度状态诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08847 2026-01-16 cs.CL cs.AI 57%

Scalable and Reliable Evaluation of AI Knowledge Retrieval Systems: RIKER and the Coherent Simulated Universe

可扩展且可靠的AI知识检索系统评估:RIKER和一致性模拟宇宙

JV Roig

机构 * Kamiwaza AI

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 RIKER通过生成文档而非提取地面真实,提供了一种可扩展且抗污染的AI知识检索系统评估方法,揭示了上下文长度、跨文档聚合和事实基础能力等关键问题。

Comments 26 pages, 17 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10355 2026-01-16 cs.CL 50%

Unlocking Implicit Experience: Synthesizing Tool-Use Trajectories from Text

解锁隐含经验:从文本合成工具使用轨迹

Zhihao Xu, Rumei Li, Jiahuan Li, Rongxiang Weng, Jingang Wang, Xunliang Cai, Xiting Wang

机构 * Renmin University of China(中国人民大学) Meituan(美团)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究提出GEM方法,通过文本数据生成多轮工具使用轨迹,提升LLM在多轮交互中的工具使用能力,实验显示其在基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10080 2026-01-16 cs.CL 50%

Deriving Character Logic from Storyline as Codified Decision Trees

从故事线推导出角色逻辑作为编码决策树

Letian Peng, Kun Zhou, Longfei Yun, Yupeng Hou, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出CDT框架,通过大规模叙述数据诱导可执行且可解释的决策树结构,提升角色扮演代理行为的可靠性与可维护性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18442 2026-01-16 q-bio.MN q-bio.QM 50%

Markovian Promoter Models: A Mechanistic Alternative to Hill Functions in Gene Regulatory Networks

马尔可夫启动子模型:基因调控网络中一种机制性替代Hill函数的方法

Tianyu Wu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出一种基于马尔可夫过程的启动子模型,用于替代传统Hill函数,以更准确地捕捉基因调控网络中的动态行为。

详情

展开后加载摘要…

URL PDF HTML 收藏