arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-08 至 2026-01-08 共收录 9 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 9 篇

2601.03850 2026-01-08 cs.AI 79%

Investigating the Grounding Bottleneck for a Large-Scale Configuration Problem: Existing Tools and Constraint-Aware Guessing

探讨大规模配置问题中的 grounding 阻塞问题:现有工具与约束感知猜测

Veronika Semmelrock, Gerhard Friedrich

机构 * Department of Artificial Intelligence(人工智能系) Cybersecurity University of Klagenfurt, Austria(克雷根弗特大学网络安全学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文探讨了ASP在大规模配置问题中的grounding瓶颈,提出约束感知猜测方法以减少内存需求。

Comments In Proceedings ICLP 2025, arXiv:2601.00047

Journal ref EPTCS 439, 2026, pp. 482-495

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22351 2026-01-08 cs.CV cs.AI 79%

VULCAN: Tool-Augmented Multi Agents for Iterative 3D Object Arrangement

VULCAN:工具增强的多智能体用于迭代3D物体排列

Zhengfei Kuang, Rui Lin, Long Zhao, Gordon Wetzstein, Saining Xie, Sanghyun Woo

机构 * Stanford University(斯坦福大学) Google(谷歌) New York University(纽约大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 VULCAN通过引入MCP API、视觉工具和多智能体框架,提升了3D物体排列任务中MLLMs的视觉接地能力与迭代处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03669 2026-01-08 cs.CL 78%

eTracer: Towards Traceable Text Generation via Claim-Level Grounding

eTracer:通过声明级 grounding 实现可追溯的文本生成

Bohao Chu, Qianli Wang, Hendrik Damm, Hui Wang, Ula Muhabbek, Elisabeth Livingstone, Christoph M. Friedrich, Norbert Fuhr

机构 * University of Duisburg-Essen(杜伊斯堡-埃森大学) Technische Universität Berlin(柏林技术大学) University of Applied Sciences and Arts Dortmund(多特蒙德应用科学大学) University Hospital Essen(埃森大学医院)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 eTracer 通过声明级 grounding 提升文本生成的可追溯性和可信度,改进了生物医学领域响应的验证效率。

Comments ACL 2026 Conference Submission (8 main pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03713 2026-01-08 cs.CV 70%

BREATH-VL: Vision-Language-Guided 6-DoF Bronchoscopy Localization via Semantic-Geometric Fusion

BREATH-VL:基于视觉-语言引导的6自由度支气管镜定位:通过语义-几何融合

Qingyao Tian, Bingyu Yang, Huai Liao, Xinyan Huang, Junyong Li, Dong Yi, Hongbin Liu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Department of Pulmonary and Critical Care Medicine, The First Affiliated Hospital of Sun Yat-sen University(中山大学附属第一医院呼吸与危重症医学科) Centre of AI and Robotics, Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences(香港科学院人工智能与机器人中心) School of Biomedical Engineering and Imaging Sciences, King’s College London(伦敦国王学院生物医学工程与影像科学学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 BREATH-VL通过融合语义和几何信息,实现高精度的6自由度支气管镜定位,减少定位误差并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03261 2026-01-08 cs.CL cs.AI 57%

DeepResearch-Slice: Bridging the Retrieval-Utilization Gap via Explicit Text Slicing

DeepResearch-Slice: 通过显式文本切片弥合检索-利用差距

Shuo Lu, Yinuo Xu, Jianjie Cheng, Lingxiao He, Meng Wang, Jian Liang

机构 * NLPR & MAIS CASIA(CASIA NLPR与MAIS) School of AI UCAS(UCAS人工智能学院) Meituan Inc.(美团公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 DeepResearch-Slice通过显式文本切片技术,有效解决检索与利用之间的差距问题,提升模型在嘈杂环境中的鲁棒性。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05509 2026-01-08 cs.CL cs.AI 57%

LAG: Logic-Augmented Generation from a Cartesian Perspective

LAG: 从笛卡尔视角出发的逻辑增强生成

Yilin Xiao, Chuang Zhou, Yujing Zhang, Qinggang Zhang, Su Dong, Shengyuan Chen, Chang Yang, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 LAG通过系统的问题分解、原子记忆库和逻辑感知推理,提升知识密集型任务的准确性和减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03858 2026-01-08 cs.CL 50%

What Does Loss Optimization Actually Teach, If Anything? Knowledge Dynamics in Continual Pre-training of LLMs

连续预训练中损失优化实际上教了什么?LLMs持续预训练中的知识动态

Seyed Mahed Mousavi, Simone Alghisi, Giuseppe Riccardi

机构 * Signals and Interactive Systems Lab, University of Trento(信号与交互系统实验室,特伦托大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究揭示连续预训练中损失优化与知识学习的不一致性,发现事实学习不稳定且非单调,知识路径随训练动态变化,促使基于学习动态的停止标准评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03556 2026-01-08 cs.SE 50%

Do Autonomous Agents Contribute Test Code? A Study of Tests in Agentic Pull Requests

自主代理是否贡献测试代码?对代理拉取请求中测试的调查

Sabrina Haque, Sarvesh Ingale, Christoph Csallner

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究分析了代理拉取请求中测试代码的出现频率及影响因素,揭示了测试代码对PR规模和处理时间的影响,为自主软件开发研究提供实证依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03259 2026-01-08 cs.IR 50%

LLMDiRec: LLM-Enhanced Intent Diffusion for Sequential Recommendation

LLMDiRec: 基于大语言模型的意图扩散增强序列推荐

Bo-Chian Chen, Manel Slokom

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 LLMDiRec通过整合大语言模型与意图感知扩散模型,提升序列推荐中复杂用户意图捕捉和长尾项推荐效果。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏