arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7473 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7473 篇

2601.14607 2026-01-22 physics.geo-ph 50%

SeisBind: Physics-Aware Tri-Modal Representation Binding for Seismic Data via Contrastive Learning

SeisBind:通过对比学习实现地震数据的物理感知三模态表示绑定

Chaohua Liang, Jun Matsushima

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 SeisBind通过对比学习将地震数据与物理描述符结合,实现更可解释的地下速度模型构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14460 2026-01-22 cs.IR 50%

Trust Me on This: A User Study of Trustworthiness for RAG Responses

相信我:对RAG响应可信度的用户研究

Weronika Łajewska, Krisztian Balog

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究通过用户实验探讨了不同解释类型如何影响用户对RAG响应的信任度,发现信任受响应清晰度和用户知识影响,而非单纯客观质量。

Comments This is the author's version of the work. The definitive version is published in: Proceedings of the 48th European Conference on Information Retrieval (ECIR '26), March 29-April 2, 2026, Delft, The Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10923 2026-01-22 cs.CR cs.HC 50%

Hidden-in-Plain-Text: A Benchmark for Social-Web Indirect Prompt Injection in RAG

隐于 plain-text:一种用于 RAG 中社会网络间接提示注入的基准测试

Haoze Guo, Ziqi Wei

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 OpenRAG-Soc 提供了一种用于评估 RAG 系统在社会网络间接提示注入攻击下的基准测试工具,通过标准化的端到端评估和可部署的缓解措施,帮助从业者跟踪风险并增强部署安全性。

Comments WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14081 2026-01-21 cs.SE 50%

Feature-Aware Test Generation for Deep Learning Models

面向深度学习模型的特征感知测试生成

Xingcheng Chen, Oliver Weissl, Andrea Stocco

专题命中 视觉定位与Grounding :vision-language model(abstract)

AI总结 本文提出Detect框架,通过特征感知扰动生成高质量测试用例,揭示模型中的捷径行为和未被准确度指标捕捉的bug,提升深度学习模型的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14007 2026-01-21 cs.CL 50%

BACH-V: Bridging Abstract and Concrete Human-Values in Large Language Models

BACH-V: 联结抽象与具体的人类价值观在大语言模型中

Junyu Zhang, Yipeng Kang, Jiong Guo, Jiayu Zhan, Junqi Wang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 BACH-V研究通过探测和引导方法揭示大语言模型中抽象与具体价值观的联结机制,发现其能稳定锚定抽象价值观以影响具体决策。

Comments 34 pagess, 16 figures, 6 tables, submitted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13882 2026-01-21 cs.CL 50%

OpenLearnLM Benchmark: A Unified Framework for Evaluating Knowledge, Skill, and Attitude in Educational Large Language Models

OpenLearnLM基准:一个评估教育大型语言模型知识、技能和态度的统一框架

Unggi Lee, Sookbun Lee, Heungsoo Choi, Jinseo Lee, Haeun Park, Younghoon Jeon, Sungmin Cho, Minju Kang, Junbo Koh, Jiyeong Bae, Minwoo Nam, Juyeon Eun, Yeonji Jung, Yeil Jeong

机构 * Chosun University(chosun大学) Korea University(韩国大学) Ewha Womans University(成均馆大学) Korea Institute for Curriculum and Evaluation(韩国课程评价院) Seoul National University(首尔国立大学) Texas A&M University(德克萨斯农工大学) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 OpenLearnLM基准通过统一框架评估教育大型语言模型的知识、技能和态度,揭示不同模型在多维度上的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13297 2026-01-21 q-bio.NC 50%

Multifaceted neural representation of words in naturalistic language

自然语言中词语的多维神经表征

Xuan Yang, Chuanji Gao, Cheng Xiao, Nicholas Riccardi, Rutvik H. Desai

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究通过心理语言学建模与fMRI结合,揭示了词语多维属性在自然语言理解中的神经表征,发现八个潜在维度支持不同的认知功能。

Comments 65 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11722 2026-01-21 cs.CL cs.IR 50%

RAC: Retrieval-Augmented Clarification for Faithful Conversational Search

RAC:基于检索的澄清以实现可靠的对话搜索

Ahmed Rayane Kebir, Vincent Guigue, Lynda Said Lhadj, Laure Soulier

机构 * Sorbonne Université, CNRS, ISIR, F-75005 Paris, France(索邦大学、国家科学研究中心、ISIR、法国巴黎) Ecole nationale Supérieure d’Informatique (ESI), Algeria(信息技术国家高等学院(ESI)、阿尔及利亚) AgroParisTech, UMR MIA-PS, Palaiseau, France(农业巴黎技术学院、UMR MIA-PS、法国帕莱索)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 RAC通过检索增强的方法生成基于语料库的澄清问题,提高对话搜索的准确性与可靠性。

Comments This is the author's version of the work. The definitive version is published in: Proceedings of the 48th European Conference on Information Retrieval (ECIR '26), 29 March--2 April, 2026, Delft, Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22753 2026-01-19 cs.CL 50%

Opportunities and Challenges of LLMs in Education: An NLP Perspective

大语言模型在教育中的机遇与挑战:一种自然语言处理视角

Sowmya Vajjala, Bashar Alhafni, Stefano Bannò, Kaushal Kumar Maurya, Ekaterina Kochmar

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文从自然语言处理视角探讨大语言模型在教育中的应用,分析其在教学、学习和评估中的机遇与挑战。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10355 2026-01-16 cs.CL 50%

Unlocking Implicit Experience: Synthesizing Tool-Use Trajectories from Text

解锁隐含经验:从文本合成工具使用轨迹

Zhihao Xu, Rumei Li, Jiahuan Li, Rongxiang Weng, Jingang Wang, Xunliang Cai, Xiting Wang

机构 * Renmin University of China(中国人民大学) Meituan(美团)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究提出GEM方法,通过文本数据生成多轮工具使用轨迹,提升LLM在多轮交互中的工具使用能力,实验显示其在基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10080 2026-01-16 cs.CL 50%

Deriving Character Logic from Storyline as Codified Decision Trees

从故事线推导出角色逻辑作为编码决策树

Letian Peng, Kun Zhou, Longfei Yun, Yupeng Hou, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出CDT框架,通过大规模叙述数据诱导可执行且可解释的决策树结构,提升角色扮演代理行为的可靠性与可维护性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18442 2026-01-16 q-bio.MN q-bio.QM 50%

Markovian Promoter Models: A Mechanistic Alternative to Hill Functions in Gene Regulatory Networks

马尔可夫启动子模型:基因调控网络中一种机制性替代Hill函数的方法

Tianyu Wu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出一种基于马尔可夫过程的启动子模型,用于替代传统Hill函数,以更准确地捕捉基因调控网络中的动态行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09036 2026-01-15 cs.CL cs.IR 50%

SpectraQuery: A Hybrid Retrieval-Augmented Conversational Assistant for Battery Science

SpectraQuery: 一种用于电池科学的混合检索增强型对话助手

Sreya Vangara, Jagjit Nanda, Yan-Kai Tzeng, Eric Darve

机构 * Mechanical Engineering, Stanford University(斯坦福大学机械工程系) Applied Energy Division, SLAC National Accelerator Laboratory(SLAC国家加速器实验室应用能源部门) Institute of Computational and Mathematical Engineering, Stanford University(斯坦福大学计算与数学工程研究所)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 SpectraQuery通过结合结构化数据库和文献语料库,为电池科学提供检索增强型对话助手,有效整合数值证据与机理解释,提升科学推理效率。

Comments 11 pages, 8 figures, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08852 2026-01-15 cs.CL 50%

NewsScope: Schema-Grounded Cross-Domain News Claim Extraction with Open Models

NewsScope:基于模式的跨领域新闻声明提取与开放模型

Nidhi Pandya

机构 * Pace University(帕克大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 NewsScope通过开放模型实现基于模式的跨领域新闻声明提取,展现优于GPT-4o-mini的准确性和泛化能力。

Comments 5 pages, 3 tables. Code, model, and benchmark publicly released

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06230 2026-01-15 physics.ed-ph 50%

Introducing the Physics of Complex Systems through Videogames

通过视频游戏引入复杂系统的物理

Alessio Focardi, Franco Bagnoli, Andrea Guazzini, Giorgio Gronchi

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究通过视频游戏教学,帮助高中生理解复杂系统的物理概念,如相变、敏感性和同步,并评估教学效果。

Comments Same as version 1.0, the only changes is Focardi's email address

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08105 2026-01-14 cs.CL 50%

Query Suggestion for Retrieval-Augmented Generation via Dynamic In-Context Learning

通过动态上下文学习实现检索增强生成的查询建议

Fabian Spaeh, Tianyi Chen, Chen-Hao Chiang, Bin Shen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出通过动态上下文学习实现检索增强生成的查询建议,以提升用户交互的安全性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06021 2026-01-12 cs.CL 50%

Chaining the Evidence: Robust Reinforcement Learning for Deep Search Agents with Citation-Aware Rubric Rewards

证据链的构建:基于引用感知的鲁棒深度搜索代理强化学习

Jiajie Zhang, Xin Lv, Ling Feng, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学) Zhipu AI(智谱AI)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出引用感知评分框架和组相对策略优化方法,用于提升深度搜索代理的鲁棒性和推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04160 2026-01-12 cs.CL cs.CE q-fin.CP 50%

All That Glisters Is Not Gold: A Benchmark for Reference-Free Counterfactual Financial Misinformation Detection

并非所有发光的都是金子:一个无参考信息的反事实金融虚假信息检测基准

Yuechen Jiang, Zhiwei Liu, Yupeng Cao, Yueru He, Ziyang Xu, Chen Xu, Zhiyang Deng, Prayag Tiwari, Xi Chen, Alejandro Lopez-Lira, Jimin Huang, Junichi Tsujii, Sophia Ananiadou

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 RFC Bench通过对比上下文提升金融虚假信息检测性能,揭示无参考设置下的模型局限性。

Comments 48 pages; 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15490 2026-01-09 cs.CL 50%

Collaborative Problem-Solving in an Optimization Game

优化游戏中的协作问题解决

Isidora Jeknic, Alex Duchnowski, Alexander Koller

机构 * Saarland University(萨尔兰大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出了一种新的对话游戏,通过协作解决双人旅行商问题,结合大语言模型与符号机制,实现了在自我对战中45%的最优解率,并展示了与人类用户协作和泛化能力。

Comments 23 pages, 16 figures

Journal ref Proceedings of the 26th Annual Meeting of the Special Interest Group on Discourse and Dialogue (2025) 780-799

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04525 2026-01-09 cs.CL 50%

GRACE: Reinforcement Learning for Grounded Response and Abstention under Contextual Evidence

GRACE:基于上下文证据的强化学习用于 grounded 响应和回避

Yibo Zhao, Jiapeng Zhu, Zichen Ding, Xiang Li

机构 * School of Data Science and Engineering, East China Normal University(数据科学与工程学院,东华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 GRACE通过强化学习框架整合证据基础和可靠回避,解决检索增强生成中的准确性和回避性问题,实现高准确率与低标注成本的平衡。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04196 2026-01-09 cs.CL cs.IR 50%

RAGVUE: A Diagnostic View for Explainable and Automated Evaluation of Retrieval-Augmented Generation

RAGVUE:一种用于可解释和自动评估检索增强生成的诊断视图

Keerthana Murugaraj, Salima Lamsiyah, Martin Theobald

机构 * University of Luxembourg(卢森堡大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 RAGVUE通过分解RAG行为并提供结构化解释,实现无参考的自动评估,揭示RAG流程中的细粒度失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03858 2026-01-08 cs.CL 50%

What Does Loss Optimization Actually Teach, If Anything? Knowledge Dynamics in Continual Pre-training of LLMs

连续预训练中损失优化实际上教了什么?LLMs持续预训练中的知识动态

Seyed Mahed Mousavi, Simone Alghisi, Giuseppe Riccardi

机构 * Signals and Interactive Systems Lab, University of Trento(信号与交互系统实验室,特伦托大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究揭示连续预训练中损失优化与知识学习的不一致性,发现事实学习不稳定且非单调,知识路径随训练动态变化,促使基于学习动态的停止标准评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03556 2026-01-08 cs.SE 50%

Do Autonomous Agents Contribute Test Code? A Study of Tests in Agentic Pull Requests

自主代理是否贡献测试代码?对代理拉取请求中测试的调查

Sabrina Haque, Sarvesh Ingale, Christoph Csallner

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究分析了代理拉取请求中测试代码的出现频率及影响因素,揭示了测试代码对PR规模和处理时间的影响,为自主软件开发研究提供实证依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03259 2026-01-08 cs.IR 50%

LLMDiRec: LLM-Enhanced Intent Diffusion for Sequential Recommendation

LLMDiRec: 基于大语言模型的意图扩散增强序列推荐

Bo-Chian Chen, Manel Slokom

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 LLMDiRec通过整合大语言模型与意图感知扩散模型,提升序列推荐中复杂用户意图捕捉和长尾项推荐效果。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03017 2026-01-07 cs.CL 50%

MMFormalizer: Multimodal Autoformalization in the Wild

MMFormalizer: 多模态自动形式化

Jing Xiong, Qi Han, Yunta Hsieh, Hui Shen, Huajian Xin, Chaofan Tao, Chenyang Zhao, Hengyuan Zhang, Taiqiang Wu, Zhen Zhang, Haochen Wang, Zhongwei Wan, Lingpeng Kong, Ngai Wong

机构 * The University of Hong Kong(香港大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) University of Edinburgh(爱丁堡大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Ohio State University(俄亥俄州立大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 MMFormalizer通过整合适应性定位与现实世界数学物理领域实体,实现多模态自动形式化,首次处理经典力学、相对论、量子力学和热力学等复杂领域。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24181 2026-01-06 cs.CL 50%

MedKGI: Iterative Differential Diagnosis with Medical Knowledge Graphs and Information-Guided Inquiring

MedKGI: 基于医学知识图谱和信息引导提问的迭代诊断

Qipeng Wang, Rui Sheng, Yafei Li, Huamin Qu, Yushi Sun, Min Zhu

机构 * Sichuan University(四川大学) HKUST(香港科技大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 MedKGI通过整合医学知识图谱和信息引导提问,提升临床诊断的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10048 2026-01-06 cs.HC 50%

Between Knowledge and Care: Evaluating Generative AI-Based IUI in Type 2 Diabetes Management Through Patient and Physician Perspectives

在知识与关怀之间:通过患者和医师视角评估生成式AI在2型糖尿病管理中的IUI

Yibo Meng, Ruiqi Chen, Bingyi Liu, Yan Guan, Xiaolan Ding

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过患者和医师视角评估生成式AI在2型糖尿病管理中的应用,揭示其在安全性、情境判断和责任边界方面的不足,提出需智能界面调解AI输出以支持长期护理中的信任与责任。

Comments In Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24428 2026-01-01 cs.RO 50%

Subsecond 3D Mesh Generation for Robot Manipulation

亚秒级机器人操作用3D网格生成

Qian Wang, Omar Abdellall, Tony Gao, Xiatao Sun, Daniel Rakita

机构 * Office of Naval Research(海军研究办公室)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究提出了一种亚秒级3D网格生成系统,通过集成开放词汇分割、加速扩散生成和稳健点云注册,实现高保真网格的快速生成,用于机器人感知与规划。

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04235 2026-01-01 cs.CL 50%

Addressing Hallucinations with RAG and NMISS in Italian Healthcare LLM Chatbots

通过RAG和NMISS解决意大利医疗LLM聊天机器人中的幻觉

Maria Paola Priola

机构 * Department of Economics and Business, University of Cagliari(经济与商业系,卡利亚里大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过RAG和NMISS方法有效缓解和检测LLM中的幻觉问题,验证了GPT-4和NMISS对提升医疗领域LLM性能的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22534 2025-12-30 cs.DC 50%

Object Abstraction To Streamline Edge-Cloud-Native Application Development

对象抽象以简化边缘-云原生应用开发

Pawissanutt Lertpongrujikorn

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究提出OaaS范式,通过整合碎片化抽象和自动化优化,简化云原生应用开发,提升生产率和可维护性。

Comments This is a doctoral dissertation submitted to University of North Texas

详情

展开后加载摘要…

URL PDF HTML 收藏