arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7473 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7473 篇

2602.08529 2026-02-10 cs.MA 50%

EvoCorps: An Evolutionary Multi-Agent Framework for Depolarizing Online Discourse

EvoCorps:一种用于去极化的进化多智能体框架

Ning Lin, Haolun Li, Mingshu Liu, Chengyun Ruan, Kaibo Huang, Yukun Wei, Zhongliang Yang, Linna Zhou

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 EvoCorps通过进化多智能体框架主动应对在线讨论中的极化问题,提升讨论质量并实现闭环干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22246 2026-02-10 quant-ph cond-mat.dis-nn cond-mat.str-el 50%

Complexity in multi-qubit and many-body systems

多量子比特和许多体系统的复杂性

Imre Varga

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出了一种基于熵的复杂性度量,用于识别多量子比特和许多体系统中的非平凡量子相变和临界行为。

Comments 13 pages, 9 figures

Journal ref Phys. Rev. A 113, 022606, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07978 2026-02-10 cs.CL 50%

Cross-Linguistic Persona-Driven Data Synthesis for Robust Multimodal Cognitive Decline Detection

跨语言人格驱动的数据合成用于鲁棒多模态认知衰退检测

Rui Feng, Zhiyao Luo, Liuyu Wu, Wei Wang, Yuting Song, Yong Liu, Kok Pin Ng, Jianqing Li, Xingyao Wang

机构 * Engineering Research Center of Intelligent Theranostics Technology and Instruments, Ministry of Education, School of Biomedical Engineering and Informatics, Nanjing Medical University(智能诊疗技术与仪器工程研究中心、教育部、生物医学工程与信息学院、南京医科大学) Institute of Biomedical Engineering, University of Oxford(生物医学工程研究所、牛津大学) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所、科技研究局(A*STAR)) Department of Neurology, National Neuroscience Institute, Singapore, 308433, Singapore(神经病学部、新加坡国家神经科学研究所) Duke-NUS Medical School, Singapore, 169857, Singapore(新加坡国立大学医学院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract)

AI总结 SynCog通过跨语言人格驱动数据合成与推理链微调,提升多模态模型在认知衰退检测中的诊断性能和跨语言泛化能力。

Comments 18 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07371 2026-02-10 cs.DB 50%

DeepPrep: An LLM-Powered Agentic System for Autonomous Data Preparation

DeepPrep: 一种基于大语言模型的自主数据准备代理系统

Meihao Fan, Ju Fan, Yuxin Zhang, Shaolei Zhang, Xiaoyong Du, Jie Song, Peng Li, Fuxin Jiang, Tieying Zhang, Jianjun Chen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 DeepPrep通过基于树状代理推理和渐进式训练框架,实现高效且准确的数据准备,相比闭源模型具有更低的成本和更广的适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23189 2026-02-10 eess.SY cs.SY 50%

The Dawn of Agentic EDA: A Survey of Autonomous Digital Chip Design

代理EDA的黎明:自主数字芯片设计的综述

Zelin Zang, Yuhang Song, Aili Wang, Bingo Wing-Kuen Ling, Qi Sun, Zhen Lei, Fuji Yang, Cheng Zhuo, Jiebo Luo

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出代理EDA的系统框架,通过认知堆栈分析前端和后端设计流程,强调神经符号优化和可信度提升的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22978 2026-02-10 cs.CL 50%

ShoppingComp: Are LLMs Really Ready for Your Shopping Cart?

ShoppingComp: LLMs 是否真的准备好为您的购物车服务?

Huaixiao Tou, Ying Zeng, Yuemeng Li, Cong Ma, Muzhi Li, Minghao Li, Weijie Yuan, He Zhang, Kai Jia

机构 * ByteDance(字节跳动)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 ShoppingComp通过现实世界基准揭示LLM在购物代理任务中的局限性,强调其在信息定位、多约束验证和风险决策方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06001 2026-02-06 cs.RO 50%

Visuo-Tactile World Models

视觉-触觉世界模型

Carolina Higuera, Sergio Arnaud, Byron Boots, Mustafa Mukadam, Francois Robert Hogan, Franziska Meier

机构 * Paul G. Allen School of Computer Science, University of Washington(华盛顿大学保罗·G·阿伦计算机科学学院) FAIR, Meta(FAIR,Meta)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出视觉-触觉世界模型,通过融合视觉与触觉传感提升机器人在接触丰富任务中的物理建模能力,实验显示其在物体永恒性和运动定律遵守方面表现更优,并在真实机器人任务中实现更高的成功率。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00377 2026-02-06 cs.CL 50%

DecompressionLM: Deterministic, Diagnostic, and Zero-Shot Concept Graph Extraction from Language Models

DecompressionLM:从语言模型中确定性、诊断性地提取零样本概念图

Zhaochen Hong, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 DecompressionLM通过无状态框架实现零样本概念图提取,揭示语言模型编码内容,解决跨序列耦合、竞争解码效应和可扩展性限制问题,提升压缩模型的知识广度和事实基础评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04450 2026-02-05 cs.HC 50%

Can Theory-Informed Message Framing Drive Honest and Motivated Performance with Better Assessment Experiences in a Remote Assessment?

基于理论的信息框架能否通过更好的评估体验促进诚实和有动力的表现?

Suvadeep Mukherjee, Björn Rohles, Gabriele Lenzini, Pedro Cardoso-Leite

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究通过基于理论的信息框架减少作弊,同时保持表现和体验,发现不同理论概念的信息效果相似,且支持性动机干预更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02771 2026-02-04 stat.ME 50%

Markov Random Fields: Structural Properties, Phase Transition, and Response Function Analysis

马尔可夫随机场:结构特性、相变与响应函数分析

J. Brandon Carter, Catherine A. Calder

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文探讨了马尔可夫随机场的结构特性、相变现象及响应函数分析,旨在提供理论基础和实用工具以改进模型理解和扩展应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21875 2026-02-04 cs.CL 50%

LUMINA: Detecting Hallucinations in RAG System with Context-Knowledge Signals

LUMINA:通过上下文-知识信号检测RAG系统中的幻觉

Samuel Yeh, Sharon Li, Tanwi Mallick

机构 * Department of Computer Science, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) Argonne National Laboratory(阿贡国家实验室)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 LUMINA通过上下文-知识信号检测RAG系统中的幻觉,利用分布距离和token演变测量,实现高准确率和实用性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01525 2026-02-03 cs.HC cs.CY 50%

How Notations Evolve: A Historical Analysis with Implications for Supporting User-Defined Abstractions

符号如何演变:一种历史分析及其对支持用户定义抽象的启示

Jingyue Zhang, J. D. Zamfirescu-Pereira, Elena L. Glassman, Damien Masson, Ian Arawjo

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过历史分析探讨符号演变的三个社会阶段和三个功能阶段,提出如何设计支持用户定义抽象的新系统。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01230 2026-02-03 q-bio.GN 50%

Toward Interpretable and Generalizable AI in Regulatory Genomics

迈向可解释且可推广的监管基因组AI

Masayuki Nagai, Alan E. Murphy, Kaeli Rizzo, Peter K. Koo

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文探讨了seq2func模型在可解释性和泛化能力上的挑战,提出通过AI-实验反馈回路实现持续改进,以提升调控理解的可靠性。

Comments 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00818 2026-02-03 cs.NI eess.SP 50%

The Syntactic-Semantic Internet:Engineering Infrastructures for Autonomous Systems

语法-语义互联网:为自主系统工程基础设施

Mallik Tatipamula, Xuesong Liu, Yao Sun, Muhammad Ali Imran

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出语法-语义互联网的概念,旨在通过引入语义层解决自主系统中意义表示和交换的不足,推动网络基础设施向更智能、更互操作的方向发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20230 2026-01-30 cs.CL cs.HC 50%

Unit-Based Agent for Semi-Cascaded Full-Duplex Dialogue Systems

基于单元的代理用于半级联全双工对话系统

Haoyuan Yu, Yuxuan Chen, Minjie Cai

机构 * Hunan University(湖南大学) Gongdao Technology(公道科技) Jilin University(吉林大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract)

AI总结 本文提出基于单元的半级联全双工对话系统,利用多模态大语言模型和辅助模块实现高效对话处理,实验显示其在挑战赛中表现优异。

Comments ICASSP 2026 (Grant Challenge). https://github.com/yu-haoyuan/fd-badcat

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20833 2026-01-29 cs.CE 50%

Idea2Story: An Automated Pipeline for Transforming Research Concepts into Complete Scientific Narratives

Idea2Story: 一种将研究概念转化为完整科学叙述的自动化流程

Tengyue Xu, Zhuoyang Qian, Gaoge Liu, Li Ling, Zhentao Zhang, Biao Wu, Shuo Zhang, Ke Lu, Wei Shi, Ziqi Wang, Zheng Feng, Yan Luo, Shu Xu, Yongjin Chen, Zhibo Feng, Zhuo Chen, Bruce Yuan, Harry Wang, Kris Chen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 Idea2Story通过离线知识构建实现自主科学发现,提升研究效率与可靠性。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20105 2026-01-29 cs.CL 50%

FFE-Hallu:Hallucinations in Fixed Figurative Expressions:Benchmark of Idioms and Proverbs in the Persian Language

FFE-Hallu:固定修辞表达中的幻觉:波斯语中的成语和谚语基准

Faezeh Hosseini, Mohammadali Yousefzadeh, Yadollah Yaghoobzadeh

机构 * Tehran Institute for Advanced Studies, Khatam University, Iran(德黑兰高级研究 institute,Khatam 大学,伊朗) School of Electrical and Computer Engineering, College of Engineering, University of Tehran, Tehran, Iran(电气与计算机工程学院,工程学院,德黑兰大学,德黑兰,伊朗)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 FFE-Hallu是首个针对波斯语隐喻幻觉评估的基准,揭示了LLMs在处理隐喻语言方面的系统性弱点。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18697 2026-01-29 cs.HC 50%

Bridging Instead of Replacing Online Coding Communities with AI through Community-Enriched Chatbot Designs

通过社区增强的聊天机器人设计连接而非取代在线编程社区

Junling Wang, Lahari Goswami, Gustavo Kreia Umbelino, Kiara Chau, Mrinmaya Sachan, April Yi Wang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出Community-Enriched AI设计范式,通过整合在线编程社区内容提升AI聊天机器人与社区的互动性,增强用户信任并支持学习者解决问题。

Comments Accepted at the ACM Conference on Computer-Supported Cooperative Work and Social Computing (CSCW 2026). To appear in PACMHCI

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19281 2026-01-28 cs.HC 50%

Gazeify Then Voiceify: Physical Object Referencing Through Gaze and Voice Interaction with Displayless Smart Glasses

通过眼动和语音交互实现无显示屏智能眼镜的物理物体指认

Zheng Zhang, Mengjie Yu, Tianyi Wang, Kashyap Todi, Ajoy Savio Fernandes, Yue Liu, Haijun Xia, Tovi Grossman, Tanya Jonker

专题命中 视觉定位与Grounding :vision-language model(abstract)

AI总结 无显示屏智能眼镜通过眼动和语音交互实现物理物体指认,结合先进分割与视觉-语言模型,提升交互准确性和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19021 2026-01-28 cs.HC 50%

Listening before Asking: Lived-Experience Advisors as Methodological Partners in Dementia Caregiving Studies

在提问前倾听:生活经验顾问作为痴呆症照护研究的方法学伙伴

Joy Lai, Kelly Beaton, David Black, Alex Mihailidis

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文探讨了生活经验顾问在痴呆症照护研究中的方法学作用,通过提前参与的方法学伙伴角色,提升研究的伦理性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17540 2026-01-28 cs.SE 50%

SGCR: A Specification-Grounded Framework for Trustworthy LLM Code Review

SGCR:一种基于规范的可信大语言模型代码审查框架

Kai Wang, Bingcheng Mao, Shuai Jia, Yujie Ding, Dongming Han, Tianyi Ma, Bin Cao

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 SGCR通过规范引导LLMs实现可信代码审查,其双路径架构在工业环境中提升了42%的开发者采纳率。

Comments Accepted at ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18810 2026-01-28 quant-ph physics.hist-ph 50%

Interaction-Conditional Semantics and the Dissolution of Quantum Paradoxes

交互条件语义与量子悖论的消解

Jonathon Sendall

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过交互条件语义消解量子力学中的多个经典悖论,提出基于物理测量几何的相对谓词原则,重构贝尔定理和科赫-斯佩克尔定理,实现对经验现实的客观解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00008 2026-01-28 q-bio.NC 50%

The Copernican Argument for Alien Consciousness; The Mimicry Argument Against Robot Consciousness

第谷论证与机器人意识的反对论;模仿论证

Eric Schwitzgebel, Jeremy Pober

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 基于第谷观点和模仿论证,推翻平衡原则,探讨外星人和机器人意识的判断依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18267 2026-01-27 cs.IR 50%

Orchestrating Specialized Agents for Trustworthy Enterprise RAG

协调专用代理以实现可信的企业RAG

Xincheng You, Qi Sun, Neha Bora, Huayi Li, Shubham Goel, Kang Li, Sean Culatana

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 ADORE通过结构化记忆库和迭代协调机制,提升企业RAG在高风险决策中的可追溯性和证据完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17219 2026-01-27 cs.RO 50%

Advancing Improvisation in Human-Robot Construction Collaboration: Taxonomy and Research Roadmap

推动人机协同建造中的即兴能力:分类与研究路线图

David Wireko Atibila, Vineet R. Kamat, Carol C. Menassa

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出六级分类法,分析人机协同建造中即兴能力的发展现状与未来研究方向,指出技术、概念和方法学三方面障碍,建议通过增强现实、大语言模型和云系统提升人机协作水平。

Comments 73 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17002 2026-01-27 cs.CL 50%

RAM-SD: Retrieval-Augmented Multi-agent framework for Sarcasm Detection

RAM-SD:基于检索的多智能体框架用于讽刺检测

Ziyang Zhou, Ziqi Liu, Yan Wang, Yiming Lin, Yangbin Chen

机构 * Xi’an Jiaotong–Liverpool University(西安交通大学利物浦大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 RAM-SD通过多智能体框架提升讽刺检测性能,实现77.74%的宏F1值,提供透明推理轨迹。

Comments 12 pages, 4 figures, 6 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16507 2026-01-26 cs.SE 50%

REprompt: Prompt Generation for Intelligent Software Development Guided by Requirements Engineering

REprompt:基于需求工程的智能软件开发提示生成

Junjie Shi, Weisong Sun, Zhenpeng Chen, Zhujun Wu, Xiaohong Chen, Zhi Jin, Yang Liu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 REprompt是一种基于需求工程的多代理提示优化框架,旨在通过根植需求工程原则来优化系统和用户提示,提升智能软件开发中的提示生成效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19469 2026-01-26 cs.SD cs.MM 50%

MusiCRS: Benchmarking Audio-Centric Conversational Recommendation

MusiCRS:面向音频导向的对话推荐基准测试

Rohan Surana, Amit Namburi, Gagan Mundada, Abhay Lal, Zachary Novack, Julian McAuley, Junda Wu

机构 * University of California, San Diego, USA(加州大学圣地亚哥分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 MusiCRS通过链接Reddit用户对话与音乐曲目,为音频导向的对话推荐提供首个基准测试,揭示了跨模态整合的局限性,并释放了相关数据集和代码以促进研究进展。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15465 2026-01-23 cs.HC 50%

Cloning the Self for Mental Well-Being: A Framework for Designing Safe and Therapeutic Self-Clone Chatbots

为心理健康福祉克隆自我:一种设计安全且治疗性自我克隆聊天机器人的框架

Mehrnoosh Sadat Shirvani, Jackie Crowley, Cher Peng, Jackie Liu, Thomas Chao, Suky Martinez, Laura Brandt, Ig-Jae Kim, Dongwook Yoon

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出了一种设计安全且治疗性自我克隆聊天机器人的框架,旨在通过跨学科方法解决身份混淆和伦理风险,促进心理健康福祉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15352 2026-01-23 cs.SE 50%

A Prompt-Based Framework for Loop Vulnerability Detection Using Local LLMs

基于提示的本地LLM循环漏洞检测框架

Adeyemi Adeseye, Aisvarya Adeseye

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出基于本地LLM的循环漏洞检测框架,利用提示技术提高代码分析的准确性和安全性,验证Phi模型在性能上的优势。

Comments Accepted and Waiting to be published ICAI'25: 27th International Conference on Artificial Intelligence https://american-cse.org/csce2025/conferences-ICAI

详情

展开后加载摘要…

URL PDF HTML 收藏