arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7464 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7464 篇

2603.29820 2026-04-01 cs.SD 50%

SIREN: Spatially-Informed Reconstruction of Binaural Audio with Vision

SIREN:基于视觉的双耳音频重建

Mingyeong Song, Seoyeon Ko, Junhyug Noh

机构 * Ewha Womans University, Seoul, Korea(韩国首尔梨花女子大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 SIREN通过视觉引导将单声道音频转换为双耳音频,利用双头自注意力机制生成场景图,并通过两阶段波形域融合抑制混响,提升时间频率和相位敏感度指标。

Comments 5 pages, 1 figure, to appear in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28428 2026-03-31 cs.CY cs.MA 50%

Synergy: A Next-Generation General-Purpose Agent for Open Agentic Web

Synergy: 一个下一代通用智能体用于开放性智能体网络

Xiaohang Nie, Zihan Guo, Kezhuo Yang, Zhichong Zheng, Bochen Ge, Shuai Pan, Zeyi Chen, Youling Xiang, Yu Zhang, Weiwen Liu, Yuanjian Zhou, Weinan Zhang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出Synergy,一个用于开放性智能体网络的通用智能体架构,强调智能体间的协作、身份管理和持续进化,以实现开放网络中的社会集成。

Comments A tech report of a general-purpose agent architecture and human-agent society, 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26990 2026-03-31 hep-ph 50%

Agentic Diagrammatica: Towards Autonomous Symbolic Computation in High Energy Physics

代理图示学:迈向高能物理中自主符号计算

Tony Menzo, Alexander Roman, George T. Fleming, Sergei Gleyzer, Konstantin T. Matchev, Stephen Mrenna

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出Diagrammatica,通过HEPTAPOD框架扩展实现LLM代理的多步骤理论计算。通过工具约束计算和知识接地方法,实现符号计算的精确性与可验证性,验证了在高能物理中的应用效果。

Comments 54 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26701 2026-03-31 physics.soc-ph cs.CY 50%

From Heard to Lived Opinions: Simulating Opinion Dynamics with Grounded LLM Agents in Economic Environments

从听到的意见到 lived 的意见:利用 grounded LLM 代理在经济环境中模拟意见动态

Ryuji Hashimoto, Masahiro Kaneko, Ryosuke Takata, Takehiro Takayanagi, Kiyoshi Izumi

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出一种基于经济环境的LLM代理框架,通过模拟个体经济经历影响意见动态,揭示个体与群体意见变化的机制及经济因素对极化的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26329 2026-03-30 cs.SE 50%

Large Language Models for Software Testing Education: an Experience Report

大型语言模型在软件测试教育中的应用:经验报告

Peng Yang, Yunfeng Zhu, Chao Chang, Shengcheng Yu, Zhenyu Chen, Yong Tang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过混合方法研究,探讨学生在使用LLM进行测试任务时的交互问题及教学策略,提出轻量级提示框架以提升测试脚本生成能力。

Comments Paper Accepted by the ACM International Conference on the Foundations of Software Engineering (FSE 2026) Software Engineering Education Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16123 2026-03-30 cs.HC 50%

"You Can Actually Do Something'': Shifts in High School Computer Science Teachers' Conceptions of AI/ML Systems and Algorithmic Justice

你实际上可以做些什么

Daniel J. Noh, Deborah A. Fields, Yasmin B. Kafai, Danaé Metaxa

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究探讨了高中计算机教师在参与设计一年后,对AI/ML系统理解的转变,发现教师观点更加具体、批判性和主动性,强调通过教育角色关注算法正义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09575 2026-03-27 cs.RO 50%

Traffic Scene Generation from Natural Language Description for Autonomous Vehicles with Large Language Model

基于大语言模型的自然语言描述生成交通场景用于自动驾驶车辆

Bo-Kai Ruan, Hao-Tang Tsui, Yung-Hui Li, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Carnegie Mellon University(卡内基梅隆大学) AI Research Center, Hon Hai Research Institute(鸿海研究院人工智能研究中心)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出TTSG框架,通过自然语言生成可控交通场景,解决文本到空间布局、无预设位置场景构建及多智能体行为规划问题,实验表明其在安全关键场景中碰撞率低且提升驾驶 captioning 模型性能。

Comments Accepted by WAD@CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24535 2026-03-26 cs.CL cs.CY 50%

Representation Learning to Study Temporal Dynamics in Tutorial Scaffolding

基于表示学习研究教程支架的动态过程

Conrad Borchers, Jiayi Zhang, Ashish Gurung

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过对话语义对齐分析,揭示了教程支架中任务对齐和时间模式的系统差异,证明角色特定语义对齐能预测教学进展。

Comments Accepted as short paper to the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21686 2026-03-26 cs.MA 50%

Is AI Ready for Multimodal Hate Speech Detection? A Comprehensive Dataset and Benchmark Evaluation

人工智能是否准备好进行多模态仇恨言论检测?一个全面的数据集和基准评估

Rui Xing, Qi Chai, Jie Ma, Jing Tao, Pinghui Wang, Shuming Zhang, Xinping Wang, Hao Wang

专题命中 视觉定位与Grounding :multimodal large language model(abstract)

AI总结 本文提出M^3数据集,通过七种专门代理生成细粒度仇恨标签和理由,揭示现有多模态模型在处理真实世界语境时的不足,强调需发展上下文感知的多模态架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24021 2026-03-26 cs.RO 50%

QuadFM: Foundational Text-Driven Quadruped Motion Dataset for Generation and Control

QuadFM: 用于生成与控制的四足运动基础数据集

Li Gao, Fuzhi Yang, Jianhui Chen, Liu Liu, Yao Zheng, Yang Cai, Ziqiao Li

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 QuadFM 是首个大规模高保真四足运动数据集,包含11784个运动片段,涵盖多种运动、交互和情绪表达行为,支持语言驱动的运动生成与控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23938 2026-03-26 cs.CL 50%

OmniACBench: A Benchmark for Evaluating Context-Grounded Acoustic Control in Omni-Modal Models

OmniACBench:一种评估多模态模型上下文感知语音控制的基准

Seunghee Kim, Bumkyu Park, Kyudan Jung, Joosung Lee, Soyoon Kim, Jeonghoon Kim, Taeuk Kim, Hwiyeol Jo

机构 * Hanyang University(翰阳大学) Seoul National University(首尔国立大学) KAIST AI(韩国科学技术院人工智能研究所) NAVER Cloud(NAVER云)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 OmniACBench评估多模态模型在上下文感知语音生成中的能力,通过语音速率、音调等六种特征验证,揭示模型在多模态整合中的瓶颈及三种常见失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23828 2026-03-26 cs.SE cs.HC 50%

Bridging the Interpretation Gap in Accessibility Testing: Empathetic and Legal-Aware Bug Report Generation via Large Language Models

弥合可访问性测试中的解释鸿沟:通过大语言模型生成共情且法律意识的缺陷报告

Ryoya Koyama, Zhiyao Wang, Devi Karolita, Jialong Li, Kenji Tei

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出HEAR框架,通过语义切片和视觉定位重建UI上下文,注入残疾导向的人设并多层推理,生成共情且法律意识的缺陷报告,提升非专业人士对用户伤害和合规风险的认知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01287 2026-03-26 cs.CR 50%

Compliance as a Trust Metric

合规作为信任度量

Wenbo Wu, George Konstantinidis

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出通过新型自动化合规引擎ACE,将合规性作为定量动态信任度量,通过量化模型评估违规严重性,实现更透明、可问责的TRMS。

Journal ref Financial Cryptography and Data Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24856 2026-03-26 econ.TH cs.AR cs.CE cs.ET 50%

Advances in Agentic AI: Back to the Future

代理AI的进展:回到未来

Sergio Alvarez-Telena, Marta Diez-Fernandez

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文探讨代理AI与算法化领域的融合,提出清晰的概念定义和分析框架,回顾过去十年的方法和技术进展,并提出M1和M2的架构概念,为未来二十年的研究和转型制定计划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23013 2026-03-25 cs.CL 50%

Knowledge Access Beats Model Size: Memory Augmented Routing for Persistent AI Agents

知识访问胜过模型规模:基于对话记忆的持久AI代理路由

Xunzhuo Liu, Bowei He, Xue Liu, Andy Luo, Haichen Zhang, Huamin Chen

机构 * vLLM Semantic Router Project(vLLM语义路由器项目) MBZUAI McGill University(麦吉尔大学) Mila AMD Red Hat(红帽)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出利用对话记忆提升AI代理效率,通过轻量模型结合检索信息,使小模型在用户特定查询中表现优于大模型,证明知识访问比模型规模更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22704 2026-03-25 cs.CL 50%

Synthetic or Authentic? Building Mental Patient Simulators from Longitudinal Evidence

合成还是真实?从纵向证据构建心理健康患者模拟器

Baihan Li, Bingrui Jin, Kunyao Lan, Ming Wang, Mengyue Wu

机构 * SJTU Paris Elite Institute of Technology(上海交通大学巴黎精英理工学院) X-LANCE Lab(X-LANCE实验室) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算机与信息系统学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出DEPROFILE框架,通过整合多源数据构建统一患者档案,提升对话真实性和行为多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21898 2026-03-25 cs.HC 50%

From Scores to Strategies: Towards Gaze-Informed Diagnostic Assessment for Visualization Literacy

从分数到策略:面向可视化素养的凝视引导诊断评估

Kathrin Schnizer

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出通过凝视数据补充传统测试,以更全面评估读者在可视化信息处理中的认知负荷和策略差异,推动评估从二元分类向精细化描述转变。

Comments 4 pages, Workshop on Data Literacy for the 21st Century at CHI 2026, April 26, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14425 2026-03-25 cs.DB 50%

Time and Relations into Focus: Ontological Foundations of Object-Centric Event Data

时间与关系聚焦:对象导向事件数据的本体论基础

Hosna Hooshyar, Mattia Fumagalli, Marco Montali, Giancarlo Guizzardi

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出基于本体论的对象导向事件数据模型,通过三步方法解决现有模型在时间与动态关系方面的不足,增强表达能力与清晰度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01212 2026-03-24 physics.optics quant-ph 50%

BIFROST: A First-Principles Model of Polarization Mode Dispersion in Optical Fiber

BIFROST:光纤偏振模色散的首原则模型

Patrick R. Banner, Steven L. Rolston, Joseph W. Britton

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 BIFROST是首个基于物理原理的光纤偏振模色散模型,通过物理参数如环境温度和外部应力研究真实光纤,用于量子网络中偏振编码的波分复用PMD补偿方案预测。

Comments Minor edits and additions following peer review; 16 pages + references, 8 figures, 2 tables

Journal ref Phys. Rev. Applied 25(3), 034054 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19267 2026-03-23 cs.CL cs.IR 50%

Reviewing the Reviewer: Graph-Enhanced LLMs for E-commerce Appeal Adjudication

审查审查者:图增强的大语言模型用于电商争议裁决

Yuchen Du, Ashley Li, Zixi Huang

机构 * Purdue University(普渡大学) Amazon(亚马逊)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出图增强的大语言模型,通过显式动作建模和冲突建模解决电商争议裁决中的信息不对称问题,提升裁决一致性。

Comments 10 pages, 3 figures, KDD 2026 Applied Data Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19195 2026-03-20 eess.AS cs.CL cs.SD 50%

How Auditory Knowledge in LLM Backbones Shapes Audio Language Models: A Holistic Evaluation

LLM骨干中的听觉知识如何塑造音频语言模型:全面评估

Ke-Han Lu, Szu-Wei Fu, Chao-Han Huck Yang, Zhehuai Chen, Sung-Feng Huang, Chih-Kai Yang, Yi-Cheng Lin, Chi-Yuan Hsiao, Wenze Ren, En-Pei Hu, Yu-Han Huang, An-Yu Cheng, Cheng-Han Chiang, Yu Tsao, Yu-Chiang Frank Wang, Hung-yi Lee

机构 * National Taiwan University, Taiwan(国立台湾大学) NVIDIA Academia Sinica, Taiwan(台湾“学术院”)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究比较不同LLM在文本仅和音频基础设置下的表现,揭示听觉知识在不同家族间差异显著,文本结果与音频性能强相关。

Comments Project website: https://kehanlu.github.io/AKB

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17806 2026-03-19 cs.HC 50%

Building a "-Sensitive Design" Methodology from Political Philosophies or Ideologies

从政治哲学或意识形态构建‘-敏感设计’方法论

Anthony Maocheia-Ricci, Edith Law

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出‘-敏感设计’方法论,结合政治或意识形态价值规范设计过程,通过依赖敏感设计实例展示其应用,并呼吁拓展哲学与设计结合的研究领域。

Comments Position paper for the CHIdeology workshop at CHI 2026, Barcelona. https://ideologies.digital

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17659 2026-03-19 cs.SE 50%

From Symbol to Meaning: Ontological and Philosophical Reflections on Large Language Models in Information Systems Engineering

从符号到意义:关于大语言模型在信息系统工程中的本体论与哲学反思

José Palazzo Moreira de Oliveira

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 大语言模型标志着信息系统工程理论基础的转折点,本文探讨其如何重构语言、意义与系统设计的关系,强调需建立透明且伦理一致的框架以尊重人类中心的知识过程。

Comments This paper constitutes a substantially extended version of a conference article to be published in the proceedings of the International Conference on Enterprise Information Systems ICEIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15677 2026-03-18 cs.CL 50%

MedArena: Comparing LLMs for Medicine-in-the-Wild Clinician Preferences

MedArena: 比较医疗领域LLM的临床医生偏好

Eric Wu, Kevin Wu, Jason Hom, Paul H. Yi, Angela Zhang, Alejandro Lozano, Jeff Nirschl, Jeff Tangney, Kevin Byram, Braydon Dymm, Narender Annapureddy, Eric Topol, David Ouyang, James Zou

机构 * Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系) Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) Division of Hospital Medicine, Department of Medicine, Stanford School of Medicine(斯坦福医学院医学部住院医学科) Department of Radiology, St. Jude Children's Research Hospital(圣 Jude 儿童研究医院放射科) University of California, San Francisco(旧金山大学) Department of Pathology and Laboratory Medicine, University of Wisconsin School of Medicine and Public Health(威斯康星大学医学与公共卫生学院病理学与实验室医学系) Doximity, San Francisco, CA, USA(Doximity公司) Department of Medicine, Division of Rheumatology and Immunology, Vanderbilt University Medical Center(范德比尔特大学医学中心医学系风湿病与免疫学科) Department of Neurology, Charleston Area Medical Center(查尔斯顿医疗中心神经科) Department of Translational Medicine, Scripps Research Translational Institute(斯克里普斯研究转化研究所转化医学系) Kaiser Permanente Division of Research(凯撒医疗集团研究部)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 MedArena通过真实临床问题和医生偏好比较LLM,揭示临床实用性与基准性能的差异,强调可读性和临床细节的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13713 2026-03-18 cs.CL 50%

On Theoretically-Driven LLM Agents for Multi-Dimensional Discourse Analysis

关于理论驱动的LLM代理在多维话语分析中的应用

Maciej Uberna, Michał Wawer, Jarosław A. Chudziak, Marcin Koszowy

机构 * Laboratory of The New Ethos, Warsaw University of Technology, Poland(新伦理实验室,华沙理工大学,波兰) Faculty of Electronics and Information Technology, Warsaw University of Technology, Poland(电子与信息技术学院,华沙理工大学,波兰)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出一种多代理框架,通过引入显式理论知识提升话语分析中改写策略的识别能力,实验表明理论增强的LLM代理在检测强化和泛化等任务上表现显著优于基线模型,宏F1分数提升近30%。

Comments 8 pages, 4 figures, 3 tables. This is the accepted version of the paper presented at the 18th International Conference on Agents and Artificial Intelligence (ICAART 2026), Marbella, Spain

Journal ref Proceedings of the 18th International Conference on Agents and Artificial Intelligence (ICAART 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14054 2026-03-17 cs.SE 50%

LegacyTranslate: LLM-based Multi-Agent Method for Legacy Code Translation

LegacyTranslate: 基于LLM的多智能体方法用于遗留代码翻译

Zahra Moti, Heydar Soudani, Jonck van der Kogel

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出LegacyTranslate多智能体框架,通过三个智能体提升遗留代码翻译质量,实验显示初始翻译智能体达到45.6%可编译输出,结合API grounding和refinement智能体进一步提升编译和测试通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13773 2026-03-17 cs.CL 50%

LiveWeb-IE: A Benchmark For Online Web Information Extraction

LiveWeb-IE:一个在线网页信息提取的基准测试

Seungbin Yang, Jihwan Kim, Jaemin Choi, Dongjin Kim, Soyoung Yang, ChaeHun Park, Jaegul Choo

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出LiveWeb-IE基准测试,用于评估在线网页信息提取系统,通过活体网站和多阶段代理框架VGS,提升信息提取的准确性和鲁棒性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13267 2026-03-17 cs.CY cs.HC cs.SE 50%

Gamification Preferences in Digital Education: The Role of Individual Differences

数字化教育中的游戏化偏好:个体差异的作用

Anna Katharina Ricker, Kai Marquardt, Lucia Happe

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究探讨了学习者特征和任务情境如何影响游戏化元素的偏好,发现年龄是最重要的预测因素,学习活动类型显著影响游戏化元素的适用性。

Comments 32 pages, 4 Figures, Springer EAIT in review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18946 2026-03-17 q-bio.NC 50%

Schema-based active inference supports rapid generalization of experience and frontal cortical coding of abstract structure

基于模式的主动推断支持经验的快速泛化和前额叶皮层对抽象结构的编码

Toon Van de Maele, Tim Verbelen, Dileep George, Giovanni Pezzulo

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出基于模式的分层主动推断框架,通过模拟展示其在空间导航任务中实现快速模式泛化的能力,并揭示前额叶皮层中与模式相关的神经编码机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12649 2026-03-16 cs.RO 50%

Autonomous Integration and Improvement of Robotic Assembly using Skill Graph Representations

基于技能图表示的机器人装配自主集成与改进

Peiqi Yu, Philip Huang, Chaitanya Chawla, Guanya Shi, Jiaoyang Li, Changliu Liu

机构 * Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出基于技能图表示的机器人装配系统自主集成与持续改进框架,通过语义级规划与执行接口实现系统配置、执行、评估与学习的统一,提升装配系统的适应性与可重用性。

详情

展开后加载摘要…

URL PDF HTML 收藏