arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7464 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7464 篇

2601.06580 2026-05-27 cs.CL 50%

Stylistic Evolution and LLM Neutrality in Singlish Language

新加坡英语中的文体演变与LLM中立性

Linus Tze En Foo, Weihan Angela Ng, Wenkai Li, Lynnette Hui Xian Ng

机构 * Independent Researcher(独立研究者) ETH Zürich(苏黎世联邦理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 通过分析十年间非正式数字信息的文体变化,研究大型语言模型(LLM)能否生成时间中立的输出,发现文体可分离性随时间距离增加,且LLM在真实性和时间中立性之间存在结构性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25869 2026-05-26 cs.CL 50%

Mitigating Provenance-Role Collapse in Long-Term Agents via Typed Memory Representation

通过类型化记忆表示缓解长期智能体中的来源-角色崩溃

Zhengda Jin, Bingbing Wang, Jing Li, Ruifeng Xu, Min Zhang

机构 * Harbin Institute of Technology(哈尔滨工业大学) The Hong Kong Polytechnic University(香港理工大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出MemIR类型化记忆中间表示,通过结构约束实现来源监控,解决长期智能体中因无结构存储导致的来源-角色崩溃问题,在LoCoMo和BEAM-100K上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06218 2026-05-26 cs.RO 50%

Few-Shot Neural Differentiable Simulator: Real-to-Sim Rigid-Contact Modeling

少样本神经可微模拟器:真实到模拟的刚体接触建模

Zhenhao Huang, Siyuan Luo, Bingyang Zhou, Ziqiu Zeng, Jason Pho, Fan Shi

机构 * National University of Singapore(新加坡国立大学) Prana Lab(Prana实验室)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出一种结合解析公式物理一致性与图神经网络表示能力的少样本真实到模拟方法,通过少量真实数据校准解析模拟器生成大规模合成数据集,并引入基于网格的图神经网络隐式建模刚体前向动力学及碰撞检测的代理梯度,实现完全可微性,从而提升模拟保真度和策略学习效率。

Comments Accepted in ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25216 2026-05-26 cs.RO 50%

InvariantCloud: A Globally Invariant, Uniquely Indexed Point Cloud Framework for Robust 6-DoF Tactile Pose Tracking

InvariantCloud:一种全局不变、唯一索引的点云框架,用于鲁棒的6自由度触觉姿态跟踪

Pengfei Ye, Yuxiang Ma, Yi Zhou, Wei Chen, Wenzhen Dong, Molong Duan

机构 * Department of Mechanical and Aerospace Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学机械与航空航天工程系) Department of Mechanical Engineering, Massachusetts Institute of Technology(麻省理工学院机械工程系) Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系)

专题命中 视觉定位与Grounding :vision-language model(abstract)

AI总结 提出InvariantCloud框架,利用视觉触觉传感器上表面标记星座的全局不变性,通过一次性全局不变点云配准实现6自由度物体姿态估计,抑制累积漂移并准确估计偏航旋转,在长序列操作任务中展现出高精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24683 2026-05-26 cs.NI 50%

B.O.D.Y.: Beyond-Overlay Deterministic topologY -- A Layer-2 Declarative Ground Truth for AIOps Pipelines under Fragmented Administrative Boundaries

B.O.D.Y.: 超越覆盖的确定性拓扑——面向碎片化管理边界的AIOps管道的第二层声明式地面真相

Matheus Marques, Carlos Alberto Malcher, Cledson de Sousa

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出B.O.D.Y.方法,通过多模态数据融合管道解决跨校区异构网络中的拓扑漂移和未管理物理段问题,为AIOps提供确定性的物理层地面真相。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04889 2026-05-26 physics.med-ph 50%

FENCE: Flexible Electric Noise reduCtion Endo-shield for the Suppression of Electromagnetic Interference in Low-Field MRI

FENCE:用于抑制低场MRI电磁干扰的柔性电噪声减少内屏蔽

Julia Pfitzer, Martin Uecker, Hermann Scharfetter

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对低场MRI电磁干扰问题,提出FENCE柔性内屏蔽方法,通过阻断电容耦合有效抑制EMI,在保持系统便携性的同时显著提升图像质量。

Comments 21 pages, 13 figures, 8 tables

Journal ref NMR in Biomedicine 2026;39:e70287

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24351 2026-05-26 cs.CL 50%

How Much Structure Do LLMs Need? Evaluating LLMs for Bibliometric Cluster Description

LLM 需要多少结构?评估 LLM 用于文献计量聚类描述

Abraham Camelo-Guerrero, Jairo Diaz-Rodriguez

机构 * School of Information Technology(信息科技学院) Department of Mathematics and Statistics(数学与统计学系) York University(约克大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究通过六种不同证据和结构水平的流水线,评估文献计量结构是否改善 LLM 辅助的聚类描述生成,发现混合工作流(算法提供可审计结构,LLM 生成可读描述)效果最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24291 2026-05-26 cs.SD cs.CL cs.MM 50%

Rubato: Transcribing Piano Music with Timestamps

Rubato: 带时间戳的钢琴音乐转录

Nazif Can Tamer, Victoria Ebert, Guang Yang, Noah A. Smith

机构 * Paul G. Allen School of Computer Science & Engineering, University of Washington(保罗·G·阿伦计算机科学与工程学院,华盛顿大学) Allen Institute for AI(阿伦人工智能研究所)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出一个名为Rubato的提示条件编码器-解码器模型,结合新的多声部音乐文本表示InterMo,实现从音频生成带时间戳的钢琴乐谱,在记谱准确性上优于现有级联方法。

Comments 18 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24218 2026-05-26 cs.CL 50%

QUEST: Training Frontier Deep Research Agents with Fully Synthetic Tasks

QUEST:使用完全合成任务训练前沿深度研究代理

Jian Xie, Tianhe Lin, Zilu Wang, Yuting Ning, Yuekun Yao, Tianci Xue, Zhehao Zhang, Zhongyang Li, Kai Zhang, Yufan Wu, Shijie Chen, Boyu Gou, Mingzhe Han, Yifei Wang, Vint Lee, Xinpeng Wei, Xiangjun Wang, Yu Su, Huan Sun

机构 * The Ohio State University(俄亥俄州立大学) Amazon AGI SF Lab(亚马逊人工智能SF实验室)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出QUEST系列模型,通过统一规则树合成训练数据,结合中训练、监督微调和强化学习,使开放模型在深度研究任务上接近或超越闭源前沿代理。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11138 2026-05-25 cond-mat.stat-mech cs.IT hep-th math.IT stat.ME 50%

Field Theory of Data: Anomaly Detection via the Functional Renormalization Group. The 2D Ising Model as a Benchmark

数据的场论:基于泛函重整化群的异常检测——以二维Ising模型为基准

Riccardo Finotello, Vincent Lahoche, Parham Radpay, Dine Ousmane Samary

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文建立高噪声异常检测与非平衡场论重整化群流之间的对应关系,通过二维Model A的泛函重整化群分析,证明噪声信号比作为物理温度,并利用Onsager精确解验证该方法在临界阈值识别上误差低于4%,优于KL散度。

Comments 15 pages, 2 appendixes; correction of typos and captions, improved clarity

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23361 2026-05-25 physics.optics 50%

Approaching physical limits of latent dimensionality in optical computing

接近光学计算中潜在维度的物理极限

Zhenyu Zhao, Zijun Qiu, Xuan Hu, Yao Zhou, Jinlong Xiang, Youlve Chen, Chaojun Xu, Yuchen Yin, Tao Lin, Yikai Su, Xuhan Guo

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 通过探索有界光学域潜在维度的物理极限,设计并实现了超紧凑多模光子处理器,在实验上逼近这些极限,为光学计算架构提供了缺失的理论参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23193 2026-05-25 cs.HC cs.CL cs.CY cs.MA 50%

CultivAgents: Cultivating Relationship-Centered Multi-Agent Systems for Personalized Gardening

CultivAgents:培育以关系为中心的多智能体系统以实现个性化园艺

Yiyang Wang, Moeiini Reilly, Britney Johnson, Kefei Yan, Alex Cabral, Josiah Hester

机构 * Georgia Institute of Technology(佐治亚理工学院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出 CultivAgents,一个基于关怀伦理、协调经验、环境和民族植物学三个专业智能体的多智能体系统,为社区园丁提供个性化、社会文化背景化的园艺支持,并通过混合方法研究验证其有效性。

Comments Preprint, 9 pages. Website: https://hello-diana.github.io/CultivAgents/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22027 2026-05-22 cs.CR 50%

Parser-Free Querying of Security Logs

无解析器的日志查询

Evan Luo, Julien Piet, David Wagner

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出Sieve系统,通过将大型语言模型与轻量级自动提取的日志格式上下文相结合,生成可执行的查询代码,从而在无需解析器的情况下实现安全日志的高效查询,显著降低了复杂时间序列和跨事件查询的错误率。

Comments 21 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21816 2026-05-22 cs.CY 50%

Barriers to Evidence in AI-Related Cases and the Privatization of Proof

人工智能相关案件中的证据障碍与证明的私有化

Sarah H. Cen, Hannah Ismael, Lucia Zheng

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文研究了人工智能相关案件中证据获取的障碍,探讨了由于访问权、资源和专业知识的不对称性导致的证明私有化问题,并提出了一种解决AI访问争议的三步测试法。

Comments 42 pages, 0 figures, 1 table, The 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26), June 25--28, 2026, Montreal, QC, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21690 2026-05-22 cs.SE 50%

The 2nd Workshop on Agile Practice & Research: A Summary and Call For Research

第二届敏捷实践与研究研讨会:总结与研究呼吁

Karen Eilers, Michael Neumann, Eva-Maria Schön, Mali Senapathi, Maria Rauschenberger, Tiago Silva da Silva

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文总结了第二届敏捷实践与研究研讨会,探讨了理论、时间与转移三个研究与实践之间的差距,并提出了加强研究与实践协作的三个研究呼吁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17776 2026-05-21 cs.RO 50%

CosFly-Track: A Large-Scale Multi-Modal Dataset for UAV Visual Tracking via Multi-Constraint Trajectory Optimization

CosFly-Track: 一个大规模多模态数据集,用于通过多约束轨迹优化的无人机视觉跟踪

Xiangyue Wang, Hanxuan Chen, Songsheng Cheng, Ruilong Ren, Jie Zheng, Shuai Yuan, Tianle Zeng, Hanzhong Guo, Kangli Wang, Ji Pei

机构 * Autel Robotics(Autel机器人公司) Nanjing University(南京大学) Peking University(北京大学) Southern University of Science and Technology(南方科技大学) University of Hong Kong(香港大学)

专题命中 视觉定位与Grounding :vision-language model(abstract)

AI总结 本文提出CosFly-Track数据集,用于无人机视觉跟踪任务,通过多约束轨迹优化生成大规模多模态数据,提升了动态目标跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05253 2026-05-21 cs.IR 50%

EnterpriseRAG-Bench: A RAG Benchmark for Company Internal Knowledge

EnterpriseRAG-Bench: 一个用于企业内部知识的RAG基准测试

Yuhong Sun, Joachim Rahmfeld, Chris Weaver, Weijia Chen, Roshan Desai, Wenxi Huang, Mark H. Butler

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出EnterpriseRAG-Bench,一个包含50万文档和500个问题的基准测试,用于评估和比较基于检索增强生成(RAG)方法在企业内部知识处理中的性能。

Comments Code and dataset available at https://github.com/onyx-dot-app/EnterpriseRAG-Bench or https://huggingface.co/datasets/onyx-dot-app/EnterpriseRAG-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16359 2026-05-21 cs.SE 50%

LLM4Log: A Systematic Review of Large Language Model-based Log Analysis

LLM4Log: 大型语言模型基于日志分析的系统综述

Zeyang Ma, Jinqiu Yang, Tse-Hsun Chen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文系统综述了基于大型语言模型的日志分析,涵盖从日志生成维护到解析结构化及下游任务如异常检测、故障预测、根本原因分析和日志摘要的全流程,总结了常见设计模式和评估实践,并指出可靠实际应用中的关键挑战和开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22453 2026-05-20 cs.CL cs.SI 50%

XNote: Benchmarking Automated Community Notes Generation for Image-based Contextual Deception

XNote: 对基于图像的上下文欺骗的自动社区笔记生成进行基准测试

Jin Ma, Jingwen Yan, Mohammed Aldeen, Ethan Anderson, Taran Kavuru, Jinkyung Katie Park, Feng Luo, Long Cheng

机构 * School of Computing, Clemson University(克莱姆森大学计算机学院)

专题命中 视觉定位与Grounding :vision language model(abstract)

AI总结 本文研究了基于图像的上下文欺骗的自动社区笔记生成任务,提出了一个真实世界数据集XNote,并对前沿大视觉语言模型和商业工具进行了基准测试,以评估其在欺骗检测和笔记生成任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18118 2026-05-19 q-bio.NC 50%

Functional Whole-Brain Models: A New Framework for Unifying Brain Structure and Cognitive Function

功能全脑模型:一种统一脑结构与认知功能的新框架

Mario Senden, Leonardo Dalla Porta, Jan Fousek, Jorge F. Mejias, Gorka Zamora-López

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出功能全脑模型(fWBMs),旨在整合脑结构和动态真实性与任务执行能力,通过三个支柱路线图在短期、中期和长期目标上推进,为脑科学研究提供新的工具和跨尺度假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08439 2026-05-19 cs.CL 50%

Can Language Models Identify Side Effects of Breast Cancer Radiation Treatments?

语言模型能否识别乳腺癌放射治疗的副作用?

Natalie Seah, Danielle S. Bitterman, Daphna Spiegel, Thomas Hartvigsen

机构 * University of Virginia(弗吉尼亚大学) Mass General Brigham Dana-Farber Cancer Institute Harvard Medical School(麻省总医院达纳-法伯癌症研究所哈佛医学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究探讨了语言模型在识别乳腺癌放射治疗副作用中的能力,通过评估多种语言模型在不同提示下的表现,揭示了其在精度、召回率及罕见长期副作用识别上的局限性,并提出了改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05966 2026-05-18 cs.CL 50%

FinReporting: An Agentic Workflow for Localized Reporting of Cross-Jurisdiction Financial Disclosures

FinReporting: 一种用于跨司法管辖区财务披露本地化报告的代理工作流

Fan Zhang, Mingzi Song, Rania Elbadry, Yankai Chen, Shaobo Wang, Yixi Zhou, Xunwen Zheng, Yueru He, Yuyang Dai, Georgi Georgiev, Ayesha Gull, Muhammad Usman Safder, Fan Wu, Liyuan Meng, Fengxian Ji, Junning Zhao, Xueqing Peng, Jimin Huang, Yu Chen, Xue, Liu, Preslav Nakov, Zhuohan Xie

机构 * MBZUAI The University of Tokyo(东京大学) Meiji Gakuin University(明治大学) McGill University(麦吉尔大学) Kyoto University(京都大学) Columbia University(哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出FinReporting,一种代理工作流,用于跨司法管辖区的财务披露本地化报告。该系统构建了涵盖损益表、资产负债表和现金流量表的统一本体,将报告分解为可审计的阶段,并通过约束验证器提升一致性和可靠性。

Comments Accepted at ACL 2026 Demo Track. 9 pages, including figures and tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15474 2026-05-18 cs.IR 50%

Jobs' AI Exposure Should Be Measured from Evidence, Not Model Priors

AI 对岗位的影响应从证据而非模型先验来衡量

Luca Mouchel, Pierre Bouquet, Yossi Sheffi

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文主张通过基于证据的方法测量AI对岗位的影响,而非仅依赖LLM先验。提出一个检索增强框架,利用公开权重推理和检索到的新闻和论文摘要,为O*NET 30.2中的18796个职业-任务对分配AI影响标签,优于零样本基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15019 2026-05-15 cs.CL 50%

From Scenes to Elements: Multi-Granularity Evidence Retrieval for Verifiable Multimodal RAG

从场景到元素:面向可验证多模态RAG的多粒度证据检索

Guanhua Chen, Chuyue Huang, Yutong Yao, Shudong Liu, Xueqing Song, Lidia S. Chao, Derek F. Wong

机构 * NLP 2 CT Lab, Department of Computer and Information Science, University of Macau(NLP2CT实验室,计算机与信息科学系,澳门大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出GranuRAG框架,通过多粒度跨模态对齐和元素级检索,解决多模态RAG中粗粒度证据与细粒度查询不匹配的问题,提升可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14169 2026-05-15 cs.CL 50%

BOOKMARKS: Efficient Active Storyline Memory for Role-playing

BOOKMARKS: 为角色扮演高效主动故事线记忆

Letian Peng, Ziche Liu, Yiming Huang, Longfei Yun, Kun Zhou, Yupeng Hou, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 BOOKMARKS通过主动初始化和维护任务相关书签,提升角色扮演代理的长期一致性,有效避免信息丢失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12905 2026-05-14 cs.IR 50%

Same Image, Different Meanings: Toward Retrieval of Context-Dependent Meanings

同一图像,不同含义:面向依赖上下文的含义检索

Ayuto Tsutsumi, Ryosuke Kohita

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究图像意义的上下文依赖性及其对检索的影响,提出L1-L4框架,探讨嵌入式叙事上下文对不同抽象层次检索效果的影响。

Comments SIGIR 2026 (short paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09335 2026-05-14 quant-ph 50%

Steganographic Entanglement Sharing

量子纠缠分发的隐写术

Bruno Avritzer, Todd A. Brun

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出利用量子数态和相干态在光学信道中实现量子信息传输,展示隐写术纠缠分发在非经典态传送中的实用性,即使存在主动窃听者。

Comments 9 pages, 7 figures

Journal ref Phys. Rev. A 112, 022604 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12059 2026-05-13 cs.HC cs.RO 50%

RoboBlockly Studio: Conversational Block Programming with Embodied Robot Feedback for Computational Thinking

RoboBlockly Studio:具有身体反馈的对话式积木编程用于计算思维

Leyi Li, Chenyu Du, Jiafei Sun, Erick Purwanto, Qing Zhang

机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出RoboBlockly Studio,结合积木编程、对话AI教学代理和具身机器人执行,通过迭代循环提升学生计算思维能力,探讨AI与机器人在教育中的应用。

Comments Accepted to ACM DIS 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11993 2026-05-13 cs.CL 50%

Towards Visually-Guided Movie Subtitle Translation for Indic Languages

面向视觉引导的电影字幕翻译:用于印地语等语言

Tarun Chintada, Kshetrimayum Boynao Singh, Asif Ekbal

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Indian Institute of Technology Patna(印度理工学院帕纳布分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文研究了视觉引导的电影字幕翻译,针对低资源印地语等语言,提出两种轻量视觉锚定策略,发现时间错位是长视频的主要障碍,而选择性视觉锚定能有效提升翻译质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11874 2026-05-13 cs.IR 50%

RecRM-Bench: Benchmarking Multidimensional Reward Modeling for Agentic Recommender Systems

RecRM-Bench:面向代理推荐系统的多维奖励建模基准测试

Wenwen Zeng, Jinhui Zhang, Hao Chen, Zhaoyu Hu, Yongqi Liang, Jiajun Chai, Dengcan Liu, Zhenfeng Liu, Shurui Yan, Minglong Xue, Xiaohan Wang, Wei Lin, Guojun Yin

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出RecRM-Bench,首个大规模多维奖励建模基准,涵盖指令遵循、事实一致性等四个维度,为训练复杂奖励模型提供基础数据。

详情

展开后加载摘要…

URL PDF HTML 收藏