arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7464 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7464 篇

2605.11796 2026-05-13 cs.LO 50%

On Knowledge Compilation For Two-Variable First-Order Logic

关于为二变量一阶逻辑进行知识编译

Qiaolan Meng, Juhua Pu, Hongting Niu, Yuyi Wang, Yuanhong Wang, Ondřej Kuželka

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究二变量一阶逻辑命题的地面化理论在DNNF基知识编译语言中的紧凑表示可能性及高效构建方法,证明一般情况下无法紧凑编译,并提出两阶段编译器利用命题地面化中的对称性,提升效率。

Comments 37 pages and 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11268 2026-05-13 cs.CR 50%

Context-Aware Spear Phishing: Generative AI-Enabled Attacks Against Individuals via Public Social Media Data

具有上下文意识的钓鱼攻击:通过公共社交媒体数据利用生成式AI对个人进行攻击

Elham Pourabbas Vafa, Sayak Saha Roy, Shirin Nilizadeh

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文研究了如何利用公开社交媒体数据和生成式AI自动化并扩大针对个人的个性化、上下文感知的钓鱼攻击。通过模块化框架结合多模态信号提取、沟通风格分析和攻击类型实例化,展示了七种攻击策略,并通过大规模多模型评估验证了生成式AI邮件在个性化、上下文相关性和说服力方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11144 2026-05-13 cs.RO 50%

Forecast-aware Gaussian Splatting for Predictive 3D Representation in Language-Guided Pick-and-Place Manipulation

面向预测的高斯点散布用于语言引导的抓取与放置操作中的预测3D表示

Kaixin Jia, Jiacheng Xu

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出Forecast-GS框架,通过预测3D状态提升语言引导的机器人操作性能,实验显示其在抓取与放置任务中优于基线方法,表明明确预测任务完成状态有助于更可靠的行动评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09808 2026-05-12 cs.CL 50%

Quantifying the Utility of User Simulators for Building Collaborative LLM Assistants

量化用户模拟器在构建协作大语言模型助手中的效用

Joseph Suh, Ayush Raj, Minwoo Kang, Serina Chang

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过实验评估用户模拟器的质量,发现基于细调模拟器训练的助手在真实人类交互中表现更优,且模拟器规模扩大对细调模拟器有效,但对角色扮演模拟器无帮助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09120 2026-05-12 cs.IR cs.SD 50%

Reddit2Deezer: A Scalable Dataset for Real-World Grounded Conversational Music Recommendation

Reddit2Deezer: 一个可扩展的现实世界基础对话音乐推荐数据集

Haven Kim, Julian McAuley

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出Reddit2Deezer数据集,基于19万独特的线程和叶子评论对,提供真实对话音乐推荐资源,包含原始和改写版本,链接音乐实体到Deezer标识符,支持未来内容基础对话推荐研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08860 2026-05-12 cond-mat.stat-mech math-ph math.MP 50%

A Closer Look on the Influence of Constraints Upon the Optimization of the Nonadditive Entropic Functional $S_{q}$

对约束对非加性熵函数S_q优化影响的深入研究

Leandro Lyra Braga Dognini, Constantino Tsallis

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文研究了非加性熵S_q在约束下的优化问题,推导了解存在的充分条件,并定义了有效温度和Helmholtz能量,揭示了q-指数分布的唯一性及经典系统与非线性动力学系统的联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22003 2026-05-12 cs.RO 50%

VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models

VP-VLA:作为视觉语言动作模型接口的视觉提示

Zixuan Wang, Yuxin Chen, Yuqi Liu, Jinhui Ye, Pengguang Chen, Changsheng Lu, Shu Liu, Bei Yu, Jiaya Jia

机构 * HKUST(香港科技大学) CUHK(香港大学) SmartMore(SmartMore公司)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 VP-VLA通过结构化视觉提示接口解耦高层推理与低层执行,提升空间精度和鲁棒性,实验证明优于现有端到端基线。

Comments Project page: https://visualprompt-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07789 2026-05-11 cs.HC 50%

Analyzing Human Heuristics and Strategies in Everyday Decision-Making Conversations for Conversational AI Design

分析日常决策对话中的人类启发式与策略以指导对话AI设计

Sora Kang, Soyun Jeon, Jinsu Eun, Kwangwon Lee, Chaerin Song, Minyoung Joo, Joonhwan Lee

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过分析955个真实韩国对话,揭示人们在决策中优先满足而非优化,发现启发式策略在探索阶段维持对话流畅,而规则策略在利用阶段有效推动解决,为对话AI设计提供认知理论支持。

Comments CogSci 2026 (Annual Meeting of the Cognitive Science Society 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07605 2026-05-11 cs.RO 50%

BrickCraft: Visuomotor Skill Composition with Situated Manual Guidance for Long-Horizon Interlocking Brick Assembly

BrickCraft: 基于情境手动指导的长视界互锁积木组装技能组合

Jichuan Yu, Bowei Li, Zhenran Tang, Guanxing Lu, Chuxiong Hu, Ruixuan Liu, Changliu Liu

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 BrickCraft通过情境手册将高层装配计划与物理执行连接,利用相对公式分解复杂任务为可重用的原始技能,实现长视界互锁积木组装。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07249 2026-05-11 cs.IR 50%

MLAIRE: Multilingual Language-Aware Information Retrieval Evaluation Protocal

MLAIRE: 多语言语言感知信息检索评估协议

Youngjoon Jang, Seongtae Hong, Hyeonseok Moon, Heuiseok Lim

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出MLAIRE评估协议,用于评估多语言信息检索中语言感知维度,引入语言偏好率和Lang-nDCG等指标,分析语义检索与查询语言偏好之间的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19791 2026-05-11 cs.CR 50%

Text-Based Personas for Simulating User Privacy Decisions

基于文本的隐私人物模拟

Kassem Fawaz, Ren Yi, Octavian Suciu, Rishabh Khandelwal, Hamza Harkous, Nina Taft, Marco Gruteser

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出Narriva方法,通过生成基于历史隐私决策的文本隐私人物,提升隐私研究的准确性与效率,实现87%的预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06311 2026-05-08 cs.RO 50%

Toward Visually Realistic Simulation: A Benchmark for Evaluating Robot Manipulation in Simulation

迈向视觉逼真模拟:评估机器人操作的基准测试

Yixin Zhu, Zixiong Wang, Jian Yang, Jin Xie, Jingyi Yu, Jiayuan Gu, Beibei Wang

机构 * Nanjing University(南京大学) Nankai University(南开大学) ShanghaiTech University(上海科技大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出VISER基准,通过高保真3D资产和物理渲染材料,评估机器人操作的视觉逼真度,提升仿真与现实性能的关联性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11409 2026-05-08 quant-ph 50%

When T-Depth Misleads: Predicting Fault-Tolerant Quantum Execution Slowdown under Magic-State Delivery Constraints

当T深度误导:在魔态交付限制下预测容错量子执行延迟

Boshuai Ye, Arif Ali Khan, Peng Liang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出通过slack ratio和Delta_max预测量子执行延迟,揭示静态T深度无法准确预测执行性能,实验证明Delta_max是预测延迟的最强指标。

Comments 10 pages, 10 figures. Code available at https://github.com/C2-Q/BARC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00631 2026-05-04 cs.CL cs.IR 50%

H-RAG at SemEval-2026 Task 8: Hierarchical Parent-Child Retrieval for Multi-Turn RAG Conversations

H-RAG在SemEval-2026任务8中的应用:多轮RAG对话中的层次父-子检索

Passant Elchafei, Hossam Emam, Mohamed Alansary, Monorama Swain, Markus Schedl

机构 * Johannes Kepler University Linz(约翰尼斯·开普勒大学林茨) Linz Institute of Technology(林茨技术学院) Artificial Intelligence Lab(人工智能实验室)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 H-RAG通过层次化父-子检索方法提升多轮RAG对话性能,结合密集-稀疏搜索与上下文重构,实现检索与生成的协同优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00353 2026-05-04 cs.IR 50%

Negative Data Mining for Contrastive Learning in Dense Retrieval at IKEA.com

密集检索中对比学习的负样本挖掘

Eva Agapaki, Amritpal Singh Gill

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出基于结构化负样本策略和LLM评估方法提升IKEA产品检索,通过生成语义挑战性负样本和训练数据生成,提升检索性能,但发现在线用户参与度无显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21723 2026-05-04 cs.RO 50%

VLBiMan: Vision-Language Anchored One-Shot Demonstration Enables Generalizable Bimanual Robotic Manipulation

VLBiMan: 视觉-语言锚定的一次示例演示使通用化双臂机器人操作成为可能

Huayi Zhou, Kui Jia

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 VLBiMan通过任务感知分解从单个示例中提取可重用技能,实现双臂机器人操作的通用化,减少演示需求并增强跨平台适应性。

Comments accepted by ICLR 2026. The project link is https://hnuzhy.github.io/projects/VLBiMan/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27846 2026-05-01 cs.CL 50%

Multi-Level Narrative Evaluation Outperforms Lexical Features for Mental Health

多层级叙事评估在心理健康预测中优于词法特征

Yuxi Ma, Jieming Cui, Muyang Li, Ye Zhao, Yu Li, Yixuan Wang, Chi Zhang, Yinyin Zang, Yixin Zhu

机构 * Institute for Artificial Intelligence(人工智能研究院) School of Psychological and Cognitive Sciences(心理学与认知科学学院) School of Intelligence Science and Technology(智能科学与技术学院) State Key Laboratory of General AI(通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health(北京行为与心理健康重点实验室) PKU-Changsha Institute for Computing and Digital Economy(北京大学长沙计算与数字经济研究院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出多层级框架,通过830篇中文治疗文本验证,宏观层面的LLM叙事评估在心理健康预测中表现最佳,挑战了词频统计为主的传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27821 2026-05-01 cs.RO 50%

Learning-Based Hierarchical Scene Graph Matching for Robot Localization Leveraging Prior Maps

基于学习的分层场景图匹配用于利用先验地图的机器人定位

Nimrod Millenium Ndulue, Jose Andres Millan-Romera, Matteo Giorgi, Holger Voos, Jose Luis Sanchez-Lopez

机构 * Automation and Robotics Research Group, Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg(卢森堡大学自动化与机器人研究组,安全、可靠性与信任跨学科研究中心(SnT))

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出一种端到端可微 pipeline,通过语义驱动的边类型增强场景图,实现从高层房间概念到低层墙面的同步匹配,优于组合基线,在真实LiDAR环境中运行更快且具备零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08678 2026-05-01 cs.SE cs.HC 50%

The Ultimate Configuration Management Tool? Lessons from a Mixed Methods Study of Ansible's Challenges

终极配置管理工具?来自对Ansible挑战的混合方法研究的启示

Carolina Carreira, Nuno Saavedra, Alexandra Mendes, João F. Ferreira

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过混合方法研究Ansible面临的挑战,揭示了改进Ansible的关键方向,包括增强故障本地性、明确语言与模板边界、针对性文档和改进执行后端,为配置管理工具设计提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27000 2026-05-01 cs.SE cs.CR cs.PL 50%

Adaptive and AI-Augmented Security Testing: A Systematic Survey of Program Analysis, Feedback-Driven Testing, and Hybrid Learning-Based Approaches

自适应与AI增强的安全测试:程序分析、反馈驱动测试和基于混合学习方法的系统性综述

Michael Wienczkowski

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文系统综述了自适应和AI增强的安全测试研究,探讨了程序分析、DevSecOps、反馈驱动模糊测试、LLM自动化测试生成及混合系统等五个领域,揭示了结构化程序表示与自适应测试机制之间的断层,并提出五个开放研究挑战。

Comments 29 pages, submitted for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21995 2026-05-01 cs.HC 50%

Emergent Technology, Emergent Critique: Students and Teachers Developing Critical AI Literacy through Participatory Design around Generative AI

涌现技术,涌现批判:学生和教师通过参与式设计围绕生成式AI发展批判性AI素养

Santiago Ojeda-Ramirez, Eva Durall Gazulla, Kylie Peppler

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文探讨学生和教师通过参与式设计发展批判性AI素养,揭示了共同质疑AI假设、互补学习和基于文化知识的AI批判三种核心实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26666 2026-04-30 cs.DC cs.PF 50%

FACT: Compositional Kernel Synthesis with a Three-Stage Agentic Workflow

FACT:基于三阶段代理工作流的组合内核合成

Sina Heidari, Dimitrios S. Nikolopoulos

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 FACT框架通过三阶段代理工作流实现PyTorch模块的多模式组合优化,结合CUTLASS C++实现内核合成,提升GPU计算性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26653 2026-04-30 cs.IR 50%

AgentSim: A Platform for Verifiable Agent-Trace Simulation

AgentSim:可验证代理跟踪模拟平台

Saber Zerhoudi, Michael Granitzer, Jelena Mitrovic

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出AgentSim平台,通过多模型验证和主动人工参与流程,生成可验证的代理推理轨迹,构建了覆盖三个信息检索基准的Agent-Trace Corpus,并揭示了先进模型在信息检索中的系统性差异。

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), July 20--24, 2026, Melbourne, VIC, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26161 2026-04-30 cs.PL 50%

Finite Functional Programming

有限函数编程

Michael Arntzenius, Max Willsey

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出有限函数编程,通过将谓词视为具有有限支持的函数,统一了函数式和逻辑编程,用于处理聚合和加权逻辑编程。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09297 2026-04-28 cs.RO 50%

One-Shot Real-World Demonstration Synthesis for Scalable Bimanual Manipulation

单次现实演示合成用于可扩展的双臂操作

Huayi Zhou, Kui Jia

机构 * HNuzhy

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出BiDemoSyn框架,通过单个现实示例生成大量高质量双臂操作演示,结合任务分解与视觉引导对齐,实现高效且物理可行的演示合成,提升机器人操作的泛化能力与数据效率。

Comments accepted by RSS 2026. The project link is https://hnuzhy.github.io/projects/BiDemoSyn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24104 2026-04-28 cs.CL 50%

Factual and Edit-Sensitive Graph-to-Sequence Generation via Graph-Aware Adaptive Noising

通过图感知自适应噪声生成事实和编辑敏感的图到序列生成

Aditya Hemant Shahane, Anuj Kumar Sirohi, Tanmoy Chakraborty, Prathosh A P, Sandeep Kumar

机构 * Department of Electrical Engineering, Indian Institute of Technology Delhi, New Delhi, India(印度理工学院德里分校电子工程系) Indian Institute of Science, Bengaluru, India(印度科学研究所,班加罗尔,印度)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出DLM4G框架,通过自适应噪声策略提升图到序列生成的事实性和编辑敏感性,在多个数据集上优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22245 2026-04-27 eess.AS 50%

Listening with Time: Precise Temporal Awareness for Long-Form Audio Understanding

通过时间聆听:为长音频理解实现精确的时间意识

Mingchen Shao, Hang Su, Wenjie Tian, Bingshen Mu, Zhennan Lin, Lichun Fan, Zhenbo Luo, Jian Luan, Lei Xie

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出LAT-Audio模型,通过构建长音频数据集和基准测试,解决长音频时间意识任务中的性能下降问题,提升模型对长音频的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21986 2026-04-27 cs.HC 50%

Community-Based AI Learning: Redistributing Artificial Intelligence's Epistemic Authority in Education

基于社区的AI学习:在教育中重新分配人工智能的认知权威

Santiago Ojeda-Ramirez, Symone Gyles, Kylie Peppler

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出基于社区的AI学习框架,通过重新分配权威和校准信任,促进教育中的AI素养。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20948 2026-04-24 cs.HC 50%

Can Virtual Agents Care? Designing an Empathetic and Personalized LLM-Driven Conversational Agent

虚拟代理能关心吗?设计一个具有同理心和个性化的LLM驱动对话代理

Truong Le Minh Toan, Dieu Bang Mach, Tan Duy Le, Nguyen Tan Viet Tuyen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出一种框架,通过检索增强架构、结构化记忆和多模态交互,设计出具有同理心和个性化支持的虚拟代理,以提升心理健康支持的质量和可靠性。

Comments Accepted manuscript version to be presented at the SCI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20865 2026-04-24 cs.CY 50%

Advances in Art: Orthogonal Disruption and the Beauty in Schematics

艺术进展:正交颠覆与图示之美

Sergio Alvarez-Telena, Marta Diez-Fernandez

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出正交艺术,一种对人工智能的辩证回应而非其服务的艺术学科。通过技术图示作为主要媒介,探索生成与概念空间的新型艺术实践,促进人文学科与艺术、工程、哲学交叉领域的跨学科素养。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏