arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7464 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7464 篇

2608.12951 2026-08-18 cs.SD 版本更新 50%

VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching

VoxAudio:基于多奖励自回归流匹配的发声音频合成

Wenxiang Guo, Changhao Pan, Ziyue Jiang, Zhou Zhao, Fei Wu

机构 * Zhejiang University(浙江大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 VoxAudio是一种多奖励自回归流匹配模型,通过架构、偏好、数据层面的优化,解决现有T2A系统发声控制不足的问题,在多基准上验证了有效性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24861 2026-08-18 cond-mat.stat-mech cs.IT math.IT 版本更新 50%

First-Order Recoverability Collapse in Self-Referential Information Decoders: The Operating Loop of an AI System as a Driven Nonequilibrium Steady State

自指信息解码器中的一阶可恢复性崩溃

Pieter van Rooyen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究自适应系统在持续非平衡驱动下耦合推理与不可逆动作的可恢复性,发现容量饱和导致可恢复性丧失和诊断发散,反馈使转变变为一阶,出现双稳态区域和滞后现象。

Comments 27 pages, 7 figures, 3 tables. v3: specification-map roadmap figure and classification-audit table; prior-identifications and literature bridges; fleet-limit N-scaling measurement; bootstrapped empirical spinodal; title updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24312 2026-08-18 cs.CR 版本更新 50%

Five Queries Are Enough: Query-Efficient and Surrogate-Free Membership Inference Attacks on RAG via Entailment

五个查询就足够了:基于蕴含的查询高效且无替代模型的RAG成员推断攻击

Nguyen Linh Bao Nguyen, Wanlun Ma, Viet Vo, Alsharif Abuadbba, Minghong Fang, Jun Zhang, Yang Xiang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出MEntA攻击方法,利用自然语言蕴含在少量查询下高效推断RAG系统中的文档成员关系,无需替代模型,成本低且难以检测。

Comments Accepted by USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26460 2026-08-17 cs.CL 版本更新 50%

Theory-Grounded Evaluation Exposes the Authorship Gap in LLM Personalization

基于理论的评估揭示了LLM个性化中的作者身份差距

Yash Ganpat Sawant

机构 * April 2026(2026年4月)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过理论指导的评估方法,揭示了LLM个性化中作者身份差距的问题,采用三种测量传统评估四种个性化方法,发现理论指导的指标能提供更准确的基准。

Comments Accepted at CTB Workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12707 2026-08-14 cs.RO 新提交 50%

SAP-Nav: Spatial Semantic Representation Meets Active Perception for Hierarchical Open-Vocabulary Object Navigation

SAP-Nav:空间语义表示与主动感知结合的分层开放词汇对象导航

Xuetong Pei, Jian Liu, Vidura Munasinghe, Bo Miao, U-Xuan Tan, Wenrui Ding, Na Zhao

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究提出SAP-Nav框架,结合空间语义表示与主动感知,解决分层开放词汇对象导航问题,在基准测试中性能最优且真实场景可行,无需特定训练或预计算场景地图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02815 2026-08-12 cs.CL 版本更新 50%

FlexSQL: Flexible Exploration and Execution Make Better Text-to-SQL Agents

FlexSQL:灵活探索与执行打造更优的文本到SQL智能体

Quang Hieu Pham, Yang He, Ping Nie, Canwen Xu, Davood Rafiei, Yuepeng Wang, Xi Ye, Jocelyn Qiaochu Chen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 FlexSQL是一种文本到SQL智能体,通过灵活的数据库交互机制,在Spider2-Snow数据集上使用gpt-oss-120b取得65.4%得分,优于相关基线,集成到Claude Code中可实现超10%的相对提升

Comments Published at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11033 2026-08-12 cs.MA 新提交 50%

Who Are You Explaining To? A Multi-Agent System for Audience-Aware XAI Narratives

你在向谁解释?面向受众感知的XAI叙事多智能体系统

Francesco Musicco, Danilo Danese, Giuseppe Fasano, Angela Lombardi, Alberto Carlo Maria Mancino, Tommaso Di Noia

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对现有XAI叙事无法适配不同受众的问题,提出XstrAI多智能体框架,结合三类LLM智能体与修正循环,在糖尿病、中风风险预测任务中,其叙事适配性与保真度优于多数基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03253 2026-08-12 cs.SD 版本更新 50%

CLASVS: Continuous-Latent Autoregression for Melody-Preserving Lyric Editing in Singing Voice Synthesis

CLASVS:用于歌声合成中保留旋律的歌词编辑的连续潜变量自回归

Yizhong Geng, Tian-Hao Zhang, Chunfeng Wang, Wenxin Fu, Yingming Gao, Ruimin Wang, Zhou Pan, Kun Zhan, Liang Li, Ya Li

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 CLASVS是用于歌声合成的连续潜变量自回归模型,通过SCT路由与PSCG方法实现保留旋律的歌词编辑,在普通话基准上优于离散自回归Vevo2,降低46.2%的宏观音素错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09874 2026-08-12 cs.CL cs.SI 版本更新 50%

Simulating Organized Group Behavior: New Framework, Benchmark, and Analysis

模拟有组织群体行为:新框架、基准和分析

Xinkai Zou, Yiming Huang, Zhuohang Wu, Jian Sha, Nan Huang, Longfei Yun, Jingbo Shang, Letian Peng

机构 * University of California, San Diego(加州大学圣迭戈分校) University of California, Irvine(加州大学尔湾分校) Meta

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出新框架和基准,用于模拟有组织群体决策,通过结构化分析模型提升预测性能,并揭示群体行为随时间的变化及跨群体相似性。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09698 2026-08-11 cs.HC cs.CL 新提交 50%

VeriForge: Mitigating Latent Knowledge Gaps in Narrative Drafting via Mixed-Initiative Scaffolding

VeriForge:通过混合式主动脚手架缓解叙事创作中的潜在知识缺口

Ruqi Sun, Jiaping Li, Wenhui Tao, Ximing Zheng, Yuefeng Tan, Jiahao Wei, Yuxin Ma

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 VeriForge是混合式主动写作系统,通过主动内联高亮、双流查询、空间知识画布三种机制,帮助作者识别叙事创作中的潜在知识缺口,提升领域知识整合能力,获用户与专家认可。

Comments 14 pages, 5 figures, Accepted by UIST'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09588 2026-08-11 cs.CL 新提交 50%

MDB-Link: Hierarchical Schema Linking for Multi-Database Text-to-SQL

MDB-Link:面向多数据库Text-to-SQL的分层模式链接方法

Beiyu Xu, Zhenyu Wu, Jiaoyan Chen, Riza theresa Batista-navarro

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文针对多数据库Text-to-SQL场景提出分层模式链接框架MDB-Link,结合LLM实现数据库定位与列选择,在多个数据集上性能及运行速度均优于基线方法,可高效支撑SQL生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08927 2026-08-11 cs.SE 新提交 50%

Biomedical Knowledge Composition: A Software Engineering Perspective

生物医学知识构建:软件工程视角

Natallia Kokash, Adam S. Z. Bellouma, Paola Grosso

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文从软件工程视角,阐述生物医学知识图谱的核心地位与相关挑战,提出需借鉴Web工程的可组合可复现实践,为生物医学知识基础设施构建提供研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08543 2026-08-11 cs.CY 新提交 50%

Rethinking Higher Education: From Fixed Curricula to Learnity Graphs

重新思考高等教育:从固定课程到学习图谱(Learnity Graphs)

Smadar Szekely, Judith Gal-Ezer, David Harel

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文针对高等教育在AI时代的转型需求,提出以学习图谱为核心的终身学习框架,整合多类学习以拓展传统课程的培养维度。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07497 2026-08-11 cs.HC cs.CL 新提交 50%

EvalConvoLearn: An Open-Source Framework for Evaluating Grounded Learner Simulations in Tutoring Conversations

EvalConvoLearn:一个用于评估辅导对话中具身学习者模拟的开源框架

Baptiste Moreau-Pernet

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 EvalConvoLearn是评估辅导对话中学习者模拟的开源框架,从学习行为与对话质量两个维度开展评估,验证了其在辅导对话数据集上的有效性并公开了代码。

Comments Poster at the Impactful and Responsible AI Systems for Education workshop, as part of the Festival of Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14380 2026-08-10 cs.CL 版本更新 50%

VISHC at PsyDefDetect: Mitigating Data Scarcity in Psychological Defense Classification with Context-Aware Synthetic Augmentation

通过上下文感知的合成增强缓解心理防御分类中的数据稀缺

Hoang-Thuy-Duong Vu, Quoc-Cuong Pham, Huy-Hieu Pham

机构 * College of Engineering and Computer Science, VinUniversity, Hanoi, Vietnam(越南 Vin大学工程与计算机科学学院,河内,越南) VinUni-Illinois Smart Health Center, VinUniversity, Hanoi, Vietnam(越南 Vin大学与伊利诺伊大学智能健康中心,河内,越南) Center for Innovations in Health Sciences, VinUniversity, Hanoi, Vietnam(越南 Vin大学健康科学创新中心,河内,越南)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出上下文感知合成增强框架与混合分类模型,解决心理防御机制分类中的数据稀缺问题,实验表明方法在低资源环境下取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06022 2026-08-07 cs.CL q-bio.GN 新提交 50%

EpiBench: Can LLMs Understand Epitopes for Antibody Drug Discovery?

EpiBench:大型语言模型能否为抗体药物发现表位?

Zirui Wang, Jiaqi Wang, Qinghan Wang, Yuzhi Xu, Gang Du, Tingjun Hou, Odin Zhang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究提出用于评估大型语言模型表位推理能力的基准EpiBench,发现现有通用LLMs在抗体药物发现相关表位推理上仍存局限,为改进序列感知型生物医学LLMs提供了测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05917 2026-08-07 cs.SE 新提交 50%

Escaping the Self-Repair Trap: Improving Test Oracle Generation via Dual-Context Awareness

跳出自修复陷阱:通过双上下文感知改进测试预言生成

Kefan Li, Hongyue Yu, Yuan Yuan

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对迭代自修复引发的自修复陷阱问题,提出非迭代高效框架DCAware,结合结构化静态上下文与动态状态,在低计算成本下提升测试预言的故障检测效果

Comments Accepted to ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05957 2026-08-07 cond-mat.mtrl-sci 新提交 50%

ASE2SPRKKR: a unified Python framework integrating the Spin-Polarized Relativistic Korringa-Kohn-Rostoker method into the Atomic Simulation Environment

ASE2SPRKKR:将自旋极化相对论Korringa-Kohn-Rostoker(SPR-KKR)方法集成到原子模拟环境(ASE)的统一Python框架

Ridha Eddhib, Matyáš Novák, Hubert Ebert, Aki Pulkkinen, Ján Minár

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究人员开发了将SPR-KKR集成到ASE的Python框架ASE2SPRKKR,扩展了Atoms对象功能,支持多类材料计算,符合FAIR原则,为相关代码融入现代材料发现工作流提供了蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04645 2026-08-06 cs.PL 新提交 50%

Towards Datalog on Quantum Annealers: Compiling Recursive Logic Programs with Bottom-up Semantics to 2-local Ising Models

面向量子退火器的Datalog:将具有自底向上语义的递归逻辑程序编译为2局域伊辛模型

Bruno Rucy Carneiro Alves de Lima, Victor Henrique Cabral Pinheiro, Evgenii Dolzhkov, Joseph Haske

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究将递归Datalog程序编译为量子退火器可处理的2局域伊辛模型,经Lean 4验证正确性,还映射到商用退火器拓扑并表征基态获取情况。

Comments 12 pages, 4 pages of appendix, Datalog 2.0 preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04195 2026-08-06 cs.SE 新提交 50%

SONAR: Task-Aware Code Summary Evaluation for LLM Consumers Without References

SONAR:面向LLM使用者的任务感知型代码摘要评估框架(无需参考摘要)

Simantika Bhattacharjee Dristi, Matthew B. Dwyer

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究提出无需参考摘要的SONAR框架,从四个维度评估代码摘要,发现正确性、抽象性对LLM性能影响显著,简洁性、流畅性影响微弱,还明确了不同LLM在各维度的优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27549 2026-08-06 cs.SE 版本更新 50%

How Effective Are NPM Malicious Package Detectors? A Large-Scale Empirical Study

理解NPM恶意软件包检测:基于基准的实证分析

Wenbo Guo, Zhongwen Chen, Zhengzi Xu, Chengwei Liu, Ming Kang, Shiwen Song, Chengyue Liu, Yijia Xu, Weisong Sun, Yang Liu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文基于基准测试分析NPM恶意软件包检测,构建包含6420个恶意和7288个良性包的数据集,评估8种工具的性能,揭示工具精度-召回率由代码意图解析决定,GuardDog达到93.32% F1,SAP_DT检测率提升至79.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04002 2026-08-05 cs.HC 新提交 50%

Semantic Bundling: Interactive Node and Edge Bundling to Simplify Knowledge Graphs using Large Language Models

语义捆绑:使用大语言模型简化知识图谱的交互式节点与边捆绑

Adam Coscia, Zeyu Hua, Eric Krokos, Timothy Lin, Alex Endert

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究提出基于LLM的语义捆绑技术,在开源系统AgentK中实现,用于简化知识图谱,通过节点边捆绑形成高级结构,在电影评论等场景中可揭示文档集合新见解。

Comments Under review. 12 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03872 2026-08-05 cs.RO 新提交 50%

EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning

EvoHIL:用于鲁棒交互式强化学习的自演化奖励与流匹配策略优化

Shuoqin Zhang, Tongtong Cheng, Xiru Gao, Jinzhuo Peng, Bin Zheng, Jiahao Tu, Ke Wang, Jia Pan, Zhe Hu, Kai Liu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 EvoHIL是适配奖励模型、动作生成器和视觉域的统一交互式学习框架,在六类机械臂操纵任务中提升了成功率、运动平滑度等性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03735 2026-08-05 cs.MA cs.CL 新提交 50%

An Actionable Diagnosis of Multilingual, Multi-Agent Planning Failures

多语言多智能体规划失败的可操作诊断

Vikas Pahuja, Jonathan Brokman, Omer Hofman, Tamir Nizri, Daniel Vishna, Seraphina Goldfarb-Tarrant, Kelly Marchisio, Hisashi Kojima, Roman Vainshtein

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究针对多语言多智能体系统在非英语场景下的规划失败问题,提出规划-接地失败分类法,开发TART方法,在多语言任务中显著提升了现有系统的性能。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02959 2026-08-05 cs.MA 新提交 50%

SABRE: A Multi-Agent Approach for Selecting Out-of-Distribution Detectors Under a Budget

SABRE:预算约束下选择分布外检测器的多智能体方法

Mary Wisell, Salimeh Sekeh

专题命中 视觉定位与Grounding :vision-language model(abstract)

AI总结 SABRE是一种多智能体方法,可在预算约束下针对视觉-语言模型的分布外检测,自动选择各领域最优检测器,解决固定检测器跨领域失效的问题,实现可靠检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02582 2026-08-05 cs.SE 版本更新 50%

ACEM: A Cost Estimation Model for Agentic Software Engineering

ACEM:面向智能体软件工程的成本估算模型

Mohammad El-Ramly

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对智能体软件工程成本估算问题,本文提出ACEM模型,分解成本为LLM、HITL、基础设施三类,引入RF、CF、HIS构念并映射传统度量,为智能体开发成本估算提供早期方案。

Comments 27 pages, under journal publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01238 2026-08-04 cs.CL cs.MM 新提交 50%

Evaluating VLMs on Multimodal Aristotelian Persuasion Tasks

评估视觉语言模型(VLMs)在亚里士多德式多模态说服任务上的表现

Khondoker Ittehadul Islam

机构 * Saarland University(萨尔大学)

专题命中 视觉定位与Grounding :vision language model(abstract)

AI总结 该研究采用ImageArg数据集评估VLMs在亚里士多德式多模态说服任务的表现,发现Qwen系列模型在相关检测任务上性能提升并发布代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01066 2026-08-04 cs.RO 新提交 50%

OC-VLA++: Monocular Geometry-Guided Cross-View Consistency for Viewpoint-Robust Robotic Manipulation

OC-VLA++:用于视点鲁棒机器人操作的单目几何引导跨视图一致性

Tianyi Zhang, Ziyang Gong, Zhenjie Yang, Zhe Qian, Haonan Duan

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究针对相机覆盖有限时机器人操作的视点泛化问题,提出OC-VLA++模型,通过几何引导的配对视图监督和跨视图动作等变目标提升未见视点泛化能力,性能优于原模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00779 2026-08-04 cs.RO 新提交 50%

SIPTraj: Map-Free End-to-End Trajectory Prediction via Physics-Guided Scene Interaction

SIPTraj:无高精地图的物理引导场景交互端到端轨迹预测

Feifei Liu, Zejun Wei, Haozhe Wang, Yazhi Ye, Yuying Zhang, Jintao Cheng, Chi Man Vong, Xieyuanli Chen, Xiaoyu Tang

机构 * School of Data Science and Engineering, Xingzhi College, South China Normal University(华南师范大学行知学院数据科学与工程学院) Hong Kong University of Science and Technology(香港科技大学) University of Macau(澳门大学) College of Intelligence Science and Technology, National University of Defense Technology(国防科技大学智能科学学院) School of Electronic Science and Engineering, South China Normal University(华南师范大学电子科学与工程学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 SIPTraj是一种无高精地图的端到端轨迹预测框架,通过分层智能体-场景编码器和物理引导迭代解码器解决场景锚定与物理可行性问题,在两个数据集上性能优于现有方法,推理无需高精地图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28915 2026-08-03 physics.soc-ph cs.SI math-ph math.MP 新提交 50%

An agent-based model of the formation and evolution of common ground

基于智能体的共同基础形成与演化模型

Mengbin Ye, Wooseok Jung, Tony J. Mathew, Lorenzo Zino, Yoshihisa Kashima

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究开发智能体模型,通过蒙特卡洛模拟探究网络上智能体交互的共同基础形成与演化,揭示不同交互情境会导致全球共同基础形成、分裂或完全丧失等现象,凸显数学模型研究文化动态微宏观关联的潜力。

Comments Submission for a journal paper

详情

展开后加载摘要…

URL PDF HTML 收藏