arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7464 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7464 篇

2604.20216 2026-04-23 cs.CL 50%

Text-to-Distribution Prediction with Quantile Tokens and Neighbor Context

基于分位数标记和邻近上下文的文本到分布预测

Yilun Zhu, Yuan Zhuang, Nikhita Vedula, Dushyanta Dhyani, Shaoyuan Xu, Moyan Li, Mohsen Bayati, Bryan Wang, Shervin Malmasi

机构 * Amazon.com, Inc.(亚马逊公司) Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出分位数标记回归,通过插入专用分位数标记并结合邻近实例,提升分布预测精度,实验显示在多个数据集上效果显著,MAPE更低且预测区间更窄。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20117 2026-04-23 cs.CL 50%

To Know is to Construct: Schema-Constrained Generation for Agent Memory

知即建构:基于模式约束的代理记忆生成

Lei Zheng, Weinan Song, Daili Li, Yanming Yang

机构 * UnionPay(中国银联)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出SCG-MEM架构,通过模式约束生成实现记忆检索,避免结构幻觉并提升多跳推理能力,实验显示其在LoCoMo基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20006 2026-04-23 cs.CL 50%

From Recall to Forgetting: Benchmarking Long-Term Memory for Personalized Agents

从回忆到遗忘:个性化代理长期记忆的基准测试

Md Nayem Uddin, Kumar Shubham, Eduardo Blanco, Chitta Baral, Gengyu Wang

机构 * Arizona State University(亚利桑那州立大学) Genies University of Arizona(亚利桑那大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出Memora基准测试,评估个性化代理在长期对话中的记忆、推理和推荐能力,引入FAMA指标以衡量对过时记忆的依赖,发现LLM和记忆代理在处理长期记忆时存在显著不足。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15804 2026-04-22 cs.CL eess.AS 50%

Qwen3.5-Omni Technical Report

Qwen3.5-Omni 技术报告

Qwen Team

机构 * Qwen Team(通义实验室)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 Qwen3.5-Omni在多模态能力上取得突破,支持256k上下文长度和多语言理解,通过混合注意力MoE架构实现高效推理,并引入ARIA提升语音合成稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17894 2026-04-21 cs.CL 50%

Automatic Slide Updating with User-Defined Dynamic Templates and Natural Language Instructions

基于用户定义动态模板和自然语言指令的自动幻灯片更新

Kun Zhou, Jiakai He, Wenmian Yang, Zhensheng Wang, Yiquan Zhang, Weijia Jia

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Institute of Artificial Intelligence and Future Networks, Beijing Normal University(北京师范大学人工智能与未来网络研究院) Faculty of Arts and Sciences, Beijing Normal University(北京师范大学文理学院) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出DynaSlide基准,结合多模态解析和自然语言指令,实现幻灯片动态更新,保留布局与样式,并设计评估协议揭示未来研究挑战。

Comments To appear in Findings of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19944 2026-04-21 q-fin.TR q-fin.ST 50%

Large Language Models and Stock Investing: Is the Human Factor Required?

大语言模型与股票投资:是否需要人类因素?

Ricardo Crisostomo, Diana Mykhalyuk

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文研究大语言模型能否生成可靠的股市预测,发现其预测能力受限于推理错误,需人类监督以提升表现。

Comments 33 pages; 6 tables; 2 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17667 2026-04-21 cs.CL cs.IR 50%

Peerispect: Claim Verification in Scientific Peer Reviews

Peerispect:科学同行评审中的声明验证

Ali Ghorbanpour, Soroush Sadeghian, Alireza Daghighfarsoodeh, Sajad Ebrahimi, Negar Arabzadeh, Seyed Mohammad Hosseini, Ebrahim Bagheri

机构 * University of Toronto, Reviewerly(多伦多大学,Reviewerly)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 Peerispect通过提取同行评审中的可验证声明,检索相关证据并验证其真实性,提供可视化界面帮助快速检查和解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09033 2026-04-20 cs.CL 50%

Do LLMs Really Know What They Don't Know? Internal States Mainly Reflect Knowledge Recall Rather Than Truthfulness

大语言模型真的了解它们不知道的东西吗?内部状态主要反映知识回忆而非真实性

Chi Seng Cheang, Hou Pong Chan, Wenxuan Zhang, Yang Deng

机构 * Singapore Management University(新加坡国立管理学院) DAMO Academy, Alibaba Group(阿里集团达摩院) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文探讨大语言模型是否真正了解其未知领域,通过分析内部状态发现其主要反映知识回忆而非真实性,提出hallucination分类方法以区分不同hallucination类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13593 2026-04-16 cs.MM 50%

AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction

AVID:一种通过代理驱动构建的多模态音频视觉不一致理解基准

Zixuan Chen, Depeng Wang, Hao Lin, Li Luo, Ke Xu, Ya Guo, Huijia Zhu, Tanfeng Sun, Xinghao Jiang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 AVID是首个大规模多模态音频视觉不一致理解视频基准,通过可扩展的构建流程和8种细粒度不一致类别,评估检测、时间定位、分类和推理能力,验证了其在可信多模态AI系统中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13045 2026-04-16 cs.DB 50%

Draft-Refine-Optimize: Self-Evolved Learning for Natural Language to MongoDB Query Generation

草稿-细化-优化:面向自然语言到MongoDB查询生成的自演化学习

Mingwei Ye, Jiaxi Zhuang, Mingjun Xu, Linfeng Zhang, Guolin Ke, Hengxing Cai

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出EvoMQL框架,通过迭代的草稿-细化-优化流程,结合执行反馈实现自然语言到MongoDB查询生成的自演化学习,提升了执行准确率。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12776 2026-04-15 cs.CL 50%

EvoSpark: Endogenous Interactive Agent Societies for Unified Long-Horizon Narrative Evolution

EvoSpark:内生交互代理社会的统一长周期叙述进化

Shiyu He, Minchi Kuang, Mengxian Wang, Bin Hu, Tingxiang Gu

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Department of Precision Instrument, Tsinghua University(清华大学精密仪器系)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 EvoSpark通过内生交互代理社会框架,解决LLM多代理系统中长周期叙述演化的矛盾,通过分层叙述记忆和生成场景机制实现逻辑一致的持续叙事。

Comments Accepted to the Main Conference of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08196 2026-04-15 astro-ph.IM astro-ph.GA astro-ph.HE 50%

A Statistical-AI Framework for Detecting Transient Flares in SDSS Stripe 82 Quasar Light Curves

基于统计-人工智能框架的SDSS Stripe 82类星体光变曲线暂Transient耀斑检测

Atal Agrawal

专题命中 视觉定位与Grounding :vision language model(abstract)

AI总结 本文提出FLARE框架,通过物理信息学习、异常评分和识别引擎检测暂Transient耀斑,利用EVT进行异常评分,并验证候选者。

Comments 22 pages, 20 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11570 2026-04-14 cs.HC cs.MM 50%

From Multimodal Signals to Adaptive XR Experiences for De-escalation Training

从多模态信号到自适应XR体验的降级训练

Birgit Nierula, Karam Tomotaki-Dawoud, Daniel Johannes Meyer, Iryna Ignatieva, Mina Mottahedin, Thomas Koch, Sebastian Bosse

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出了一种多模态实时通信分析系统,用于自适应VR训练的基础交互层,整合了语音、手势、情感分析、脑电波和生理信号,通过同步技术实现用户意识和无意识沟通线索的连续评估,结合社会符号学和象征互动理论,构建了连接低层信号到冲突缓解的解释层。

Comments 16 pages, 5 figures, ACM Intelligent User Interfaces (IUI) Workshops 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11514 2026-04-14 cs.SE cs.CL 50%

DuET: Dual Execution for Test Output Prediction with Generated Code and Pseudocode

DuET:通过生成代码和伪代码的双执行进行测试输出预测

Hojae Han, Jaejin Kim, Seung-won Hwang, Yu Jin Kim, Moontae Lee

机构 * ETRI(韩国电子通信研究院) Seoul National University(首尔大学) SNU-LG AI Research Center(首尔大学-LG人工智能研究中心) LG AI Research(LG人工智能研究院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出DuET框架,结合生成代码和伪代码执行,通过功能多数投票提升测试输出预测的准确性,实验表明其在LiveCodeBench上达到最优性能,Pass@1提升13.6个百分点。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04457 2026-04-14 cs.IR 50%

Retrieval Augmented Conversational Recommendation with Reinforcement Learning

基于强化学习的检索增强对话推荐

Zhenrui Yue, Honglei Zhuang, Zhen Qin, Zhankui He, Huimin Zeng, Julian McAuley, Dong Wang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出RAR框架,通过动态结合检索与生成提升推荐性能与事实性,构建大规模电影语料库并引入强化学习方法优化候选集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17853 2026-04-14 cs.DL 50%

CiteGuard: Faithful Citation Attribution for LLMs via Retrieval-Augmented Validation

CiteGuard: 通过检索增强验证实现LLM的忠实引文归因

Yee Man Choi, Xuehang Guo, Yi R. Fung, Qingyun Wang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出CiteGuard,通过检索增强验证提升LLM引文准确性,实现比基线模型高10个百分点的性能,达到68.1%的准确率,接近人类水平。

Comments Project Page: https://kathcym.github.io/CiteGuard_Page/. ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09683 2026-04-14 cs.SE 50%

A Vision for Context-Aware CI Adoption Decisions

面向上下文的持续集成采纳决策展望

Osamah H. Alaini, Taher A. Ghaleb

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出基于AI的框架,通过评估项目特征推荐适合的CI服务,旨在实现基于上下文的CI采纳决策,避免冗余服务和迁移成本。

Comments Accepted at the 34th ACM Joint European Software Engineering Conference and Symposium on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09550 2026-04-14 cs.IR cs.DB 50%

HyEm: Query-Adaptive Hyperbolic Retrieval for Biomedical Ontologies via Euclidean Vector Indexing

HyEm:通过欧几里得向量索引实现查询自适应的双曲检索用于生物医学本体

Ou Deng, Shoji Nishimura, Atsushi Ogihara, Qun Jin

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 HyEm通过结合双曲本体嵌入与欧几里得ANN基础设施,解决生物医学本体中层次感知的检索问题,提升实体中心查询和混合意图查询性能,保持索引可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08082 2026-04-10 cs.HC 50%

From Binary Groundedness to Support Relations: Towards a Reader-Centred Taxonomy for Comprehension of AI Output

从二元 groundedness 到支持关系:迈向以读者为中心的 AI 输出理解分类体系

Advait Sarkar, Christian Poelitz, Viktor Kewenig

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出以读者为中心的 groundedness 分类体系,旨在通过支持关系提升 AI 输出理解的透明度和可解释性。

Comments Advait Sarkar, Christian Poelitz, and Viktor Kewenig. 2026. From Binary Groundedness to Support Relations: Towards a Reader-Centred Taxonomy for Comprehension of AI Output. ACM CHI 2026 Workshop on Science and Technology for Augmenting Reading (CHI '26 STAR) ACM CHI 2026 Workshop on Science and Technology for Augmenting Reading (CHI '26 STAR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07788 2026-04-10 cs.IR cs.CL 50%

PeReGrINE: Evaluating Personalized Review Fidelity with User Item Graph Context

PeReGrINE:基于用户-物品图上下文的个性化评论可信度评估

Steven Au, Baihan Lin

机构 * Icahn School of Medicine at Mount Sinai(西奈山伊坎医学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 PeReGrINE通过构建用户-物品图结构,评估个性化评论生成中证据组合对可信度、个性化和检索条件语言模型的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06882 2026-04-09 cs.RO cs.SY eess.SP eess.SY 50%

Telecom World Models: Unifying Digital Twins, Foundation Models, and Predictive Planning for 6G

电信世界模型:统一数字孪生、基础模型和预测规划用于6G

Hang Zou, Yuzhi Yang, Lina Bariah, Yu Tian, Yuhuan Lu, Bohao Wang, Anis Bara, Brahim Mefgouda, Hao Liu, Yiwei Tao, Sergy Petrov, Salma Cheour, Nassim Sehad, Sumudu Samarakoon, Chongwen Huang, Samson Lasaulce, Mehdi Bennis, Mérouane Debbah

机构 * Research Institute for Digital Future, Khalifa University(哈利法大学数字未来研究所) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息与电子工程学院) University of Oulu(奥卢大学) Aalto University(阿尔托大学) Université de Lorraine, CNRS, CRAN(洛林大学,法国国家科学研究中心,CRAN)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出电信世界模型(TWM),结合数字孪生与基础模型,解决6G网络中动态建模、不确定性处理和多层控制规划问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07189 2026-04-09 cs.CL 50%

Agent-Driven Corpus Linguistics: A Framework for Autonomous Linguistic Discovery

基于代理的语料库语言学:一种自主语言发现的框架

Jia Yu, Weiwei Yu, Pengfei Xiao, Fukun Xing

机构 * Zhejiang International Studies University(浙江外国语学院) Tianjin University(天津大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出基于代理的语料库语言学框架,通过大语言模型与语料库查询引擎的交互,实现自动化的语言研究,提升研究效率并降低技术门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20922 2026-04-07 q-bio.PE math.PR math.SP 50%

Spectral Geometry and Heat Kernels on Phylogenetic Trees

谱几何与在系统发育树上的热核

Ángel Alfredo Morán Ledezma

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出了一种统一的谱框架,用于有限超度量系统发育树,结合算子理论和随机动力学分析。通过引入超度量拉普拉斯算子,研究其谱理论,并展示其在系统发育分析中的应用,包括谱重构定理、谱间隙解释及生物特征分解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01417 2026-04-03 cs.IR cs.CL 50%

ReFormeR: Learning and Applying Explicit Query Reformulation Patterns

ReFormeR:学习和应用显式查询改写模式

Amin Bigdeli, Mert Incesu, Negar Arabzadeh, Charles L. A. Clarke, Ebrahim Bagheri

机构 * University of Waterloo(滑铁卢大学) University of Toronto(多伦多大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 ReFormeR通过提取并整合查询改写模式,引导LLM进行受控的改写操作,提升检索效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01110 2026-04-02 cs.SE 50%

Harnessing Hype to Teach Empirical Thinking: An Experience With AI Coding Assistants

利用 hype 教授实证思维:与 AI 编码助手的实践经验

Marvin Wyrich, Norman Peitek, Kallistos Weis, Sven Apel

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文探讨通过 hype 驱动技术使学生更易理解实证方法,结合 AI 编码助手实践,提升学生批判性思维与实证研究能力。

Comments Accepted to FSE'26 (Education Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24116 2026-04-02 eess.AS 50%

How Open is Open TTS? A Practical Evaluation of Open Source TTS Tools

开放程度如何?对开源语音合成工具的实用性评估

Teodora Răgman, Adrian Bogdan Stânea, Horia Cucu, Adriana Stan

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文评估了四种开源语音合成框架在构建新型TTS模型的可行性,特别是在资源受限语言中的挑战,通过客观指标和主观测试揭示了工具链设置、数据预处理和计算效率的问题。

Comments Published in IEEE Access https://ieeexplore.ieee.org/document/11269795

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09504 2026-04-02 cs.CL 50%

MVSS: A Unified Framework for Multi-View Structured Survey Generation

MVSS:多视图结构化调查生成的统一框架

Yinqi Liu, Yueqi Zhu, Yongkang Zhang, Feiran Liu, Yutong Shen, Yufei Sun, Xin Wang, Renzhao Liang, Yidong Wang, Cunxiang Wang

机构 * Beijing University of Technology(北京工业大学) Peking University(北京大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出MVSS框架,通过结构优先方法生成和对齐引用支撑的层级树、结构化比较表和调查文本,提升调查生成的结构组织和证据呈现质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12993 2026-04-02 cs.SE cs.CR 50%

SmartPoC: Generating Executable and Validated PoCs for Smart Contract Bug Reports

SmartPoC: 为智能合约漏洞报告生成可执行且验证的PoC

Longfei Chen, Ruibin Yan, Taiyu Wong, Yiyang Chen, Jialai Wang, Chao Zhang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 SmartPoC通过生成并执行可执行的PoC测试用例,验证审计报告中的漏洞。该方法通过提取关键函数切片、生成-修复-执行循环及差分验证提高可执行性与准确性,实现了高精度和召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23418 2026-04-02 cs.CR 50%

Beyond Metadata: Multimodal, Policy-Aware Detection of YouTube Scam Videos

超越元数据:多模态、政策感知的YouTube诈骗视频检测

Ummay Kulsum, Aafaq Sabir, Abhinaya S. B., Anupam Das

专题命中 视觉定位与Grounding :LLaVA(abstract)

AI总结 本文提出多模态、政策感知的YouTube诈骗视频检测方法,通过结合文本、音频和视频信息,提升检测性能和鲁棒性,同时提供可解释的政策依据。

Comments Accepted at AAAI ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29856 2026-04-01 cs.HC cs.GR cs.RO 50%

An Interactive LLM-Based Simulator for Dementia-Related Activities of Daily Living

基于交互式大语言模型的痴呆相关日常活动模拟器

Kruthika Gangaraju, Shu-Fen Wung, Kevin Berner, Jing Wang, Fengpei Yuan

机构 * Worcester Polytechnic Institute(伍斯特理工学院) University of California Davis(加州大学戴维斯分校) MGH Institute of Health Professionals(麻省总医院健康专业学院) University of New Hampshire(新罕布什尔大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出一个交互式模拟器,利用大语言模型生成痴呆患者在日常活动中的多轮行为,通过专家反馈优化策略,提升辅助AI和机器人在痴呆护理中的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏