arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-25 至 2026-08-25 共收录 179 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 53 篇

2608.23474 2026-08-25 cs.CL cs.AI cs.CV 新提交 84%

What's the Catch? Evaluating Temporal Consistency in Vision-Language Models

有何玄机?评估视觉-语言模型的时间一致性

Marek Hradil, Danae Sánchez Villegas

机构 * University of Copenhagen(哥本哈根大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出TimeCatch基准,发现视觉-语言模型可检测单帧异常但难整合跨帧信息,在时间异常检测上表现接近随机水平。

Comments 17 pages, ACL format

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22232 2026-08-25 cs.AI cs.CL cs.CV cs.MM 新提交 84%

Beyond What Meets the Eye: Unveiling Situational Illusions for Multimodal Large Language Models

超越表象:揭示多模态大语言模型的情境错觉

Zhiming Yang, Zhuoxi Xiong, Donglin Zhou, Wenjun Wei, Shiyao Cui, Jinqiao Shi

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文针对多模态大语言模型(MLLMs)面临的情境错觉问题,构建分类体系并推出MSIBench基准,发现27种模型配置均易受6类错觉影响,通过提示工程和监督微调最多提升性能20%。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23302 2026-08-25 cs.CV 新提交 83%

Grounding Free-Form Instructions for Fashion Complementary Image Generation

基于自由形式指令的时尚互补图像生成的接地

Matteo Attimonelli, Claudio Pomo, Alessandro De Bellis, Danilo Danese, Dietmar Jannach, Tommaso Di Noia

机构 * Politecnico di Bari(巴里理工大学) Sapienza University of Rome(罗马大学) University of Klagenfurt(克拉根福大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 针对现有时尚互补图像生成基准的缺陷,该研究提出基于自由形式指令的新设置,用StyleFlow模型实现该任务,其生成的服装符合指令且风格连贯,同时降低了架构复杂度和推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23138 2026-08-25 cs.RO cs.AI cs.CV 新提交 81%

Pointing-VLA: Typed Spatial Grounding Interfaces for Vision-Language-Action Manipulation

Pointing-VLA:面向视觉-语言-动作操控的类型化空间定位接口

Xiwen Chen, Zelin Li, Zhiruo Zhou, Huiming Chen, Chenwei Wang, Xiaojun Zhu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 Pointing-VLA是基于Embodied-R1的类型化空间读出接口,可提升VLA模型的机器人操控性能,在多任务评估中实现SOTA表现,还能高效迁移至其他机器人系统并提升真实机器人自主成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23065 2026-08-25 cs.CV cs.AI cs.CL cs.IR cs.MM 新提交 81%

Cultural Moment Benchmark: Evaluating Video Cultural Reasoning and Grounding in Southeast Asia

文化时刻基准:评估东南亚视频文化推理与定位

Burak Satar, Zhixin Ma, Cheng Yu-Tong, Huy Hoang Tran, Phuong Anh Nguyen, Chong-Wah Ngo

机构 * Singapore Management University(新加坡管理大学) VNU-HCM(胡志明市国家大学)

专题命中 视觉定位与Grounding :grounding(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究推出东南亚文化时刻基准CMB,通过三阶段评估视觉-语言模型的文化理解能力,发现模型跨阶段能力未完全级联,音频在非拉丁文字国家多为干扰,专家对邻国概念的识别也不及随机水平。

Comments Accepted to EMNLP 2026 Main Conference, this https URL (https://culturalmoment-benchmark.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21387 2026-08-25 cs.RO eess.SY 新提交 80%

Multimodal-Language-Model-Driven Interaction and Companionship for Service Robots in Elderly-Care Facilities

面向养老机构服务机器人的多模态语言模型驱动的交互与陪伴

Ching-Chieh Liu, Cong-Thanh Vu, Yen-Chen Liu

机构 * National Cheng Kung University (NCKU)(成功大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract)

AI总结 该研究针对养老机构服务机器人缺乏综合陪伴与安全能力的问题,提出整合主动视觉跟人、LLM语音交互及VLM安全监测的智能陪伴机器人系统,实验验证其跟随交互与跌倒检测的有效性。

Comments Accepted to the 2026 IEEE/ASME International Conference on Advanced Intelligent Mechatronics (AIM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23143 2026-08-25 cs.CV 新提交 79%

An end-to-end-trained vision-language model for native-language prostate pathology report generation

用于生成本土语言前列腺病理报告的端到端训练视觉-语言模型

Christian Grashei, Fabian Gülhan, Maximilian Legnar, Fabian Stögbauer, Cleo-Aron Weis, Carolin Mogler, Peter Schüffler

机构 * Technical University of Munich(慕尼黑工业大学) Munich Data Science Institute(慕尼黑数据科学研究所) Munich Center for Machine Learning(慕尼黑机器学习中心) University Hospital Heidelberg(海德堡大学医院) Heidelberg University(海德堡大学) Interdisciplinary Center for Scientific Computing (IWR)(跨学科科学计算中心(IWR))

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 该研究提出语言独立的切片级视觉-语言框架,用自动化流水线生成17344对图像-文本对,实现德语前列腺病理报告生成,恶性肿瘤检测F1达96.2%,可支持机构用自有档案训练本土语言报告模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21878 2026-08-25 cs.CV 新提交 79%

ViSMoE: Visual-Aware Sparse Mixture-of-Experts for Embodied Referring Expression Grounding

ViSMoE:面向具身指代表达接地的视觉感知稀疏混合专家模型

Shuo Feng, Piji Li

机构 * College of Artificial Intelligence(人工智能学院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 针对现有具身指代表达接地方法无法区分视角与物体导致表示模糊的问题,提出带视觉感知路由策略的ViSMoE框架,在REVERIE和SOON数据集上性能优于现有SOTA方法。

Comments Accepted by ICANN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15382 2026-08-25 cs.AI cs.CL cs.IR q-bio.QM 版本更新 79%

Framework for Grounding Healthcare LLMs in a Causal Knowledge Graph: A Cardiovascular Example Pilot

将医疗大语言模型(LLM)基于因果知识图谱:框架、指标与心血管试点研究

Ummara Mumtaz, Aimen Noor, Awais Ahmed

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本研究提出以因果知识图谱为核心的医疗LLM评估框架,在心血管试点中验证其有效性,发现集成条件C4在因果推理相关指标上表现最优,未基于图的C1原始干预准确性最高但缺乏因果与证据基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22225 2026-08-25 cs.CV cs.AI 版本更新 79%

ExtrinSplat: Decoupling Geometry and Semantics for Open-Vocabulary Understanding in 3D Gaussian Splatting

ExtrinSplat:解耦几何与语义以实现3D高斯散射中的开放词汇理解

Jiayu Ding, Xinpeng Liu, Zhiyi Pan, Shiqiang Long, Ge Li

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(广东省超高清沉浸式媒体技术重点实验室,北京大学深圳研究生院) School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) Guangdong Bohua UHD Innovation Center Co., Ltd.(广东博华超高清创新中心有限公司)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 ExtrinSplat通过解耦几何与语义,利用视觉语言模型生成轻量文本假设,提升3D高斯散射中开放词汇物体选择和语义分割的性能和效率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17177 2026-08-25 cs.SE 版本更新 71%

Grounding AI Agents in Contracts: An Empirical Evaluation of Spec-Driven Test Generation

将AI智能体建立在契约基础上:对规范驱动测试生成的实证评估

Michele Tufano, James McClure, José Cambronero, Runxiang Cheng, Sherry Y. Shi, Renyao Wei, Dorothy Chen, Franjo Ivančić, Livio Dalloro, Pat Rondon

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本研究针对LLM智能体生成测试时易遗漏契约相关边界的问题,提出规范驱动测试生成方法,经Google生产缺陷评估,其缺陷检测率、分支覆盖率均优于基线,测试套件质量也显著更高。

Comments To appear in Proceedings of the 1st International Workshop on Specification-Driven Development Life Cycle (SpecOps 2026), co-located with SPLASH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22883 2026-08-25 cs.CV 新提交 70%

FOVEA: Focused On-Demand Visual Evidence Adaptation for Cache-Friendly Multimodal Speculative Decoding

FOVEA:面向缓存友好型多模态推测解码的聚焦式按需视觉证据适配

Hengjie Zhu, Dayan Wu, Zihao Zhang, Xinze Liu, Jingxuan Yu, Peng Fu, Zheng Lin, Weiping Wang, Ding Wang

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 FOVEA是一种缓存友好型多模态推测解码方法,通过动态检索视觉记忆子集提升草稿接受率,使多模态生成速度最高提升2.13倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21476 2026-08-25 cs.SE cs.CV 新提交 70%

From Subjective Judgments to Auditable Standards:Protocol-Guided AI Auditing of Website Redundancy

从主观判断到可审计标准:协议引导的网站冗余度AI审计

Ge Kong, Yongtong Cao

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出CORA审计方法,通过多维度测量分离网站冗余的不同含义,在测试台上表现优于基线,对不达标工具弃权自动评分,是受控基准的可审计候选程序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31192 2026-08-25 cs.CV 版本更新 70%

Specialist-Generalist Fusion with Outcome-Supervised Rationales for Deepfake Detection

语言训练深度伪造检测器的正则化能力

Benedikt Hopf, Zongwei Wu, Radu Timofte

机构 * Computer Vision Lab, CAIDAS, University of Würzburg(计算机视觉实验室,CAIDAS,乌尔姆大学)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出利用多模态大语言模型的双编码器架构和两阶段训练,通过语言正则化缓解过拟合,提升深度伪造检测的泛化性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22651 2026-08-25 cs.CL 新提交 67%

Iteration Without Elaboration: A Simple ReAct Architecture Suffices for Text-to-SQL Generation

无需复杂设计的迭代:简单的ReAct架构足以完成文本转SQL生成

Jian Lu, Haiwei Yu, Raymond M Xiong, Anru Zhang, Danyang Zhuo

机构 * Duke University(杜克大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 该研究针对现有文本转SQL系统复杂且延迟高的问题,提出简单的ReAct-SQL框架,在两个数据集上达到高准确率且运行速度提升8倍,验证了其有效性。

Comments 19 pages; preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21864 2026-08-25 cs.LG cs.AI cs.CV 新提交 67%

BioMed-Agent-RL: A Meta Learning, All You Need for Biomedical Applications

BioMed-Agent-RL:元学习,生物医学应用的一切所需

Md Asaduzzaman Jabin, Zihao Wu, Tianming Liu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 该研究针对临床视觉大语言模型的缺陷,提出BioMed-Agent-RL医学智能体,整合多模态元学习与强化学习等技术,在多基准实验中准确率达约73%,较现有模型提升约5%,为临床智能体系统建立新标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21067 2026-08-25 cs.CV cs.AI 版本更新 62%

AT-ViT: Area-Targeted Multi-View Vision Transformer with Cross-Attention and Multi-Scale Patching for Plant Trait Recognition in Herbarium Images

AT-ViT:面向标本馆图像植物性状识别的区域定向多视图视觉Transformer,融合交叉注意力与多尺度分块技术

Amani Sedrat, Takieddine Chehhat, Youcef Sklab, Hanane Ariouat, Abderrazak Sebaa, Eric Chenin, Jean-Daniel Zucker, Edi Prifti

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对标本馆图像植物性状识别的背景干扰问题,提出双分支视觉Transformer模型AT-ViT,通过交叉注意力与掩码引导分块加权机制提升植物区域注意力,在多任务中实现准确率与鲁棒性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02592 2026-08-25 cs.CV cs.LG 版本更新 62%

H-OPD: Confidence Aware Heterogeneous Multi-Teacher Multimodal On-policy Distillation

H-OPD:置信感知异构多教师多模态在线策略蒸馏

Qixiang Yin, Huanjin Yao, Yuchen Cai, Jianghao Chen, Ziyi Wang, Min Yang, Fei Su, Zhicheng Zhao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ByteDance(字节跳动) USTC(中国科学技术大学) Beijing Key Laboratory of Network System and Network Culture(北京网络系统与网络文化重点实验室) Key Laboratory of Interactive Technology and Experience System, Ministry of Culture and Tourism(文化和旅游部互动技术与体验系统重点实验室) Zhongguancun Academy(中关村科学城)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 研究多模态推理的在线策略蒸馏问题,提出H-OPD框架,通过验证异构教师互补性,以令牌级教师仲裁取代任务或样本级路由,结合视觉与文本教师,在多基准测试中性能优越。

Comments EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01101 2026-08-25 cs.LG cs.AI 版本更新 62%

Soft-NBCE: Entropy-Weighted Chunk Fusion for Long-Context

Soft-NBCE: 基于熵加权分块融合的长上下文处理

Shihao Ji, Mingyu Li, Zihui Song

机构 * Beijing Normal University(北京师范大学) Chunjiang Intelligence(春江智能)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 针对长上下文推理中硬选择策略导致语义碎片化的问题,提出Soft-NBCE,通过熵加权软融合和一致性蒸馏,在保持检索精度的同时提升多跳推理性能。

Comments Withdrawn due to serious concerns regarding the authenticity and accuracy of the listed authorship. The identity of one or more listed authors cannot presently be verified, and the author list may not represent distinct contributors. The manuscript is withdrawn pending institutional review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06770 2026-08-25 cs.CV cs.AI 版本更新 62%

FlowExtract: Procedural Knowledge Extraction from Maintenance Flowcharts

FlowExtract:从维护流程图中提取过程知识

Guillermo Gil de Avalle, Laura Maruster, Eric Sloot, Christos Emmanouilidis

机构 * University of Groningen(格罗宁根大学) Philips Consumer Lifestyle B.V.(飞利浦消费生活方式有限公司)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FlowExtract,通过分离元素检测与连接性重建,利用YOLOv8和EasyOCR提取标准流程图节点,结合新边检测方法实现高精度连接提取,优于视觉语言模型基线,为可查询的过程知识表示提供实用路径。

Comments Accepted to the 45th IFIP WG 5.7 International Conference on Advances in Production Management Systems (APMS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23104 2026-08-25 cs.CL cs.AI 新提交 57%

Molecular LLM Agents: From Architectural Design to Scientific Autonomy

分子大语言模型智能体:从架构设计到科学自主性

Jiatong Li, Wengyu Zhang, Weida Wang, Yuxuan Ren, Wei Liu, Chenyang Mao, Yuqiang Li, Yatao Bian, Changmeng Zheng, Xiaoyong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai AI Lab(上海人工智能实验室) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究提出分子LLM智能体的概念框架,从架构设计和科学自主性阶梯两方面展开,为分子领域LLM智能体的比较、设计评估及部署提供指导。

Comments 25pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23026 2026-08-25 cs.CL cs.AI 新提交 57%

Beyond Surface Cues: Disentangling Sociocultural Signals in Multilingual LLMs

超越表层线索:在多语言大语言模型(LLM)中解耦社会文化信号

Yuanjun Feng, Tanzhou Liu, Stefan Feuerriegel, Yash Raj Shrestha

机构 * University of Lausanne(洛桑大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究提出经人工验证的多智能体审计框架,分析12个LLM的89253个多语言输出,发现多语言LLM的偏见表征随语言和任务变化,需区分表层线索与真正的跨文化模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22974 2026-08-25 cs.AI 新提交 57%

Toward Effective and Reliable LLM Agents via Dynamic Ontology

基于动态本体的有效可靠大语言模型智能体研究

Xiaohui Zhang, Zequn Sun, Chengyuan Yang, Yuanning Cui, Lingbing Guo, Wei Hu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出OaK框架,通过动态构建优化面向任务的本体论,在TravelPlanner等数据集上验证其可提升LLM智能体的证据基础与多步推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21445 2026-08-25 cs.CV 新提交 57%

ViTexSZ: Heterogeneous Vision-Text Knowledge Distillation for EEG Seizure Detection

ViTexSZ:用于脑电图癫痫发作检测的异构视觉-文本知识蒸馏框架

Chenxi Liu, Mingzhao Li, Yicong Liu, Hao Miao, Hongyuan Zhang, Ziyi Chen, Gaofeng Meng

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 ViTexSZ是用于EEG癫痫发作检测的异构视觉-文本知识蒸馏框架,通过多模态大语言模型对齐异构EEG与临床语义,在四个数据集上实现最高准确率,相对第二优基线提升达12.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21416 2026-08-25 cs.RO cs.AI 新提交 57%

Operational digital twin clinics enable task-based evaluation of embodied AI

可操作的数字孪生诊所支持具身人工智能的任务型评估

Xinyuan Wu, Jingrao Zhang, Mengdi Xu, Henry K. Chu, Mingguang He, Danli Shi

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出将常规诊所图像转换为可操作的数字孪生,用于评估具身人工智能,验证了其在机器人测试、策略学习等方面的有效性,填补了具身AI医疗应用离线开发与物理部署间的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21409 2026-08-25 cs.CY cs.AI cs.CL 新提交 57%

Sycophants in the Courtroom: Are LLMs Fragile to Juridical Authority and Evolving Legal Standards?

法庭中的谄媚者:大型语言模型(LLMs)是否对司法权威与演变的法律标准脆弱?

Lorenzo Molfetta, Alessio Cocchieri, Luca Ragazzi, Ilaria Bartolini, Marco Patella, Gianluca Moro

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究通过比较诊断框架对比LLMs在法律与医学领域的表现,发现法律LLMs对司法权威扰动更脆弱,过度信任权威虚假信息,模型规模会放大该问题。

Comments Please cite the definitive, peer-reviewed version of this article published in the Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), edited by Maria Liakata et al., Association for Computational Linguistics, pp. 10865-10886, 2026. DOI: this https URL (https://doi.org/10.18653/v1/2026.acl-long.497)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19197 2026-08-25 cs.CL cs.AI 版本更新 57%

SPADE: Self-Play in Adaptive Synthetic Executable Environments

SPADE:自适应合成可执行环境中的自博弈

Bo Liu, Simon Yu, Yiding Jiang, Ao Qu, Andrew Zhao, Zichen Liu, Junsu Kim, Zijian Zhou, Seungone Kim, Tongzheng Ren, Mickel Liu, Hanfei Yu, Zhaorun Chen, Weiyan Shi, Paul Pu Liang, Luke Zettlemoyer, Yejin Choi, Natasha Jaques

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学) Seoul National University(首尔大学) Stevens Institute of Technology(史蒂文斯理工学院) University of Chicago(芝加哥大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 SPADE是一种双角色自博弈强化学习框架,让单个LLM同时担任环境设计者与推理智能体,在多类基准上显著提升了语言智能体的性能,推动了开放式自我改进。

Comments Work in progress. Project page: this https URL (https://spade-rl.github.io); Code: this https URL (https://github.com/spade-rl/spade)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24772 2026-08-25 cs.AI cs.CL 版本更新 57%

RSMeM: Knowledge-Enhanced Memory Evolution for Remote Sensing Agents with Systematic Evaluation

RSMeM:用于遥感智能体的知识增强记忆进化及系统评估

Bingxian Wu, Yu Zhang, Zonghao Guo, Tang Liu, Chen Qian, Yuxiang Lu, Xingbo Du, Yanghao Li, Yidan Zhang, Chi Chen, Ling Yao, Maosong Sun

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对现有遥感智能体问题,提出RSMeM机制,通过分层知识基础和失败感知经验提炼两个组件,迭代吸收领域知识转化为执行经验,经实验验证能提升工具使用性能和答案质量,具有强大知识密度。

Comments Accepted to ACL 2026 Main. 18 pages. Added links to the GitHub repository and ModelScope Studio below the title; technical content and results remain unchanged. Code: this https URL (https://github.com/AI9Stars/RSMeM). Demo: this https URL (https://modelscope.cn/studios/wbx929/RSMeM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20553 2026-08-25 cs.AI cs.CL 版本更新 57%

CMI-Mem: Toward Generalizable Long-Term Memory Management via CMI-Augmented Reinforcement Learning

CMI-Mem:通过CMI增强的强化学习实现可泛化的长期内存管理

Yubo Wang, Qiuyu Zhao, Zenghui Sun, Shichao Dong, Jinsong Lan, Xiaoyong Zhu, Haoyang Li, Bo Zheng, Lei Chen

机构 * Alibaba Group(阿里巴巴集团) HKUST(香港科技大学) PolyU(香港理工大学) HKUST(GZ)(香港科技大学(广州))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对现有内存管理器模型局限,提出基于强化学习的CMI-Mem模型,结合下游问答正确性与内在条件互信息CMI作为混合奖励,可评估新输入信息,补充而非取代问答基础,实现可泛化的长期内存管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20274 2026-08-25 cs.AI 版本更新 57%

Lagrange: An Open-Vocabulary, Energy-Based Sparse Framework for Generalized End-to-End Driving

Lagrange: 一种面向通用端到端驾驶的开放词汇、基于能量的稀疏框架

Shihao Ji, HongXi Li, Zihui Song, Mingyu Li

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.AI

AI总结 提出Lagrange框架,利用掩码潜在场和视觉语言模型实现开放词汇、稀疏计算,通过拉格朗日动作最小化确保运动学约束,在nuScenes和CODA基准上验证了鲁棒性和可解释性。

Comments Withdrawn due to serious concerns regarding the authenticity and accuracy of the listed authorship. The identity of one or more listed authors cannot presently be verified, and the author list may not represent distinct contributors. The manuscript is withdrawn pending institutional review

详情

展开后加载摘要…

URL PDF HTML 收藏