arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-24 至 2026-08-24 共收录 73 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 9 篇

2608.20414 2026-08-24 cs.AI cs.CV 新提交 81%

StateSight: Benchmarking Latent Spatial-State Reconstruction in Vision-Language Models

StateSight:评测视觉语言模型中的潜在空间状态重建能力

Michelle Lin

机构 * Thomas Jefferson High School for Science and Technology(托马斯·杰斐逊科学技术高中)

专题命中 视觉问答 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究推出StateSight基准及配套数据集StateSight-Steps,评估视觉语言模型的潜在空间状态重建能力,发现GPT-5.5、Claude Sonnet 5的表现均逊于人类基线,格式正确的响应可能掩盖空间结构恢复失败的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21140 2026-08-24 cs.CV cs.AI 新提交 79%

A Modular Agent for Reliable and Auditable Spatial Relation Verification in CT Scans

用于CT扫描中可靠且可审计的空间关系验证的模块化智能体

Simon Vincent Abel, Heiko Hillenhagen, Michael Götz, Timo Ropinski, Ayhan Can Erdur, Daniel Santak Wolf

机构 * Ulm University(乌尔姆大学) Ulm University Hospital(乌尔姆大学医院) Technical University of Munich (TUM)(慕尼黑工业大学(TUM)) TUM University Hospital(慕尼黑工业大学医院) Department of Radiation Oncology, TUM University Hospital(慕尼黑工业大学医院放射肿瘤科)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对医学视觉-语言模型空间推理薄弱的问题,提出模块化医学影像智能体,通过分阶段处理实现CT扫描空间关系验证,性能优于端到端基线,可作为未来医学影像智能体的构建块。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21134 2026-08-24 cs.CV cs.LG 新提交 73%

Llama-Mobile: Efficient 2.7-Bit Quantization of VLMs

Llama-Mobile:视觉语言模型的高效2.7位量化

Luka Ribar, Jeevan Bhoot, Douglas Orr

机构 * Graphcore Research(Graphcore研究院) Arm(Arm公司)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG

AI总结 针对VLMs部署于移动设备的资源瓶颈,提出结合自生成训练数据的量化流水线与2.7位参数格式的框架,将Llama 3.2 11B Vision Instruct模型压缩至3.7 GB且保留视觉问答任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06972 2026-08-24 cs.CV 版本更新 70%

Generative Embedding Benchmark: How Much Information Survives in a Dense Embedding?

生成式嵌入基准:密集嵌入中保留了多少信息?

Yun Li, Biao Yang, Peixi Wu, Yunhao Zhou, Mingzhou Jiang, Wei Yuan, Fan Yang, Wenwu Ou

专题命中 视觉问答 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究提出Generative Embedding Benchmark(GEB),通过仅用嵌入和问题文本的解码器评估7种嵌入模型,发现生成式读出能揭示可分性评估未捕捉的信息瓶颈,视觉语言模型嵌入表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17886 2026-08-24 cs.CV cs.CL 版本更新 70%

When Better Teachers Don't Make Better Students: Revisiting Knowledge Distillation for CLIP Models in VQA

当更好的教师不培养更好的学生:重新审视用于CLIP模型的KL知识蒸馏在视觉问答中的应用

Pume Tuchinda, Parinthapat Pengpun, Romrawin Chumpu, Patomporn Payoungkhamdee, Sarana Nutanong, Peerat Limkonchotiwat

机构 * VISTEC Bangkok Christian International School(巴吞普林国际学校) AI Singapore(AI新加坡)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文重新审视了CLIP模型在视觉问答中的知识蒸馏,发现更强教师不必然产生更好学生,揭示了现有蒸馏框架的局限性,并指明了参数高效多模态模型的设计新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21133 2026-08-24 cs.CV cs.CR 新提交 57%

Masking Is Not Enough: Generative Restoration for Multimodal De-Identification in Medical AI

仅掩码不足:面向医疗AI的多模态去标识化生成式修复

Shiva Shrestha, Zongxing Xie, Chen Zhao, Liran Ma, Zhipeng Cai, Honghui Xu

机构 * Kennesaw State University(肯尼索州立大学) Miami University(迈阿密大学) Georgia State University(佐治亚州立大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 针对医疗图像-文本数据的PHI泄漏问题,提出端到端多模态净化框架ClinX,结合图像侧生成式修复与文本侧渐进式去标识化,在MedVQA中验证其优于仅OCR掩码的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20890 2026-08-24 cs.CV cs.RO 新提交 57%

A Collaborative Multi-Modality Interaction for VLA-based End-to-End Autonomous Driving

面向基于视觉-语言-动作(VLA)的端到端自动驾驶的协同多模态交互

Jingtao Sun, Xiaohai He, Yike Zhang, Dong Huang, Yaonan Wang, Ajmal Mian, Mike Zheng Shou

机构 * National University of Singapore (NUS)(新加坡国立大学) Hunan University(湖南大学) The University of Western Australia (UWA)(西澳大学)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 本文针对现有VLA自动驾驶模型决策不可靠、多模态交互不足的问题,提出含三类核心组件的多模态交互与多轨迹规划系统,实验显示其在安全推理与场景感知上优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20814 2026-08-24 cs.CV 新提交 57%

Enhancing Localized Reasoning for Long Video Understanding via Efficient Segment-to-Video Supervision

通过高效的段级到视频级监督增强长视频理解的局部推理能力

Beibei Zhang, Chao Xu, Jun Lan, Zongyi Li, Lai Wei, Huijia Zhu, Tongwei Ren

机构 * Ant Group(蚂蚁集团)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 针对长视频理解中MLLMs易受干扰噪声影响的问题,提出S2V方法,通过段级VQA训练模型,提升了LVU性能与训练推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15867 2026-08-24 cs.CV 版本更新 57%

CogCanvas: A Benchmark for Evaluating Multi-Subject Reference-Based Image Generation

CogCanvas: 用于评估多主体参考图像生成的基准

Long-Bao Nguyen, Quang-Khai Le, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, Ho Chi Minh City, Vietnam(胡志明市理科大学) University of Dayton, Ohio, United States(代顿大学) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学胡志明市分校)

专题命中 视觉问答 :grounding(abstract);分类 cs.CV

AI总结 提出CogCanvas基准,包含1952张参考图像和1361个组合提示,评估多身份、对象绑定和背景场景的生成,引入BG-Sim和Attr-VQA指标,发现现有模型在超过3个主体时性能严重下降。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 7 篇

2608.21170 2026-08-24 cs.CV cs.AI 新提交 91%

Is Visual Prompting All You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds

视觉提示就足够了?研究渐进式视觉支架下视觉语言模型的空间推理能力

Lars Benedikt Kaesberg, Tianyu Yang, Florian Valentin Wunderlich, Terry Ruas, Jan Philip Wahle, Daniel Kurzawe, Bela Gipp

专题命中 视觉推理 :VLM(title,summary_cn);grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对 VLMs 的空间推理问题,在 SPaRC 基准中引入轻量视觉支架,可提升 VLMs 任务准确率并补充 GRPO 训练,揭示视觉呈现对 VLM 基准测量属性的关键作用。

Comments Accepted at EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21030 2026-08-24 cs.CV cs.CL cs.LG 新提交 86%

COMET: Contrastive Motion-Enhanced Temporal Reasoning for Video Multimodal Large Language Models

COMET:面向视频多模态大语言模型的对比运动增强时序推理

Chenghua Zhu, Zhaolu Kang, Qifan Shi, Siyan Wu, Kehan Jiang, Lei Wei, Lianyu Hu, Guangyuan Dong, Mingbo Yang, Rui Lu, Guibo Luo

机构 * Peking University(北京大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Sun Yat-Sen University(中山大学) Pingan Technology(平安科技)

专题命中 视觉推理 :multimodal large language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 COMET是一种视频多模态大语言模型时序增强框架,通过显式时序表示等方法,在Qwen3-VL-8B等模型的动作、时序推理任务上取得性能提升,且可跨模型家族通用。

Comments Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21032 2026-08-24 cs.RO 新提交 86%

Roadside-Cooperative Autonomous Driving: From Data Platform to Vision-Language End-to-End Reasoning

路侧协同自动驾驶:从数据平台到视觉-语言端到端推理

Yitao Xu, Tong Wu, Yiyan Wu, Guoji Xu, Yanbo Jiang, Jiahao Wang, Zehong Ke, Junkai Jiang, Fang Zhang, Jianqiang Wang

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract_cn)

AI总结 针对现有V2X基准的局限,推出V2XBench平台与Chat-V2XBench数据集,提出AURORA端到端协同驾驶框架,其在严重遮挡场景下路径完成率达98.21%、驾驶得分76.02,开创了可扩展的V2X-VLM范式。

Comments 15 pages, 5 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20549 2026-08-24 cs.AI 新提交 79%

Volumetric Radiology AI in the Era of Multimodal Large Language Models

多模态大语言模型时代的容积放射学人工智能

Zanting Ye, Shengyuan Liu, Xin Liu, Chenhui Wang, Zhisong Wang, Jiashuai Liu, Zipei Wang, Cheng Wang, Wentao Pan, Mengjie Fang, Di Dong, Mohammad Salmanpour, Arman Rahmim, Yu Gu, Yong Xia, Hongming Shan, Yixuan Yuan, Yefeng Zheng, Lijun Lu

机构 * Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学) Xi’an Jiaotong University(西安交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Southern Medical University(南方医科大学) The Chinese University of Hong Kong(香港中文大学) University of British Columbia(不列颠哥伦比亚大学) Microsoft Research(微软研究院) Westlake University(西湖大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 该综述梳理截至2026年7月的200余篇文献,探讨多模态大语言模型时代容积放射学AI的表征、智能体系统及临床评估,提出相关框架以明确原生容积建模的适用场景。

Comments 9 Figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21022 2026-08-24 cs.CV cs.MM 新提交 77%

Recognition-Conditioned Reasoning: A Training-Free Multimodal-LLM Pipeline for Fine-Grained Micro-Action Understanding

识别条件推理:一种用于细粒度微动作理解的无训练多模态大语言模型流水线

Fengshun Wang, Jin'ang Han, Zhigang Tu

机构 * Wuhan University(武汉大学)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 该研究提出一种无训练的多模态大语言模型流水线,动态分配子任务至适配的模型,在2026年MAC微动作挑战赛MA-Bench赛道的开放式任务上获显著性能优势,取得第一名。

Comments Accept at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21357 2026-08-24 cs.AI 新提交 70%

VIALS: A Benchmark for Visual Interpretation of Artifacts in the Life Sciences

VIALS:生命科学领域人工产物视觉解释基准

Elaine Lau, Thanuka Udumulla, Lee Izhaki-Tavor, Francisco Guzmán, Nicholas Magazine, Jonas Mueller

机构 * Handshake AI

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.AI

AI总结 研究针对生命科学人工产物视觉解释的需求,构建含161项任务的VIALS基准,发现前沿视觉语言模型在该任务上存在领域知识与推理局限,凸显AI需具备此类能力以服务生命科学工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21305 2026-08-24 cs.CV cs.AI 新提交 62%

Re$^3$Cap: Retrieval-Guided Refinement for Image Captioning Enhancement via Reinforcement Learning

Re³Cap:基于强化学习的图像字幕增强的检索引导优化

Haonan Jia, Shichao Dong, Zenghui Sun, Jiawen Zheng, Ziqi Miao, Gege Shi, Qiuyu Zhao, Jinsong Lan, Xiaoyong Zhu, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝和天猫集团) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Re³Cap方法,利用多模态检索作为推理信号,通过CRS和CQA优化图像字幕,在COCO-LN500基准上关系推理性能较GRPO提升8.64%,优于SFT。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 29 篇

2608.20720 2026-08-24 cs.CV 新提交 93%

AffordAny: Open-World 3D Affordance Grounding from Monocular RGB Images via Vision-Language-Guided Geometric Reasoning

AffordAny:基于单目RGB图像的开放世界3D affordance grounding,通过视觉-语言引导的几何推理实现

Junqi Wu, Kaihua Tang, Xuanwen Chen, Hongzhi Li, Jianqiang Huang, Xian-Sheng Hua

专题命中 视觉定位与Grounding :grounding(title,title_cn);VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 AffordAny是端到端框架,通过单目RGB图像结合VLM引导解码器与伪标签自训练,实现开放世界3D affordance grounding,在未见对象、类别等评估中表现出有效性与鲁棒性。

Comments The code and dataset are publicly available. Code: this https URL (https://github.com/lzlfwow/AffordAny). Dataset: this https URL (https://modelscope.cn/datasets/lzlfwow/AffordAny)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21244 2026-08-24 cs.CV 新提交 91%

A VLM Answer Is Not an Anomaly Score: Rank Compression in Training-Free Video Anomaly Detection

VLM 的回答并非异常分数:无训练视频异常检测中的排名压缩

Inpyo Song, Jangwon Lee

机构 * SungKyunKwan University(成均馆大学)

专题命中 视觉定位与Grounding :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 该研究针对基于VLM的无训练视频异常检测,发现生成式回答读出存在排名压缩问题,提出概率读出方法可提升性能,证明回答接口是该类检测器的关键组成部分。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21180 2026-08-24 eess.IV cs.CV 新提交 89%

Toward Vision Language Model-based Assessment of Clinical Quality and Usability of LGE-MR Images for Cardiac Ablation Planning

面向基于视觉语言模型的LGE-MR图像临床质量与可用性评估以用于心脏消融规划

Bipasha Kundu, Abhishek Chaturvedi, Axel W. E. Wismueller, Richard Simon, Cristian A. Linte

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision language model(title,abstract);分类 cs.CV

AI总结 本研究提出两阶段VLM框架用于左心房LGE-MRI的临床导向图像质量评估,在60个图像切片-文本对数据集上,InternVL2的标准级准确率最高,DeepSeek实现完美临床可用性一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20534 2026-08-24 cs.CV 新提交 87%

Grounded-Exo2Ego: Structured Semantic Grounding for Robust Exocentric-to-Egocentric Video Generation

Grounded-Exo2Ego:用于鲁棒外部视角到自我视角视频生成的结构化语义 grounding

Shengze Wang, Michael Stengel, Tianye Li, Seonwook Park, Amrita Mazumdar, Koki Nagano, Alex Trevithick, Shalini De Mello

机构 * NVIDIA(英伟达)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV

AI总结 本文提出Grounded-Exo2Ego框架,通过双分支视频扩散模型、相机重定位算法和自动合成数据引擎,在EgoExo4D数据集上大幅提升了外部视角到自我视角视频生成的性能。

Comments website url: this https URL (https://research.nvidia.com/labs/amri/projects/grounded-exo2ego/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17633 2026-08-24 cs.RO 版本更新 83%

OVIP-SG: Open-Vocabulary Instance-Preserving Scene Graphs for Mapping and Retrieval of Small, Fine-Grained Objects

OVIP-SG:用于小型细粒度物体映射与检索的开放词汇实例保留场景图

Tianjing Hao, Haiyu Lan, Angsong Li, Cheng Chen, Enyu Li, Jiarui Yang, Yuning Su, Peiwen Lin, Wang Chuang

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 本文提出OVIP-SG框架,通过VLM等技术实现小型细粒度物体的实例保留映射与语言引导检索,在Replica数据集上的多项指标优于现有方法,且经实际机器人实验验证有效。

Comments 15 pages, 6 figures, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20392 2026-08-24 cs.CL cs.AI 新提交 79%

Evaluation-as-Search: Adaptive Discovery of Grounding Failures in Meeting Assistants

评估即搜索:会议助手接地故障的自适应发现

Sami Khairy, Yasaman Hosseinkashi, Vishak Gopal, Ross Cutler

机构 * Microsoft(微软公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文提出EaS方法构建MeetingProbe基准,发现会议助手故障多源于话语语用挑战,其自适应搜索比随机探测的故障发现率高2.5倍,且公开了该基准以支持可复现评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20405 2026-08-24 cs.CL 新提交 78%

ARGUS: Theory-of-Mind Guided Argument Generation with Strategy-Aware Planning and Knowledge Grounding

ARGUS:基于心理理论(Theory-of-Mind)的论证生成,结合策略感知规划与知识接地

Zhe Hu

机构 * InspireOmni AI The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 该研究提出基于智能体的Argus框架,结合心理理论推理、策略感知规划等,在三个基准上优于基线,可有效改变抗拒受众立场。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20492 2026-08-24 cs.CV 新提交 77%

Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs

以标注为回滚:面向视频多模态大语言模型的高效可扩展强化学习

Yunheng Li, Guohong Mu, Hao Li, Shengsheng Qian, Dingwen Zhang, Qibin Hou, Ming-Ming Cheng

机构 * Nankai University(南开大学) Northwestern Polytechnical University(西北工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) NKIARI

专题命中 视觉定位与Grounding :MLLM(summary_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出OraRL算法,将标注作为神谕回滚解耦优势估计,实现高效可扩展的视频MLLM强化学习,在多项视频感知基准上超越现有模型,解码速度大幅提升。

Comments Project page: this https URL (https://orarl.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20844 2026-08-24 cs.AI 新提交 74%

TRACE: Agentic Catalog Enrichment with Multi-source Evidence Grounding

TRACE:基于多源证据锚定的智能体式商品目录丰富

Rohan Kumar, Steven Xu, Kyle MacDonald, Matthew Long, Bernice Chow, Mac VanRenterghem, Sudeep Das

机构 * DoorDash(多闸道科技(DoorDash))

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 针对电商商品目录属性稀疏问题,提出基于LLM的TRACE框架,经离线评估、生产部署及在线实验验证,可高效提升目录属性丰富的准确率、覆盖率及结账转化率。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20958 2026-08-24 cs.AI cs.CV 新提交 73%

TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming

TLive-Omni:面向电商直播的全模态理解模型

Yibo Hu, Yu Qian, Mao Gu, Yingfan Tao, Yuhao Chen, Yongdong Luo, Zhuoqun Liu, Meiguang Jin, Junfeng Ma

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本研究提出专为电商直播设计的全模态理解模型TLive-Omni,通过引入Per-vGrid等技术,结合多阶段训练流程,在电商直播基准任务上表现强劲且泛化能力出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21031 2026-08-24 cs.RO 新提交 71%

PhysCaP: Grounding Code-as-Policy Agent with Physics-Informed Exploration

PhysCaP:基于物理引导探索的代码即策略智能体

Chen-Yu Lin, Jing-Wen Chen, Hsueh-En Chang, Hung-An Chen, Sheng-Hsun Chang, Chi-Pin Huang, Fu-En Yang, Min-Hung Chen, Yi-Ting Chen, Yu-Chiang Frank Wang, Shao-Hua Sun

机构 * National Taiwan University(台湾大学) NVIDIA Research(英伟达研究院) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 PhysCaP是一种带物理引导探索层的代码即策略智能体,采用双智能体设计,可高效估算物体物理属性,在桌面操纵及LIBERO模拟任务中性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20831 2026-08-24 cs.CL cs.AI 新提交 70%

STAR-OPD: Structured Aspect-Cascade-Aware On-Policy Reward Distillation for ABSA Quadruple Extraction

STAR-OPD:面向ABSA四元组抽取的结构化级联感知在线策略奖励蒸馏

Tong Sun, Mingyang Ma, Jiayang Yu

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对ABSA四元组抽取中蒸馏模型的结构错误问题,提出STAR-OPD方法,通过在线策略蒸馏结合级联感知集结构奖励,在多个数据集上优于基线,缩小了学生-教师差距并提升了推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21310 2026-08-24 cs.SE 新提交 67%

Beyond Fault Localization: A Trajectory-Level Study of LLM Agents for Microservice Root Cause Analysis

超越故障定位:面向微服务根本原因分析的大语言模型智能体的轨迹级研究

Qisheng Lu, Aoyang Fang, Junjielong Xu, Jin'ao Shang, Songhan Zhang, Yifan Yang, Xiaochuan Yan, Pinjia He

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 本研究针对微服务根本原因分析,提出轨迹级评估框架,发现智能体答案正确性与诊断质量脱节,构建DiagGuard架构提升了RCA的Acc@1指标,为自动化RCA改进提供指导。

Comments 13 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13798 2026-08-24 cs.CV cs.AI cs.LG 版本更新 67%

CFM: Language-aligned Concept Foundation Model for Vision

CFM:面向视觉的语言对齐概念基础模型

Kai Wittenmayer, Sukrut Rao, Amin Parchami-Araghi, Bernt Schiele, Jonas Fischer

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 CFM提出一种语言对齐的概念基础模型,提供细粒度可解释的概念,提升视觉任务的解释能力,实现分类、分割和描述生成的高性能表现。

Comments Accepted as a Spotlight at ECCV 2026. Corrected inaccuracies in equation 3,4 and B.8. 58 pages

详情

展开后加载摘要…

URL PDF HTML 收藏