arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-26 至 2026-08-26 共收录 56 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 5 篇

2608.24302 2026-08-26 cs.AI 新提交 89%

VideoHarness-RSI: Recursive Harness Self-Improvement for Long-Video Understanding with Frozen Vision-Language Models

VideoHarness-RSI:基于冻结视觉语言模型的长视频理解的递归 harness 自改进方法

Guoyang Xu, Hao Chen

机构 * Tencent(腾讯)

专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.AI

AI总结 该研究提出 VIDEOHARNESS-RSI,通过递归搜索可执行上下文构建程序,在冻结 VLM 上实现长视频理解的改进,且所选 harness 可迁移至其他长视频基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24325 2026-08-26 cs.AI 新提交 85%

SonarLLM: A Native Sonar--Optical Multimodal Large Language Model for Underwater Perception

SonarLLM:一种用于水下感知的原生声呐-光学多模态大语言模型

Cong Su, longxuan ma, Ling Dong, Guofeng Tang, Weijie Yin, Haohui Chen, Zhengtao Yu

机构 * Faculty of Information Engineering and Automation, Kunming University of Science and Technology(昆明理工大学信息工程与自动化学院) Yunnan Key Laboratory of Artificial Intelligence(云南省人工智能重点实验室)

专题命中 视觉问答 :multimodal large language model(title);MLLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.AI

AI总结 针对现有多模态大语言模型不适用于水下声呐-光学感知的问题,提出SonarLLM模型,结合专用编码器与分层融合机制,在SonarBench基准上实现了优异的水下感知性能,凸显了声呐的互补价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24011 2026-08-26 cs.CL cs.AI 新提交 70%

SAGE: From Direct Answering to Evidence-Grounded Inference for Chinese Ancient Document Understanding

SAGE:面向中国古代文献理解的从直接回答到证据导向推理

Yuchuan Wu, Xuan Luo, Yinglian Zhu, Meng Fang, Xiangyang Xue, Bin Li

机构 * Fudan University(复旦大学) University of Liverpool(利物浦大学)

专题命中 视觉问答 :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 针对现有大型视觉语言模型(LVLMs)在古代文献理解中证据支撑不足的问题,本文提出SAGE多智能体框架,通过多阶段证据导向推理实现任务规划、证据获取与验证,在AncientDoc基准上优于基线,搭载Qwen3.5-9B的SAGE性能超更大单体模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24134 2026-08-26 cs.CV 新提交 57%

EgoErrorVQA: Assess Egocentric Comprehension Capabilities through Procedural Errors for Ego-Agentic AI

EgoErrorVQA:通过程序错误评估自我主体人工智能的以自我为中心的理解能力

Junlong Li, Junxi Li, Jianjun Gao, Chen Cai, Lap-Pui Chau, Yi Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉问答 :visual language model(abstract);分类 cs.CV

AI总结 针对现有视觉智能体和VLMs忽略以自我为中心视角评估程序理解能力的问题,本文提出EgoErrorVQA任务,开发基于A2A协议的评估智能体,引入Ego-ADR框架提升模型对程序错误的理解,取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24221 2026-08-26 cs.SE cs.CL cs.PL 新提交 50%

DeepRepoQA: Code Repository Question Answering with Deep Agent Exploration

DeepRepoQA:基于深度智能体探索的代码仓库问答系统

Weihan Peng, Yuling Shi, Yingwei Ma, Longfei Yun, Beijun Shen, Xiaodong Gu

专题命中 视觉问答 :grounding(abstract)

AI总结 针对现有代码仓库问答方法缺乏深度推理能力的问题,提出基于LLM智能体与蒙特卡洛树搜索的DeepRepoQA框架,在SWE-QA基准上实现了性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 5 篇

2608.24040 2026-08-26 cs.LG 新提交 90%

PinSieve: Production Selective VLM Serving and a Governed Memory Flywheel for Enterprise Content-Quality Triage

PinSieve:面向企业内容质量分类的生产级选择性VLM服务及受控内存飞轮

Chuqing Gao, Yuanfang Song, Jonathan Zhang, Yifan Wu, Vishwakarma Singh, Qinglong Zeng, Andrey Gusev

专题命中 视觉推理 :VLM(title,title_cn);分类 cs.LG

AI总结 本文提出PinSieve,即面向企业内容质量分类的选择性VLM服务智能体,结合受控内存飞轮维护机制,提升审核效率、降低成本并改善信号交付,具有任务可迁移性。

Comments Accepted at the KDD 2026 workshop "Enterprise AI Agents: From Prototypes to Production."

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24430 2026-08-26 cs.CV 新提交 89%

Vision Language Model Fusion for Explainable Face Recognition

用于可解释人脸识别的视觉语言模型融合

Ana Estrada-Real, Lydia Alapatt, Christoph Busch, Christian Rathgeb

机构 * Hochschule Darmstadt(达姆施塔特应用科学大学)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 本研究提出多视觉语言模型(VLM)融合框架,结合相似度分数、文本解释与人脸图像,提升了人脸识别准确率,同时生成更丰富稳健的可解释决策,助力开发负责任的可解释人脸识别系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24535 2026-08-26 cs.CV cs.HC 新提交 84%

VizAnchor: Decoding Manipulation Intent from Tampering Visualizations via Dual-Anchor Reasoning

VizAnchor:通过双锚推理从篡改可视化中解码操纵意图

Xiaotian Zhang, Huayuan Ye, Haiyang Zhang, Chenhui Li, Changbo Wang, Sicheng Song

机构 * School of Data Science and Engineering, East China Normal University(华东师范大学数据科学与工程学院) Division of Emerging Interdisciplinary Areas, The Hong Kong University of Science and Technology(香港科技大学新兴跨学科领域分部) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)

专题命中 视觉推理 :VLM(summary_cn,abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出VizAnchor框架,通过双锚构建与VLM推理实现可视化操纵理解,含三个专用智能体,构建相关数据集,可准确定位篡改并生成忠实解释。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23974 2026-08-26 cs.CV cs.MM 新提交 84%

Boot-and-Feedback Framework for Generalist-Expert Model Collaboration in Breast Ultrasound Diagnosis

用于乳腺超声诊断的通才-专家模型协作的引导与反馈框架

Ming Cheng, Hongyu Sun, Zhaolin Chen, Jun Liu, Hossein Rahmani, Qiuhong Ke

机构 * Monash University(莫纳什大学) Renmin University of China(中国人民大学) Lancaster University(兰卡斯特大学)

专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 针对乳腺超声诊断中深度学习的可靠性与可解释性难题,提出BooF框架实现MLLM与专家模型协作,经多数据集验证其性能优于现有最优方法。

Comments 5 pages, 2 figures. Published in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24439 2026-08-26 cs.CV 新提交 79%

DoublesEval: Diagnosing Multi-Agent Tactical Reasoning in Vision-Language Models via Professional Doubles Badminton

DoublesEval:通过专业双打羽毛球诊断视觉语言模型的多智能体战术推理能力

Jintao Cheng, Weibin Li

机构 * The Hong Kong University of Science and Technology(香港科技大学) University of Macau(澳门大学)

专题命中 视觉推理 :vision-language model(title);visual language model(abstract);分类 cs.CV

AI总结 本研究提出DoublesEval框架,以专业双打羽毛球为测试平台评估VLMs的多智能体战术推理能力,发现现有模型存在明显瓶颈,所提TacticCheck可提升模型表现但仍有差距,强调需改进VLMs的评估范式。

Comments Accepted by BMVC2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 21 篇

2608.23880 2026-08-26 cs.CV 新提交 93%

LG-GER: Language-Guided Group Emotion Recognition via Multimodal Evidence Distillation

LG-GER:基于多模态证据蒸馏的语言引导群体情绪识别

Ahmed Shehab Khan, Zhiyuan Li, Yan Tong

机构 * University of South Carolina(南卡罗来纳大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);MLLM(summary_cn,abstract);vision-language model(abstract,abstract_cn);multimodal large language model(abstract,abstract_cn)

AI总结 该研究提出LG-GER框架,通过MLLM生成结构化证据并蒸馏至VLM骨干,无需检测器等即可实现高效群体情绪识别,在GroupEmoW和GAF 3.0数据集上取得了有竞争力或更优的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24133 2026-08-26 cs.CV cs.AI cs.IR 新提交 91%

PlaceSeek: Human-Centered Geospatial Retrieval of Urban Outdoor Places via Semantic Grounding and Affective Alignment

PlaceSeek:通过语义 grounding 与情感对齐实现以人类为中心的城市户外地点地理空间检索

Ziqi Cui, Shangyu Lou

机构 * University of British Columbia(不列颠哥伦比亚大学) University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校) San Diego State University(圣地亚哥州立大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对现有地理空间检索难以满足情感/活动类需求的问题,提出 PlaceSeek 框架,通过语义 grounding 与情感对齐实现城市户外地点检索,在米兰数据集上的表现优于多种基线方法。

Comments Accepted as a Research Paper (short) at ACM SIGSPATIAL 2026. This arXiv version is the full version of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24671 2026-08-26 cs.CV 新提交 90%

ReGround-Surg: Reliability-Guided Anchor Grounding for Referring Surgical Video Segmentation

ReGround-Surg:用于指代手术视频分割的可靠性引导锚点 grounding

Jiaxin Wen, Ming Yin, Lu Liu, Zeyu Fu

机构 * University of Exeter(埃克塞特大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV

AI总结 本文针对手术视频分割中初始锚点错误导致跟踪误差传播的问题,提出 ReGround-Surg 框架,通过可靠性引导锚点 grounding 改进 SAM2,在 Ref-EndoVis 数据集上实现优于 SOTA 的性能且速度损失极小。

Comments 15 pages, 5 figures, accepted at PRCV 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23869 2026-08-26 cs.CV 新提交 87%

Gen2Physics: Grounding Generated 3D Meshes in Physics via Multi-View Material Decomposition

Gen2Physics:通过多视图材料分解将生成的三维网格与物理特性关联

Mauro Comi, Jordi Serrano Berbel, Kevis-Kokitsi Maninis, Philipp Henzler, Manuel Sanchez

机构 * University of Bristol(布里斯托大学) Google DeepMind(谷歌DeepMind) Google Research(谷歌研究院)

专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 Gen2Physics是一个将生成的三维网格与物理特性关联的自动化框架,通过多视图材料分解实现,其材料分割精度较现有方法提升超一倍,还能输出水密性各材料子网格。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23978 2026-08-26 cs.AI cs.CV 新提交 84%

When Seeing Is Not Enough: Benchmarking Interactive Visual Grounding in LVLMs

当视觉不再足够:评估大视觉语言模型(LVLMs)中的交互式视觉定位

Zhengxiang Wang, Owen Rambow

机构 * Stony Brook University(石溪大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文针对大视觉语言模型(LVLMs)提出交互式视觉定位的受控评估框架,发现当前LVLMs表现低于人类基线,主动提问式定位困难且校准不佳,该任务仍具挑战性。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23928 2026-08-26 cs.CV cs.AI 新提交 84%

RefineRank: Joint Box Refinement and Ranking for Surgical Spatio-Temporal Grounding

RefineRank:用于外科时空定位的联合框优化与排序

Linzhe Jiang, Jiayuan Huang, Changhao Zhang, Chunyang Jiang, Zhehua Mao, Mobarak I. Hoque

机构 * UCL Hawkes Institute, University College London(伦敦大学学院霍克斯研究所) King’s College London(伦敦国王学院) School of Medicine, Nankai University(南开大学医学院) University of Manchester(曼彻斯特大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 RefineRank通过RefineNet模块结合冻结医学视觉语言模型与开放集检测器,实现外科时空定位的联合框优化与排序,在MedVidBench上取得较高STG mIoU,提升了定位性能且无需重训主干。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24024 2026-08-26 cs.AI 新提交 83%

Beyond Confidence: Test-Time Scaling for Multi-Turn Search Agents via Retrieval Grounding

超越置信度:基于检索 grounding 的多轮搜索智能体测试时缩放

Hyunho Kook, Junhyuk So, Tianyu Fu, Haizhong Zheng, Beidi Chen

机构 * University of Southern California(南加州大学) Pohang University of Science and Technology (POSTECH)(浦项科技大学) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.AI

AI总结 针对多轮搜索智能体中基于置信度投票因复制膨胀失效的问题,提出检索接地投票(RGV)方法,在四个基准和五个 LLM 上性能优于基线,准确率最高提升 5.4%

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24157 2026-08-26 cs.HC 新提交 82%

Balancing Evidence and Interpretation: Historical Grounding Ratio as a Design Parameter for AI-Generated Urban Storytelling

平衡证据与阐释:历史接地比率作为AI生成城市叙事的设计参数

Fuyang Zhang, Maurice Benayoun

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 该研究提出历史接地比率(HGR)作为AI生成城市叙事的设计参数,通过GeoDrama系统的步行研究发现,HGR增强叙事与位置相关性,但多项体验指标在中间平衡条件下最优,为信息分配策略提供可操作测量方法。

Comments 34 pages, 11 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24574 2026-08-26 cs.AI 新提交 81%

PhysMLLMs: Spatial Priors for Unified Referring Segmentation and Grounded Reasoning of Images and Videos

PhysMLLMs:用于图像与视频的统一指称分割及接地推理的空间先验

Siyao Yan, Bo Han, Jisheng Dang, Bimei Wang, Shude Wang, Hong Peng, Yulan Guo, Jianhuang Lai, Bin Hu, Tat-SengChua

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) School of Electronics and Communication Engineering, Sun Yat-sen University(中山大学电子与通信工程学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 PhysMLLMs是注入物理启发空间先验的训练架构,通过REPA-Global机制提升视频分割的时空一致性,且不损害图像级接地与通用多模态能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24044 2026-08-26 cs.LG 新提交 79%

XP-JEPA: Cross-Predictive Physics Grounding for Forecastable Latent Dynamics

XP-JEPA:用于可预测潜在动力学的交叉预测物理基础

Kehan Wen, Ziming Li, Siyuan Luo, Fan Shi

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

AI总结 XP-JEPA通过将视觉与物理表征交叉预测,提升了潜在动力学的可预测性,在多任务套件上降低了展开漂移并提高了控制成功率,无需特权输入即可实现更优的基于展开的控制性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24107 2026-08-26 cs.CV cs.AI 新提交 73%

MatReplace: A Reference-Free, Conditioning-Aligned Benchmark for Material Replacement in Interior Scenes

MatReplace:用于室内场景材料替换的无参考、条件对齐基准

Mingzhe Du, Thong Thanh Nguyen, Nguyen Tran Cong Duy, See-Kiong Ng, Luu Anh Tuan

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) VinUniversity

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 研究针对室内场景材料替换任务推出无参考基准MatReplace,定义三个条件轨道,实验发现命名材料渲染基本解决但像素视觉定位仍存挑战,专家评分验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23965 2026-08-26 cs.CR cs.AI cs.IR cs.LG 新提交 73%

RAGSentinel: Certifiable Geometric Consensus for Robust Retrieval-Augmented Generation

RAGSentinel:用于鲁棒检索增强生成的可验证几何共识

Yueyang Quan, Anjun Gao, Yufei Xia, Minghong Fang, Zhuqing Liu

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究针对RAG系统的中毒攻击漏洞,提出无训练无标签的RAGSentinel防御方法,通过几何共识过滤中毒文档,实验显示其能低攻高保准且抗自适应攻击。

Comments To appear in EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24281 2026-08-26 cs.CV 新提交 70%

Example-based Robust Abnormality Detection with Minimal Annotations using Exemplar Med-DETR

基于范例的、使用最少标注的鲁棒异常检测:Exemplar Med-DETR

Sheethal Bhat, Bogdan Georgescu, Awais Mansoor, Mathias Zinnen, Pranjal Sahu, Florin C. Ghesu, Sasa Grbic, Andreas Maier

机构 * Friedrich-Alexander-Universität(弗里德里希-亚历山大大学) Siemens Healthineers(西门子医疗) Siemens Medical Solutions(西门子医疗解决方案)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对医学目标检测标注需求高的问题,扩展EM-DETR框架提出Exemplar Med-DETR方法,结合基于范例的特征生成与领域感知对比优化,用不足10%标注数据实现接近SOTA的胸部X射线异常检测性能,适配新疾病发现且无需大量重训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24212 2026-08-26 cs.CV 新提交 70%

NeoWorld-Pro: Programming Interactive Scenes from Monocular Images for Embodied Simulation

NeoWorld-Pro:从单目图像编程交互式场景以实现具身仿真

Yumeng He, Yichen Song, Xiaotian Yang, Weijia Zhang, Zanwei Zhou, Junru Gong, Xiaokang Yang, Yunbo Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 针对具身AI中图像转仿真场景的物理与交互性不足问题,提出NeoWorld-Pro框架,通过MLLMs将单目图像转为可执行程序,结合物理在环机制优化,性能优于现有方法并支持复杂下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23845 2026-08-26 cs.CV 新提交 70%

Object Counting Across Modalities: Taxonomies, Benchmarks, Applications, and Open Challenges

跨模态物体计数:分类体系、基准、应用及开放挑战

Joana Konadu Owusu, Shivanand Venkanna Sheshappanavar

机构 * University of Wyoming(怀俄明大学) Geometric Intelligence Research Lab.(几何智能研究实验室)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 本综述针对跨模态物体计数领域,提出五轴分类体系,梳理应用领域挑战,给出路线图,强调需构建稳健评估基础设施区分开放世界泛化与基准优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24263 2026-08-26 cs.AI cs.CV 新提交 62%

Real-World Knowledge-Guided Change Data Synthesis for Remote Sensing

面向遥感的真实世界知识引导变化数据合成

Yaoyi Qi, Xingxing Weng, Chao Pang, Yongkang Cui, Xiangyu Hao, Xiaokang Zhang, Guibo Zhu, Gui-Song Xia

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Wuhan AI Research(武汉人工智能研究院) Institute of Automation, University of Chinese Academy of Sciences(中国科学院大学自动化研究所) Institute for Math & AI, Wuhan(武汉数学与人工智能研究院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出KnowChange框架,利用预训练视觉-语言模型实现知识引导的变化数据合成,其生成的紧凑规模数据在合成到真实迁移及增强任务中性能优于现有合成数据集,可提升合成数据下游效用。

Comments 29 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24876 2026-08-26 cs.AI cs.CL 新提交 57%

Recursive Experiential-Working Memory Evolution for Long-Horizon Agent Harnesses

面向长 horizon 智能体利用的递归经验-工作记忆演化

Zhaochen Yu, Yingcheng Wu, Zhenfei Yin, Kaiyuan Chen, Zhe Zhao, Mengdi Wang, Shuicheng Yan, Ling Yang

机构 * Princeton University(普林斯顿大学) Stanford University(斯坦福大学) University of Oxford(牛津大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对长 horizon 智能体的递归自我改进难题,提出 Recuris 架构,通过递归记忆演化提升任务成功率,在多个基准和模型上实现显著性能提升,为 RSI 提供可扩展基础。

Comments Code: this https URL (https://github.com/Gen-Verse/Recuris)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23839 2026-08-26 cs.RO cs.AI 新提交 57%

Resilience Matters for Embodied Agents System: New Metrics, Systematic Evaluation, and Optimization

弹性对具身智能体系统的重要性:新指标、系统评估与优化

Yapeng Liu, Yuanzhao Zhai, Xudong Gong, Dawei Feng, Bo Ding, Lin Wang, Huaimin Wang

机构 * National University of Defense Technology(国防科技大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究针对具身智能体系统忽略弹性属性的问题,提出弹性评估框架与指标集,经400项家庭任务实验验证其诊断优化效果,揭示弹性特征间的权衡关系。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23723 2026-08-26 cs.CV 新提交 57%

DriftAD: Visually-Guided Text Drift for Few-Shot Industrial Anomaly Detection

DriftAD:用于小样本工业异常检测的视觉引导文本漂移

Wenyang Liu, Tianyi Liu, Dongshuo Zhang, Kejun Wu, Adams Wai-Kin Kong

机构 * Nanyang Technological University(南洋理工大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 针对现有小样本工业异常检测方法无法捕捉缺陷局部性与尺度依赖性的问题,提出含ASA、VGTD、DGSG模块及对应损失的DriftAD框架,在MVTec-AD和VisA数据集的1/2/4次设置下取得最优性能。

Comments Accepted by ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23640 2026-08-26 cs.AI cs.CL cs.CY 新提交 57%

Auditing the Synthetic Memoir: Measuring Scene-Level Confabulation in LLM-Generated Autobiography Against the Documented Record of the Life It Describes

审计合成回忆录:对照人生的文献记录,测量大语言模型生成自传中的场景层面虚构

Heather Renze

机构 * Serenze Global(塞伦兹全球)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文对照人生真实语料库审计LLM生成的自传,发现96.7%的场景验证失败,提出了可重复使用的审计工具及基于真实信息的补救方法。

Comments 20 pages, 4 figures, 6 tables. Code and derived data available at this https URL (https://github.com/heathriel/synthetic-memoir-audit)

详情

展开后加载摘要…

URL PDF HTML 收藏