arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-28 至 2026-08-28 共收录 61 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 6 篇

2608.26856 2026-08-28 cs.CV cs.AI 新提交 85%

From Reasoning to Pixels: Grounded Medical Multimodal LLMs for VQA and Segmentation

从推理到像素:用于VQA和分割的接地医学多模态大语言模型

Haowen Gu, Gensheng Pei, Junzhu Mao, Qiong Wang, Mingwu Ren, Yazhou Yao

机构 * Nanjing University of Science and Technology(南京理工大学) Sungkyunkwan University(成均馆大学)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);visual question answering(abstract);grounding(abstract);multimodal large language model(abstract)

AI总结 针对现有医学多模态大语言模型缺乏像素级接地的问题,提出MedREAL框架,引入SARP与R2V机制,构建MedRAVS-13K数据集,在Med-VQA和分割任务上性能优于现有方法,为医学图像分析提供可解释框架。

Comments accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26716 2026-08-28 cs.CV 新提交 83%

Beyond Atomic Layouts: Compositional Design Understanding with Vision-Language Models

超越原子布局:基于视觉-语言模型的组合式设计理解

Yiyang Huang, Zhaowen Wang, Simon Jenni, Jing Shi, Yitian Zhang, Yizhou Wang, Yun Fu

机构 * Northeastern University(东北大学) Adobe Research(奥多比研究院)

专题命中 视觉问答 :vision-language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 本文针对组合式布局理解任务,提出后训练范式MASON,利用约2万布局的CoDeLayout数据集,使Qwen2.5-VL 7B准确率达91.66%,优于基线及全数据微调。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26580 2026-08-28 cs.CV cs.CL 新提交 79%

Visual Information-Guided Parallel Decoding for Diffusion Multimodal Large Language Models

面向扩散多模态大语言模型的视觉信息引导并行解码

Insu Lee, Wooje Park, Wonseok Shin, Jinwoo Son, Byonghyo Shim

机构 * Seoul National University(首尔大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 针对扩散多模态大语言模型解码时未充分利用输入图像信息的问题,提出视觉信息引导采样器 VIG-Sampler,在 7 个基准及 3 个开源模型上验证其性能优于 Info-Gain 采样器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26848 2026-08-28 cs.CV cs.AI 新提交 73%

MedFG-VQA: Low-Frequency Memory and Graph Attention for Lightweight Medical VQA

MedFG-VQA:用于轻量级医学视觉问答的低频记忆与图注意力

Haowen Gu, Gensheng Pei, Zeren Sun, Mingwu Ren, Xiangbo Shu, Yazhou Yao, Fumin Shen

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) State Key Laboratory of Intelligent Manufacturing of Advanced Construction Machinery(高端工程机械智能制造国家重点实验室) Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电气与计算机工程系) School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 MedFG-VQA是轻量级医学VQA框架,通过FMF和GACA实现高效视觉-文本对齐,构建含200万对问答的SynMed-VQA数据集,性能优于大模型且计算成本低,适用于临床部署。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26949 2026-08-28 cs.AI 新提交 57%

A Table Is Worth 64 Tokens: Pixel-level Compression for Multi-Table Document Question Answering

一张表格值64个Token:面向多表格文档问答的像素级压缩

Iñigo Alonso, Mirella Lapata

机构 * School of Informatics(信息学院) University of Edinburgh(爱丁堡大学)

专题命中 视觉问答 :VLM(abstract_cn);分类 cs.AI

AI总结 本文针对多表格文档问答提出无需训练的两步像素级表格压缩方法,在长文档上节省41%总Token,比高效单步压缩配置少用15%Token且无准确率损失,还较原生分辨率单步问答提升7个百分点准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26431 2026-08-28 cs.SD eess.AS 新提交 50%

AudioSpan: Spanning the Duration and Depth of Audio Comprehension

AudioSpan:覆盖音频理解的时长与深度

Wen Huang, Yunfei Chu, Meng Gao, Haolin He, Jin Xu

机构 * Qwen Team, Alibaba Group(通义千问团队,阿里巴巴集团) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉问答 :grounding(abstract)

AI总结 本研究提出覆盖10分钟至2小时音频的基准AudioSpan,含3240个分三认知层级的问题,评估12个大型音频-语言模型,发现从长音频提取相关事实是核心难点,该基准可公开获取。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 12 篇

2608.27456 2026-08-28 cs.CV 新提交 86%

UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City

UrbanGround:从局部感知到真实城市中的空间能动性

Tianjie Ju, Zheng Wu, Yueqing Sun, Yuhan Cui, Bobo Li, Shengqiong Wu, Pengzhou Cheng, Haodong Zhao, Zongru Wu, Xinbei Ma, Doris Zhang, Kunling Li, Mong-Li Lee, Wynne Hsu, Hao Fei, Qi Gu, Gongshen Liu, Zhuosheng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学) Meituan(美团) The Chinese University of Hong Kong(香港中文大学) Shanghai University(上海大学) University of Oxford(牛津大学)

专题命中 视觉推理 :MLLM(summary_cn,abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出首个基于香港3D地理空间数据构建的UrbanGround沙盒,探究MLLM智能体在真实城市中从局部感知转化为可靠行动的程度,发现其长时间探索时错误累积的缺陷,为相关研究提供支撑。

Comments 35 pages, 11 figures, 7 tables. Project Page: this https URL (https://urbanground.github.io), Code Repository: this https URL (https://github.com/UrbanGround/UrbanGround)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26993 2026-08-28 cs.CV 新提交 86%

Aphanta: Diagnosing Task-Aligned Image-Edited Intermediates for Multimodal Reasoning

Aphanta:面向多模态推理的任务对齐图像编辑中间产物诊断框架

Hengyuan Xu, Wei Cheng, Yumeng Ji, Xuanyang Zhang, Xianfang Zeng, Gang Yu, Xingjun Ma

机构 * StepFun(阶跃星辰) Fudan University(复旦大学)

专题命中 视觉推理 :MLLM(summary_cn,abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出Aphanta框架,用于诊断MLLM与图像编辑中间产物的任务对齐性,实验显示图像编辑是专用视觉工作空间,该框架可用于评估相关流水线效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26744 2026-08-28 cs.CV 新提交 86%

G2D: Generative-to-Discriminative Collaborative Inference for Zero-Shot Image Classification

G2D:用于零样本图像分类的生成式到判别式协同推理框架

Zehua Hao, Fang Liu, Qinliang Wang, Yaoyang Du, Xinyan Huang, Puhua Chen

机构 * Xidian University(西安电子科技大学)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 G2D是一种无需训练的零样本图像分类框架,通过生成式VLM验证CLIP检索的候选,在8个基准上平均准确率达68.85%,优于CLIP及独立生成式模型,还可迁移至其他模型。

Comments Accepted at ACM MM 2026. 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26715 2026-08-28 cs.HC 新提交 83%

RegulAR: Graph-Grounded Error Recognition and Assistance for Procedural Tasks in AR

RegulAR:面向增强现实中流程任务的基于图的错误识别与辅助

Yi-Lin Ye, Jindu Wang, Hiu Tung Wong, Shuchang Xu, Huamin Qu, Wong Kam-Kwai

专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract)

AI总结 RegulAR是一款结合分层依赖图与MLLM的AR任务助手,可识别流程任务错误并提供恢复指导,在被试内研究中被证实比仅用MLLM的基线系统更能帮助用户理解任务结构与恢复任务。

Comments 16 pages, 7 figures. Accepted to UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26581 2026-08-28 cs.LG 新提交 81%

Activation Outliers Matter: Robust Recovery for Quantized Multimodal LLMs

激活异常值很重要:量化多模态大语言模型的鲁棒恢复

Tanzila Rahman, Mehran Taghian Jazi, Yunke Peng, Zhuang Ma, Anandharaju Durai Raju, Yao Wang, Xing Huang, Hei Yi Mak, Shadan Golestan, Hoang Le, Yonghan Dong, Wei Guo, Yaoyuan Wang

机构 * Huawei(华为)

专题命中 视觉推理 :multimodal large language model(abstract,abstract_cn);MLLM(abstract,abstract_cn);分类 cs.LG

AI总结 本研究针对多模态大语言模型超低比特量化的性能损失问题,提出Residual Fallback Quantization框架,可有效恢复MXFP4、HiF4量化下的性能,缩小与BF16基线的差距。

Comments 14 Pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26355 2026-08-28 cs.CV cs.LG 新提交 73%

Finding the Right Evidence: Factor-Guided Coarse-to-Fine Reasoning for Long Videos

寻找合适的证据:因子引导的长视频由粗到细推理

Baixuan Xu, Yinyui Xu, Tianshi Zheng, Zhaowei Wang, Weiqi Wang, Haochen Shi, Jiayu Liu, Qing Zong, Xiyu Ren, Xinyu Geng, Zhitao He, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程学系)

专题命中 视觉推理 :VLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 针对长视频问答的证据稀疏、选项区分困难问题,提出因子引导的PACE框架,经实验在多基准数据集上优于现有方法,实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26809 2026-08-28 cs.CV cs.MM 新提交 70%

Thinking on Shots: Consistent Multi-Shot Video Editing with Agentic Reasoning

思考镜头:基于智能体推理的一致多镜头视频编辑

Chenyang Wu, Fuchen Long, Binyuan Huang, Xinlong Sun, Xi Chen, Chun-Le Guo, Chongyi Li

机构 * Nankai University(南开大学) Tencent(腾讯)

专题命中 视觉推理 :vision-language model(abstract,abstract_cn);分类 cs.CV

AI总结 本文针对多指令编辑长视频的挑战,提出MMLVE任务与智能体编辑框架,构建MMLVE-Bench数据集及评估指标,所提MMLVE-Agent优于Seedance 2.0等闭源SOTA方法,可实现一致且无幻觉的长视频编辑。

Comments Project Page: this https URL (https://wucy0519.github.io/MMLVE/) and see source codes at this https URL (https://github.com/Wucy0519/MMLVE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26193 2026-08-28 cs.AI 新提交 70%

AffectOmni: RL-Verifiable People-Centric Grounded Affective Reasoning for Social and Art-Related Scenes

AffectOmni:面向社交与艺术相关场景的可通过强化学习验证的以人为中心的接地情感推理

Yibo Wang, Rui Yang, Jisheng Dang, Bimei Wang, Yitao Wu, Pengfei Cao, Wencan Zhang, Hong Peng, Bin Hu, Tat-Seng Chua

机构 * Lanzhou University(兰州大学) Hainan University(海南大学) National University of Singapore(新加坡国立大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 AffectOmni是面向社交与艺术场景的可验证情感推理框架,通过GRPO训练,引入两类奖励优化以人为中心的证据选择与时间推理,经多数据集实验较7B基线实现显著性能提升。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27176 2026-08-28 cs.CL cs.AI cs.LG eess.AS 新提交 62%

When Text Misleads: Inconsistent-Aware Reasoning for Audio-Grounded Dialogue

当文本误导时:面向音频接地对话的不一致感知推理

Yen-Ju Lu, Yuzhe Wang, Yaohan Guan, Xiluo He, Jiarui Hai, Mingrui Liang, Kaavya Chaparala, Thomas Thebaud, Laureano Moro-Velazquez, Najim Dehak, Jesus Villalba

机构 * Center for Language and Speech Processing, Johns Hopkins University(约翰霍普金斯大学语言与语音处理中心)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对口语对话理解中基于转录本的捷径问题,构建了含501个问题的受控基准ContraTalk,提出Audio Twin智能体式推理框架,可提升冲突问答案例的准确率并减少文本偏向陷阱选择。

Comments 24 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26386 2026-08-28 cs.CL cs.AI cs.LG 新提交 62%

Co-Evolving Structured Knowledge and Reasoning in Language Models

语言模型中结构化知识与推理的协同演化

Ryan Thomas Noonan, Linxi Zhao, Menghan Xu, Akanksha Sarkar, Mihir Mishra, Dongyoung Go, Kilian Q. Weinberger, Yoav Artzi, Jennifer J. Sun

机构 * Cornell University(康奈尔大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 针对检索增强方法的局限,提出协同演化框架KBevo,联合学习构建结构化知识库与推理,提升了知识结构质量、答案可达性及推理与可控性。

Comments COLM2026. Code available at this https URL (https://github.com/kilian-group/KBevo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26866 2026-08-28 cs.CV 新提交 57%

Order Matters: A Chinese Multi-Panel Meme Benchmark for Vision-Language Reasoning

顺序很重要:面向视觉-语言推理的中文多面板梗图基准

Haihan Li, Haihao Li, Zhenfei Xu, Jize Qian

机构 * Shanghai Maritime University(上海海事大学) Dalian Maritime University(大连海事大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 该研究推出中文多面板梗图基准CMPM,评估大型视觉-语言模型对梗图的顺序感知推理能力,发现模型在打乱顺序时准确率大幅下降,Gemini 3.1 Pro和GPT-5.5表现优于开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26329 2026-08-28 cs.CL 新提交 50%

Neuro-symbolic PRM: Enhancing Scientific Reasoning via Structured Traces and Symbolic Verification

神经符号PRM:通过结构化轨迹与符号验证增强科学推理

Yuxin Zi, Cong Xu, Suparna Bhattacharya, Martin Foltin, Amit Sheth

机构 * AI Institute of South Carolina(南卡罗来纳州人工智能研究所) HPE Labs(慧与实验室) Indian AI Research Organisation(印度人工智能研究组织)

专题命中 视觉推理 :grounding(abstract)

AI总结 该研究提出神经符号PRM框架,解耦推理为符号有效性与语义接地性,引入反事实符号扰动训练PRM,通过验证器优先搜索提升工具增强型LLM的科学推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 21 篇

2608.26925 2026-08-28 cs.CL eess.AS 新提交 89%

Mapping Written Words to Spoken Words in a Different Language Using Only Visual Grounding

仅使用视觉 grounding 将不同语言的书面词映射到口语词

Gabriel Pirlogeanu, Dan Oneata, Horia Cucu, Herman Kamper

机构 * Politehnica Bucharest(布加勒斯特理工大学) Stellenbosch University(斯坦陵布什大学) Trinity College Dublin(都柏林圣三一学院)

专题命中 视觉定位与Grounding :grounding(title,title_cn)

AI总结 本研究针对低资源场景下的语音数据构建问题,提出一种基于自监督语音表示的对齐方法,可从视觉 grounding 数据中直接学习跨语言词到语音的映射,效果优于以往的注意力模型。

Comments 9 pages, 5 figures, 5 tables, preprint, submitted to IEEE Transactions on Audio, Speech and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26142 2026-08-28 cs.CL cs.AI 新提交 85%

Position Is All You Need: A Free Lunch Token Compression Strategy for MLLM-based Referring Expression Segmentation

位置即你所需:一种用于基于多模态大语言模型的指代表达分割的免费午餐式令牌压缩策略

Yuhan Liu, Yixiong Zou, Yuhua Li, Ruixuan Li

专题命中 视觉定位与Grounding :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 针对基于多模态大语言模型的指代表达分割任务的计算开销瓶颈,提出仅依赖位置信息的即插即用无训练令牌压缩方法PAYN,性能优于现有方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26641 2026-08-28 cs.CL 新提交 80%

Information-Guided Frontier Decoding: Contextual Utility-Driven Commitment in dMLLMs

信息引导的前沿解码:扩散多模态语言模型(dMLLMs)中上下文效用驱动的提交

Xingyou Fang, Jingxing Zhong, Xiaosong Yuan, Xiaofeng Zhang

机构 * Fuzhou University(福州大学) Jilin University(吉林大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);MLLM(abstract,abstract_cn)

AI总结 针对扩散多模态语言模型解码时结构令牌过早提交削弱上下文传播的问题,提出无需训练的信息引导前沿解码策略,通过多维度排序优化候选选择,在多类基准上实现了优于现有方法的性能。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26722 2026-08-28 cs.CV 新提交 77%

UniGeo: A Multi-modal Large Language Model for Text-Guided Cross-View Geo-Localization

UniGeo:用于文本引导跨视角地理定位的多模态大语言模型

Jiahao Wen, Hang Yu, Zhedong Zheng

机构 * School of Computer Engineering and Science, Shanghai University(上海大学计算机工程与科学学院) Institute of Collaborative Innovation, University of Macau(澳门大学协同创新研究院)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 UniGeo是一种统一多模态大语言模型,通过地理语义学习、跨视角生成及即插即用验证模块,在文本引导无人机地理定位任务中显著提升了检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26163 2026-08-28 cs.CL cs.AI cs.HC cs.MA cs.SD 新提交 77%

From Sound to Symptom: Real-Time Respiratory Signal Understanding for Conversational Healthcare Agents

从声音到症状:面向对话式医疗智能体的实时呼吸信号理解

Tanmay Laud, Herprit Mahal, Subhabrata Mukherjee

机构 * Hippocratic AI(希波克拉底人工智能公司)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 提出面向对话式医疗智能体的HealthCUES系统,可实时检测分析咳嗽等呼吸信号,经内部与外部数据集评估及医疗人员验证,性能优异且具临床实用性。

Comments Accepted for publication at SIGDIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26787 2026-08-28 cs.MM 新提交 75%

Self-Reflective Multi-modal Reasoning for Short-Video Fake News Detection

用于短视频假新闻检测的自反思多模态推理

Pinjie Xu, Yuzhou Yang, Zhikai Tan, Qichao Ying, Zaiyang Yu, Ce Li, Zhenxing Qian

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);vision-language model(abstract)

AI总结 针对短视频假新闻检测的挑战,提出SRM-FND框架,通过自反思多模态推理及相关机制,在FakeSV和FakeTT数据集上实现优于强基线的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26624 2026-08-28 cs.CV 新提交 70%

Text-to-seed generation: Training-free open-vocabulary seeded semantic segmentation via re-purposing diffusion as text-guided seed generator

文本到种子生成:通过将扩散模型重新用作文本引导的种子生成器实现免训练开放词汇种子语义分割

Kumju Jo, Heesun Jung, Sungyong Baik

机构 * Hanyang University(汉阳大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 本研究提出免训练框架T2S,利用Stable Diffusion生成文本引导的种子点,结合SAM实现开放词汇语义分割,在标准基准上取得优异性能。

Comments Preprint version of the work accepted for publication in Knowledge-Based Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27079 2026-08-28 cs.RO 新提交 67%

GRAFT: Grounded and Efficient Online Reinforcement Adaptation for Fine-Grained Robot Manipulation

GRAFT:面向精细机器人操作的 grounded 高效在线强化适应

Yibo Qiu, Haoliang Ye, Shu'ang Sun, Zan Huang, Ronald X Xu, Mingzhai Sun

机构 * Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学生命科学与医学部生物医学工程学院)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 GRAFT是一种高效在线VLA适应框架,通过特定视角视觉锚点聚焦任务相关线索,在四项生物医学操作任务中提升25个百分点成功率并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27038 2026-08-28 cs.CL 新提交 67%

Cascaded Batch Prompting

级联批量提示

Sho Hoshino, Peinan Zhang

机构 * CyberAgent(赛博agent公司)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 针对批量提示导致大语言模型下游任务性能不可预测的问题,提出级联批量提示方法,在多项选择问答等任务上性能优于单提示基线,且加速效果与批量大小成正比,在帕累托前沿达到新最优。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27358 2026-08-28 cs.CL cs.AI 新提交 57%

RCMN: Understanding Misleadingness in Influential Public Discourse

RCMN:理解有影响力公共话语中的误导性

Peiling Yi

机构 * School of Computer Science and Mathematics(计算机科学与数学学院) Faculty of Engineering, Computing and the Environment(工程、计算与环境学院) Kingston University London(伦敦金斯顿大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究针对有影响力公共话语的误导性,提出以读者为中心的RCMN框架构建数据集,发现轻量表征可恢复读者解读但难识别误导机制,为可扩展误导性分析提供了新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26867 2026-08-28 cs.AI 新提交 57%

BekchiAI: Measuring, Observing, and Controlling LLM Agents in One Click

BekchiAI:一键式测量、观测与控制大语言模型智能体

Mesut Toruk

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 BekchiAI是一款兼具智能体技能测量基准与实时观测控制平台的工具,含2057个测试任务的基准及配套平台,已公开发布并完成多模型对比。

Comments 8 pages, 1 Figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26752 2026-08-28 cs.CV 新提交 57%

Glass Surface Detection Grounded in 3D Visual Geometry

基于3D视觉几何的玻璃表面检测

Yiwei Lu, Ke Xu, Tao Yan, Xiaojun Chang, Radu Timofte, Rynson W. H. Lau

机构 * Jiangnan University(江南大学) University of Science and Technology of China(中国科学技术大学) University of Wurzburg(维尔茨堡大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出将玻璃表面检测(GSD)基于3D视觉几何的新范式,结合VGGT、FSAM与GeGB,在7个基准上达最优性能,泛化性好且提升玻璃场景重建效果。

Comments 9 pages, 10 figures. Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏