arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-26 至 2026-08-26 共收录 90 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 7 篇

2608.24680 2026-08-26 cs.CV 新提交 57%

Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training

Game2World引擎:解锁野外游戏视频用于世界模型训练

Wenxuan Shen, Dongna Jin, Dongping Chen

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 针对游戏视频界面干扰世界模型训练的问题,提出GameUI-Taxonomy与G2WEngine框架构建Game2World数据集,研发无掩码UI去除模型GameCleaner,提升了世界模型训练效果与UI去除性能。

Comments We are currently building Gaming World Model and data engine that transfers game dynamics to robotics. Feel free to contact Dongping Chen (dongpingchen0612@gmail.com) if you are interested in research collaboration or financial support

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24138 2026-08-26 cs.CV 新提交 57%

Rubrics as Visual-Repair Context for Self-Evolving UI-to-Code Generation

作为自演进UI转代码生成视觉修复上下文的评分标准

Tianyi Xiong, Zhengyuan Yang, Xiaofei Wang, Chung-Ching Lin, Ruichun Ma, Kevin Lin, Zhendong Wang, Linjie Li, Chenxi Liu, Ruibo Chen, Ramani Duraiswami, Heng Huang, Lijuan Wang

机构 * University of Maryland(马里兰大学) Microsoft(微软公司)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 该研究针对视觉语言模型UI转代码自演进不稳定的问题,提出RubSE框架,利用评分标准作为视觉修复上下文,在多模型多基准上显著提升了生成性能与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24043 2026-08-26 cs.CV 新提交 57%

ConsensusTAS: Self-Supervised Temporal Action Segmentation for Long-Horizon Construction Videos

ConsensusTAS:面向长时程施工视频的自监督时序动作分割

Xiaoshan Zhou, Yafei Sun

机构 * School of Project Management, University of Sydney(悉尼大学项目管理学院) School of Civil and Environmental Engineering, University of New South Wales(新南威尔士大学土木与环境工程学院)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 本研究提出自监督时序动作分割模型ConsensusTAS,无需标注且可在CPU运行,在公开数据集及真实施工视频上的性能优于现有最优方法,可用于人机协同与视频监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24295 2026-08-26 cs.IR 新提交 50%

RecGPT-Mobile-V2 Technical Report

RecGPT-Mobile-V2 技术报告

Lingqing Zhang, Bin Zhang, Weipeng Huang, Chengfei Lv, Chengyu Lai, Chuxin Chen, Dimin Wang, Han Zhu, Hongtao Cheng, Jialin Zhu, Jian Wang, Jiuning Lin, Junqing Wu, Li Chen, Qichao Ma, Ruiquan Lan, Shuai Zhong, Tao Wang, Xiaodong Zhu, Yinjiang Cai, Yinnan Song, Yipeng Yu, Yuan Liu, Yuning Jiang, Zhaode Wang, Zhibo Xiao, Zhixin Ma, Zihong Huang

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 本文提出 RecGPT-Mobile-V2 端到端框架,解决个性化查询预测的设备端挑战,经实验验证其在查询质量、失败率等指标上表现更优,推理策略更具针对性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与鲁棒性 7 篇

2605.31351 2026-08-26 cs.CL cs.CV 版本更新 90%

VIABLE: A Visually Impaired Assistance Benchmark for VLM-as-a-Judge Evaluation

面向VLM-as-a-Judge评估的视障辅助基准

Yi Zhao, Siqi Wang, Zhe Hu, Yushi Li, Jing Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)

专题命中 幻觉与鲁棒性 :VLM(title,title_cn);分类 cs.CV

AI总结 针对视障辅助任务中VLM-as-a-Judge评估的可靠性问题,提出VIABLE基准(含30万+样本、有效性-公正性-稳定性框架及12种失败模式分类),发现现有模型不可靠,并开发VIA-Judge-Agent方法提升诊断准确性和用户偏好。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24730 2026-08-26 cs.MM cs.HC 新提交 83%

Learning to Prefer Reliably: Error-Augmented Emotion Preference Optimization with Calibrated Fusion

学习可靠偏好:带校准融合的错误增强情感偏好优化

Zilong Huang, Junyi Peng, Junjie Li, Kai Li, Wenze Ren, Kong Aik Lee, Man-Wai Mak, Tatsuya Kawahara

专题命中 幻觉与鲁棒性 :MLLM(summary_cn,abstract);multimodal large language model(abstract)

AI总结 针对情感偏好学习的稀疏监督与单一MLLM评判者的偏差问题,提出EAPO框架,构建错误增强数据集并通过边际校准软融合聚合多MLLM评判结果,提升情感偏好预测与鲁棒性。

Comments Accepted at ACM MM 2026 Workshop (MRAC '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23634 2026-08-26 cs.CV cs.LG 新提交 81%

The Blending Ratio Is Not Where the Performance Is: Diagnosing Prototype Blending for Few-Shot Adaptation of Vision-Language Models

混合比例并非性能所在:诊断视觉-语言模型少样本适配中的原型混合

Liangzhi Li, Bowen Wang, Yiming Qian, Thorsten Neumann, Xia Xie, Guangshun Li

机构 * Qufu Normal University(曲阜师范大学) Climind The University of Osaka(大阪大学) Institute of Scientific and Industrial Research (SANKEN)(产业科学研究所(SANKEN)) Institute of High Performance Computing (IHPC), A*STAR(新加坡科技研究局高性能计算研究所(IHPC)) Standard Chartered Bank(渣打银行) Hainan University(海南大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文针对视觉-语言模型少样本适配的原型混合方法,发现其最优混合比例可仅通过支持集估计,且无验证的线性探针性能优于最优调参混合,性能上限由模型本身而非超参数决定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07737 2026-08-26 cs.CV cs.AI 版本更新 62%

Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes

看见 vs. 相信:评估开源多模态大模型在反直觉场景中的语言偏见

Chen Ling, Tongwei Zhang, Hanqian Li, Nai Ding

机构 * Zhejiang University(浙江大学) Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 为评估多模态大模型处理反直觉动作场景的能力,提出CAIT基准(400个高保真合成场景),发现开源模型因语言先验而忽视视觉证据,性能接近随机水平,而链式思维推理虽提升准确率但导致过度思考拒绝视觉内容,通过微调和结构化提示可缓解此偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23635 2026-08-26 cs.SE cs.AI 新提交 57%

ToolRobustBench: Stage-Wise Perturbation Evaluation and Failure Diagnosis for Tool-Calling Agents

ToolRobustBench:工具调用智能体的分阶段扰动评估与故障诊断

YiShan Zheng, Yuan Wu, Yi Chang

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本研究推出ToolRobustBench,这一工具调用智能体的分阶段诊断基准,通过四类扰动族评估7个模型等的15456个实例,发现工具输出/观测扰动是主要瓶颈,可诊断工具调用故障来源与传播。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24094 2026-08-26 cs.RO 新提交 50%

SIREN-Bench: Behavior-Driven Generation and Evaluation of Emergency-Vehicle Interactions

SIREN-Bench:行为驱动的应急车辆交互生成与评估

Yicheng Zhu, Tianmu Zhao, Haoxin Leng, Fan Zuo, Tao Li, Zilin Bian

机构 * Rochester Institute of Technology(罗切斯特理工学院) CVS Health(CVS健康公司) City University of Hong Kong(香港城市大学) New York University(纽约大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 该研究提出行为驱动的SIREN协同仿真平台,构建SIREN-Bench-v1基准,经3类任务评估揭示不同行为模式下的失效特性,为自动驾驶与交通安全研究提供可扩展平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23570 2026-08-26 cs.CL 新提交 50%

Taming Visual Neglect: A Variational Information Bottleneck Framework for Adaptive Attention in Multimodal In-Context Learning

驯服视觉忽视:用于多模态上下文学习中自适应注意力的变分信息瓶颈框架

Kaito Tanaka, Yuji Nishimura, Keisuke Matsuda, Aya Nakayama

机构 * SANNO University(山王大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 针对多模态上下文学习中视觉上下文时而被利用时而被忽视的问题,提出VIB-ICL框架,通过CMIG量化跨模态信息,推导理论界并经五组基准实验验证,实现准确率提升与演示样本减少。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. VLM训练与架构 14 篇

2608.24563 2026-08-26 cs.CV cs.RO 新提交 91%

X-MULTI: VLM-based Imaging Factor Disentanglement for Factor-Aware Image Synthesis

X-MULTI:基于VLM的成像因子解耦用于因子感知图像合成

Sonali Godavarthy, Matthias Neuwirth-Trapp, Tim-Felix Faasch, Maarten Bieshaar, Michael Moeller, Kristof Van Laerhoven, Danda Pani Paudel

机构 * University of Siegen(锡根大学) ETH Zürich(苏黎世联邦理工学院) Bosch Research(博世研究中心) INSAIT(INSAIT(保加利亚的智能与数据科学研究所)) Sofia University “St. Kliment Ohridski”(索非亚大学“圣·克利门特·奥赫里德斯基”)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 该研究针对文本到图像生成的成像因子解耦问题,提出基于VLM的X-MULTI方法及改进的I-FAA指标,提升了新颖因子组合的因子对齐效果与评估的稳健性。

Comments Accepted to the MUCG Workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24115 2026-08-26 cs.RO cs.AI 新提交 91%

PonderPounce: A Pretrained MLLM as an Episode Context Engine for Robot Control

PonderPounce:作为机器人控制回合上下文引擎的预训练多模态大语言模型(MLLM)

Suhwan Choi, Jaeyoon Jung, Sungkyung Kim, Yunsung Lee, Youngjae Yu

机构 * Seoul National University(首尔大学)

专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 PonderPounce复用预训练MLLM的因果上下文作为机器人记忆,由System2 MLLM(Ponder)和System1 VLA(Pounce)组成,在RoboMME、RoboCasa-DC等数据集上的性能优于现有基线,实现了低延迟的机器人控制。

Comments Project page: this https URL (https://worv-ai.github.io/ponderpounce/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23921 2026-08-26 cs.CV 新提交 84%

HAP: Head-Adaptive Visual Token Pruning via Cross-Modal Alignment

HAP:基于跨模态对齐的头部自适应视觉Token剪枝

Yuanhao Sun, Huawei Ji, Yuan Jin, Cheng Deng, Luoyi Fu, Xinbing Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Edinburgh(爱丁堡大学)

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 该研究针对视觉-语言模型预填充成本过高的问题,提出基于PAQ指标的头部自适应视觉Token剪枝方法,在18个基准上实现最优权衡,在LLaVA-1.5-7B上仅保留5.6% Token即可维持99.1%的原始性能,优于基线AutoPrune。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24063 2026-08-26 cs.CV cs.AI 新提交 73%

VisCache: Visual KV Cache Pruning for Efficient Vision Large Language Model Inference

VisCache:用于高效视觉大语言模型推理的视觉键值缓存剪枝方法

Lyuke Wang, Zhuo Li, Guangxu Zhu

机构 * Shenzhen International Center for Industrial and Applied Mathematics(深圳国际工业与应用数学中心) Shenzhen Research Institute of Big Data(深圳大数据研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 VisCache是一种无需训练的即插即用视觉KV缓存剪枝框架,通过两阶段协同操作提升VLLM长上下文推理效率,实现最高2.35倍加速,建立效率与性能的新帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24354 2026-08-26 cs.CR cs.AI cs.CL 新提交 70%

Not All Tokens Are Equal: Region-Aware Consistency Repair of Backdoors in MLLMs

并非所有 token 都平等:多模态大语言模型(MLLMs)中后门的区域感知一致性修复

Jiali Wei, Ming Fan, Mingkun Zhang, Haoyu Wang, Jun Sun, Guoheng Sun, Xiaoning Ren, Haijun Wang, Ting Liu

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对 MLLMs 的后门风险,提出区域感知一致性修复框架 RACER,仅需 100 个干净样本即可有效抑制后门,平均 ASR 降至 1.1%且多数场景达 0%,同时保留模型正常效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23853 2026-08-26 cs.CV 新提交 70%

LUX: A Lesion-Aware Graph-Conditioned Visual - Language Architecture for Explainable Endoscopic Captioning

LUX:一种用于可解释内镜图像描述的病灶感知图条件视觉-语言架构

Alexis Ivan Escamilla-Lopez, Gilberto Ochoa-Ruiz, Salvador Hinojosa, Sharib Ali

机构 * School of Engineering and Sciences, Tecnologico de Monterrey(蒙特雷理工学院工程与科学学院) School of Computer Science, University of Leeds(利兹大学计算机学院)

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 该研究针对内镜图像解读的主观性问题,提出LUX图条件视觉-语言架构,通过病灶中心场景图实现可解释描述,在多指标上优于现有模型并减少了幻觉与定位误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11048 2026-08-26 cs.RO cs.AI 版本更新 70%

ForceFlow: Learning to Feel and Act via Contact-Driven Flow Matching

ForceFlow: 通过接触驱动的流匹配学习感知与行动

Shuoheng Zhang, Yifu Yuan, Hongyao Tang, Yan Zheng, Qiaojun Yu, Pengyi Li, Guowei Huang, Helong Huang, Xingyue Quan, Jianye Hao

机构 * Tianjin University(天津大学) Huawei Noah's Ark Lab(华为诺亚实验室) Shanghai AI Lab(上海人工智能实验室)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出ForceFlow框架,通过融合力信号与多模态信息,提升机器人在复杂接触任务中的鲁棒性和泛化能力,实验显示其在六个真实任务中成功率提升37%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23970 2026-08-26 cs.AI cs.LG 新提交 62%

Giraffe: A Mapping Architecture from Hidden Text Representations to Visual Embeddings for Efficient Graphic Design

Giraffe:一种用于高效平面设计的从隐藏文本表示到视觉嵌入的映射架构

Nejla Ghaboosi

机构 * Canva Research(Canva研究院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 Giraffe 是一种轻量映射架构,以单 [IMG] token 实现从文本隐藏表示到视觉模型嵌入空间的转换,在平面设计生成任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23807 2026-08-26 cs.AI 新提交 57%

Serving Masked Diffusion LLMs: Characterization and Design Principles from Real Hardware

部署掩码扩散大语言模型:基于真实硬件的特性分析与设计原则

Farhana Amin, Sabiha Afroz, Mona Moghadampanah, Dimitrios S. Nikolopoulos

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文通过真实硬件实验分析LLaDA-8B-Instruct等dLLM的部署特性,发现其请求步数离散、批处理可分摊CPU开销等规律,提出适配dLLM的部署设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15062 2026-08-26 cs.CL cs.LG 版本更新 57%

Gated Recurrent Transformers: Expressive Depth through Recurrent Modulation in Transformers

RecurrentGPT:通过Transformer中的循环调制实现表达性深度

Amr Hegazy, Amr Alanwar, Mostafa Elhoushi

机构 * The German University in Cairo(开罗德国大学) Technical University of Munich(慕尼黑工业大学) Cerebras Systems Inc.(赛布拉斯系统公司)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 本文提出RecurrentGPT,通过循环调制解决Transformer语言模型表达性与内存效率的矛盾,在多约束下优于基线模型,实现参数与内存的高效利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20809 2026-08-26 cs.CV 版本更新 57%

Layer-Aware Video Composition via Split-then-Merge

通过分割后再融合的分层视频合成

Ozgur Kara, Yujia Chen, Ming-Hsuan Yang, James M. Rehg, Wen-Sheng Chu, Du Tran

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google(谷歌)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 StM通过分割未标注视频并融合动态前景与背景层,提升生成视频合成的控制能力和数据效率。

Comments Project Webpage: this https URL (https://split-then-merge.github.io)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18778 2026-08-26 cs.RO cs.AI 版本更新 57%

VGGT-DP: Generalizable Robot Control via Vision Foundation Models

VGGT-DP:基于视觉基础模型的通用机器人控制

Shijia Ge, Yijun Liu, Yinxin Zhang, Shuzhao Xie, Weixiang Zhang, Mingcai Zhou, Zhi Wang

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 该研究提出 VGGT-DP 视觉运动策略框架,采用 VGGT 作为视觉编码器并设计 FTR 机制与随机令牌剪枝,在 MetaWorld 任务上较 DP、DP3 等基线表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24667 2026-08-26 cs.IR 新提交 50%

EviGraph: Towards Verifiable Evidence Construction for Information-Seeking Agents

EviGraph:面向信息检索智能体的可验证证据构建

Jiashun Chen, Yirong Mao, Wenhui Que

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 EviGraph是分离搜索与证据记录的深度搜索框架,在BrowseComp等数据集上显著提升了智能体网络搜索的准确率,每轮生成token更少,验证了结构化证据记录的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23812 2026-08-26 cs.CL 新提交 50%

From Preferences to Principles: Rubric-Based Alignment for Grounded Knowledge Answers

从偏好到原则:基于评分规则的接地知识答案对齐

Aman Saini, Priyanshu Kumar, Eric Peng, Kai Yuan, Harsh Girase, Wanming Chen

机构 * Apple(苹果公司)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本研究针对开放域问答的奖励信号设计难题,提出基于检索证据生成查询特定多维评分规则的奖励框架,经实验验证其比基线方法有显著性能提升,为复杂开放域问答提供更有效的奖励监督。

Comments 18 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他VLM 5 篇

2608.23646 2026-08-26 cs.AI cs.LG 新提交 81%

MolEmb: Multimodal Large Language Models Can Be Strong Molecular Embedding Models

MolEmb:多模态大语言模型可作为强大的分子嵌入模型

Xinjian Zhao, Xiangru Jian, Yaoyao Xu, Xiaozhuang Song, Wei Pang, Lei Bai, Tianshu Yu

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出MolEmb框架,利用多模态大语言模型构建通用分子嵌入模型,在分子性质预测上具竞争力,还提出MolCAR基准验证上下文感知分子嵌入的特性。

Comments Presented at the 3rd Workshop on Multi-modal Foundation Models and Large Language Models for Life Sciences (FM4LS), ICML 2026. Non-archival workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24142 2026-08-26 cs.CV 新提交 79%

What Does Prompt Learning Change? -A Natural-Language Concept Analysis of Vision-Language Models

提示学习改变了什么?——视觉-语言模型的自然语言概念分析

Ryo Kamiya, Hiroshi Kera, Kazuhiko Kawamoto

机构 * Chiba University(千叶大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 该研究提出PromptSpLiCE方法分析视觉-语言模型提示学习后的概念分布变化,发现概念分布变化与准确率提升正相关,还推导了局部梯度表达式解释相关几何直觉。

Comments 11 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24118 2026-08-26 cs.CL 新提交 78%

MC-CXR: A Multi-Context Chest X-ray Benchmark for Context-Induced Disruption in Vision-Language Models

MC-CXR:用于视觉-语言模型中上下文诱导干扰的多上下文胸部X射线基准

Junhyeok Lee, Songsoo Kim, Kyu Sung Choi

机构 * Seoul National University College of Medicine(首尔国立大学医学院) Seoul National University Hospital(首尔国立大学医院) Healthcare AI Research Institute, Seoul National University Hospital(首尔国立大学医院医疗人工智能研究院)

专题命中 其他VLM :vision-language model(title,abstract)

AI总结 该研究针对视觉-语言模型在临床胸部X射线解读中受上下文干扰的问题,构建了MC-CXR基准,评估多类模型发现文本误导性比视觉误导性更易导致模型转向错误,验证了上下文诱导干扰的存在。

Comments 15 pages, 3 figures, 4 tables. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24258 2026-08-26 cs.AI 新提交 74%

Beyond Accuracy: A Dual-Judge Evaluation Protocol for Vision-Language Models in Legally Grounded Tasks

超越准确率:面向法律依据任务的视觉语言模型双裁判评估协议

Su Myat Noe, Ha Thanh Nguyen, May Myo Zin, Ken Satoh

机构 * National Institute of Informatics (NII)(国立信息学研究所) VinUniversity(文大学) ROIS-DS Center for Juris-Informatics(ROIS-DS法学信息学中心)

专题命中 其他VLM :vision-language model(title);分类 cs.AI

AI总结 针对法律依据任务,提出双裁判评估协议,结合质量与语义等价裁判,在英国交通标志解读任务中发现不对称II型模式,发布相关资源以评估视觉语言模型的法律相关性能。

Comments Accepted and presented at the AI for Law Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24467 2026-08-26 cs.AI 新提交 57%

HMGCLIP: Heterogeneous Multi-Granularity Contrastive Learning for E-commerce Representation Learning

HMGCLIP:面向电商表征学习的异构多粒度对比学习

Qiuyu Zhu, Yi Gao, Zhichao Wan, Mingyang Ma

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 针对现有多模态大语言模型难以捕获电商产品细粒度属性的问题,提出异构多粒度对比学习框架HMGCLIP,构建异构超图对齐多粒度语义,发布细粒度电商数据集,在多基准上性能优于对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏