arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-28 至 2026-08-28 共收录 94 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 29 篇

2606.25647 2026-08-28 cs.CE 版本更新 50%

Smallholder Farmers on Remote Islands Receiving Retrieval-Grounded Multilingual LLM Assistance and Agronomic Advice

基于检索的多语言LLM辅助工具用于岛屿小农户

Nikolaos D. Tantaroudas, Ilias Karachalios, Andrew J. McCracken

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对偏远岛屿小农户获取农业建议困难且方言知识缺乏全球语料支持的问题,提出嵌入双语电商平台的对话AI助手Falco eleonorae,通过工具增强检索(MCP)获取本地化数据,实现可信的多语言、语音和图像交互。

Comments 13, 4

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 4 篇

2608.26544 2026-08-28 cs.LG 新提交 70%

Chart2SVG: Editable SVG Generation from Raster Chart Images

Chart2SVG:从栅格图表图像生成可编辑的SVG

Jinning Cui, Lu Chen, Haoyan Shi, Yue He, Chenglong Wang, Mengyu Zhou, Weidong Huang, Yunhai Wang

机构 * Renmin University of China(中国人民大学) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Shandong University(山东大学) Microsoft Research(微软研究院) Qwen Large Model Application Team, Alibaba(阿里巴巴通义大模型应用团队) University of Technology Sydney(悉尼科技大学)

专题命中 文档图表理解 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.LG

AI总结 Chart2SVG是融合图表语义令牌、Beagle+数据集与Chart Structure Graph的多模态大语言模型,可生成可编辑SVG,在图表重建与编辑任务中性能优于基线,助力智能可视化工具发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27169 2026-08-28 cs.CV 新提交 57%

Ancient-Bench: A Comprehensive Multi-millennial, Multi-medium, and Multi-script Benchmark for Ancient Chinese Artifact Text Recognition

Ancient-Bench:用于中国古代文物文字识别的综合多千年、多介质、多文字基准数据集

Hiuyi Cheng, Nuo Xu, Yuyi Zhang, Xuhan Zheng, Wei Pan, Jing Zhang, Dezhi Peng, Minghui Liao, Yihua Teng, Jihao Wu, Haoyu Ren, Lianwen Jin

机构 * South China University of Technology(华南理工大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 针对现有古代文本基准数据集碎片化问题,推出Ancient-Bench基准数据集,含2700张图像,覆盖多千年、多介质、多文字,经实验发现古代文物文字识别仍存在异体字等挑战。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26757 2026-08-28 cs.AI 新提交 57%

DEEPCHART: How Far are LLMs from Faithful Data-Science Chart Generation?

DEEPCHART:大型语言模型在忠实的数据科学图表生成方面存在多大差距?

Jiahui tang, Kuicai Dong, Dexun Li, Hongchao Gu, Haocheng Yu, Wei Han, Chen Zhang, Yong Liu, Hao Wang, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 文档图表理解 :grounding(abstract);分类 cs.AI

AI总结 该研究推出专家标注的DEEPCHART基准,将图表生成分为提取-推理-可视化流程,发现现有LLMs生成的图表常隐藏数据幻觉,仅靠大上下文窗口无法实现忠实图表生成,需可靠的证据提取与定量推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25434 2026-08-28 cs.IR 版本更新 50%

DocPC: Document-Level Visual Retrieval via Representative Page Composition

DocPC:基于代表性页面组合的文档级视觉检索

Chengsong You, Junwei Zhou, Xiaoyu Cao, Weiyao Wang, Yiwei Xu, Ziyan Zhao, Zhen Sun, Qicheng Zhu, Xuanyi Fu, Yufan Chen, Yilun Li, Rongkang Xiong, Yunhai Hu, Nan Du

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 针对现有视觉文档检索以页面为中心的问题,提出DocPC框架,通过组合代表性页面实现文档级索引,在DocViRe基准上性能优于最强页面级基线且存储成本大幅降低。

Comments 15 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 4 篇

2608.21832 2026-08-28 cs.CL 版本更新 78%

GUI-Primitives: Diagnosing Spatial Reasoning Failures in Vision-Language GUI Grounding

GUI-Primitives:诊断视觉-语言GUI定位中的空间推理失败

Md Abrar Jahin, Md Rizwan Parvez

机构 * University of Southern California(南加州大学) USC Information Sciences Institute(南加州大学信息科学研究所) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)

专题命中 GUI与屏幕智能体 :grounding(title);vision-language model(abstract)

AI总结 本文提出GUI-Primitives基准,通过994个含7种空间关系的对比指令对,发现多数视觉-语言GUI定位模型的失败源于候选定位而非关系理解,且标记候选可提升准确率。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17512 2026-08-28 cs.RO 版本更新 75%

Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation

具身导航器:指向、思考、记忆与对齐以实现高效导航

Hongyan Feng, Sunlai Chen, Xuanyu Liu, Miao Pan, Yangfan Xie, Yuxiang Cui, Zhongxiang Zhou, Rong Xiong, Wenqi Zhang, Jianwei Yin, Yueting Zhuang, Xuhong Zhang

机构 * ZJU(浙江大学)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 本研究提出具身导航框架TAMP-Nav,通过像素转3D动作、选择性推理记忆与GRPO两级对齐,在R2R-CE数据集上实现66.2% SR,仅需90k训练轨迹,达成高效具身导航的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27384 2026-08-28 cs.RO 新提交 67%

FlashVLA: Streaming Action Decoding for Fast and Asynchronous VLA Inference

FlashVLA:用于快速异步VLA推理的流式动作解码

Zekai Li, Jiaming Tang, Zhijian Liu

机构 * UC San Diego(加州大学圣迭戈分校) MIT(麻省理工学院)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn)

AI总结 FlashVLA是一种流式动作解码框架,通过分块因果注意力维护动作缓冲,实现低延迟、平稳异步的VLA推理,在单GPU上达≥30Hz控制频率且任务性能优异。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26947 2026-08-28 cs.RO cs.CV 新提交 57%

4DSynth: Controllable Procedural World Synthesis for Dynamic Embodied Simulation

4DSynth:面向动态具身模拟的可控程序式世界合成

Zehao Qi, Haochen Luo, Jia-Wang Bian, Zeyu Ma, Shuyang Sun

机构 * Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学) Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出可控程序式4D环境生成系统4DSynth,可将自然语言等输入转化为可编辑4D环境,并构建交互式导航基准4DSynth-Nav,为具身智能体开发评估提供实用基础。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 5 篇

2608.26645 2026-08-28 cs.RO 新提交 80%

FLARE: A Failure-Aware Framework for Autonomous Correction and Recovery in Visual-Language Robotic Manipulation

FLARE:一种面向视觉-语言机器人操纵中自主修正与恢复的故障感知框架

Ganlong Zhao, Zijia Tang, Xingping Chen, Zhanghui Kuang, Ye Tian, Guanbin Li

机构 * The Chinese University of Hong Kong(香港中文大学) Centre for Perceptual and Interactive Intelligence(感知与交互智能中心) Duke University(杜克大学) Sun Yat-sen University(中山大学) TengenX(天工科技) Tencent Robotics X(腾讯Robotics X实验室) Shenzhen Loop Area Institute(深圳河套学院) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 幻觉与鲁棒性 :MLLM(summary_cn,abstract)

AI总结 针对视觉-语言机器人操纵中VLAs无法从执行错误恢复的问题,提出含“重试”“重置”范式的FLARE框架,结合MLLM实现故障恢复,显著提升接触密集型操纵任务的成功率与鲁棒性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27004 2026-08-28 cs.CV 新提交 79%

MVC-Bench: Benchmarking Calibration of Medical Vision-Language Models

MVC-Bench:医学视觉-语言模型的校准基准测试

Ashshak Sharifdeen, Shihab Aaqil Ahamed, Ufaq Khan, Muhammad Akhtar Munir Sujair Ibrahim, Mohamed Rafeek Mareer Ahamed, Yutong Xie, Imran Razzak, Muhammad Haris Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) Sabaragamuwa University of Sri Lanka(斯里兰卡萨巴拉加穆瓦大学) Digital Platform Development, SLT PLC(SLT公共有限公司数字平台开发部)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 该研究针对医学视觉-语言模型校准不足的问题,提出以校准为核心的基准MVC-Bench,通过多维度评估并提出MCM正则化方法,为医疗工作流提供校准改进指导。

Comments Accepted in EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26382 2026-08-28 cs.CV 新提交 79%

VIPER: An Expert-Curated Benchmark for Vision-Language Models in Veterinary Pathology

VIPER:用于兽医病理学视觉语言模型的专家策划基准

Luca L. Weishaupt, Simone de Brot, Javier Asin, Llorenç Grau-Roma, Nic G. Reitsam, Andrew H. Song, Dongmin Bang, Stefan T. Kaluziak, Long Phi Le, Jakob Nikolas Kather, Faisal Mahmood, Guillaume Jaume

机构 * Harvard-MIT HST(哈佛-麻省理工卫生科学与技术部) Mass General Brigham(麻省总医院布里格姆医疗系统) Harvard Medical School(哈佛医学院) COMPATH, University of Bern(伯尔尼大学COMPATH) UC Davis(加州大学戴维斯分校) University of Augsburg(奥格斯堡大学) UT MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心) TU Dresden(德累斯顿工业大学) University of Lausanne(洛桑大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究针对现有病理视觉语言模型基准聚焦人体组织的问题,推出首个兽医病理学视觉语言模型评估基准VIPER,测试16类模型发现领域差距,验证领域特定训练的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10358 2026-08-28 cs.CV cs.AI 版本更新 62%

Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift

在域转移下对用于乳腺钼靶成像的基础模型的稳健性进行基准测试

Giang Nguyen, Raghav Mehta, Emma A.M. Stanley, Tian Xia, Thi Hao Nguyen, Hieu Pham, Ben Glocker

机构 * College of Engineering and Computer Science, VinUniversity(工程与计算机科学学院,文大大学) Imperial College London(伦敦帝国理工学院) Radiology Department, Vietnam National Cancer Hospital(越南国家癌症医院放射科) VinUni-Illinois Smart Health Center, VinUniversity(文大大学 - 伊利诺伊智能健康中心,文大大学) The Computer Vision and Medical AI Lab, VinUniversity(计算机视觉与医学人工智能实验室,文大大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究在域转移下乳腺钼靶成像基础模型的稳健性,用统一协议在多数据集上训练评估15种模型主干,发现特定视觉语言模型性能强,DINOv3是有竞争力基线,适应预训练未持续提升泛化,强调数据集级OOD评估是核心标准。

Comments Accepted at Deep-Brea3th 2026 workshop in conjunction with MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26157 2026-08-28 cs.AI 新提交 57%

GROUND: Reducing Hallucinations in LLM-Based Enterprise Analytics Through Governed Semantic Definitions

GROUND:通过受监管的语义定义减少基于大语言模型的企业分析中的幻觉现象

Aravind Sasidharan Pillai

机构 * Cox Automotive Inc(考克斯汽车公司)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 该研究提出GROUND框架,通过受监管语义层约束大语言模型生成的企业分析内容,在多模型多数据集测试中消除了所有评估类别的幻觉,保障了数据安全。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 18 篇

2608.26143 2026-08-28 cs.CL cs.AI 新提交 89%

Beyond Accuracy: A Qualitative Analysis of Vision-Language Models for Hate Speech Detection in Memes

超越准确率:对用于表情包仇恨言论检测的视觉-语言模型的定性分析

Muhammad Jawad Chowdhury, Adiba Hasan, Ishrak Hossain, Shahriar Ivan, Sabbir Ahmed

机构 * Islamic University of Technology(伊斯兰科技大学)

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);vision-language model(title,abstract);分类 cs.AI

AI总结 本研究通过定性分析LLaVA-7B等四个VLMs在零样本、少样本设置下的表现,揭示其检测仇恨表情包时忽略关键语境线索的问题,为优化模型提供了更深入的理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27206 2026-08-28 cs.CV cs.AI 新提交 86%

PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inference

PACE:用于快速视觉语言模型推理的统一压缩-提取范式

Junjie Liu, Shengyuan Ye, Xu Chen

机构 * Sun Yat-sen University(中山大学) Power Dispatch Control Center, Guangdong Power Grid Co., Ltd.(广东电网有限责任公司电力调度控制中心) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract,abstract_cn);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 针对视觉语言模型推理成本随视觉 token 增多而上升的问题,提出无需训练的 PACE 框架,集成到 Qwen2.5-VL-7B 后仅用 10% 视觉 token 保留 93.8% 原性能,TTFT 加速 3.1 倍。

Comments 22 pages, 9 figures, 13 tables. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08139 2026-08-28 cs.CV cs.AI 版本更新 86%

Subspace Alignment for Vision-Language Model Test-time Adaptation

子空间对齐用于视觉-语言模型测试时适应

Zhichen Zeng, Wenxuan Bao, Xiao Lin, Ruizhong Qiu, Tianxin Wei, Xuying Ning, Yuchen Yan, Chen Luo, Monica Xiao Cheng, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 SubTTA通过子空间对齐提升视觉-语言模型测试时适应性能,有效解决模态差距和视觉噪声问题。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26806 2026-08-28 cs.CV 新提交 85%

Multi-Image Visual Token Pruning in Large Visual Language Models

多图像视觉语言模型中的多图像视觉令牌剪枝

Rongyang Zhang, Chengqiang Lu, Cong Li, Hongchao Gu, Tingjia Shen, Xuyang Zhi, Qimeng Wang, Yan Gao, Yi Wu, Yao Hu, Hao Wang, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Xiaohongshu Inc.(小红书科技有限公司)

专题命中 VLM训练与架构 :visual language model(title);LLaVA(abstract,abstract_cn);vision language model(abstract);分类 cs.CV

AI总结 本文针对现有LVLMs多图像剪枝方法的局限,提出无需训练的AVTP框架,在多类LVLMs上实现显著推理加速,同时保持较高准确率,部分模型性能甚至优于基线。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26788 2026-08-28 cs.AI cs.CL cs.MA cs.RO 新提交 84%

Decoupling Planning and Control for Instructable Agents

可指令智能体的规划与控制解耦

Zineng Tang, Kelsey R. Allen, Sjoerd van Steenkiste, Ishita Dasgupta, Alane Suhr

机构 * UC Berkeley(加州大学伯克利分校) UBC(不列颠哥伦比亚大学) Google DeepMind(谷歌DeepMind)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.AI

AI总结 本研究提出Instruct-to-Act系统,将VLM规划器与世界模型控制器解耦,在七个具身环境中验证其性能优于仅控制器、直接VLM动作生成等基线,可替换VLM规划器且保持快速控制。

Comments Published as a conference paper at COLM 2026. Project page: this https URL (https://zinengtang.github.io/instruct-to-act/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27154 2026-08-28 cs.CV 新提交 81%

ReViCo: Unveiling the Limitations of VLMs in Visual Text Understanding via Error Correction

ReViCo:通过纠错揭示视觉语言模型在视觉文本理解中的局限性

Bojun Zhang, Junhong Liang, Feifei Zhai, Fengxian Ji, Yu Zhou

机构 * Institute of Automation, CAS(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Zhongke Fanyu Technology Co., Ltd(中科梵语科技有限公司)

专题命中 VLM训练与架构 :vision language model(abstract,abstract_cn);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究提出ReViCo基准,以视觉文本纠错任务评估VLMs,发现其与人类存在显著性能差距,为开发更优文本感知VLMs提供新基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26956 2026-08-28 cs.CV 新提交 81%

RubricRM: Generative Reward Modeling via Dynamic Rubrics for Image Generation and Editing

RubricRM:基于动态评分规则的生成式奖励模型,用于图像生成与编辑

Zijian Kan, Wei Wang, Long Luo, Bing Zhao, Xuan Ren, Weixu Qiao, Wenbo Li, Hu Wei, Lin Qu

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Alibaba DAMO Academy(阿里巴巴达摩院)

专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 该研究提出RubricRM框架,为文本到图像生成和图像编辑训练专用模型,其性能优于现有专用奖励模型,且与强专有MLLM评估器竞争力相当,可用于图像生成与编辑的奖励建模。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26820 2026-08-28 cs.CV 新提交 77%

LLaVAFlow: Preserving Latent Alignment Flow for Parameter-Efficient Multimodal Fine-Tuning

LLaVAFlow:用于参数高效多模态微调的潜在对齐流保留方法

Muyao Yuan, Muyan Jiao, Jiangyong Ying, Weizhan Zhang, Yuanhong Zhang, Lan Ma, Yuan Gao, Haipeng Du

机构 * MOEKLINNS China Telecom(中国电信)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 针对多模态大语言模型微调的灾难性遗忘问题,本文提出即插即用的LLaVAFlow框架,通过信息论蒸馏保留跨模态对齐流,提升下游任务性能与泛化能力。

Comments Accepted by ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26155 2026-08-28 cs.CL cs.AI 新提交 77%

VFA: Empowering Multilingual MLLMs via Vision-Free Adaptation

VFA:通过无视觉适配赋能多语言多模态大语言模型

Yixia Li, Yaqing Shi, Zhiwen Ruan, Dongdong Zhang, Lingjie Jiang, Shaohan Huang, Yun Chen, Guanhua Chen, Furu Wei

机构 * Southern University of Science and Technology(南方科技大学) Microsoft Research Asia(微软亚洲研究院) Shanghai University of Finance and Economics(上海财经大学) Peking University(北京大学)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 本研究针对多模态大语言模型的英语中心化问题,提出VFA框架,通过组合任务向量实现多语言增强与视觉对齐解耦,仅用少量数据就提升了多语言模型性能并保留原有能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27417 2026-08-28 cs.CV 新提交 70%

Retrieval Heads Meet Vision: Uncovering How VLMs Locate and Extract Visual Information

检索头与视觉结合:揭示视觉语言模型如何定位和提取视觉信息

Chanho Park, Daehyeon Choi, Jihyun Lee, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 该研究发现视觉语言模型(VLMs)中存在视觉检索头(VRHs),其占注意力头的1.7%-2.6%,负责将文本描述与图像区域建立因果关联,屏蔽前20个VRHs可使定位准确率降低多达80个百分点,且VRHs具备泛化性、功能特异性与架构共享性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26495 2026-08-28 cs.CV 新提交 70%

Video-FLAIR: Not Whether to Reason, But How

Video-FLAIR:不是是否推理,而是如何推理

Yogesh Kulkarni, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学)

专题命中 VLM训练与架构 :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 该研究提出 Video-FLAIR 训练框架,通过强化学习让模型为多模态查询选择适配的推理模式,在多个视频多模态基准上提升准确率并降低 token 用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01942 2026-08-28 cs.CV cs.CL cs.MM 版本更新 70%

CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation

CultureVidBench:文本到视频生成中的文化理解基准测试

Xianjing Han, Yuhan Su, Yang Deng, Dong Ma, Wee Peng Tay, Bin Zhu

机构 * Nanyang Technological University(南洋理工大学) Centrale Supélec(中央高等电力学院) Singapore Management University(新加坡管理大学) University of Cambridge(剑桥大学)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本研究推出CultureVidBench基准,评估7款T2V模型的文化理解能力,发现现有模型难捕捉细粒度文化细节,尤其针对代表性不足的文化区域与线索。

Comments EMNLP 2026 Main Conference, Project page: this https URL (https://hanxjing.github.io/CultureVidBench/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05745 2026-08-28 cs.CV cs.AI 版本更新 62%

UniVVT: A Unified End-to-End Framework for High-Fidelity Video Virtual Try-on

UniVVT:用于高保真视频虚拟试穿的统一端到端框架

Yushe Cao, Shikun Feng, Fei Shen, Haikuo Peng, Jianqiang Xia, Yiheng Zhu, Dianxi Shi, Chun Yu

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 UniVVT是一种统一端到端视频虚拟试穿框架,以多模态大语言模型为核心,采用三阶段渐进训练策略,在多基准上实现了优于主流方法的高保真试穿效果。

Comments 17 pages,21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02324 2026-08-28 cs.CL cs.AI cs.LG 版本更新 62%

Grounded Token Initialization for New Vocabulary in LMs for Generative Recommendation

为生成推荐系统中的新词汇提供基础性词 token 初始化

Daiwei Chen, Zhoutong Fu, Chengming Jiang, Haichao Zhang, Ran Zhou, Tan Wang, Chunnan Yao, Guoyao Li, Rui Cai, Yihan Cao, Ruijie Jiang, Fedor Borisyuk, Jianqiang Shen, Jingwei Wu, Ramya Korlakai Vinayak

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) LinkedIn Corporation(领英公司) Northeastern University(东北大学) University of California, Davis(加州大学戴维斯分校)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GTI方法,通过在预训练嵌入空间中语义地初始化新词汇,提升生成推荐系统性能,优于传统均值初始化和辅助任务适应方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26632 2026-08-28 cs.CV 新提交 57%

Who Remains, What Changes: Identity Anchored Composed Gait Retrieval

谁留存,什么改变:基于身份锚定的组合步态检索

Jingchen Fei, Zengbin Wang, Yukun Liu, Muyi Sun, Shibiao Xu, Man Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出组合步态检索(CoGR)新任务,构建了首批步态-语言数据集,提出基于身份锚定的ComposeGait框架,在两个基准上取得最优R@1,为CoGR提供强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26141 2026-08-28 cs.CL cs.LG 新提交 57%

AdaThinking-E: One-Token Entropy Regulation for Adaptive Thinking

AdaThinking-E:用于自适应思考的单token熵调控

Zining Wang, Tongkun Guan, Boming Chen, Zhentao Guo, Jianqiang Liu, Chao Jin, Chen Duan, Kai Zhou, Pengfei Yan, Wei Shen, Xiaokang Yang

机构 * Meituan(美团) MoE Key Lab of Artificial Intelligence(MoE人工智能重点实验室) AI Institute(人工智能研究院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) MAIS&NLPR, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.LG

AI总结 提出AdaThinking-E强化学习框架,通过单token熵调控实现自适应思考,使模型在不同复杂度文档任务中兼顾准确率与效率

详情

展开后加载摘要…

URL PDF HTML 收藏