arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-27 至 2026-08-27 共收录 58 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 6 篇

2608.25575 2026-08-27 cs.CV cs.AI 新提交 92%

MLLMCLIP: Feature-Level Distillation of MLLM for Robust Vision-Language Representations

MLLMCLIP:面向鲁棒视觉-语言表征的多模态大语言模型(MLLM)特征级蒸馏

Jongsuk Kim, Qiyu Wu, Zhuoyuan Mao, Hiromi Wakaki, Junmo Kim, Yuki Mitsufuji

机构 * KAIST(韩国科学技术院) Sony Group Corporation(索尼集团公司)

专题命中 图文多模态 :MLLM(title,title_cn);multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 MLLMCLIP是一种异构特征级蒸馏框架,直接将MLLM的多模态知识迁移至CLIP,在组合性任务和通用视觉-语言任务上均实现最优性能。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24935 2026-08-27 cs.CV cs.AI 新提交 81%

A Lightweight Multimodal Vision-Language Framework for Early-Stage Anatomical Green Fruit Classification in Commercial Orchards

面向商业果园早期解剖结构青果分类的轻量级多模态视觉-语言框架

Ranjan Sapkota, William Bu, Chen Chen, Yunjun Xu, Manoj Karkee

机构 * Cornell University(康奈尔大学) University of Central Florida(中佛罗里达大学) Institute of Artificial Intelligence (IAI)(人工智能研究所(IAI))

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出适配TinyCLIP的轻量级多模态视觉-语言框架,实现复杂果园环境下幼果解剖结构细粒度分类,在NVIDIA T4上取得0.93宏F1,经优化可边缘部署,支撑自动化幼果分析与机器人疏果系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26013 2026-08-27 cs.CL 新提交 79%

VISA: Agentic Self-Evolving Data Synthesis for Multimodal Instruction Following

VISA:用于多模态指令遵循的智能体式自进化数据合成

Min Zeng, Guanxin Tan, Libin Cen, Yawei Wen, Rui Hu, Liuyang Bian, Xiaolong Chen, Xiaoxin Chen

机构 * vivo AI Lab(vivo AI实验室)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 VISA是一种智能体式自进化数据合成框架,通过自进化循环优化多模态指令合成,在MM-IFEval等基准上提升了多模态指令遵循性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25580 2026-08-27 cs.CV cs.AI 新提交 62%

V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning

V-Rubrics:基于评分规则的强化学习实现视觉忠实性

Shulin Tian, Minglun Li, Yuhao Dong, Hao Ding, Jiarui Yao, Haiwen Diao, Jingkang Yang, Hongyuan Zhu, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(新加坡南洋理工大学S-Lab) UIUC(伊利诺伊大学厄巴纳-香槟分校) A*STAR(新加坡科技研究局)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对视觉-语言模型回答缺乏视觉依据的问题,提出基于评分规则的强化学习方法V-Rubrics,通过分解响应为原子命题并从三方面评分,训练的模型在相关推理基准上性能优于基线。

Comments Proj page: this https URL (https://shulin16.github.io/v-rubrics/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25037 2026-08-27 cs.AI cs.CL cs.DB cs.IR 新提交 62%

Retrieve, Match, Escalate: Accurate and Scalable Product Linking with VLM-Distilled Cross-Encoders and Agentic VLMs

检索、匹配、升级:基于VLM蒸馏的交叉编码器与智能体VLMs的准确且可扩展的商品链接

Jian Wang, Steven Xu, Sanjyot Thete, Maryam Barouti, Tom Tang, Elaine Wu, Charu Sareen, Kyle MacDonald

机构 * DoorDash Inc.(DoorDash公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大规模商品链接的成本与精度矛盾,提出“检索-匹配-升级”级联框架,用VLM蒸馏的交叉编码器处理多数简单案例,智能体VLM解决模糊案例,提升了链接覆盖率且降低成本。

Comments 9 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25707 2026-08-27 cs.LG 新提交 50%

Fairness-Aware Test-Time Prompt Tuning

感知公平性的测试时提示调优

Yoann Launay, Parameswaran Kamalaruban, Tom Kempton, Stuart Burrell, David Sutton

机构 * University of Cambridge(剑桥大学) Visa Inc.(维萨公司) University of Manchester(曼彻斯特大学)

专题命中 图文多模态 :multi-modal(abstract)

AI总结 本文针对分布偏移下视觉-语言模型的公平性问题,提出了感知公平性的情节式测试时自适应方法FairTPT,通过软提示调优联合优化熵,实现公平性提升并优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 2 篇

2608.25157 2026-08-27 cs.CV cs.MM cs.SD 新提交 82%

What Do Audio-Visual Synchronization Metrics Actually Measure?

视听同步指标究竟测量什么?

Jai Kumar Sharma, Peeyush Tapadiya

机构 * Virginia Tech(弗吉尼亚理工大学) Accenture(埃森哲公司)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM

AI总结 该研究审计了AV-Align等4种视听同步指标,发现它们在不同任务上各有优劣且一致性差,建议以含置信区间的指标类别细分形式报告视听同步结果。

Comments Accepted at the ECCV 2026 Workshop on Generative AI for Audio-Visual Content Creation (Gen4AVC), poster presentation; non-archival workshop. 7 pages (4-page main text + references + 2-page appendix), 3 figures, 8 tables. Project page: this https URL (https://jaishrm07.github.io/avsync-reliability-card/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24909 2026-08-27 cs.HC cs.CV cs.SD 新提交 57%

Super Star: Towards Streaming Real-time Interactive Agents for Digital Humans

超级明星:面向数字人的流式实时交互智能体

Wentao Jiang, Youchen Xie, Haidi Fan, Yajing Chen, Xin Wang, Ye Shi, Jingya Wang

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文针对交互式数字人提出流式实时同步言语手势生成任务,构建耦合流式语音响应与在线手势生成的框架,经实验验证其在延迟-质量权衡等方面优于现有基线。

Comments Accepted by ACM Multimedia 2026. Project Page: \url{ this https URL (https://super-star-2026.github.io/) }

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 5 篇

2608.26067 2026-08-27 cs.CV 新提交 83%

StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models

StreamPI:面向视觉-语言-动作模型的流式多模态时序建模

Zhe Liu, Jinghua Hou, Yuxiang Lu, Zhenya Yang, Xianzhe Fan, Junwei Luo, Junyi Li, Ruihua Han, Zhi Hou, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) ACE Robotics(ACE机器人公司)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出StreamPI框架,为单帧VLA模型赋予时序推理能力,通过指令锚定时序建模、随机间隔流式训练等方法,在真实机器人与仿真基准任务上性能优于pi0.5。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25529 2026-08-27 cs.CV 新提交 79%

Video-IFBench: Evaluating Instruction Following of Multimodal LLMs in Video Understanding Scenarios

Video-IFBench:评估多模态大语言模型在视频理解场景中的指令遵循能力

Hongbo Liu, Peixian Chen, Sihan Liu, Peiyuan Zhang, Kai Zou, Dian Zheng, Xiaoxing Hu, Yuhao Dong, Mengdan Zhang, Yunhang Shen, Haoyu Cao, Wei Liu, Weibo Gu, Xing Sun, Shengjie Zhao

机构 * TJU(天津大学) Tencent Youtu Lab(腾讯优图实验室) SJTU(上海交通大学) Tencent Hunyuan(腾讯混元) CUHK(香港中文大学) NTU(南洋理工大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文推出Video-IFBench基准,构建含四类模板的指令分类体系与半自动数据 pipeline,评估20余种MLLMs的视频指令遵循能力,发现当前模型在复杂指令上仍具挑战,推动相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25433 2026-08-27 eess.SP 新提交 78%

BeamGuard: Risk-Aware Multimodal Beam Forecasting and Adaptive Virtual Beamwidth Control for 6G mmWave V2I Links

BeamGuard:面向6G毫米波车联网(V2I)链路的风险感知多模态波束预测与自适应虚拟波束宽度控制

Abidemi Orimogunje, Dejan Vukobratovic, Sunwoo Kim, Igbafe Orikumhi, Vukan Ninkovic, Evariste Twahirwa, Gaspard Gashema

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 BeamGuard是面向6G毫米波V2I链路的多模态感知辅助波束管理框架,通过融合多模态传感与带内观测预测波束分布,实现自适应虚拟波束宽度控制,在DeepSense 6G数据集上较基线方法性能更优,可实现鲁棒的低开销波束管理。

Comments Accepted for Publication in IEEE Open Journal of the Communications Society. 18 pages, 5 figures, 11 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26105 2026-08-27 cs.CV cs.AI cs.LG cs.MM cs.RO 新提交 67%

VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning

VBVR-Pro:用于原生视觉推理的可扩展且可验证工具套件

Junxiang Xu, Ruisi Wang, Fanyi Pu, Maijunxian Wang, Ran Ji, Tongxi Zhou, Chenyang Gu, Jing Zuo, Hongcan Xiao, Yimeng Geng, Wanqi Yin, Wei Chen, Oscar Qian, Zhengan Yan, Ziqi Huang, Haiwen Diao, Liang Pan, Bo Li, Xiangyu Fan, Dezhi Luo, Fengyuan Yu, Zehong Zhao, Qingying Gao, Tinghui Zhu, Yilan Zhang, Jingqi Tong, Pinyuan Feng, Zhengze Jiang, Letian Wang, Ziyu Guo, Renrui Zhang, Jieneng Chen, Sonia Joseph, Constantin Venhoff, Saman Motamed, Mengyue Yang, Chandra Sripada, Alan Yuille, Philip Torr, Lvmin Zhang, Vikash Kumar, Daniel Khashabi, Nikolaus Kriegeskorte, Raphaël Millière, Vincent C. Müller, Anyi Rao, Quan Wang, Ziwei Liu, Dahua Lin, Lei Yang, Hokin Deng, Zhongang Cai

机构 * Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) University of California, San Diego(加州大学圣地亚哥分校) The University of Tokyo(东京大学) The Chinese University of Hong Kong(香港中文大学) University of Michigan(密歇根大学) Johns Hopkins University(约翰霍普金斯大学) University of California, Davis(加州大学戴维斯分校) University of California, Los Angeles(加州大学洛杉矶分校) Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学) University of Toronto(多伦多大学)

专题命中 视频多模态 :MLLM(abstract_cn);分类 cs.CV、cs.AI、cs.MM

AI总结 本研究提出VBVR-Pro,一个可扩展可验证的原生视觉推理闭环测试平台,含300个生成任务、确定性评分器及多生成器机制研究,训练模型在多视觉推理基准上迁移性强,发布全部相关资源。

Comments Homepage: this https URL (https://video-reason.com/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26094 2026-08-27 cs.CV cs.AI cs.ET cs.HC cs.LG 新提交 62%

MyoMechanix: Biomechanically-Grounded Compositional Skilled Activity Understanding and Coaching

MyoMechanix:基于生物力学的可组合技能活动理解与指导

Hao Yin, Paritosh Parmar, Lijun Gu, Lin Xu, Tianxiao Guo, Xiujin Liu, Tianyou Zheng, Yang Zhang, Weiwei Fu

机构 * University of Science and Technology of China(中国科学技术大学) Suzhou Institute of Biomedical Engineering and Technology, Chinese Academy of Sciences(中国科学院苏州生物医学工程技术研究所) Arexeni Research and Technologies Inc.(Arexeni研究与技术公司) Beijing Sports University(北京体育大学) University of Michigan(密歇根大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MyoMechanix多模态生态系统,构建FKG与CUBIST,建立三类任务,多模态方法提升AQA性能与可解释性,为物理AI提供生物力学基础的技能理解方案。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 8 篇

2608.25412 2026-08-27 cs.CV 新提交 83%

AdaptiveEmbed: Sample-Adaptive Multi-Vector Representation for Multimodal Retrieval

AdaptiveEmbed:面向多模态检索的样本自适应多向量表示

Xinze Liu, Lei Yang, Dayan Wu, Hengjie Zhu, Zihao Zhang, Hanqi Wu, Tianzhu Hu, Peng Fu, Zheng Lin, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本研究提出样本自适应多向量表示(SAMVR)新设定,构建AdaptiveEmbed框架,通过多组对比学习等技术实现样本级自适应容量分配,在多模态检索基准上验证其性能优于固定容量方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26091 2026-08-27 cs.IR cs.CL cs.CV 新提交 81%

PlanSightRAG: A Visual-First Multimodal RAG for Automating Question Answering and Compliance Checking for Civil Standard Plans

PlanSightRAG:面向民用标准图纸的自动化问答与合规检查的视觉优先多模态检索增强生成模型

Nabaraj Subedi, Shuvo Dip Datta, Ahmed Abdelaty, Shivanand Venkanna Sheshappanavar

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 针对民用标准图纸的OCR自动化方法会丢失关键几何信息,本文提出视觉优先多模态RAG框架PlanSightRAG,整合多向量检索与智能体架构,构建基准数据集并验证其在检索、合规检查任务上的性能,还实现了自主视觉规则 grounding。

Comments 32 pages, 9 figures, 25 tables. Preprint submitted to Automation in Construction

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25986 2026-08-27 cs.AI 新提交 79%

Multi-Granularity Context-Enhanced RAG over Multimodal Knowledge Graphs

面向多模态知识图谱的多粒度上下文增强检索增强生成

Zongyu Wu, Yilong Wang, Xiaochen Wang, Minhua Lin, Zhichao Xu, Fenglong Ma, Xiang Zhang, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Utah(犹他大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 针对现有多模态知识图谱RAG方法的语义鸿沟问题,本文提出CEMMKG框架,通过多粒度局部与全局上下文增强,有效提升了多模态GraphRAG的性能与适用性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25780 2026-08-27 cs.IR 新提交 78%

PUMA: Post-Hoc Sparsification of Universal Multimodal Embeddings for Efficient Retrieval

PUMA:用于高效检索的通用多模态嵌入的事后稀疏化

Matteo Attimonelli, Alessandro De Bellis, Franco Maria Nardini, Claudio Pomo, Cosimo Rulli, Rossano Venturini, Tommaso Di Noia

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 针对通用多模态嵌入的高存储与推理成本问题,提出无需微调主干网络的PUMA稀疏自编码器方案,在五个基准上验证其可实现8-16倍存储压缩与最高25倍检索加速,且多数数据集性能与密集检索相当或更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25381 2026-08-27 cs.IR 新提交 78%

MOTIF: Motivation-guided Topology Inference for Cold-start Multimodal Recommendation

MOTIF:面向冷启动多模态推荐的动机引导拓扑推断

Yurui Shi, Yuchen Miao, Ximing Hu, Zijun Wang, Chang Han

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 针对冷启动多模态推荐的三大耦合挑战,提出MOTIF框架,整合四类技术实现拓扑推断,在三个多模态基准上较各类基线取得最高6.07%的相对提升。

Comments 15 pages, 3 figures, 7 tables. Accepted at WISE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25023 2026-08-27 cs.AI cs.CV 新提交 62%

CVE-SAI: Counterfactual Visual Evidence-Guided Selective Attribute Indexing for Risk-Controlled E-commerce Search

CVE-SAI:用于风险可控电商搜索的反事实视觉证据引导的选择性属性索引

Xiaolong Sun, Qichao Wang, Hangyu Li, Liang Chen

机构 * Sun Yat-Sen University(中山大学) Nanyang Technological University(南洋理工大学) Tencent(腾讯)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出CVE-SAI方法,将电商属性推断与索引准入分离,通过反事实视觉证据控制风险,在5%不安全准入预算下,于Amazon Berkeley Objects数据集上实现了更优的属性补全与检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26088 2026-08-27 cs.AI cs.LG 新提交 57%

Planetary Prediction Engine: Autonomous Geospatial Prediction via Intelligent Data Selection and Foundation Model Embeddings

行星预测引擎:通过智能数据选择和基础模型嵌入实现自主地理空间预测

Evelyn Ma, Rama Kumar Pasumarthi, Kishwar Shafin, Mandar Sharma, Mimi Sun, Hamed Sadeghi, Dav M. Ebengo, Mbulayi Onesime, Rouslan Solomakhin, John Wamburu, William Ogallo, Aisha Walcott-Bryant, Sanxing Chen, Arbaaz Muslim, Yael Mayer, Ronald Ho, Roy Lee, Ruth Alcantara, Abdoulaye Diack, Monica Bharel, Lambert Rosique, Jeremy Amez-Droz, Christopher Haire, James Manyika, Yossi Matias, Niv Efron, Gautam Prasad, Shravya Shetty

机构 * Google Research(谷歌研究院) Institut National de Recherche Biomédicale(国家生物医学研究院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 该研究提出行星预测引擎(PPE),一种自主AI系统,可根据自然语言查询完成地理空间预测的端到端工作流程,在多类任务中优于现有模型,降低了行星规模分析的技术门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25625 2026-08-27 cs.IR 新提交 50%

RetrievalRouter: Joint Modality and Architecture Selection for Document Retrieval

RetrievalRouter:面向文档检索的联合模态与架构选择

Emre Kuru, Mehmet Onur Keskin, Reza Farahbakhsh, Noel Crespi

专题命中 跨模态检索 :multimodal(abstract)

AI总结 RetrievalRouter是一种轻量级查询感知路由模型,仅从查询文本为每个文档检索任务匹配合适流程,在金融、科学语料库基准测试中,其准确率较最佳静态基准高2.5%、速度快12.4倍,且优于现有自适应策略选择方法。

Comments Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 3 篇

2608.25855 2026-08-27 cs.CE cs.AI 新提交 79%

Unlocking Multimodal Protein Language Models at Inference Time

在推理阶段解锁多模态蛋白质语言模型

Yi Zhou, Qipeng Wang, Yunqing Liu, Jun Xia, Qing Li, Wenqi Fan

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文建立三阶段研究框架,在不更新多模态蛋白质语言模型参数的前提下,通过优化推理阶段采样策略,揭示默认推理协议的次优性并提升其任务性能,得出与现有共识不同的基础模型相关结论。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25138 2026-08-27 cs.LG cs.AI 新提交 57%

Drift Variation Autoencoder: Unifying Generation and Representation Learning through Conditional Posterior Flow Matching

漂移变分自编码器:通过条件后验流匹配统一生成与表示学习

Jiarui Cao

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本研究提出漂移变分自编码器,通过条件后验流匹配统一生成与表示学习,在CrossGeom-4基准上实现了高表示精度与模态一致性,完成多模态概念验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26076 2026-08-27 cs.RO 新提交 50%

Fast Generative Grasping via Lie Group-Constrained MeanFlow

基于李群约束MeanFlow的快速生成式抓取

S. Talha Bukhari, Yi Wei, Ruiqi Ni, Zachary Kingston, Aniket Bera

机构 * Purdue University(普渡大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 该研究提出基于李群约束MeanFlow的快速生成式抓取方法,可在≤5次网络评估内采样可靠抓取,在ACRONYM数据集上性能与SOTA模型相当,推理延迟达毫秒级,且无需额外训练即可迁移到真实机器人抓取。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 14 篇

2608.24934 2026-08-27 cs.CV cs.AI 新提交 89%

Fusing Perceptual Vision Experts with Multimodal Large Language Models for Explainable Plant Disease Diagnosis: From Benchmark Imagery to Real-World Robotic Field Validation

融合感知视觉专家与多模态大语言模型的可解释植物病害诊断:从基准图像到真实世界机器人现场验证

Ranjan Sapkota, Konstantinos I. Roumeliotis, Pengyao Xie, Nikolaos D. Tselikas, Lirong Xiang, Manoj Karkee

机构 * Cornell University(康奈尔大学) University of the Peloponnese(伯罗奔尼撒大学) Agricultural University of Athens(雅典农业大学)

专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究提出H²MAF框架,结合EfficientNet-B3、ConvNeXt-Tiny与Gemma、Qwen等MLLM,在PlantDoc及Cornell机器人田间数据集上实现高准确率可解释植物病害诊断,验证了MLLM仲裁的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25490 2026-08-27 cs.CR cs.AI cs.MM 新提交 84%

MMJailBench: A Factorized Benchmark for Disentangling Multimodal Jailbreak Vulnerabilities

MMJailBench:用于解耦多模态越狱漏洞的因子化基准

Tianshi Wang, Jingsong Wang, Yafei Huang, Fengling Li, Xin Li, Lei Zhu

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 研究人员推出MMJailBench因子化基准,对16个MLLMs评估后揭示其越狱漏洞特征异质且依赖模型,明确提示框架等关键影响因素,开发出模块化多模态越狱评估套件用于高效审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25520 2026-08-27 cs.CV 新提交 83%

Asymmetric Cross-Modal Fine-Grained Visual Categorization: ACF-Net and the BirdPro Benchmark

非对称跨模态细粒度视觉分类:ACF-Net与BirdPro基准

Bohan Deng, Shuo Ye, Zitong Yu

机构 * Great Bay University(大湾区大学)

专题命中 多模态评测 :cross-modal(title,abstract);audio-visual(abstract);分类 cs.CV

AI总结 针对非对称跨模态细粒度视觉分类的挑战,提出ACF-Net框架并构建BirdPro基准,实验显示其在融合与不匹配设置中均优于基线方法。

Comments Accepted by the 9th Chinese Conference on Pattern Recognition and Computer Vision (PRCV 2026). 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25367 2026-08-27 cs.CV 新提交 83%

RSFusionDet: Underwater RGB-Sonar Multimodal Object Detection

RSFusionDet:水下RGB-声呐多模态目标检测

Zhuoyan Liu, Yihan Wang, Bo Wang, Bing Wang, Ye Li

机构 * Harbin Engineering University(哈尔滨工程大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对水下单模态目标检测的传感器成像缺陷,本文构建RSFusion数据集并提出RSFusionDet模型,通过CAFusion模块与OMHead、OMLoss实现跨模态特征融合与目标匹配,在RSFusion数据集上性能优于基线模型DINO。

Comments 18 pages, 13 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25097 2026-08-27 cs.AI cs.MM math-ph 新提交 82%

PhysElite: How Far Are LLMs from Solving Olympiad-Level Physics Problems?

PhysElite:大型语言模型在解决奥林匹克级物理问题上的表现差距有多大?

Ruoran Xu, Wending Gao, Liyunfeng Chen, Aixin Shi, Haoyu Cheng, Zixiang Fang, Yiqiang Zou, Qiufeng Wang

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 多模态评测 :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.AI、cs.MM

AI总结 本文提出PhysElite基准,含11586道奥林匹克级物理题及配套资源,测试18款MLLM发现最强者准确率仅33.7%,还开展分步流程评估诊断推理失败环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25973 2026-08-27 cs.AI cs.LG 新提交 79%

SciMIF: Understanding Multimodal Instruction Following in Scientific Domains

SciMIF:理解科学领域中的多模态指令遵循

Ye Shen, Yuting Zheng, Dun Pei, Zijian Chen, Wenlong Zhang, Qi Jia, Guangtao Zhai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究提出用于评估多模态大语言模型科学指令遵循能力的SciMIF基准,揭示模型在科学领域性能差异及规模提升未对应改善约束遵循等问题,填补相关评估空白。

Comments 21pages, 9 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏