arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-24 至 2026-08-24 共收录 49 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 5 篇

2608.21133 2026-08-24 cs.CV cs.CR 新提交 83%

Masking Is Not Enough: Generative Restoration for Multimodal De-Identification in Medical AI

仅掩码不足:面向医疗AI的多模态去标识化生成式修复

Shiva Shrestha, Zongxing Xie, Chen Zhao, Liran Ma, Zhipeng Cai, Honghui Xu

机构 * Kennesaw State University(肯尼索州立大学) Miami University(迈阿密大学) Georgia State University(佐治亚州立大学)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 针对医疗图像-文本数据的PHI泄漏问题,提出端到端多模态净化框架ClinX,结合图像侧生成式修复与文本侧渐进式去标识化,在MedVQA中验证其优于仅OCR掩码的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20810 2026-08-24 cs.MM cs.AI cs.CV cs.GR 新提交 75%

When Generated Images Look Right and Retrieve Wrong: Coverage-Guided Cross-Scale Re-Indexing for Knowledge-Faithful Generative Perception

当生成图像看起来正确但检索错误:面向知识保真生成感知的覆盖度引导跨尺度重索引

Guangyuan Dong, Chuang Liu, Yangchen Zeng, Haoyu Wang, Xiaoyang Yu, Pinlong Zhao, Yuchao Hou, Ziwei Li, Zheng Lin

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 针对生成图像因尺度差异导致的语义崩溃问题,提出闭环多模态索引框架CERES,在多基准上实现SOTA,显著提升概念-查询检索性能。

Comments 20 pages, 7 figures, and 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20414 2026-08-24 cs.AI cs.CV 新提交 73%

StateSight: Benchmarking Latent Spatial-State Reconstruction in Vision-Language Models

StateSight:评测视觉语言模型中的潜在空间状态重建能力

Michelle Lin

机构 * Thomas Jefferson High School for Science and Technology(托马斯·杰斐逊科学技术高中)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本研究推出StateSight基准及配套数据集StateSight-Steps,评估视觉语言模型的潜在空间状态重建能力,发现GPT-5.5、Claude Sonnet 5的表现均逊于人类基线,格式正确的响应可能掩盖空间结构恢复失败的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21305 2026-08-24 cs.CV cs.AI 新提交 62%

Re$^3$Cap: Retrieval-Guided Refinement for Image Captioning Enhancement via Reinforcement Learning

Re³Cap:基于强化学习的图像字幕增强的检索引导优化

Haonan Jia, Shichao Dong, Zenghui Sun, Jiawen Zheng, Ziqi Miao, Gege Shi, Qiuyu Zhao, Jinsong Lan, Xiaoyong Zhu, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝和天猫集团) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Re³Cap方法,利用多模态检索作为推理信号,通过CRS和CQA优化图像字幕,在COCO-LN500基准上关系推理性能较GRPO提升8.64%,优于SFT。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21170 2026-08-24 cs.CV cs.AI 新提交 62%

Is Visual Prompting All You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds

视觉提示就足够了?研究渐进式视觉支架下视觉语言模型的空间推理能力

Lars Benedikt Kaesberg, Tianyu Yang, Florian Valentin Wunderlich, Terry Ruas, Jan Philip Wahle, Daniel Kurzawe, Bela Gipp

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对 VLMs 的空间推理问题,在 SPaRC 基准中引入轻量视觉支架,可提升 VLMs 任务准确率并补充 GRPO 训练,揭示视觉呈现对 VLM 基准测量属性的关键作用。

Comments Accepted at EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 3 篇

2608.20387 2026-08-24 cs.CL cs.AI 新提交 62%

Poly-InstructTTS: Learning In-the-Wild Expressive Speech Synthesis from Open-Ended Instructions

Poly-InstructTTS:基于开放式指令学习野外场景下的高表现力语音合成

Junhui Zhang, Qianhui Xu, Qingxiang Guo, Dawei Yang, Ling Miao, Qiangqiang Wang, Yang Song

机构 * ZuoYeBang Technology(作业帮科技)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 针对现有TTS模型难以通过自然语言指令控制细粒度表现力的问题,本文提出Poly-InstructTTS模型,构建1000小时指令标注语料库,采用多模态流水线等技术实现高表现力语音合成,相关成果可在项目页面获取。

Comments Accepted to Interspeech 2026. Demo page: this https URL (https://zhangjh915.github.io/PolyInstructTTS-demo/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20433 2026-08-24 cs.RO cs.HC cs.MM cs.SD 新提交 57%

Humanoid Musical Robots as Experimental Interfaces for Music-Evoked Emotion

类人音乐机器人作为音乐诱发情绪研究的实验接口

Vincent K.M. Cheung, Jia-Yeu Lin

机构 * Sony Computer Science Laboratories(索尼计算机科学实验室) Waseda University(早稻田大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

AI总结 本文提出将类人音乐机器人作为音乐诱发情绪研究的实验接口,通过WAS-5案例验证其技术可行性,为该领域可控研究提供方法论平台。

Comments Opinion paper accepted for presentation at the Sound and Music Computing (SMC) Conference 2026 (5-7 November in Zagreb, Croatia)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20880 2026-08-24 cs.HC 新提交 50%

Live Artifacts: Authoring Dynamic Media via Live Layers Encapsulating Generative Specifications

动态制品:通过封装生成式规范的实时图层创作动态媒体

Leixian Shen, Haotian Li, Hugo Romat, Fanny Chevalier, Nicolai Marquardt, Nathalie Riche

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 该研究定义了介于静态资源与交互式软件间的Live Artifacts,提出LiveCanvas创作系统,可让创作者通过视觉画布编排动态生成式制品,经评估能帮助用户从创作静态输出转向打造响应式生成式制品。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 6 篇

2608.21022 2026-08-24 cs.CV cs.MM 新提交 86%

Recognition-Conditioned Reasoning: A Training-Free Multimodal-LLM Pipeline for Fine-Grained Micro-Action Understanding

识别条件推理:一种用于细粒度微动作理解的无训练多模态大语言模型流水线

Fengshun Wang, Jin'ang Han, Zhigang Tu

机构 * Wuhan University(武汉大学)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.MM

AI总结 该研究提出一种无训练的多模态大语言模型流水线,动态分配子任务至适配的模型,在2026年MAC微动作挑战赛MA-Bench赛道的开放式任务上获显著性能优势,取得第一名。

Comments Accept at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21030 2026-08-24 cs.CV cs.CL cs.LG 新提交 81%

COMET: Contrastive Motion-Enhanced Temporal Reasoning for Video Multimodal Large Language Models

COMET:面向视频多模态大语言模型的对比运动增强时序推理

Chenghua Zhu, Zhaolu Kang, Qifan Shi, Siyan Wu, Kehan Jiang, Lei Wei, Lianyu Hu, Guangyuan Dong, Mingbo Yang, Rui Lu, Guibo Luo

机构 * Peking University(北京大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Sun Yat-Sen University(中山大学) Pingan Technology(平安科技)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 COMET是一种视频多模态大语言模型时序增强框架,通过显式时序表示等方法,在Qwen3-VL-8B等模型的动作、时序推理任务上取得性能提升,且可跨模型家族通用。

Comments Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20492 2026-08-24 cs.CV 新提交 77%

Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs

以标注为回滚:面向视频多模态大语言模型的高效可扩展强化学习

Yunheng Li, Guohong Mu, Hao Li, Shengsheng Qian, Dingwen Zhang, Qibin Hou, Ming-Ming Cheng

机构 * Nankai University(南开大学) Northwestern Polytechnical University(西北工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) NKIARI

专题命中 视频多模态 :MLLM(summary_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出OraRL算法,将标注作为神谕回滚解耦优势估计,实现高效可扩展的视频MLLM强化学习,在多项视频感知基准上超越现有模型,解码速度大幅提升。

Comments Project page: this https URL (https://orarl.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20814 2026-08-24 cs.CV 新提交 57%

Enhancing Localized Reasoning for Long Video Understanding via Efficient Segment-to-Video Supervision

通过高效的段级到视频级监督增强长视频理解的局部推理能力

Beibei Zhang, Chao Xu, Jun Lan, Zongyi Li, Lai Wei, Huijia Zhu, Tongwei Ren

机构 * Ant Group(蚂蚁集团)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对长视频理解中MLLMs易受干扰噪声影响的问题,提出S2V方法,通过段级VQA训练模型,提升了LVU性能与训练推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20802 2026-08-24 cs.AI 新提交 57%

SPARC: Single-Pass Scaling for Motion Forecasting with Conformal Bayesian Last Layers

SPARC:采用保形贝叶斯最后层的运动预测单通缩放方法

Sakif Hossain, Julian Teusch, Jörg P. Müller

机构 * Clausthal University of Technology (TU Clausthal)(克劳斯塔尔工业大学(克劳斯塔尔工业大学))

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出SPARC,一种贝叶斯-保形不确定性层,在9个数据集-协议模块上的NLL及MPJPE+NLL综合指标优于基线,可作为轻量风险监控工具。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20376 2026-08-24 cs.CL cs.LG 新提交 57%

TH-GNN: Heterogeneous Temporal Graph Neural Networks for LLM-Agent Shilling Attack Detection

TH-GNN:用于检测大语言模型智能体刷单攻击的异质性时序图神经网络

Shivam Swarup, Divya Prakash Shrivastava, Rakesh Thakur

机构 * JAIN (Deemed to be University)(JAIN(被认定大学)) Zayed University(扎耶德大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CL

AI总结 本文提出TH-GNN,一种异质性时序图神经网络,联合建模时序、结构与语义信号,在5类攻击族和4个基准数据集上检测LLM智能体刷单攻击,总体平均F1值达0.870,性能优于纯文本基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 3 篇

2608.20756 2026-08-24 cs.CV cs.AI 新提交 89%

Vis-Poison: Poisoning Visual Knowledge in Multimodal Retrieval-Augmented Generation

Vis-Poison:多模态检索增强生成中的视觉知识投毒攻击

Rujin Liang, Zhongpu Chen, Yuhao Lei, Xin Miao

机构 * Southwestern University of Finance and Economics(西南财经大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 跨模态检索 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出Vis-Poison攻击,通过自动化多智能体方法构建视觉合理的被投毒图像,在黑盒设置下对多模态RAG系统实现40.16%-65.40%的攻击成功率,且对仅依赖参数知识的MLLM平均成功率超60%。

Comments Findings of EMNLP, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20886 2026-08-24 cs.CV cs.LG 新提交 79%

EviRank: Structured Relevance Evidence for Multimodal Image Re-ranking

EviRank:用于多模态图像重排序的结构化相关性证据

Enjun Du, Siyi Liu, Zirong Chen, Xinyu Zuo, Jinwen Luo, Ruiwen Tao, Lisheng Duan, Haijin Liang, Jin Ma, Junfu Pu, Yongqi Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tencent Yuanbao(腾讯元宝) The University of Hong Kong(香港大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 针对现有多模态图像重排序器的不足,提出EviRank将查询解析为结构化证据包,通过证据条件验证实现重排序,在五个基准上达SOTA,蒸馏学生模型保留超90%能力且成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20840 2026-08-24 cs.IR cs.CV 新提交 57%

KoViDoRe: Korean Visual Document Retrieval

KoViDoRe:韩文视觉文档检索

Yongbin Choi, Yongwoo Song, Mujeen Sung

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 针对现有韩文视觉文档检索基准的不足,本文推出KoViDoRe基准及配套训练数据集Ko-VDR Train Public,评估发现现有模型难以处理该任务,为相关模型开发提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 6 篇

2608.20382 2026-08-24 cs.CL cs.CV 新提交 86%

Decoupled Vision-Language System for Multimodal Understanding and Generation

用于多模态理解与生成的解耦式视觉-语言系统

Yifan Xu, Baochen Xiong, Xiaoshan Yang, Donglin Di, Yaowei Wang, Changsheng Xu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Peng Cheng Laboratory(鹏城实验室) Li Auto(理想汽车)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract_cn);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本研究提出多模态大语言模型Libra的解耦式视觉-语言架构,通过开关注意力与FFN模块实现自模态与跨模态解耦,在理解与生成任务上均取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20743 2026-08-24 cs.AI 新提交 83%

Is Multimodal Speculative Decoding Ready for Diffusion-Based Parallel Drafting? A Survey and Empirical Diagnosis

多模态推测解码是否适用于基于扩散的并行草稿生成?一项调查与实证诊断

Yantao Li, Huanlin Gao, Fang Zhao, Chao Tan, Qiang Hui, Shuting Liu, Fuyuan Shi, Ting Lu, Shaoan Zhao, Xueqiang Guo, Xinpei Su, Jianbing Zhang, Xinyu Dai, Kai Wang, Shiguo Lian

机构 * Data Science & Artificial Intelligence Research Institute, China Unicom(中国联通数据科学与人工智能研究院) Unicom Data Intelligence, China Unicom(中国联通数据智能)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文通过调查多模态模型并开展跨架构实证研究,探究多模态推测解码是否适用于基于扩散的并行草稿生成,提出统一分类法并分析现有方法的局限性与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20809 2026-08-24 cs.CV cs.AI 新提交 62%

TRACE: Training-time Report-guided and Clinically Ordered Concept Editing

TRACE:训练时报告引导且临床有序的概念编辑

Wentao Yue, Tianyou Lai, Jiayu Luo, Qingyu Mao, Ziying Wang, Zhenyuan Ning, Qilei Li

机构 * Lanzhou University(兰州大学) Shenzhen University(深圳大学) Southern Medical University(南方医科大学) Central China Normal University(华中师范大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对乳腺超声诊断深度学习方法可解释性与鲁棒性不足的问题,提出训练时报告引导的TRACE框架,结合SCMT与BUSC基准,实现仅图像输入的高性能诊断与跨域鲁棒性提升。

Comments Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026). 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20932 2026-08-24 cs.CV 新提交 57%

OccluRank: Controllable Occlusion-Aware Layout-to-Image Generation by Adding Just an Ordinal Rank

OccluRank:仅添加序数秩的可控遮挡感知布局到图像生成

Wenyang Hong, Yuan Wang, Yanbin Hao, Lanqing Xue, Ke Wang, Xiang Wang, Kuien Liu, Richang Hong

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出OccluRank框架,仅添加序数秩实现可控遮挡感知布局到图像生成,构建相关数据集与基准,实验表明其能可靠保留实例、遵循布局并实现期望遮挡关系,性能相当。

Comments 16 pages, 7 figures. Code: this https URL (https://github.com/Wenyang-hong/OccluRank)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20383 2026-08-24 eess.SY cs.AI 新提交 57%

Infrared Hotspot-Guided Early Warning of Lithium-Ion Battery Thermal Runaway Under Mechanical Abuse

机械滥用下锂离子电池热失控的红外热点引导预警

Syed Sajid Ullah, Salman Khan, Muhammad Zunair Zamir

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 针对机械滥用下锂离子电池热失控预警问题,提出两阶段融合红外热点动态与多模态特征的方法,经实验验证可实现更早的预警与更高的ROC-AUC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20525 2026-08-24 cs.DB 新提交 50%

Bolo: Verified Model Hub for Next-Generation AI Databases

Bolo:面向下一代AI数据库的经验证的模型中心

Yunqi Li, Ila Petrovic, Yongjoo Park

专题命中 多模态生成 :multi-modal(abstract)

AI总结 该研究针对现有模型平台无法满足AI数据库需求的问题,提出基于多阶段智能体系统的Bolo模型平台,可将不可用模型权重转化为经验证的可用推理流水线,在实验中取得良好效果。

Comments 5 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 11 篇

2608.20944 2026-08-24 cs.CV 新提交 83%

SuppreSensing: Expert-Guided Feature Recalibration and Discrepancy Augmentation for Multimodal Object Detection

SuppreSensing:面向多模态目标检测的专家引导特征重校准与差异增强

Xin Wu, Zhenyu Gao, Qiankun Zhang, Shaoyong Guo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对遥感多模态目标检测的语义异质性与模态噪声问题,本文提出SuppreSensing,通过EMFR模块、差异增强策略和ECFP模块实现最优性能,在多个数据集上达到SOTA并具备良好泛化性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20905 2026-08-24 cs.CV 新提交 83%

EmotionDialogCN: A Spontaneous Multimodal Dataset for Mandarin Emotional Dialogue

EmotionDialogCN:面向普通话情感对话的自发多模态数据集

Yi Zheng, Yifan Xu, Yan Zhou, Hejia Chen, Chunyu Qiang, Xiaoqiang Liu, Xiaohan Li, Shenze Huang, Yue Zhang, Guoying Zhao, Pengfei Wan

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 该研究推出EmotionDialogCN数据集,其规模大、情感分布贴合真实情况,采用新型采集框架减少设备干扰,可支撑多模态情感相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20874 2026-08-24 cs.CV cs.RO 新提交 79%

Multi-Modal Traffic Sign Detection with Semantic Attributes for Autonomous Driving

面向自动驾驶的结合语义属性的多模态交通标志检测

Meda Lazar, Sourab Sridhar, Shashwata Gupta, Alexandra Tripcea, Varun Ravi, Senthil Yogamani

机构 * Arriver System Software S.r.l.(Arriver系统软件有限责任公司) Qualcomm Auto Ltd Sweden Filial(高通汽车有限公司瑞典分公司) Qualcomm Auto Ltd.(高通汽车有限公司) Qualcomm Technologies, Inc(高通技术公司)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 针对自动驾驶中交通标志检测的跨区域泛化差、远距离小目标检测弱、跟踪易受透视畸变影响的问题,提出多模态框架,结合LiDAR与相机,引入强度感知可变形融合模块、双运动模型跟踪器及语义属性分类流水线,在多国数据集上取得低漏检率,实现全球可泛化的商用级交通标志感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20384 2026-08-24 cs.AI 新提交 79%

Interpretable Multimodal Classification with Linear Discriminant Tree Ensembles

基于线性判别树集成的可解释多模态分类

Mojtaba Moattari

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究针对多模态分类器需平衡准确率与可解释性的需求,提出基于线性判别树集成的框架,在多模态情感行为分类任务中实现了优于基线模型的性能与更高的人类标注一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20984 2026-08-24 cs.CV cs.CL cs.CY 新提交 62%

MigrationNarrate: A Dataset for Detection of Migration Narratives in YouTube Videos

MigrationNarrate:用于检测YouTube视频中移民叙事的数据集

Fatima Haouari, Carolina Scarton, Kalina Bontcheva

机构 * University of Sheffield(谢菲尔德大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 该研究推出首个用于检测英国移民叙事的多模态数据集MigrationNarrate,包含1115个YouTube视频字幕,结合预训练编码器与大语言模型开展基准测试,为移民叙事检测研究提供关键资源。

Comments This work was accepted to the main conference of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21360 2026-08-24 cs.CV 新提交 57%

OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs

OmniAssistBench:面向全模态大语言模型(Omni-LLMs)的助手式交互基准

Xianyun Sun, Chaoyou Fu, Zhengye Zhang, Feiyang Duan, Qingyuan Cao, Yonghui Niu, Sihang Yuan, Ge Zhang, Caifeng Shan

机构 * Nankai University(南开大学) University of Waterloo(滑铁卢大学) Nanjing University(南京大学)

专题命中 多模态评测 :omni-modal(abstract);分类 cs.CV

AI总结 针对全模态大语言模型助手式交互的评估瓶颈,构建OmniAssistBench数据集,实验显示Gemini-3-Pro、Qwen3-Omni-Instruct表现存在差距,当前模型在多轮交互等方面仍有不足。

Comments Project page: this https URL (https://xianyunsun.github.io/OmniAssistBench/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20851 2026-08-24 cs.SE cs.AI 新提交 57%

BC-Bench: Evaluating Agentic Engineering in a Domain-Specific Language for ERP

BC-Bench:在ERP领域特定语言中评估智能体工程

Haoran Sun, Klaus Marius Hansen

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 该研究推出BC-Bench基准,评估智能体工程在ERP领域DSL(AL)上的表现,发现通用基准的改进未一致迁移到AL,凸显领域特定评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏