The 2021 NIST Speaker Recognition Evaluation
专题命中 多模态评测 :multimodal(abstract);audio-visual(abstract);分类 eess.AS
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态评测 :multimodal(abstract);audio-visual(abstract);分类 eess.AS
专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CL
Comments EMNLP 2021
专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CL
Comments Journal paper accepted in Knowledge Based Systems
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
Comments Accepted at SIGIR 2021
专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV
专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV
Comments Accepted by IEEE TRANSACTIONS ON MULTIMEDIA (TMM) in 2021
专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV
Comments MLMI-2019
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 10 pages, 5 figures, accepted as an oral paper in SIGKDD 2018
专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
Phoenix-VL 1.5 中等技术报告
机构 * Mistral AI
专题命中 多模态评测 :multimodal(abstract,comments);分类 cs.CV、cs.CL、cs.AI
AI总结 Phoenix-VL 1.5 是一个123B参数的多模态多语言基础模型,适应区域语言和新加坡环境,通过本地化数据集和对齐优化实现深度领域适应,同时在多项基准测试中表现优异。
Comments Release page: https://medium.com/htx-ai/introducing-phoenix-vl-1-5-medium-multimodal-intelligence-uniquely-singaporean-ef8214c8cfa1
专题命中 多模态评测 :multimodal(abstract,journal_ref);分类 cs.CV、cs.AI、eess.AS
Journal ref INTERNATIONAL CONFERENCE ON MULTIMODAL INTERACTION (ICMI 2024)
CP-MoE:一致性保留的混合专家用于持续学习
机构 * School of Computer Science and Engineering University of New South Wales(计算机科学与工程学院 新南威尔士大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出CP-MoE,一种基于瞬时专家的持续学习框架,通过一致性保留的路由偏置和瞬时专家引导的正则化机制,减少参数干扰和遗忘,同时保留跨任务知识转移。
Comments Accepted at CoLLAs 2026
深度学习在几何问题求解中的应用综述
机构 * Renmin University of China(中国人民大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文综述了深度学习在几何问题求解中的应用,涵盖相关任务、方法、评估指标及未来方向,旨在提供实践参考以推动该领域发展。
Comments ACL 2026 Main Conference
面向缺失数据的多模态融合用于统一微服务故障管理
机构 * Zhejiang University(浙江大学)
专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)
AI总结 本文提出ARMOR框架,通过自监督学习解决微服务故障管理中多模态数据缺失问题,提升异常检测、故障分类和根本原因定位的性能。
Comments Accepted by the Proceedings of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), 2026. This is the authors' version of the work; the definitive Version of Record is forthcoming
VistaHop: 视觉深度搜索的多跳视觉推理基准
机构 * East China Normal University(东华大学) ; Meituan(美团) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出VistaHop基准,通过多跳问答任务评估多模态大推理模型在视觉深度搜索中的迭代图像检查、视觉锚点定位和跨证据链推理能力,实验表明现有模型表现有限。
人工智能数学推理:语言模型、神经符号系统与验证发现的综合综述
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; University of Toronto(多伦多大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文综述了数学推理领域从早期规则系统到当代推理模型、多智能体系统及验证发现工作流的演变,沿非正式推理、形式推理、数学发现及推理技术四轴组织,并评估了基准测试、失败模式及未来方向。
Comments Under review, 47 pages, 14 figures, 22 tables
超越单图:多图表问答的基准测试
机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出PolyChartQA数据集,用于评估多图表问答性能,通过九种先进多模态语言模型测试,发现人类生成问题的LLM准确率下降27.4%,而本文提出的提示方法提升了5.39%。
LivePhys:通过扫描即播放框架将静态物理问题转化为交互式模拟
专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)
AI总结 研究针对教科书中静态物理问题学习的高认知负担,提出LivePhys框架,通过多模态处理构建中间表示,用大语言模型推理并由物理引擎执行生成交互式模拟,显著提升模拟性能并降低学习者认知负担。
ENTRAP-VL:视觉语言模型中双上下文夹带的分类探测器
机构 * IIIT Delhi(德里信息技术学院) ; Dr. Ambedkar Institute of Technology(阿姆贝德卡尔技术学院) ; Heritage Institute of Technology(遗产技术学院) ; PwC(普华永道)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 研究视觉语言模型中上下文夹带现象,提出需构建分类结构化双模态工具。引入ENTRAP-VL数据集,含1500个项目,跨八类,分文本和视觉夹带流,提供工具、分类法及评估协议,助力社区严格研究该现象。
UniLM-Nav:零样本最后一英里导航的统一框架
机构 * Tsinghua University(清华大学) ; State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司人工智能研究院) ; Harbin Institute of Technology(哈尔滨工业大学) ; Peking University(北京大学)
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract)
AI总结 研究移动操作中最后一英里导航问题,提出UniLM-Nav统一框架,通过多模态大语言模型后端分解任务为视图选择、功能接地和姿态推理,在OVMM基准上优于现有方法,还验证了在实际机器人上的适用性。
Comments Project page: https://unilm-nav.github.io
IntentVLA:用于有歧义机器人操作的短周期意图建模
机构 * HUST(华中科技大学) ; ZGCA(中钢集团人工智能研究院) ; ZGCI(中钢智能科技有限公司) ; HIT(哈尔滨工业大学) ; HKUST(GZ)(香港科技大学(广州)) ; BUAA(北京航空航天大学) ; ZZU(浙江工业大学) ; ECNU(华东师范大学) ; USTC(中国科学技术大学) ; DeepCybo
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 IntentVLA通过编码近期视觉观测为紧凑的短周期意图表示,提升机器人操作的执行稳定性,并在多个基准测试中优于现有VLA基线。
Comments Code can be found in https://github.com/ZGC-EmbodyAI/IntentVLA
TSAI-MetaFraud:用于元宇宙生态系统中金融欺诈交易和行为风险检测的基准数据集
机构 * tsai-unb(tsai - 新不伦瑞克大学)
专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)
AI总结 针对元宇宙平台带来的欺诈等新挑战及现有数据集局限性,提出TSAI-MetaFraud基准数据集,整合多类信息与欺诈场景,定义多项基准任务并进行基线评估,为元宇宙生态系统相关研究提供基准。
ProvICS:一种基于溯源的工业控制系统入侵检测方法
专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)
AI总结 针对工业控制系统因信息技术与运营技术融合面临多阶段网络攻击,且基于溯源的入侵检测系统在工业网络物理系统中适用性待探索的问题,提出ProvICS多模态溯源数据集,经实验验证其能有效检测攻击事件,填补现有基准空白。
BaFCo:用于复杂孟加拉语表格理解的文档理解基准
机构 * Wichita State University(威奇托州立大学) ; Center for Computational & Data Sciences(计算与数据科学中心) ; University of Dhaka(达卡大学) ; Amazon GenAI(亚马逊生成式人工智能)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 针对孟加拉语表格理解因高质量标注数据稀缺受限的问题,引入BaFCo基准数据集,涵盖多领域复杂表格。定义细粒度标注模式,评估多种MLLMs,发现其理解孟加拉语表格有局限,尤其在定位细粒度实体方面。
Comments Accepted at the 19th European Conference on Computer Vision (ECCV), 2026
从失败分类到干预:面向视频和直播平台审核的工业级AVLM诊断方法
机构 * TikTok ; The University of Sydney(悉尼大学)
专题命中 多模态评测 :multimodal(abstract);audio-visual(abstract)
AI总结 提出一种工业级音视频语言模型(AVLM)诊断方法,通过失败分类法将模型失败映射为可观察的失败特征,并链接到干预空间,应用于大规模视频和直播平台的模型开发与对齐。
EXPLORE-Bench:具有长视距推理的自我中心场景预测
机构 * University of Science and Technology of China(中国科学技术大学) ; Foundation Model Team, Li Auto Inc.(蔚来汽车基础模型团队) ; Tsinghua University(清华大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出EXPLORE-Bench基准,通过初始场景图像和动作序列预测最终场景,评估多模态大模型在自我中心长视距推理中的能力,发现与人类存在显著差距。
超越一刀切:基于诊断的在线强化学习与离线先验知识
机构 * Nanyang Technical University(南洋理工大学) ; University of Oxford(牛津大学)
专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract)
AI总结 本文提出诊断驱动的张力管理框架,通过三种功能角色表征离线先验知识如何重塑在线优化,并展示跨领域证据,解决先验知识有效性随部署变化的问题。