arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-04 至 2026-02-04 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 11 篇

2602.03263 2026-02-04 cs.AI 85%

CSR-Bench: A Benchmark for Evaluating the Cross-modal Safety and Reliability of MLLMs

CSR-Bench: 一种评估多模态大语言模型跨模态安全性和可靠性的基准

Yuxuan Liu, Yuntian Shi, Kun Wang, Haoting Shen, Kun Yang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.AI

AI总结 CSR-Bench通过四个压力测试模式评估多模态大语言模型的跨模态安全性和可靠性,发现模型在多模态输入下表现下降,且安全提升可能源于拒绝导向的启发式方法。

Comments 25 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03268 2026-02-04 cs.LG cs.AI cs.MM 84%

Unveiling Covert Toxicity in Multimodal Data via Toxicity Association Graphs: A Graph-Based Metric and Interpretable Detection Framework

通过毒性关联图揭示多模态数据中的隐性毒性:一种基于图的度量方法和可解释检测框架

Guanzong Wu, Zihao Zhu, Siwei Lyu, Baoyuan Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) State University of New York at Buffalo(纽约州立大学布法罗分校)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 本文提出基于图的毒性关联图方法,通过多模态毒性隐性度度量标准实现对隐性毒性的可解释检测,提升多模态毒性检测的透明度和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02536 2026-02-04 cs.LG cs.AI cs.CL cs.CV 82%

From Sparse Decisions to Dense Reasoning: A Multi-attribute Trajectory Paradigm for Multimodal Moderation

从稀疏决策到密集推理:一种多属性轨迹范式用于多模态调制

Tianle Gu, Kexin Huang, Lingyu Li, Ruilin Luo, Shiyang Huang, Zongqi Wang, Yujiu Yang, Yan Teng, Yingchun Wang

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 UniMod提出一种多属性轨迹范式,通过多维边界学习提升多模态调制效果,以更少的数据实现高效安全内容识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03130 2026-02-04 cs.CV cs.CE 79%

FinMTM: A Multi-Turn Multimodal Benchmark for Financial Reasoning and Agent Evaluation

FinMTM:面向金融推理和智能体评估的多轮多模态基准

Chenxi Zhang, Ziliang Gan, Liyun Zhu, Youwei Pang, Qing Zhang, Rongjunchen Zhang

机构 * HiThink Research(HiThink研究机构) Wuhan University(武汉大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Shanghai Institute of Technology(上海理工大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 FinMTM提出一个多轮多模态基准,用于评估金融推理和智能体任务,通过多样化数据和任务设计,揭示了VLMs在视觉感知、推理和复杂工作流中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16196 2026-02-04 stat.ME 78%

Inference on the Significance of Modalities in Multimodal Generalized Linear Models

在多模态广义线性模型中模态显著性的推断

Wanting Jin, Guorong Wu, Quefeng Li

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出了一种基于熵的度量方法,用于评估多模态广义线性模型中各模态的信息增益,并通过模拟和神经影像数据验证了其有效性。

Comments This research was supported by the National Institutes of Health under grant R01-AG073259

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01751 2026-02-04 cs.LG q-bio.QM 71%

MGKAN: Predicting Asymmetric Drug-Drug Interactions via a Multimodal Graph Kolmogorov-Arnold Network

MGKAN:通过多模态图科拉莫戈洛夫-阿诺德网络预测非对称药物-药物相互作用

Kunyi Fan, Mengjie Chen, Longlong Li, Cunquan Qu

机构 * School of Mathematics, Shandong University, Jinan, China(山东大学数学学院) Data Science Institute, Shandong University, Jinan, China(山东大学数据科学研究院)

专题命中 多模态评测 :multimodal(title)

AI总结 MGKAN通过多模态图科拉莫戈洛夫-阿诺德网络有效预测非对称药物-药物相互作用,提升建模的非线性和方向性。

Comments This paper has been accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14661 2026-02-04 cs.DB cs.AI 57%

Abacus: A Cost-Based Optimizer for Semantic Operator Systems

Abacus:一种基于成本的语义运算系统优化器

Matthew Russo, Chunwei Liu, Sivaprasad Sudhir, Gerardo Vitagliano, Michael Cafarella, Tim Kraska, Samuel Madden

机构 * MIT(麻省理工学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 Abacus是一种基于成本的优化器,用于优化语义运算系统,通过评估运算符性能并优化系统质量、成本和延迟,实现更高效的文档处理任务。

Comments To be published in VLDB'26, 14 pages, 8 figures

Journal ref PVLDB, 19(5): 1060 - 1073, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03285 2026-02-04 cs.AI 57%

MeetBench-XL: Calibrated Multi-Dimensional Evaluation and Learned Dual-Policy Agents for Real-Time Meetings

MeetBench-XL: 一种经过校准的多维评估和学习双策略代理用于实时会议

Yuelin Hu, Jun Xu, Bingcong Lu, Zhengxue Cheng, Hongwei Hu, Ronghua Wu, Li Song

机构 * Shanghai Jiao Tong University(上海交通大学) Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(法国巴黎-罗克琴特研究所) Rajiv Gandhi University(拉朱·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒研究实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 MeetBench-XL通过多维评估和学习双策略代理提升实时会议AI助手的性能与效率

Comments accepted by AAAI2026 ws

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03217 2026-02-04 cs.LG cs.AI 57%

Topology Matters: A Cautionary Case Study of Graph SSL on Neuro-Inspired Benchmarks

拓扑至关重要:图SSL在神经启发基准上的警示案例研究

May Kristine Jonson Carlon, Su Myat Noe, Haojiong Wang, Yasuo Kuniyoshi

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一个分层SSL框架,揭示了通用图SSL在连接体数据上的局限性,强调需设计拓扑感知的SSL目标以保持结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03416 2026-02-04 cs.IR 50%

AesRec: A Dataset for Aesthetics-Aligned Clothing Outfit Recommendation

AesRec:一个用于美学对齐的服装搭配推荐数据集

Wenxin Ye, Lin Li, Ming Li, Yang Shen, Kanghong Wang, Jimmy Xiangji Huang

专题命中 多模态评测 :multimodal(abstract)

AI总结 AesRec数据集通过系统化的定量美学注释,为开发与美学对齐的服装推荐系统提供了支持,实验表明整合量化美学信息能提升用户审美指导与个性化需求的满足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02564 2026-02-04 cs.LG cs.MA 50%

Label Curation Using Agentic AI

使用代理AI进行标签校准

Subhodeep Ghosh, Bayan Divaaniaazar, Md Ishat-E-Rabban, Spencer Clarke, Senjuti Basu Roy

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 AURA通过代理AI框架实现大规模多模态数据标注,通过概率模型联合推断真实标签和标注者可靠性,提升标注准确性并评估标注者质量。

详情

展开后加载摘要…

URL PDF HTML 收藏