arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-12 至 2026-02-12 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 10 篇

2509.16944 2026-02-12 cs.CV 83%

Catching the Details: Self-Distilled RoI Predictors for Fine-Grained MLLM Perception

捕捉细节:用于细粒度MLLM感知的自蒸馏RoI预测器

Yuheng Shi, Xiaohuan Pei, Minjing Dong, Chang Xu

机构 * University of Sydney(悉尼大学) City University of Hong Kong(香港城市大学)

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出SD-RPN,通过自蒸馏方法提升MLLM细粒度感知的效率和准确性。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03866 2026-02-12 cs.DL cs.AI 79%

PaperX: A Unified Framework for Multimodal Academic Presentation Generation with Scholar DAG

PaperX: 一种多模态学术演示生成的统一框架与学者DAG

Tao Yu, Minghui Zhang, Zhiqing Cui, Hao Wang, Zhongtian Luo, Shenghua Chai, Junhao Gong, Yuzhao Peng, Yuxuan Zhou, Yujia Yang, Zhenghao Zhang, Haopeng Jin, Xinming Wang, Yufei Xiong, Jiabing Yang, Jiahao Yuan, Hanqing Wang, Hongzhu Yi, Yan Huang, Liang Wang

机构 * CASIA(中国科学院自动化研究所) UCAS(乌尔姆大学) Peking University(北京大学) Tsinghua University(清华大学) HKUST(GZ)(香港科技大学(广州))

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 PaperX通过Scholar DAG实现多模态学术演示生成的统一框架,提升内容质量和效率。

Comments 29 pages, 9 figures, Project website: https://github.com/yutao1024/PaperX

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15922 2026-02-12 cs.CL 79%

Aligning Dialogue Agents with Global Feedback via Large Language Model Multimodal Reward Decomposition

通过大语言模型多模态奖励分解对齐对话代理

Dong Won Lee, Hae Won Park, Cynthia Breazeal, Louis-Philippe Morency

机构 * MIT(麻省理工学院) CMU(卡内基梅隆大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出了一种基于大语言模型的多模态奖励分解方法,通过分解会话级反馈来提升对话生成质量,无需人工反馈。

Comments 9 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10659 2026-02-12 cs.CV 79%

Multimodal Priors-Augmented Text-Driven 3D Human-Object Interaction Generation

多模态先验增强的文本驱动3D人-物交互生成

Yin Wang, Ziyao Zhang, Zhiying Leng, Haitian Liu, Frederick W. B. Li, Mu Li, Xiaohui Liang

机构 * State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室) Beihang University(北京航空航天大学) Department of Computer Science, University of Durham(杜伦大学计算机科学系) Zhongguancun Laboratory(中关村实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MP-HOI框架,通过多模态先验、增强物体表示、模态感知MoE模型和级联扩散技术,提升文本驱动的3D人-物交互生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16871 2026-02-12 cs.RO 78%

HOGraspFlow: Taxonomy-Aware Hand-Object Retargeting for Multi-Modal SE(3) Grasp Generation

HOGraspFlow: 一种基于分类意识的多模态SE(3)抓取生成方法

Yitian Shi, Zicheng Guo, Rosa Wolf, Edgar Welte, Rania Rayyes

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 HOGraspFlow通过多模态SE(3)抓取生成方法,在无需显式几何先验的情况下实现高保真的抓取合成。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11096 2026-02-12 cs.CL cs.AI 62%

Safety Recovery in Reasoning Models Is Only a Few Early Steering Steps Away

推理模型中的安全恢复仅需几步早期引导步骤

Soumya Suvra Ghosal, Souradip Chakraborty, Vaibhav Singh, Furong Huang, Dinesh Manocha, Amrit Singh Bedi

机构 * University of Maryland, College Park(马里兰大学哥伦比亚学院) IIT, Bombay(孟买印度理工学院) University of Central Florida(佛罗里达中央大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 SafeThink通过在推理早期干预减少攻击成功率,提升推理模型的安全性

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21963 2026-02-12 cs.CY cs.AI cs.CL cs.SI 62%

Industrialized Deception: The Collateral Effects of LLM-Generated Misinformation on Digital Ecosystems

工业化的欺骗:大语言模型生成的虚假信息对数字生态系统的影响

Alexander Loth, Martin Kappes, Marc-Oliver Pahl

机构 * Frankfurt University of Applied Sciences(法兰克福应用科学大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出JudgeGPT和RogueGPT工具,研究人类对AI生成虚假信息的感知与检测,探讨生成与检测之间的竞争及缓解策略。

Comments Accepted at ACM TheWebConf '26 Companion

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10891 2026-02-12 cs.NE cs.AI 57%

Interactive LLM-assisted Curriculum Learning for Multi-Task Evolutionary Policy Search

多任务策略搜索中的交互式LLM辅助课程学习

Berfin Sakallioglu, Giorgia Nadizar, Eric Medvet

机构 * MIGe - University of Trieste(MIGe - 乌迪内大学) University Toulouse Capitole, IRIT - CNRS UMR5505(图卢兹大学,IRIT - CNRS UMR5505) DIA - University of Trieste(DIA - 乌迪内大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种交互式LLM辅助的在线课程生成框架,通过多模态反馈提升多任务策略搜索的性能,展示其与专家设计课程的竞争力。

Comments 8 pages, 7 figures, with Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10587 2026-02-12 stat.ML cs.LG 50%

Deep Bootstrap

深度Bootstrap

Jinyuan Chang, Yuling Jiao, Lican Kang, Junjie Shi

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出基于条件扩散模型的深度Bootstrap框架,用于非参数回归,通过统一生成框架实现高效采样和准确估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10544 2026-02-12 cs.LG cs.NA math.NA 50%

Bridging the Compression-Precision Paradox: A Hybrid Architecture for Clinical EEG Report Generation with Guaranteed Measurement Accuracy

弥合压缩-精度悖论:一种用于临床EEG报告生成的混合架构,保证测量精度

Wuyang Zhang, Zhen Luo, Chuqiao Gu, Jianming Ma, Yebo Cao, Wangming Yuan, Yinzhi Jin

机构 * Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) George Mason University(乔治·马歇尔大学)

专题命中 多模态生成 :cross-modal(abstract)

AI总结 本研究提出了一种混合架构,通过信号处理和跨模态翻译实现临床EEG报告生成,保证测量精度,减少误报并提升检测速度。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏