arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-27 至 2026-02-27 共收录 59 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 6 篇

2512.21058 2026-02-27 cs.CV 70%

Beyond Pixel Simulation: Pathology Image Generation via Diagnostic Semantic Tokens and Prototype Control

超越像素模拟:通过诊断语义标记和原型控制生成病理图像

Minghao Han, Yichen Liu, Yizhou Liu, Zizhi Chen, Jingqun Tang, Xuecheng Wu, Dingkang Yang, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing(智能机器人与先进制造学院) Fudan University(复旦大学) Fysics Intelligence Technologies Co., Ltd.(Fysics智能科技有限公司) University of Science and Technology Beijing(北京科技大学) ByteDance(字节跳动) School of Computer Science and Technology(计算机科学与技术学院) Xi’an Jiaotong University(西安交通大学)

专题命中 多模态生成 :MLLM(abstract);image-text(abstract);分类 cs.CV

AI总结 UniPath通过诊断语义标记和原型控制实现可控的病理图像生成,取得SOTA性能,包括Patho-FID 80.9和98.7%的细粒度语义控制。

Comments accepted by CVPR 2026; 32 pages, 17 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17937 2026-02-27 cs.SD cs.AI cs.CL eess.AS 67%

Bob's Confetti: Phonetic Memorization Attacks in Music and Video Generation

Bob的彩纸:音乐和视频生成中的语音记忆攻击

Jaechul Roh, Zachary Novack, Yuefeng Peng, Niloofar Mireshghallah, Taylor Berg-Kirkpatrick, Amir Houmansadr

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of California San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 研究揭示了生成音乐和视频AI系统中语音记忆攻击的漏洞,通过同音替代词绕过版权过滤,展示语音结构对跨模态检索的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22624 2026-02-27 cs.CV cs.AI 62%

Instruction-based Image Editing with Planning, Reasoning, and Generation

基于指令的图像编辑与规划、推理和生成

Liya Ji, Chenyang Qi, Qifeng Chen

机构 * HKUST(香港科技大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多模态模型,通过链式思考规划、编辑区域推理和编辑,提升基于指令的图像编辑能力,以应对更复杂的真实场景。

Comments 10 pages, 7 figures

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision, 2025, Page 17506--17515

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22462 2026-02-27 cs.CV cs.IR 61%

MammoWise: Multi-Model Local RAG Pipeline for Mammography Report Generation

MammoWise:多模型本地RAG流水线用于乳腺X线摄影报告生成

Raiyan Jahangir, Nafiz Imtiaz Khan, Amritanand Sudheerkumar, Vladimir Filkov

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 多模态生成 :multimodal(abstract,comments);分类 cs.CV

AI总结 MammoWise是一种本地多模型流水线,通过多任务分类和检索增强生成技术,实现乳腺X线摄影报告的高准确度生成与分类。

Comments arXiv preprint (submitted 25 Feb 2026). Local multi-model pipeline for mammography report generation + classification using prompting, multimodal RAG (ChromaDB), and QLoRA fine-tuning; evaluates MedGemma, LLaVA-Med, Qwen2.5-VL on VinDr-Mammo and DMID; reports BERTScore/ROUGE-L and classification metrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03467 2026-02-27 cs.CV 57%

ThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editing

ThinkRL-Edit: 基于强化学习的图像编辑推理框架

Hengjia Li, Liming Jiang, Qing Yan, Yizhi Song, Hao Kang, Zichuan Liu, Xin Lu, Boxi Wu, Deng Cai

机构 * Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 ThinkRL-Edit通过引入链式推理和无偏奖励策略,提升图像编辑的推理能力,实现更精准和稳定的编辑效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 10 篇

2509.04403 2026-02-27 cs.CV cs.CL cs.CR 84%

Self-adaptive Dataset Construction for Real-World Multimodal Safety Scenarios

自适应数据集构建用于现实世界多模态安全场景

Jingen Qu, Lijun Li, Bo Zhang, Yichen Yan, Jing Shao

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 本文提出了一种图像导向的自适应数据集构建方法,用于构建现实世界多模态安全场景的数据集,通过生成35,000个图像-文本对及其指导响应,提升了安全评估的有效性。

Comments Accepted at EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22955 2026-02-27 cs.CV cs.AI 81%

MM-NeuroOnco: A Multimodal Benchmark and Instruction Dataset for MRI-Based Brain Tumor Diagnosis

MM-NeuroOnco: 一种多模态基准和指令数据集用于基于MRI的脑肿瘤诊断

Feng Guo, Jiaxiang Liu, Yang Li, Qianqian Shi, Mingkun Xu

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Center for Brain-Inspired Computing Research (CBICR), Department of Precision Instrument, Tsinghua University(脑启发计算研究中心(CBICR)、精密仪器系,清华大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 MM-NeuroOnco提出一个多模态数据集和基准,用于提升基于MRI的脑肿瘤诊断的多模态推理能力,通过生成诊断相关语义提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06008 2026-02-27 cs.CV cs.AI 81%

Detection and Measurement of Hailstones with Multimodal Large Language Models

利用多模态大语言模型检测和测量冰雹

Moritz Alker, David C. Schedl, Andreas Stöckl

机构 * Digital Media Lab University of Applied Sciences Upper Austria(数字媒体实验室 上奥地利应用科学大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 利用多模态大语言模型检测和测量冰雹,通过社交媒体图像实现快速评估

Comments 6 pages, 5 figures, accepted at The 2nd International Conference on Electrical and Computer Engineering Researches

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22843 2026-02-27 cs.CV 79%

Breaking the Visual Shortcuts in Multimodal Knowledge-Based Visual Question Answering

打破多模态知识驱动视觉问答中的视觉捷径

Dosung Lee, Sangwon Jung, Boyoung Kim, Minyoung Kim, Sungyeon Kim, Junyoung Sung, Paul Hongsuck Seo

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) Amazon(亚马逊)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究通过RETINA基准和MIMIR方法,打破多模态知识驱动视觉问答中的视觉捷径问题,验证现有模型对捷径的依赖并展示改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24449 2026-02-27 cs.CL 79%

When Large Multimodal Models Confront Evolving Knowledge: Challenges and Explorations

当大多模态模型面对不断演变的知识:挑战与探索

Kailin Jiang, Yuntao Du, Yukai Ding, Yuchen Ren, Ning Jiang, Zhi Gao, Zilong Zheng, Lei Liu, Bin Li, Qing Li

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出MMEVOKE基准,探讨了多模态模型在动态演变知识注入中的挑战,并提出知识增强和保留方法以提升注入性能和缓解能力退化。

Comments ICLR 2026, Project Page: https://evoke-lmm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23286 2026-02-27 cs.CL cs.AI cs.DB cs.IR 62%

SPARTA: Scalable and Principled Benchmark of Tree-Structured Multi-hop QA over Text and Tables

SPARTA:可扩展且原则性的树状多跳问答基准

Sungho Park, Jueun Kim, Wook-Shin Han

机构 * POSTECH

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 SPARTA通过自动生成大规模表格-文本问答基准测试,揭示了跨模态推理的深层缺陷。

Comments 10 pages, 5 figures. Published as a conference paper at ICLR 2026. Project page: https://sparta-projectpage.github.io/

Journal ref The Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23363 2026-02-27 cs.CV 57%

MediX-R1: Open Ended Medical Reinforcement Learning

MediX-R1:开放端医疗强化学习

Sahal Shaji Mullappilly, Mohammed Irfan Kurpath, Omair Mohamed, Mohamed Zidan, Fahad Khan, Salman Khan, Rao Anwer, Hisham Cholakkal

机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(迈赫迈德·本·扎耶德人工智能大学) Jubilee Mission Medical College(jubilee mission 医学院) Research Institute(研究院) JJM Medical College(JJM 医学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 MediX-R1通过综合奖励信号和LLM评估,实现医疗多模态模型的开放端强化学习,提升临床推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22426 2026-02-27 cs.CV cs.LG 57%

SimpleOCR: Rendering Visualized Questions to Teach MLLMs to Read

SimpleOCR: 将可视化问题呈现以教导大语言模型阅读

Yibo Peng, Peng Xia, Ding Zhong, Kaide Zeng, Siwei Han, Yiyang Zhou, Jiaqi Liu, Ruiyi Zhang, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) Adobe Research(Adobe研究)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 SimpleOCR通过强制模型视觉参与,解决多模态大语言模型在图像中阅读文本的性能问题,提升模型的视觉文本提取能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12439 2026-02-27 cs.LG 50%

Beyond Attribution: Unified Concept-Level Explanations

超越归因:统一的概念层面解释

Junhao Liu, Haonan Yu, Xin Zhang

机构 * School of Computer Science, Peking University, Beijing 100871, China(北京大学计算机科学学院) Key Lab of High Confidence Software Technologies (Peking University), Ministry of Education(高可信软件技术重点实验室(北京大学))

专题命中 多模态评测 :multimodal(abstract)

AI总结 UNCLE框架通过扩展局部模型无关方法,提供统一的概念层面解释,提升解释的忠实度和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22416 2026-02-27 cs.HC 50%

Seeing Graphs Like Humans: Benchmarking Computational Measures and MLLMs for Similarity Assessment

像人类一样看图:通过计算度量和MLLMs进行相似性评估的基准测试

Seokweon Jung, Jeongmin Rhee, Seoyoung Doh, Hyeon Jeon, Ghulam Jilani Quadri, Jinwook Seo

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文通过实验比较了计算度量和MLLMs在图相似性评估中的表现,发现MLLMs,特别是GPT-5,在匹配人类感知方面表现优异,能提供可解释的推理理由。

Comments 21 pages including 1 page of appendix, 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 1 篇

2505.02780 2026-02-27 cs.HC cs.AI cs.ET q-bio.TO 79%

Beyond the Monitor: Mixed Reality Visualization and Multimodal AI for Enhanced Digital Pathology Workflow

超越监视器:混合现实可视化与多模态AI用于增强的数字病理学工作流程

Jai Prakash Veerla, Partha Sai Guttikonda, Helen H. Shang, Mohammad Sadegh Nasr, Cesar Torres, Jacob M. Luber

机构 * Department of Computer Science and Engineering, University of Texas at Arlington(计算机科学与工程系,德克萨斯大学阿灵顿分校) Department of Medicine Division of Hematology-Oncology, UCLA(医学系血液肿瘤学分会,加州大学洛杉矶分校) Center for Innovation in Health Informatics, University of Texas at Arlington(健康信息创新中心,德克萨斯大学阿灵顿分校)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 PathVis通过混合现实和多模态AI优化数字病理学工作流程,提升诊断效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态训练与对齐 9 篇

2602.22405 2026-02-27 cs.LG cs.CV 88%

MolFM-Lite: Multi-Modal Molecular Property Prediction with Conformer Ensemble Attention and Cross-Modal Fusion

MolFM-Lite:基于构象集合注意力和跨模态融合的多模态分子性质预测

Syed Omer Shah, Mohammed Maqsood Ahmed, Danish Mohiuddin Mohammed, Shahnawaz Alam, Mohd Vahaj ur Rahman

机构 * Department of Computer Science and Engineering, University at Buffalo(布法罗大学计算机科学与工程系) Khoury College of Computer Sciences, Northeastern University(东北大学科赫里学院) Department of Computer Science, Muffakham Jah College of Engineering and Technology(穆法卡姆·贾赫工程与技术学院计算机科学系) Department of Computer Science and Artificial Intelligence, Muffakham Jah College of Engineering and Technology(穆法卡姆·贾赫工程与技术学院计算机科学与人工智能系)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(title,abstract);分类 cs.CV

AI总结 MolFM-Lite通过跨模态融合和构象集合注意力机制,提升多模态分子性质预测的准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23300 2026-02-27 cs.CL eess.AS 84%

A Mixture-of-Experts Model for Multimodal Emotion Recognition in Conversations

一种用于对话中多模态情绪识别的专家混合模型

Soumya Dutta, Smruthi Balaji, Sriram Ganapathy

机构 * LEAP Lab, Department of Electrical Engineering(LEAP实验室,电气工程系) Microsoft(微软)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、eess.AS

AI总结 MiSTER-E通过专家混合框架提升对话中多模态情绪识别的准确率,实现跨模态一致性与融合。

Comments Accepted to Elsevier Computer Speech and Language. 30 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15226 2026-02-27 cs.MM cs.CL 84%

Not All Attention is Needed: Parameter and Computation Efficient Transfer Learning for Multi-modal Large Language Models

并非所有注意力都是必需的:面向多模态大语言模型的参数和计算高效迁移学习

Qiong Wu, Weihao Ye, Yiyi Zhou, Xiaoshuai Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(教育部多媒体可信感知与高效计算重点实验室) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CL、cs.MM

AI总结 本文提出高效注意力跳过方法,通过减少冗余注意力计算提升多模态大语言模型的推理效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22917 2026-02-27 cs.CV 83%

Towards Multimodal Domain Generalization with Few Labels

迈向少标签多模态领域泛化的研究

Hongzhao Li, Hao Dong, Hualei Wan, Shupan Li, Mingliang Xu, Muhammad Haris Khan

机构 * Zhengzhou University(郑州大学) ETH Zürich(苏黎世联邦理工学院) MBZUAI(马克斯·普朗克智能系统研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出SSMDG框架,通过三个关键组件实现少标签多模态领域泛化,提升跨模态鲁棒性和领域不变性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22236 2026-02-27 q-bio.GN cs.CV cs.LG 79%

CrossLLM-Mamba: Multimodal State Space Fusion of LLMs for RNA Interaction Prediction

CrossLLM-Mamba: LLMs多模态状态空间融合用于RNA相互作用预测

Rabeya Tus Sadia, Qiang Ye, Qiang Cheng

机构 * Department of Computer Science, University of Kentucky, Lexington, KY, USA(计算机科学系,肯塔基大学,路易斯维尔,KY,美国) Department of Mathematics, University of Kentucky, Lexington, KY, USA(数学系,肯塔基大学,路易斯维尔,KY,美国) Institute for Biomedical Informatics, University of Kentucky, Lexington, KY, USA(生物医学信息学研究所,肯塔基大学,路易斯维尔,KY,美国)

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 CrossLLM-Mamba通过多模态状态空间融合实现RNA相互作用预测,采用双向Mamba编码器和动态序列转换模型,达到高精度性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20723 2026-02-27 cs.AI 79%

Modality-Guided Mixture of Graph Experts with Entropy-Triggered Routing for Multimodal Recommendation

模态引导的图专家混合网络与熵触发路由用于多模态推荐

Ji Dai, Quan Fang, Dengsheng Cai

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tianjin University of Technology(天津理工大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 MAGNET通过模态引导的图专家混合网络与熵触发路由,提升多模态推荐中融合的可控性、稳定性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22796 2026-02-27 cs.IT math.IT 78%

Multi-modal Data Driven Virtual Base Station Construction for Massive MIMO Beam Alignment

多模态数据驱动的大规模MIMO波束对准虚拟基站构造

Yijie Bian, Wei Guo, Jie Yang, Shenghui Song, Jun Zhang, Shi Jin, Khaled B. Letaief

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文提出利用多模态数据构建虚拟基站以优化大规模MIMO波束对准,通过几何镜像和稀疏表示提升频谱效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22944 2026-02-27 cs.MM 57%

MViR: Multi-View Visual-Semantic Representation for Fake News Detection

MViR:多视图视觉-语义表示用于虚假新闻检测

Haochen Liang, Xinqi Su, Jun Wang, Chaomeng Chen, Zitong Yu

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.MM

AI总结 MViR通过多视图视觉-语义表示方法提升虚假新闻检测的准确性,结合图像多视角特征与文本信息进行融合分析。

Comments Accepted by ICASSP'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22368 2026-02-27 cs.SE cs.AI 57%

EyeLayer: Integrating Human Attention Patterns into LLM-Based Code Summarization

EyeLayer:将人类注意力模式整合到基于LLM的代码摘要中

Jiahao Zhang, Yifan Zhang, Kevin Leach, Yu Huang

机构 * Vanderbilt University(范德比尔特大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 EyeLayer通过整合人类眼动模式提升LLM代码摘要效果,实现13.17%的BLEU-4提升。

Comments Accepted at the 34th IEEE/ACM International Conference on Program Comprehension (ICPC 2026), April 12-13, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 其他多模态 4 篇

2602.21743 2026-02-27 cs.CV 79%

Enhancing Multi-Modal LLMs Reasoning via Difficulty-Aware Group Normalization

通过难度感知分组归一化增强多模态大语言模型推理

Jinghan Li, Junfeng Fang, Jinda Lu, Yuan Wang, Xiaoyan Guo, Tianyu Zhang, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 其他多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出难度感知分组归一化方法,通过感知复杂度和推理不确定性表征样本,提升多模态大语言模型的推理稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19709 2026-02-27 cs.RO cs.SY eess.SY 78%

DreamWaQ++: Obstacle-Aware Quadrupedal Locomotion With Resilient Multi-Modal Reinforcement Learning

DreamWaQ++: 基于障碍物感知的四足机器人运动控制与鲁棒多模强化学习

I Made Aswin Nahrendra, Byeongho Yu, Minho Oh, Dongkyu Lee, Seunghyun Lee, Hyeonwoo Lee, Hyungtae Lim, Hyun Myung

机构 * Urban Robotics Lab., School of Electrical Engineering, KAIST(韩国科学技术院电子工程系城市机器人实验室) KRAFTON(KRAFTON公司) URobotics(URobotics公司) Laboratory for Information and Decision Systems (LIDS), MIT(麻省理工学院信息与决策系统实验室)

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 DreamWaQ++通过鲁棒多模强化学习融合本体和外源感觉,实现四足机器人在复杂环境中的鲁棒运动控制与敏捷性能。

Comments IEEE Transactions on Robotics 2026. Project site is available at https://dreamwaqpp.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22623 2026-02-27 cs.LG cs.AI cs.CL 76%

ContextRL: Enhancing MLLM's Knowledge Discovery Efficiency with Context-Augmented RL

ContextRL: 通过上下文增强强化学习提升大语言模型的知识发现效率

Xingyu Lu, Jinpeng Wang, YiFan Zhang, Shijie Ma, Xiao Hu, Tianke Zhang, Haonan fan, Kaiyu Jiang, Changyi Liu, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Chun Yuan

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学)

专题命中 其他多模态 :MLLM(title);分类 cs.CL、cs.AI

AI总结 ContextRL通过上下文增强强化学习提升大语言模型的知识发现效率,有效缓解奖励黑客问题并提升性能。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22998 2026-02-27 cs.RO 50%

A Perspective on Open Challenges in Deformable Object Manipulation

变形物体操控中的开放性挑战视角

Ryan Paul McKennaa, John Oyekan

机构 * Department of Computer Science, University of York(约克大学计算机科学系)

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文探讨了变形物体操控中的关键挑战,包括遮挡处理、任务泛化和实时解决方案,并介绍了多模态感知、物理感知强化学习和生成神经网络等方法,旨在提升机器人在动态环境中的适应性和实用性。

Comments 28 pages, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏