arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-09 至 2026-01-09 共收录 56 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 5 篇

2502.14778 2026-01-09 cs.CL cs.AI cs.CV 85%

Harnessing PDF Data for Improving Japanese Large Multimodal Models

利用PDF数据提升日语大规模多模态模型

Jeonghun Baek, Akiko Aizawa, Kiyoharu Aizawa

机构 * The University of Tokyo(东京大学) National Institute of Informatics(信息处理研究所)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文通过利用日本PDF数据提升日语大规模多模态模型的性能,采用自动化流程提取图像-文本对并构建指令数据,实验结果显示在Heron-Bench上性能提升达2.1%-13.8%。

Comments Accepted to ACL2025 Findings. Code: https://github.com/ku21fan/PDF-JLMM

Journal ref Findings of the Association for Computational Linguistics: ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04777 2026-01-09 cs.CV cs.AI 84%

GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models

GeM-VG:迈向通用多图像视觉 grounding 的多模态大语言模型

Shurong Zheng, Yousong Zhu, Hongyin Zhao, Fan Yang, Yufei Zhan, Ming Tang, Jinqiao Wang

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 GeM-VG通过引入MG-Data-240K数据集和混合强化微调策略,提升多图像视觉 grounding 和通用多图像理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18693 2026-01-09 cs.CV 70%

MVT: Mask-Grounded Vision-Language Models for Taxonomy-Aligned Land-Cover Tagging

MVT:基于分类对齐的土地覆盖标签的掩码导向视觉-语言模型

Siyi Chen, Kai Wang, Weicong Pang, Ruiming Yang, Ziru Chen, Renjun Gao, Alexis Kai Hon Lau, Dasa Gu, Chenchen Zhang, Cheng Li

机构 * HKUST(香港科技大学) JHU(约翰·霍普金斯大学) CUHKSZ(香港中文大学) NUS(新加坡国立大学) MUST(穆斯林大学)

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 MVT通过三阶段框架结合类无关掩码证据与基于分类的场景解释,提升遥感土地覆盖标签的准确性和信息性。

Comments The project is available at https://charlescsyyy.github.io/MVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09779 2026-01-09 cs.CV 70%

MoIIE: Mixture of Intra- and Inter-Modality Experts for Large Vision Language Models

MoIIE:多模态专家的混合模型用于大视觉语言模型

Dianyi Wang, Siyuan Wang, Zejun Li, Yikun Wang, Yitong Li, Duyu Tang, Xiaoyu Shen, Xuanjing Huang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institut(上海创新研究院) University of Southern California(南加州大学) Huawei Technologies Co., Ltd(华为技术有限公司) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Institute of Digital Twin, EIT(宁波空间智能与数字衍生关键实验室,数字孪生研究院,EIT)

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MoIIE模型,通过混合内模态和跨模态专家提升大视觉语言模型的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05159 2026-01-09 cs.CV cs.AI 62%

Vision-Language Introspection: Mitigating Overconfident Hallucinations in MLLMs via Interpretable Bi-Causal Steering

视觉-语言反思:通过可解释的双因果引导减轻大语言模型中的过度自信幻觉

Shuliang Liu, Songbo Yang, Dong Fang, Sihang Jia, Yuqi Tang, Lingfeng Su, Ruoshui Peng, Yibo Yan, Xin Zou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) The Hong Kong University of Science and Technology(香港理工大学) LIGHTSPEED

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 VLI通过可解释的双因果引导方法,有效减少大语言模型中的对象幻觉,提升多模态任务的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 4 篇

2601.01568 2026-01-09 cs.SD cs.AI cs.CV cs.MM eess.AS 83%

MM-Sonate: Multimodal Controllable Audio-Video Generation with Zero-Shot Voice Cloning

MM-Sonate: 多模态可控音频视频生成与零样本语音克隆

Chunyu Qiang, Jun Wang, Xiaopeng Wang, Kang Yin, Yuxin Guo

机构 * Kuaishou Technology(快手科技)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 MM-Sonate通过统一的指令-音素输入实现可控的音频视频联合生成与零样本语音克隆,显著提升唇形同步和语音可懂度,同时保持与专门文本到语音系统的语音克隆保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04781 2026-01-09 cs.HC 82%

Dynamic Thermal Feedback in Highly Immersive VR Scenarios: a Multimodal Analysis of User Experience

高度沉浸式VR场景中的动态热反馈:用户体验的多模态分析

Sophie Villenave, Pierre Raimbaud, Guillaume Lavoué

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract)

AI总结 本研究通过多模态分析探讨了高度沉浸式VR场景中动态热反馈对用户体验的影响,发现热反馈可提升沉浸感,但不同质量水平对用户体验的影响因人而异。

Comments 15 pages, 9 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02967 2026-01-09 cs.SD cs.AI eess.AS 62%

MoE Adapter for Large Audio Language Models: Sparsity, Disentanglement, and Gradient-Conflict-Free

用于大型音频语言模型的MoE适配器:稀疏性、解耦与梯度无冲突

Yishu Lei, Shuwei He, Jing Hu, Dan Zhang, Xianlong Luo, Danxiang Zhu, Shikun Feng, Rui Liu, Jingzhou He, Yu Sun, Hua Wu, Haifeng Wang

机构 * ERNIE Team, Baidu(百度ERNIE团队) College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出MoE-Adapter,通过稀疏混合专家架构解耦音频信息,缓解梯度冲突,提升音频语义和非语言任务的性能。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04960 2026-01-09 cs.CL cs.SD 57%

A Unified Spoken Language Model with Injected Emotional-Attribution Thinking for Human-like Interaction

具有注入情感归因思维的统一口语语言模型用于人样交互

Qing Wang, Zehan Li, Yaodong Song, Hongjie Chen, Jian Kang, Jie Lian, Jie Li, Yongxiang Li, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究院(TeleAI),中国电信,中国)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 本文提出一种通过注入情感归因思维提升情感智能的统一口语语言模型,实现人样交互中的情感感知与响应生成。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 9 篇

2512.00949 2026-01-09 cs.LG cs.AI 83%

Multi-Modal AI for Remote Patient Monitoring in Cancer Care

多模态AI在癌症护理中的远程患者监测

Yansong Liu, Ronnie Stafford, Pramit Khetrapal, Huriye Kocadag, Graça Carvalho, Patricia de Winter, Maryam Imran, Amelia Snook, Adamos Hadjivasiliou, D. Vijay Anand, Weining Lin, John Kelly, Yukun Zhou, Ivana Drobnjak

机构 * University College London(伦敦大学学院) Ethera Health LTD(Ethera健康有限公司) Centro Algoritmi, Universidade do Minho(阿尔戈里米中心,明霍大学)

专题命中 视频多模态 :multi-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 本研究提出多模态AI框架用于癌症护理中的远程患者监测,通过整合多源数据预测不良事件风险,准确率达83.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04709 2026-01-09 cs.AI 79%

Bridging Temporal and Textual Modalities: A Multimodal Framework for Automated Cloud Failure Root Cause Analysis

弥合时序与文本模态:一种多模态框架用于自动化云故障根本原因分析

Gijun Park

机构 * Okestro

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种多模态框架,通过融合时间序列与文本数据,提升云故障根本原因分析的自动化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00123 2026-01-09 cs.CV 79%

A Spatially Masked Adaptive Gated Network for multimodal post-flood water extent mapping using SAR and incomplete multispectral data

一种空间掩码自适应门控网络用于利用SAR和不完整多光谱数据的多模态洪水后水 extent 映射

Hyunho Lee, Wenwen Li

机构 * School of Geographical Sciences and Urban Planning, Arizona State University(地理科学与城市规划学院,亚利桑那州立大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出SMAGNet,一种多模态深度学习模型,通过融合SAR和不完整多光谱数据,提升洪水后水 extent 映射的准确性和鲁棒性。

Comments 50 pages, 12 figures, 6 tables

Journal ref ISPRS Journal of Photogrammetry and Remote Sensing, 232, 492-508, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04299 2026-01-09 cs.LG q-bio.QM 78%

Transformer-Based Multi-Modal Temporal Embeddings for Explainable Metabolic Phenotyping in Type 1 Diabetes

基于Transformer的多模态时间嵌入用于1型糖尿病的可解释代谢表型分析

Pir Bakhsh Khokhar, Carmine Gravino, Fabio Palomba, Sule Yildrim Yayilgan, Sarang Shaikh

专题命中 视频多模态 :multi-modal(title);multimodal(abstract)

AI总结 本研究提出基于Transformer的多模态时间嵌入框架,用于1型糖尿病的可解释代谢表型分析,识别出5种代谢亚组并揭示其与心血管风险的关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19850 2026-01-09 cs.CV 74%

FALCONEye: Finding Answers and Localizing Content in ONE-hour-long videos with multi-modal LLMs

FALCONEye: 在一小时内视频中寻找答案并定位内容的多模态大语言模型

Carlos Plou, Cesar Borja, Ruben Martinez-Cantin, Ana C. Murillo

机构 * DIIS-I3A, University of Zaragoza(DIIS-I3A,西班牙阿利坎特大学)

专题命中 视频多模态 :multi-modal(title);分类 cs.CV

AI总结 FALCONEye通过多模态大语言模型在小时长视频中高效定位内容并回答问题,超越现有模型性能并显著降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04778 2026-01-09 cs.CV cs.AI cs.CL cs.MM 70%

CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models

CounterVid: 通过生成反事实视频缓解视频-语言模型中动作和时间幻觉

Tobia Poppi, Burak Uzkent, Amanmeet Garg, Lucas Porto, Garin Kessler, Yezhou Yang, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara, Florian Schiffers

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(帕尔马大学) Amazon Prime Video(亚马逊Prime视频)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 CounterVid通过生成反事实视频缓解视频-语言模型中动作和时间幻觉问题,提出反事实视频生成框架和MixDPO方法,提升时间推理和动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11399 2026-01-09 cs.CL cs.CV 62%

Minimal Clips, Maximum Salience: Long Video Summarization via Key Moment Extraction

最短片段,最大显著性:通过关键时刻提取实现长视频摘要

Galann Pennec, Zhengyuan Liu, Nicholas Asher, Philippe Muller, Nancy F. Chen

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出了一种通过关键时刻提取实现长视频多模态摘要的方法,利用轻量级模型和大型语言模型实现高效摘要生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04982 2026-01-09 cs.RO cs.AI 57%

When to Act: Calibrated Confidence for Reliable Human Intention Prediction in Assistive Robotics

何时行动:校准信心以在辅助机器人中实现可靠的意图预测

Johannes A. Gaus, Winfried Ilg, Daniel Haeufle

机构 * Hertie Institute for Clinical Brain Research & Center for Integrative Neuroscience, University of Tübingen(海德堡临床脑研究所及整合神经科学中心,图宾根大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种基于校准概率的安全触发框架,用于提升辅助机器人中意图预测的可靠性,通过校准信心减少误校准并提高安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04891 2026-01-09 cs.CV cs.LG 57%

Scaling Vision Language Models for Pharmaceutical Long Form Video Reasoning on Industrial GenAI Platform

在工业生成式AI平台上扩展视觉语言模型用于制药长格式视频推理

Suyash Mishra, Qiang Li, Srikanth Patil, Satyanarayan Pati, Baddu Narendra

机构 * Roche(罗氏) Accenture(埃森哲) Involead

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出工业GenAI框架,解决制药领域长格式视频推理问题,通过多模态架构和实证分析提升效率并揭示现有VLMs的限制。

Comments Submitted to the Industry Track of Top Tier Conference; currently under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 4 篇

2601.04571 2026-01-09 cs.AI cs.MM 81%

Enhancing Multimodal Retrieval via Complementary Information Extraction and Alignment

通过互补信息提取与对齐增强多模态检索

Delong Zeng, Yuexiang Xie, Yaliang Li, Ying Shen

机构 * School of Intelligent Systems Engineering, Sun Yat-sen University(1 智能系统工程学院,中山大学) Alibaba Group(2 阿里巴巴集团) Guangdong Provincial Key Laboratory of Fire Science and Intelligent Emergency Technology(3 广东省火灾科学与智能应急技术重点实验室)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI、cs.MM

AI总结 CIEA通过互补信息提取与对齐提升多模态检索效果,实现对图像和文本统一潜在空间的建模,并在多个基准上取得显著优势。

Comments Accepted by ACL'2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04297 2026-01-09 cs.LG cs.CV cs.HC cs.IR 79%

ArtCognition: A Multimodal AI Framework for Affective State Sensing from Visual and Kinematic Drawing Cues

ArtCognition:一种多模态AI框架,用于从视觉和运动学绘画线索中感知情绪状态

Behrad Binaei-Haghighi, Nafiseh Sadat Sajadi, Mehrad Liviyan, Reyhane Akhavan Kharazi, Fatemeh Amirkhani, Behnam Bahrak

机构 * Department of Electrical and Computer Engineering, University of Tehran(电信工程系,德黑兰理工大学) Tehran Institute for Advanced Studies, Khatam University(德黑兰高级研究院,凯塔姆大学) Department of Psychology, Allameh Tabataba’i University(心理学系,阿勒梅·塔巴塔比大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 ArtCognition通过融合视觉和运动学绘画线索,提供非侵入性情绪状态评估的新方法,验证了其在心理测量中的潜力。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03135 2026-01-09 cs.AI 79%

Beyond Retrieval: Improving Evidence Quality for LLM-based Multimodal Fact-Checking

超越检索:提升基于大语言模型的多模态事实核查的证据质量

Haoran Ou, Gelei Deng, Xingshuo Han, Jie Zhang, Han Qiu, Shangwei Guo, Tianwei Zhang

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Aletheia框架,通过改进证据检索策略提升多模态事实核查的证据质量,实验证明其在虚假信息检测中的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04458 2026-01-09 cs.LG 50%

Using Large Language Models to Detect Socially Shared Regulation of Collaborative Learning

利用大语言模型检测协作学习中的社会共享调节

Jiayi Zhang, Conrad Borchers, Clayton Cohn, Namrata Srivastava, Caitlin Snyder, Siyuan Guo, Ashwin T S, Naveeduddin Mohammed, Haley Noh, Gautam Biswas

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学) Vanderbilt University(范德堡大学) University of Detroit Mercy(底特律默克大学) New York University(纽约大学)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文利用大语言模型检测协作学习中的社会共享调节行为,通过嵌入方法提升学习分析的预测能力。

Comments Short research paper accepted at Learning Analytics and Knowledge (LAK '26)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 8 篇

2601.03193 2026-01-09 cs.CV cs.AI 84%

UniCorn: Towards Self-Improving Unified Multimodal Models through Self-Generated Supervision

UniCorn:通过自生成监督实现自我改进的统一多模态模型

Ruiyan Han, Zhen Fang, XinYu Sun, Yuchen Ma, Ziheng Wang, Yu Zeng, Zehui Chen, Lin Chen, Wenxuan Huang, Wei-Jie Xu, Yi Cao, Feng Zhao

机构 * MoE Key Lab of BIPC, USTC(脑智能基础与应用联合实验室,中国科学技术大学) FDU(复旦大学) ECNU(华东师范大学) CUHK(香港中文大学) NJU(南京大学) SUDA(上海大学)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 UniCorn通过自生成监督实现统一多模态模型的自我改进,提升多模态生成质量与理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04706 2026-01-09 cs.CV 83%

Forge-and-Quench: Enhancing Image Generation for Higher Fidelity in Unified Multimodal Models

锻造与淬火:提升统一多模态模型中图像生成的高保真度

Yanbing Zeng, Jia Wang, Hanghang Ma, Junqiang Wu, Jie Zhu, Xiaoming Wei, Jie Hu

机构 * Meituan(美团)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出Forge-and-Quench框架,通过利用理解模型增强生成图像的保真度和细节,提升多模态模型的生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04506 2026-01-09 cs.LG cs.AI cs.CE 74%

Surface-based Molecular Design with Multi-modal Flow Matching

基于表面的分子设计与多模态流匹配

Fang Wu, Zhengyuan Zhou, Shuting Jin, Xiangxiang Zeng, Jure Leskovec, Jinbo Xu

机构 * Stanford University(斯坦福大学) University of California, San Diego(加州大学圣地亚哥分校) Wuhan University of Science and Technology(武汉科技大学) Hunan University(湖南大学)

专题命中 多模态生成 :multi-modal(title);分类 cs.AI

AI总结 SurfFlow通过多模态流匹配算法实现基于分子表面的肽共同设计,提升肽与受体的结合准确性,并在PepMerge基准中优于全原子基线。

Journal ref KDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05124 2026-01-09 cs.CV 70%

Re-Align: Structured Reasoning-guided Alignment for In-Context Image Generation and Editing

Re-Align:基于结构化推理的对齐方法用于上下文图像生成与编辑

Runze He, Yiji Cheng, Tiankai Hang, Zhimin Li, Yu Xu, Zijin Yin, Shiyi Zhang, Wenxun Dai, Penghui Du, Ao Ma, Chunyu Wang, Qinglin Lu, Jizhong Han, Jiao Dai

机构 * Hunyuan, Tencent(腾讯文库) IIE, CAS(中国科学院信息工程研究所) UCAS Project Page(中国科学技术大学)

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 Re-Align通过结构化推理引导的对齐方法,提升上下文图像生成与编辑任务的性能。

Comments 13 pages, 9 figures, project page: https://github.com/hrz2000/realign

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04734 2026-01-09 cs.CV 70%

AIVD: Adaptive Edge-Cloud Collaboration for Accurate and Efficient Industrial Visual Detection

AIVD:自适应边缘-云协作用于准确高效的工业视觉检测

Yunqing Hu, Zheming Yang, Chang Zhao, Qi Guo, Meng Gao, Pengcheng Li, Wen Ji

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院工业人工智能研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 AIVD通过边缘-云协作提升工业视觉检测的精度与效率,采用轻量边缘检测与云MLLM协同,结合高效微调策略和动态调度算法,实现高吞吐低延迟的资源优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04359 2026-01-09 cs.CV 57%

PackCache: A Training-Free Acceleration Method for Unified Autoregressive Video Generation via Compact KV-Cache

PackCache: 一种无需训练的统一自回归视频生成加速方法通过紧凑的KV缓存

Kunyang Li, Mubarak Shah, Yuzhang Shang

机构 * Institute of Artificial Intelligence, University of Central Florida(人工智能学院,中央佛罗里达大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 PackCache通过动态压缩KV缓存提升统一自回归视频生成效率,显著加速长序列生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02356 2026-01-09 cs.CV 57%

Talk2Move: Reinforcement Learning for Text-Instructed Object-Level Geometric Transformation in Scenes

Talk2Move: 基于强化学习的文本指令下场景中物体级几何变换

Jing Tan, Zhaoyang Zhang, Yantao Shen, Jiarui Cai, Shuo Yang, Jiajun Wu, Wei Xia, Zhuowen Tu, Stefano Soatto

机构 * AWS Agentic AI(AWS智能AI) Amazon Web Services(亚马逊网络服务) Amazon Robotics(亚马逊机器人技术) CUHK(香港中文大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 Talk2Move通过强化学习实现文本指令下的场景中物体级几何变换,利用组相对策略优化和空间奖励引导模型,提升学习效率并实现精确且一致的物体变换。

Comments Project page: https://sparkstj.github.io/talk2move

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04915 2026-01-09 cs.HC 50%

OnomaCompass: A Texture Exploration Interface that Shuttles between Words and Images

OnomaCompass: 一种连接词语与图像的纹理探索界面

Miki Okamura, Shuhey Koyama, Li Jingjing, Yoichi Ochiai

专题命中 多模态生成 :cross-modal(abstract)

AI总结 OnomaCompass通过连接拟声词与图像的潜在空间,帮助用户更高效地发现材料,减少工作量并提升用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏