arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4959 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4959 篇

2512.25072 2026-01-01 cs.RO cs.AI cs.LG 57%

Coordinated Humanoid Manipulation with Choice Policies

协调的人形机器人操作与选择策略

Haozhi Qi, Yen-Jen Wang, Toru Lin, Brent Yi, Yi Ma, Koushil Sreenath, Jitendra Malik

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出选择策略,通过模块化遥控和模仿学习,实现人形机器人在无结构环境中的协调操作与高效学习。

Comments Code and Website: https://choice-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22681 2026-01-01 cs.CV 57%

CritiFusion: Semantic Critique and Spectral Alignment for Faithful Text-to-Image Generation

CritiFusion: 语义批评与频谱对齐用于忠实的文本到图像生成

ZhenQi Chen, TsaiChing Ni, YuanFu Yang

机构 * National Yang Ming Chiao Tung University

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 CritiFusion通过语义批评和频谱对齐提升文本到图像生成的忠实度和细节质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15560 2025-12-30 cs.CV 57%

GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models

GRAN-TED: 生成稳健、对齐且细腻的文本嵌入以用于扩散模型

Bozhou Li, Sihan Yang, Yushuo Guan, Ruichuan An, Xinlong Chen, Yang Shi, Pengfei Wan, Wentao Zhang, Yuanxing zhang

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Xi’an Jiaotong University(西安交通大学) School of Artificial Intelligence, UCAS(清华大学人工智能学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 GRAN-TED提出了一种生成稳健、对齐且细腻的文本嵌入以用于扩散模型的范式,通过TED-6K基准提升文本编码器性能,显著加快扩散模型训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05621 2025-12-30 cs.CV 57%

A Preliminary Study on GPT-Image Generation Model for Image Restoration

基于GPT图像生成模型的图像修复初步研究

Hao Yang, Yan Yang, Ruikun Zhang, Liyuan Pan

机构 * Beijing Institute of Technology(北京理工大学) Australian National University(澳大利亚国立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本研究探讨GPT图像生成模型在图像修复中的应用,发现其在感知上表现良好但缺乏像素级结构保真度,并展示其作为视觉先验提升修复质量的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22392 2025-12-30 cs.CV 57%

iOSPointMapper: RealTime Pedestrian and Accessibility Mapping with Mobile AI

iOSPointMapper: 基于移动AI的实时行人及可达性制图

Himanshu Naidu, Yuxiang Zhang, Sachin Mehta, Anat Caspi

机构 * University of Washington(华盛顿大学) Paul G. Allen School of Computer Science and Engineering(保罗·G·艾伦计算机科学与工程学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 iOSPointMapper通过移动AI实现实时人行道制图,结合语义分割、LiDAR和GPS数据,提供隐私保护的数据收集与多模式交通数据整合,提升行人基础设施的可达性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21867 2025-12-29 cs.CV 57%

DPAR: Dynamic Patchification for Efficient Autoregressive Visual Generation

DPAR:动态分块化用于高效的自回归视觉生成

Divyansh Srivastava, Akshay Mehra, Pranav Maneriker, Debopam Sanyal, Vishnu Raj, Vijay Kamarshi, Fan Du, Joshua Kimball

机构 * University of California, San Diego(加州大学圣地亚哥分校) Dolby Laboratories(杜比实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 DPAR通过动态分块化技术提升自回归视觉生成效率,减少计算资源消耗并提高生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21691 2025-12-29 cs.CV 57%

Analyzing the Mechanism of Attention Collapse in VGGT from a Dynamics Perspective

从动力学角度分析VGGT中注意力崩溃的机制

Huan Li, Longjun Luo, Yuling Shi, Xiaodong Gu

机构 * Huazhong University of Science and Technology(华中科技大学) Guangdong University of Technology(广东工业大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 VGGT中注意力崩溃现象从动力学角度进行数学解释,揭示token特征流收敛规律及token合并方法对延迟崩溃的作用。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21560 2025-12-29 cs.CV 57%

Toward Intelligent Scene Augmentation for Context-Aware Object Placement and Sponsor-Logo Integration

迈向智能场景增强以实现情境感知的对象放置和赞助商-标志集成

Unnati Saraswat, Tarun Rao, Namah Gupta, Shweta Swami, Shikhar Sharma, Prateek Narang, Dhruv Kumar

机构 * Birla Institute of Technology and Science(巴里尔理工学院和科学研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出两个新任务:情境感知的对象插入和赞助商-产品标志增强,并构建了相应数据集以支持这些任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17376 2025-12-29 cs.CV 57%

Towards Deeper Emotional Reflection: Crafting Affective Image Filters with Generative Priors

迈向更深层次的情感反思:基于生成先验的富有情感的图像滤镜

Peixuan Zhang, Shuchen Weng, Jiajun Tang, Si Li, Boxin Shi

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) State Key Laboratory of Multimedia Information Processing and National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室和视觉技术国家工程研究中心)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出AIF任务,通过生成先验提升图像情感表达,实现更深层次的情感反思。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18699 2025-12-29 cs.CV 57%

Affective Image Editing: Shaping Emotional Factors via Text Descriptions

情感图像编辑:通过文本描述塑造情感因素

Peixuan Zhang, Shuchen Weng, Chengxuan Zhu, Binghao Tang, Zijian Jia, Si Li, Boxin Shi

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications, China(北京邮电大学人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) State Key Laboratory for Multimedia Information Processing and National Engineering Research Center of Visual Technology, School of Computer Science, Peking University, China(多媒体信息处理国家重点实验室和视觉技术国家工程研究中心,北京大学计算机学院)

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

AI总结 AIEdiT通过文本描述实现情感图像编辑,利用情感映射器和MLLM生成符合用户情感需求的图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08189 2025-12-24 cs.CV 57%

Reinforcement Learning for Large Model: A Survey

为大模型设计强化学习:综述

Weijia Wu, Chen Gao, Joya Chen, Kevin Qinghong Lin, Qingwei Meng, Yiming Zhang, Yuke Qiu, Hong Zhou, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文综述了视觉强化学习领域,探讨了多模态大语言模型、视觉生成等四个主题,分析了算法设计、奖励工程及评估协议,并指出了样本效率、泛化能力等开放挑战。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19686 2025-12-23 cs.CV 57%

Visual-Aware CoT: Achieving High-Fidelity Visual Consistency in Unified Models

视觉感知的CoT:在统一模型中实现高保真的视觉一致性

Zixuan Ye, Quande Liu, Cong Wei, Yuanxing Zhang, Xintao Wang, Pengfei Wan, Kun Gai, Wenhan Luo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出视觉感知的CoT方法,通过自适应视觉规划和迭代视觉修正提升统一模型的多模态生成能力,实现更高的视觉一致性。

Comments Project Page: https://zixuan-ye.github.io/VACoT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19680 2025-12-23 cs.CV 57%

VA-$π$: Variational Policy Alignment for Pixel-Aware Autoregressive Generation

VA-$π$: 变分策略对齐用于像素感知自回归生成

Xinyao Liao, Qiyuan He, Kai Xu, Xiaoye Qu, Yicong Li, Wei Wei, Angela Yao

机构 * Huazhong University of Science & Technology(华中科技大学) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 VA-$π$通过变分优化和像素空间目标提升自回归生成的质量和多样性。

Comments 21 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19479 2025-12-23 cs.CV 57%

Emotion-Director: Bridging Affective Shortcut in Emotion-Oriented Image Generation

情绪导演:在情绪导向图像生成中弥合情感捷径

Guoli Jia, Junyao Hu, Xinwei Long, Kai Tian, Kaiyan Zhang, KaiKai Zhao, Ning Ding, Bowen Zhou

机构 * Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学) China Unicom(中国联合通信) Shanghai Artificial Intelligence Lab(上海人工智能实验室)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 Emotion-Director通过跨模态协作框架,结合MC-Diffusion和MC-Agent,提升情绪导向图像生成的准确性和表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19271 2025-12-23 cs.CV 57%

3SGen: Unified Subject, Style, and Structure-Driven Image Generation with Adaptive Task-specific Memory

3SGen: 一种统一的主体、风格和结构驱动的图像生成方法,具有自适应任务特定记忆

Xinyang Song, Libin Wang, Weining Wang, Zhiwei Li, Jianxin Sun, Dandan Zheng, Jingdong Chen, Qi Li, Zhenan Sun

机构 * School of Artificial Intelligence, UCAS(人工智能学院,UCAS) CASIA AntGroup(蚂蚁集团)

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

AI总结 3SGen通过统一的框架实现主体、风格和结构驱动的图像生成,采用自适应任务特定记忆模块提升生成质量和跨任务迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18814 2025-12-23 cs.CV 57%

EchoMotion: Unified Human Video and Motion Generation via Dual-Modality Diffusion Transformer

EchoMotion: 通过双模态扩散变换器实现统一的人体视频与运动生成

Yuxiao Yang, Hualian Sheng, Sijia Cai, Jing Lin, Jiahao Wang, Bing Deng, Junzhe Lu, Haoqian Wang, Jieping Ye

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Nanyang Technology University(南阳技术大学) Xi’an Jiaotong University(西安交通大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 EchoMotion通过双模态扩散变换器统一生成人体视频与运动,提升复杂人类动作视频的连贯性与合理性。

Comments 26 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18635 2025-12-23 cs.CV 57%

Uni-Neur2Img: Unified Neural Signal-Guided Image Generation, Editing, and Stylization via Diffusion Transformers

Uni-Neur2Img:通过扩散变换器实现神经信号引导的图像生成、编辑和风格化

Xiyue Bai, Ronghao Yu, Jia Xiu, Pengfei Zhou, Jie Xia, Peng Ji

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 Uni-Neur2Img通过扩散变换器实现神经信号引导的图像生成、编辑和风格化,提供统一且高效的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18007 2025-12-23 cs.RO cs.CV 57%

Robotic VLA Benefits from Joint Learning with Motion Image Diffusion

机器人VLA通过与运动图像扩散的联合学习获益

Yu Fang, Kanchana Ranasinghe, Le Xue, Honglu Zhou, Juntao Tan, Ran Xu, Shelby Heinecke, Caiming Xiong, Silvio Savarese, Daniel Szafir, Mingyu Ding, Michael S. Ryoo, Juan Carlos Niebles

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出通过联合学习与运动图像扩散提升机器人VLA模型的运动推理能力,实验表明在多个基准测试中显著提升了性能。

Comments Website: https://vla-motion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17878 2025-12-22 cs.LG cs.AI stat.ML 57%

Weighted Stochastic Differential Equation to Implement Wasserstein-Fisher-Rao Gradient Flow

带权随机微分方程实现Wasserstein-Fisher-Rao梯度流

Herlock Rahimi

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出通过带权随机微分方程实现Wasserstein-Fisher-Rao梯度流,以改进生成建模中的采样效率。

Comments 26 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16625 2025-12-22 cs.CV 57%

DeContext as Defense: Safe Image Editing in Diffusion Transformers

DeContext作为防御:扩散变换器中的安全图像编辑

Linghui Shen, Mingyue Cui, Xingyi Yang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 DeContext通过扰动注意力层来防止图像编辑,有效保护输入图像免受未经授权的修改。

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17152 2025-12-22 cs.CV 57%

PhysFire-WM: A Physics-Informed World Model for Emulating Fire Spread Dynamics

PhysFire-WM: 一种融合物理信息的世界模型用于模拟火灾扩散动力学

Nan Zhou, Huandong Wang, Jiahao Li, Yang Li, Xiao-Ping Zhang, Yong Li, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 PhysFire-WM通过融合物理信息和跨任务协作训练策略,提升火灾扩散预测的物理真实性和几何准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16910 2025-12-19 cs.CV cs.LG 57%

SFTok: Bridging the Performance Gap in Discrete Tokenizers

SFTok: 缩小离散分词器在性能上的差距

Qihang Rao, Borui Zhang, Wenzhao Zheng, Jie Zhou, Jiwen Lu

机构 * Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 SFTok通过多步骤迭代机制和自引导视觉重建策略,提升图像重建质量,实现高压缩率下的高性能表现。

Comments Under review. Code is available at https://github.com/Neur-IO/SFTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16841 2025-12-19 cs.CV 57%

Radiology Report Generation with Layer-Wise Anatomical Attention

基于层间解剖注意力的放射报告生成

Emmanuel D. Muñiz-De-León, Jorge A. Rosales-de-Golferichs, Ana S. Muñoz-Rodríguez, Alejandro I. Trejo-Castro, Eduardo de Avila-Armenta, Antonio Martínez-Torteya

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种基于层间解剖注意力的紧凑图像到文本模型,用于生成胸部X光报告的发现部分,通过整合解剖区域信息提升了报告的准确性和连贯性。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16776 2025-12-19 cs.CV 57%

Kling-Omni Technical Report

Kling-Omni 技术报告

Kling Team, Jialu Chen, Yuanzheng Ci, Xiangyu Du, Zipeng Feng, Kun Gai, Sainan Guo, Feng Han, Jingbin He, Kang He, Xiao Hu, Xiaohua Hu, Boyuan Jiang, Fangyuan Kong, Hang Li, Jie Li, Qingyu Li, Shen Li, Xiaohan Li, Yan Li, Jiajun Liang, Borui Liao, Yiqiao Liao, Weihong Lin, Quande Liu, Xiaokun Liu, Yilun Liu, Yuliang Liu, Shun Lu, Hangyu Mao, Yunyao Mao, Haodong Ouyang, Wenyu Qin, Wanqi Shi, Xiaoyu Shi, Lianghao Su, Haozhi Sun, Peiqin Sun, Pengfei Wan, Chao Wang, Chenyu Wang, Meng Wang, Qiulin Wang, Runqi Wang, Xintao Wang, Xuebo Wang, Zekun Wang, Min Wei, Tiancheng Wen, Guohao Wu, Xiaoshi Wu, Zhenhua Wu, Da Xie, Yingtong Xiong, Yulong Xu, Sile Yang, Zikang Yang, Weicai Ye, Ziyang Yuan, Shenglong Zhang, Shuaiyu Zhang, Yuanxing Zhang, Yufan Zhang, Wenzheng Zhao, Ruiliang Zhou, Yan Zhou, Guosheng Zhu, Yongjie Zhu

机构 * Kling Team(Kling团队)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 Kling-Omni 是一种通用生成框架,通过多模态视觉语言输入直接合成高质量视频,整合视频生成、编辑和智能推理任务,实现电影级内容创作。

Comments Kling-Omni Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14855 2025-12-18 cs.CE cs.AI 57%

A Roadmap for Applying Graph Neural Networks to Numerical Data: Insights from Cementitious Materials

将图神经网络应用于数值数据的路线图:从水泥材料中获得的见解

Mahmuda Sharmin, Taihao Han, Jie Huang, Narayanan Neithalath, Gaurav Sant, Aditya Kumar

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出利用图神经网络(GNN)设计混凝土,通过K-NN方法将表格数据转化为图表示,并优化参数以实现可解释的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05005 2025-12-18 cs.CV cs.LG cs.RO 57%

Diff-2-in-1: Bridging Generation and Dense Perception with Diffusion Models

Diff-2-in-1:通过扩散模型弥合生成与密集感知的鸿沟

Shuhong Zheng, Zhipeng Bao, Ruoyu Zhao, Martial Hebert, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 Diff-2-in-1通过结合扩散模型的生成与感知能力,实现多模态数据生成与密集视觉感知的统一框架,提升视觉感知的判别能力。

Comments 26 pages, 14 figures

Journal ref ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14217 2025-12-17 cs.CV cs.RO 57%

DRAW2ACT: Turning Depth-Encoded Trajectories into Robotic Demonstration Videos

DRAW2ACT:将深度编码轨迹转化为机器人演示视频

Yang Bai, Liudi Yang, George Eskandar, Fengyi Shen, Mohammad Altillawi, Ziyuan Liu, Gitta Kutyniok

机构 * Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) University of Freiburg(弗赖堡大学) Technical University of Munich(慕尼黑技术大学) Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心(慕尼黑))

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 DRAW2ACT通过深度感知的轨迹条件视频生成框架,生成可控且一致的机器人演示视频,提升机器人操作的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11252 2025-12-17 cs.CV eess.IV 57%

MFGDiffusion: Mask-Guided Smoke Synthesis for Enhanced Forest Fire Detection

MFGDiffusion:基于掩码的烟雾合成以提升森林火灾检测

Guanghao Wu, Yunqing Shang, Chen Xu, Hai Song, Chong Wang, Qixing Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 MFGDiffusion通过掩码引导的烟雾合成提升森林火灾检测性能

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13276 2025-12-16 cs.CV 57%

CogniEdit: Dense Gradient Flow Optimization for Fine-Grained Image Editing

CogniEdit: 密集梯度流优化用于细粒度图像编辑

Yan Li, Lin Liu, Xiaopeng Zhang, Wei Xue, Wenhan Luo, Yike Guo, Qi Tian

机构 * Hongkong University of Science and Technology(香港科学与技术大学) Huawei Company(华为公司)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 CogniEdit通过密集梯度流优化实现细粒度图像编辑,结合多模态推理与动态令牌焦点重新定位,提升指令遵循与视觉质量的平衡

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21329 2025-12-16 cs.AI physics.soc-ph 57%

Active Inference AI Systems for Scientific Discovery

主动推断AI系统用于科学发现

Karthik Duraisamy

机构 * Michigan Institute for Computational Discovery & Engineering(密歇根计算发现与工程研究所) University of Michigan(密歇根大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出主动推断AI系统,通过结合缓慢假设生成与快速验证推理,利用因果和多模态模型促进科学发现,强调人类判断在处理不确定性中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏