arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7596 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7596 篇

2604.06165 2026-04-13 cs.CV cs.LG 79%

HaloProbe: Bayesian Detection and Mitigation of Object Hallucinations in Vision-Language Models

HaloProbe: 基于贝叶斯的方法检测和缓解视觉-语言模型中的物体幻觉

Reihaneh Zohrabi, Hosein Hasani, Akshita Gupta, Mahdieh Soleymani Baghshah, Anna Rohrbach, Marcus Rohrbach

机构 * Multimodal AI Lab, Technical University of Darmstadt(达姆施塔特工业大学多模态人工智能实验室) Department of Computer Engineering, Sharif University of Technology(谢里夫理工大学计算机工程系)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG

AI总结 本文提出HaloProbe框架,通过结合外部描述统计和内部解码信号,有效检测和缓解视觉-语言模型中的物体幻觉,实验表明其比现有干预方法更有效且保持了模型的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21472 2026-04-13 cs.CV cs.CL cs.MM 79%

Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration

通过自适应注意力校准缓解大视觉-语言模型中的幻觉

Mehrdad Fazli, Bowen Wei, Ahmet Sari, Ziwei Zhu

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本文提出CAAC框架,通过解决空间感知偏差和模态偏差,提升大视觉-语言模型在长文本生成中的准确性和视觉对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08456 2026-04-10 cs.CV cs.CL 79%

Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision-Language Models

熵-梯度基础:在视觉语言模型中无需训练的证据检索

Marcel Gröpl, Jaewoo Jung, Seungryong Kim, Marc Pollefeys, Sunghwan Hong

机构 * ETH Zurich(苏黎世联邦理工学院) ETH AI Center(ETH人工智能中心) KAIST AI(韩国科学技术院人工智能系)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 本文提出一种无需训练的视觉语言模型证据检索方法,通过熵梯度映射提升对微小视觉细节和多区域线索的处理能力,实验显示在多个基准上取得显著改进。

Comments Project Page : https://entropy-gradient-grounding.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07914 2026-04-10 cs.CV cs.AI 79%

Mitigating Entangled Steering in Large Vision-Language Models for Hallucination Reduction

缓解大型视觉-语言模型中的纠缠引导以减少幻觉

Yuanhong Zhang, Zhaoyang Wang, Xin Zhang, Weizhan Zhang, Joey Tianyi Zhou

机构 * Ministry of Education Key Laboratory of Intelligent Networks and Network Security(教育部智能网络与网络安全重点实验室) Centre for Frontier AI Research, Institute of High Performance Computing, Agency for Science, Technology and Research(前沿人工智能研究中心,高性能计算研究所,科技研究局)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出MESA框架,通过可控的潜在空间干预减少视觉-语言模型中的幻觉,同时保持生成行为,实验表明其在多个模型家族中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04383 2026-04-07 cs.AI cs.MA math.OC 79%

Optimizing Service Operations via LLM-Powered Multi-Agent Simulation

通过LLM赋能的多智能体仿真优化服务运营

Yanyuan Wang, Xiaowei Zhang

机构 * Department of Industrial Engineering and Decision Analytics, The Hong Kong University of Science and Technology(香港科技大学工业工程与决策分析系)

专题命中 知识编辑与模型理解 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出基于LLM的多智能体仿真框架,通过建模决策依赖的不确定性,优化服务运营的稳态性能,实验证明其在可持续供应链中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03562 2026-04-07 cs.AI 79%

When Adaptive Rewards Hurt: Causal Probing and the Switching-Stability Dilemma in LLM-Guided LEO Satellite Scheduling

当自适应奖励有害:因果探测与在LLM引导的LEO卫星调度中的切换-稳定性困境

Yuanhang Li

专题命中 知识编辑与模型理解 :LLM(title,abstract);分类 cs.AI

AI总结 本文研究了在多波束LEO卫星调度中使用自适应奖励设计的挑战,发现固定奖励权重在PPO收敛中表现更优,通过因果探测方法揭示了特定权重的重要性,展示了LLM在通信系统中的应用价值。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29405 2026-04-01 cs.CV cs.AI 79%

Hallucination-aware intermediate representation edit in large vision-language models

具有幻觉意识的中间表示编辑在大视觉-语言模型中

Wei Suo, Hanzu Zhang, Lijun Zhang, Ji Ma, Peng Wang, Yanning Zhang

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出一种动态检测和消除幻觉表示的框架,通过最小额外计算成本在现有基准上实现最先进的性能,展示了高效且稳健的幻觉消除能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09826 2026-04-01 cs.CL 79%

From FusHa to Folk: Exploring Cross-Lingual Transfer in Arabic Language Models

从FusHa到Folk:探索阿拉伯语言模型中的跨语言迁移

Abdulmuizz Khalak, Abderrahmane Issam, Gerasimos Spanakis

机构 * Maastricht University(马斯特里赫特大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 研究阿拉伯语言模型在不同方言间的跨语言迁移能力,发现迁移效果不均衡且受地理接近性影响,同时发现多方言模型存在负干扰现象。

Comments Accepted to VarDial 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28360 2026-03-31 cs.AI 79%

CoE: Collaborative Entropy for Uncertainty Quantification in Agentic Multi-LLM Systems

CoE:协作熵用于代理多语言模型系统中的不确定性量化

Kangkang Sun, Jun Wu, Jianhua Li, Minyi Guo, Xiuzhen Che, Jianwei Huang

专题命中 知识编辑与模型理解 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出CoE,一种用于多语言模型协作中语义不确定性的信息理论度量,通过结合模型内语义熵和模型间与集均值的差异,提供更准确的不确定性估计,实验表明其在TriviaQA和SQuAD上优于传统基线。

Comments 18 pages, 7 figures, has already published in ICLR workshop "Agentic AI in the Wild: From Hallucinations to Reliable Autonomy"

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27343 2026-03-31 cs.AI 79%

Beyond Completion: Probing Cumulative State Tracking to Predict LLM Agent Performance

超越完成:探究累积状态跟踪以预测LLM代理性能

Dengzhe Hou, Lingyu Jiang, Deng Li, Zirui Li, Fangzhou Lin, Kazunori D Yamada

机构 * Tohoku University(东北大学) Lappeenranta-Lahti University of Technology LUT(拉彭兰塔-拉赫蒂理工大学) Texas A&M University(德克萨斯农工大学) Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 知识编辑与模型理解 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出WMF-AM方法,通过评估20种模型的累积算术状态跟踪能力,发现其与代理性能密切相关,且在控制完成分数和模型规模后仍保持显著相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26494 2026-03-30 quant-ph cs.CL 79%

Entanglement as Memory: Mechanistic Interpretability of Quantum Language Models

纠缠作为记忆:量子语言模型的机制可解释性

Nathan Roll

机构 * Stanford University(斯坦福大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 研究通过因果门消融、纠缠追踪和密度矩阵交换干预,揭示量子语言模型在长程依赖任务中单量子比特与双量子比特模型的机制差异及噪声-表达性权衡。

Comments 9 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23934 2026-03-26 cs.CV cs.AI 79%

Revealing Multi-View Hallucination in Large Vision-Language Models

揭示大型视觉-语言模型中的多视角幻觉

Wooje Park, Insu Lee, Soohyun Kim, Jaeyun Jang, Minyoung Noh, Kyuhong Shim, Byonghyo Shim

机构 * Seoul National University(首尔国立大学) Sungkyunkwan University(全州大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本文针对大型视觉-语言模型在多视角输入中出现的视觉信息混淆问题,提出Reference Shift Contrastive Decoding方法,通过生成负logits抑制视觉干扰,提升模型在多视角幻觉检测任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22593 2026-03-26 cs.CV cs.AI 79%

Language Models Can Explain Visual Features via Steering

语言模型可通过引导解释视觉特征

Javier Ferrando, Enrique Lopez-Cuena, Pablo Agustin Martin-Torres, Daniel Hinjos, Anna Arias-Duart, Dario Garcia-Gasulla

机构 * Barcelona Supercomputing Center(巴塞罗那超级计算中心)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出通过因果干预引导语言模型解释视觉特征,提供了一种可扩展的替代方法,提升视觉模型的可解释性。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18523 2026-03-20 cs.CV cs.AI 79%

Counting Circuits: Mechanistic Interpretability of Visual Reasoning in Large Vision-Language Models

计数电路:大视觉-语言模型中视觉推理的机制可解释性

Liwei Che, Zhiyu Xue, Yihao Quan, Benlin Liu, Zeru Shi, Michelle Hurst, Jacob Feldman, Ruixiang Tang, Ranjay Krishna, Vladimir Pavlovic

机构 * Rutgers University(罗格斯大学) UC Santa Barbara(加州大学圣巴巴拉分校) University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本文研究了大视觉-语言模型在计数任务中的机制,提出两种新方法揭示计数电路结构,并通过干预策略提升模型计数精度和视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18353 2026-03-20 cs.AI 79%

Interpretability without actionability: mechanistic methods cannot correct language model errors despite near-perfect internal representations

无需可操作性:机制方法无法纠正语言模型错误,尽管内部表示几乎完美

Sanjay Basu, Sadiq Y. Patel, Parth Sheth, Bhairavi Muralidharan, Namrata Elamaran, Aakriti Kinra, John Morgan, Rajaie Batniji

机构 * University of California San Francisco(加州大学旧金山分校) Waymark University of Pennsylvania(宾夕法尼亚大学) Virginia Commonwealth University(弗吉尼亚 Commonwealth 大学) Stanford University(斯坦福大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 研究探讨了机制解释方法在纠正语言模型错误中的有效性,发现尽管内部表示接近完美,但现有方法无法有效将知识转化为正确输出,揭示了AI安全框架中的潜在问题。

Comments 27 pages, 5 figures, 10 tables. Code available at https://github.com/sanjaybasu/interpretability-triage

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07463 2026-03-17 cs.CV cs.LG eess.IV 79%

MSEG-VCUQ: Multimodal SEGmentation with Enhanced Vision Foundation Models, Convolutional Neural Networks, and Uncertainty Quantification for High-Speed Video Phase Detection Data

MSEG-VCUQ: 多模态分割与增强视觉基础模型、卷积神经网络和不确定性量化用于高速视频相位检测数据

Chika Maduabuchi, Ericmoore Jossou, Matteo Bucci

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出MSEG-VCUQ,结合U-Net和SAM提升高速视频相位检测分割精度,引入不确定性量化和首个开源多模态数据集,实现更可靠的相位分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13389 2026-03-17 cs.CV cs.LG 79%

High-Fidelity Text-to-Image Generation from Pre-Trained Vision-Language Models via Distribution-Conditioned Diffusion Decoding

通过分布条件扩散解码从预训练视觉-语言模型生成高保真的文本到图像

Ji Woo Hong, Hee Suk Yoon, Gwanhyeong Koo, Eunseop Yoon, SooHwan Eom, Qi Dai, Chong Luo, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Microsoft Research Asia (MSRA)(微软亚洲研究院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG

AI总结 本文提出一种基于扩散解码的框架,通过训练仅需扩散解码器即可提升图像保真度,利用分布加权代码向量增强视觉质量,仅需ImageNet-1K短训练即可改进VQ-VAE重建和文本到图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11940 2026-03-13 cs.LG 79%

Exhaustive Circuit Mapping of a Single-Cell Foundation Model Reveals Massive Redundancy, Heavy-Tailed Hub Architecture, and Layer-Dependent Differentiation Control

对单细胞基础模型的全面电路映射揭示了大量冗余、重尾枢纽架构以及层依赖的分化控制

Ihor Kendiukhov

机构 * Department of Computer Science, University of Tübingen(图宾根大学计算机科学系)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 通过全面电路追踪等方法揭示单细胞基础模型中大量冗余、重尾枢纽结构及层依赖的分化控制,证实模型架构的亚加性特性并建立层位置与分化方向性的因果联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10261 2026-03-12 cs.LG q-bio.CB q-bio.GN 79%

Discovery of a Hematopoietic Manifold in scGPT Yields a Method for Extracting Performant Algorithms from Biological Foundation Model Internals

在scGPT中发现造血 manifold 并提取出一种从生物基础模型内部提取高性能算法的方法

Ihor Kendiukhov

机构 * Department of Computer Science, University of Tübingen(图宾根大学计算机科学系)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 通过scGPT发现并提取出首个具有生物用途的高性能造血算法,显著提升细胞类型分类性能且训练效率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06302 2026-03-09 cs.CV cs.AI 79%

DEX-AR: A Dynamic Explainability Method for Autoregressive Vision-Language Models

DEX-AR: 一种用于自回归视觉-语言模型的动态可解释性方法

Walid Bousselham, Angie Boggust, Hendrik Strobelt, Hilde Kuehne

机构 * Tuebingen AI Center University of Tuebingen(图宾根人工智能中心图宾根大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) IBM Research(IBM研究院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 DEX-AR是一种针对自回归视觉-语言模型的动态可解释性方法,通过生成2D热图来解释模型决策过程,提升模型可解释性和性能评估。

Comments Project page: https://walidbousselham.com/DEX-AR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03527 2026-03-05 cs.LG 79%

Logit-Level Uncertainty Quantification in Vision-Language Models for Histopathology Image Analysis

视觉-语言模型在病理图像分析中的logit级不确定性量化

Betul Yurdem, Ferhat Ozgur Catak, Murat Kuzlu, Mehmet Kemal Gullu

机构 * Department of Electrical and Electronics Engineering, Izmir Bakircay University(电气与电子工程系,伊兹密尔巴克伊大学) Department of Electrical Engineering and Computer Science, University of Stavanger(电气工程与计算机科学系,斯塔万格大学) Batten College of Engineering and Technology, Old Dominion University(工程与技术学院,老奥布良大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG

AI总结 本研究提出了一种基于VLMs的logit级不确定性量化框架,用于评估病理图像分析中模型的可靠性与安全性。

Comments 10 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02865 2026-03-04 cs.CL cs.CV 79%

Nodes Are Early, Edges Are Late: Probing Diagram Representations in Large Vision-Language Models

节点早于边,边晚于节点:在大规模视觉-语言模型中探测图表示

Haruto Yoshida, Keito Kudo, Yoichi Aoki, Ryota Tanaka, Itsumi Saito, Keisuke Sakaguchi, Kentaro Inui

机构 * Tohoku University(东大大学) Human Informatics Labs.(人文学信息实验室) NTT, Inc.(NTT公司)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 研究发现大规模视觉-语言模型在处理图结构时,节点信息早于边信息被线性编码,导致模型在理解边关系时存在困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05535 2026-02-27 cs.LG 79%

Detecting Misbehaviors of Large Vision-Language Models by Evidential Uncertainty Quantification

通过证据不确定性量化检测大视觉-语言模型的误行

Tao Huang, Rui Wang, Xiaofei Liu, Yi Qin, Li Duan, Liping Jing

机构 * State Key Laboratory of Advanced Rail Autonomous Operation(先进轨道交通自主运行国家重点实验室) Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通数据挖掘与具身智能重点实验室) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院) Beijing Key Laboratory of Security and Privacy in Intelligent Transportation(北京智能交通安全与隐私重点实验室)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG

AI总结 通过证据不确定性量化检测大视觉-语言模型的误行,识别内部冲突和无知以提高模型可靠性。

Comments Accepted to ICLR 2026. Code is available at https://github.com/HT86159/EUQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21704 2026-02-26 cs.CV cs.AI 79%

Dynamic Multimodal Activation Steering for Hallucination Mitigation in Large Vision-Language Models

动态多模态激活引导用于大型视觉-语言模型中的幻觉缓解

Jianghao Yin, Qin Chen, Kedi Chen, Jie Zhou, Xingjiao Wu, Liang He

机构 * East China Normal University(华东师范大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出动态多模态激活引导方法,通过构建语义真实性引导向量数据库,实现幻觉缓解,提升模型性能。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21178 2026-02-25 cs.CV cs.AI 79%

XMorph: Explainable Brain Tumor Analysis Via LLM-Assisted Hybrid Deep Intelligence

XMorph: 通过LLM辅助混合深度智能进行可解释性脑肿瘤分析

Sepehr Salem Ghahfarokhi, M. Moein Esfahani, Raj Sunderraman, Vince Calhoun, Mohammed Alser

机构 * Department of Computer Science, Georgia State University(计算机科学系,佐治亚州立大学) TReNDS Center, Georgia State University(TReNDS中心,佐治亚州立大学)

专题命中 知识编辑与模型理解 :LLM(title,abstract);分类 cs.AI

AI总结 XMorph通过结合LLM和混合深度智能,实现了对脑肿瘤的高效可解释分类,准确率达96.0%。

Comments Accepted in ICCABS 2026: The 14th International Conference on Computational Advances in Bio and Medical Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19022 2026-02-24 cs.CV cs.AI 79%

An interpretable framework using foundation models for fish sex identification

基于基础模型的可解释框架用于鱼类性别识别

Zheng Miao, Tien-Chieh Hung

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI

AI总结 基于基础模型的可解释框架用于濒危鱼类三角洲虾虎鱼的性别识别,通过原型网络提升鲁棒性与可解释性,实现高准确率识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17532 2026-02-20 q-bio.GN cs.AI 79%

Systematic Evaluation of Single-Cell Foundation Model Interpretability Reveals Attention Captures Co-Expression Rather Than Unique Regulatory Signal

单细胞基础模型解释性系统评估揭示注意力捕捉共表达而非独特调控信号

Ihor Kendiukhov

机构 * Department of Computer Science University of Tübingen(计算机科学系图宾根大学)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI

AI总结 单细胞基础模型中注意力机制捕捉共表达而非独特调控信号,CSSI提升GRN恢复效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16980 2026-02-20 cs.LG cs.CR 79%

Discovering Universal Activation Directions for PII Leakage in Language Models

发现语言模型中PII泄露的通用激活方向

Leo Marchyok, Zachary Coalson, Sungho Keum, Sooel Son, Sanghyun Hong

机构 * Oregon State University, Corvallis OR, USA Korea Advanced Institute of Science \& Technology, Daejeon, South Korea

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.LG

AI总结 UniLeak通过识别语言模型中通用激活方向,提升PII泄露可能性,为隐私安全研究提供新视角。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13494 2026-02-19 cs.CV cs.AI 79%

Language-Guided Invariance Probing of Vision-Language Models

语言引导的视觉-语言模型不变性探测

Jae Joong Lee

机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出LGIP基准,用于评估视觉-语言模型对语言扰动的鲁棒性,发现EVA02-CLIP和OpenCLIP表现优异,而SigLIP存在显著缺陷。

Comments Pattern Recognition Letters 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09378 2026-02-13 cs.SD cs.AI cs.MM eess.AS 79%

Prevailing Research Areas for Music AI in the Era of Foundation Models

基础模型时代音乐AI的主流研究领域

Megan Wei, Mateusz Modrzejewski, Aswin Sivaraman, Dorien Herremans

机构 * Brown University(布朗大学) Warsaw University of Technology(华沙技术大学) Indiana University(印第安纳大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI

AI总结 本文探讨了基础模型时代音乐AI的研究领域,涵盖基础模型、多模态系统、数据集、效率、生成模型应用及版权问题,旨在揭示未来研究方向。

Journal ref Proceedings of Machine Learning Research, PMLR 303:1-23, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏