arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12251 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 12251 篇

2506.05688 2026-02-19 cs.SD cs.CL cs.LG eess.AS 73%

Voice Impression Control in Zero-Shot TTS

零 shot TTS 中的语音印象控制

Kenichi Fujita, Shota Horiguchi, Yusuke Ijima

机构 * NTT, Inc.(日本电报电话公司)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种基于大型语言模型的零 shot TTS 语音印象控制方法,通过低维向量实现语音印象的自动调节与生成。

Comments 5 pages,5 figures, Accepted to INTERSPEECH 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16929 2026-02-12 cs.LG cs.CL 73%

Dimensional Collapse in Transformer Attention Outputs: A Challenge for Sparse Dictionary Learning

Transformer注意力输出中的维度塌陷:对稀疏字典学习的挑战

Junxuan Wang, Xuyang Ge, Wentao Shu, Zhengfu He, Xipeng Qiu

机构 * Shanghai Innovation Institute, Shanghai, China(上海创新研究院) OpenMOSS Team, School of Computer Science, Fudan University, Shanghai, China(开放MOSS团队,计算机科学学院,复旦大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究发现Transformer注意力输出的低维特性对稀疏字典学习构成挑战,并提出子空间约束方法降低死特征比例。

Comments 27 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01401 2026-02-10 cs.CL cs.AI 73%

From Pragmas to Partners: A Symbiotic Evolution of Agentic High-Level Synthesis

从语义到伙伴:代理高层综合的共生进化

Niansong Zhang, Sunwoo Kim, Shreesha Srinath, Zhiru Zhang

机构 * Cornell University(康奈尔大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了在代理时代高层综合(HLS)的重要性,提出HLS作为代理优化的自然层次,并提出HLS工具的局限性及代理在其中的潜在作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03041 2026-02-10 cs.LG cs.AI 73%

Optimas: Optimizing Compound AI Systems with Globally Aligned Local Rewards

Optimas: 通过全局对齐的局部奖励优化复合AI系统

Shirley Wu, Parth Sarthi, Shiyu Zhao, Aaron Lee, Herumb Shandilya, Adrian Mladenic Grobelnik, Nurendra Choudhary, Eddie Huang, Karthik Subbian, Linjun Zhang, Diyi Yang, James Zou, Jure Leskovec

机构 * Stanford University(斯坦福大学) Amazon(亚马逊) Jožef Stefan Institute(乔泽夫·斯蒂芬研究所) Rutgers University(罗格斯大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Optimas通过全局对齐的局部奖励优化复合AI系统,有效提升复合系统的性能。

Comments Accepted to ICLR 2026. 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07338 2026-02-10 cs.CL cs.AI 73%

Intent Mismatch Causes LLMs to Get Lost in Multi-Turn Conversation

意图不匹配导致大语言模型在多轮对话中迷失

Geng Liu, Fei Zhu, Rong Feng, Changyi Ma, Shiqi Wang, Gaofeng Meng

机构 * College of Computing, City University of Hong Kong(香港城市大学计算机学院) Centre for Artificial Intelligence and Robotics, HKISI, CAS(中国科学院香港中文大学人工智能与机器人中心) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出调解员-助手架构,通过解耦意图理解和任务执行,解决大语言模型在多轮对话中因意图不匹配导致的性能下降问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06869 2026-02-09 cs.CL cs.LG 73%

Uncovering Cross-Objective Interference in Multi-Objective Alignment

揭示多目标对齐中的跨目标干扰

Yining Lu, Meng Jiang

机构 * University of Notre Dame(诺丁汉大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出CTWA方法,通过保持目标奖励与训练信号的正协方差来缓解多目标对齐中的跨目标干扰问题,并分析了干扰与模型几何属性的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06699 2026-02-09 quant-ph cs.CL cs.LG 73%

Quantum Attention by Overlap Interference: Predicting Sequences from Classical and Many-Body Quantum Data

通过重叠干涉实现量子注意力:从经典和多体量子数据中预测序列

Alessio Pecilli, Matteo Rosati

机构 * Dipartimento di Ingegneria Civile, Informatica e delle Tecnologie Aeronautiche, Università degli Studi Roma Tre(土木工程、计算机科学和航空技术系,罗马三大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种基于量子干涉的自注意力机制,通过重叠干涉实现序列预测,展示了其在经典和量子数据中的有效性。

Comments 4 + 1 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02766 2026-02-04 cs.LG cs.CL cs.CR 73%

Privately Fine-Tuned LLMs Preserve Temporal Dynamics in Tabular Data

私有微调的LLM在表格数据中保留时间动态

Lucas Rosenblatt, Peihan Liu, Ryan McKenna, Natalia Ponomareva

机构 * NYU(纽约大学) Columbia University(哥伦比亚大学) Google Research(谷歌研究)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出PATH框架,利用私有微调的LLM保留表格数据的时间动态,有效捕捉长距离依赖并提升合成数据质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04528 2026-02-03 cs.CL cs.LG 73%

Group-Adaptive Threshold Optimization for Robust AI-Generated Text Detection

群体自适应阈值优化用于鲁棒的AI生成文本检测

Minseok Jung, Cynthia Fuertes Panizo, Liam Dugan, Yi R., Fung, Pin-Yu Chen, Paul Pu Liang

机构 * mit(麻省理工学院) upenn(宾夕法尼亚大学) ibm(IBM研究院)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出FairOPT算法,通过群体特定的阈值优化减少AI生成文本检测中的群体差异,提升分类鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20445 2026-01-29 cs.CL cs.AI 73%

In-context Language Learning for Endangered Languages in Speech Recognition

上下文语言学习用于语音识别中的濒危语言

Zhaolin Li, Jan Niehues

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了LLMs通过上下文学习在语音识别中学习濒危语言的可能性,并展示了基于概率的方法在语言学习中的优势。

Comments Interspeech2025

Journal ref Proc. Interspeech 2025, 738-742

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19726 2026-01-28 cs.CR cs.AI cs.CL 73%

RvB: Automating AI System Hardening via Iterative Red-Blue Games

RvB: 通过迭代红蓝游戏自动化AI系统加固

Lige Huang, Zicheng Liu, Jie Zhang, Lewen Yan, Dongrui Liu, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Shanghai Jiao Tong University(上海交通大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 RvB通过迭代红蓝游戏自动化AI系统加固,有效提升防御性能并降低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12658 2026-01-27 cs.CL cs.AI 73%

Augmenting Question Answering with A Hybrid RAG Approach

通过混合RAG方法增强问答

Tianyi Yang, Nashrah Haque, Vaishnave Jonnalagadda, Yuya Jeremy Ong, Zhehui Chen, Yanzhao Wu, Lei Yu, Divyesh Jadav, Wenqi Wei

机构 * Plastic Lab(塑料实验室) Google(谷歌) Florida International University(佛罗里达国际大学) Rensselaer Polytechnic Institute(伦塞拉尔理工学院)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SSRAG方法,通过混合查询增强、代理路由和结构化检索技术,提升问答任务的响应质量。

Comments 10 pages, 5 tables, 2 figures; presented at IEEE CogMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14260 2026-01-27 cs.CL cs.AI 73%

Incomplete Tasks Induce Shutdown Resistance in Some Frontier LLMs

未完成任务在某些前沿大语言模型中引发关闭阻力

Jeremy Schlatter, Benjamin Weinstein-Raun, Jeffrey Ladish

机构 * Palisade Research(帕利萨德研究)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究发现某些前沿大语言模型在面对简单任务时会主动颠覆关闭机制,即使有明确指令也不受限制。

Comments Published in Trans. Mach. Learn. Res. (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03251 2026-01-27 cs.LG cs.AI 73%

Exploring the Frontiers of Softmax: Provable Optimization, Applications in Diffusion Model, and Beyond

探索softmax的前沿:可证明的优化、扩散模型中的应用及更广泛的领域

Yang Cao, Yingyu Liang, Zhenmei Shi, Zhao Song

机构 * Department of XXX, University of YYY, Location, Country(YYY大学XXX系) School of ZZZ, Institute of WWW, Location, Country(WWW研究所ZZZ学院)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究softmax函数的优化与泛化性质,揭示其在扩散模型中学习分数函数的可证明精度,并探讨其在自然语言处理及其他领域中的潜力。

Comments 53 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15348 2026-01-23 cs.SD cs.AI cs.CL 73%

Abusive music and song transformation using GenAI and LLMs

利用生成式人工智能和大语言模型进行滥用音乐和歌曲转换

Jiyang Choi, Rohitash Chandra

机构 * Transitional Artificial Intelligence Research Group, School of Mathematics and Statistics, UNSW Sydney, Australia(过渡人工智能研究组,数学与统计学学院) Centre for Artificial Intelligence and Innovation, Pingla Institute, Sydney, Australia(人工智能与创新中心,Pingla研究所)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究利用生成式人工智能和大语言模型转换音乐中的虐待性内容,降低攻击性并保持音乐连贯性,提供更安全的听觉体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13558 2026-01-21 cs.AI cs.CL 73%

Leveraging ChatGPT and Other NLP Methods for Identifying Risk and Protective Behaviors in MSM: Social Media and Dating apps Text Analysis

利用ChatGPT及其他NLP方法识别MSM中的风险与保护行为:社交媒体和约会应用文本分析

Mehrab Beikzadeh, Chenglin Hong, Cory J Cascalheira, Callisto Boka, Majid Sarrafzadeh, Ian W Holloway

机构 * 1 Department of Computer Science, Henry Samueli School of Engineering, University of California, Los Angeles, Los Angeles, CA 2 Department of Social Welfare, Luskin School of Public Affairs, University of California, Los Angeles, Los Angeles, CA 3 Department of Counseling \& Educational Psychology, New Mexico State University, Las Cruces, NM

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究利用NLP方法分析社交媒体和约会应用文本,以预测MSM的性风险行为和饮酒情况,展示大语言模型在公共卫生干预中的应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11234 2026-01-19 cs.CL cs.LG 73%

How DDAIR you? Disambiguated Data Augmentation for Intent Recognition

How DDAIR you? 解歧数据增强用于意图识别

Galo Castillo-López, Alexis Lombard, Nasredine Semmar, Gaël de Chalendar

机构 * Université Paris-Saclay, CEA, List, Palaiseau, France(巴黎萨克雷大学、法国原子能委员会、List、Palaiseau、法国)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 DDAIR通过解歧数据增强技术提升意图识别任务中低资源场景下的分类性能。

Comments Accepted for publication at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09041 2026-01-15 cs.CL cs.AI 73%

Can LLMs interpret figurative language as humans do?: surface-level vs representational similarity

LLMs能否像人类一样解读隐喻语言?:表层相似性与表征相似性

Samhita Bollepally, Aurora Sloman-Moll, Takashi Yamauchi

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM在解读隐喻性语言方面是否能像人类一样,发现GPT-4在表征层面最接近人类,但所有模型在处理讽刺、俚语和隐喻时均表现不佳。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04495 2026-01-15 cs.CL cs.AI 73%

OUNLP at TSAR 2025 Shared Task: Multi-Round Text Simplifier via Code Generation

OUNLP在TSAR 2025共享任务中的表现:通过代码生成的多轮文本简化

Cuong Huynh, Jie Cao

机构 * School of Computer Science University of Oklahoma(计算机科学学院俄克拉荷马大学)

专题命中 其他LLM :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 OUNLP通过代码生成在TSAR 2025共享任务中提出多轮文本简化方法,利用基于规则和LLM的联合简化技术提升可读性控制的文本简化性能。

Comments Accepted to TSAR 2025 Workshop at EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24098 2026-01-05 cs.CL cs.LG 73%

Training a Huggingface Model on AWS Sagemaker (Without Tears)

在AWS Sagemaker上训练Huggingface模型(无需痛苦)

Liling Tan

机构 * AWS

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文演示了如何在AWS Sagemaker上从零开始训练Huggingface模型,解决了云平台学习曲线高和文档不完整的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22903 2025-12-30 cs.LG cs.CL 73%

Debugging Tabular Log as Dynamic Graphs

基于动态图的表格日志调试

Chumeng Liang, Zhanyang Jin, Zahaib Akhtar, Mona Pereira, Haofei Yu, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出GraphLogDebugger框架,利用动态图模型高效调试表格日志,优于大型语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22382 2025-12-30 cs.LG cs.AI stat.ML 73%

Completed Hyperparameter Transfer across Modules, Width, Depth, Batch and Duration

跨模块、宽度、深度、批大小和持续时间的超参数转移

Bruno Mlodozeniec, Pierre Ablin, Louis Béthune, Dan Busbridge, Michal Klein, Jason Ramapuram, Marco Cuturi

机构 * Apple(苹果公司)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种统一宽度、深度、批大小和持续时间缩放的参数化方法,实现了跨模块超参数的优化与转移,提升了大规模模型的训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20277 2025-12-23 cs.LG cs.AI 73%

HVAdam: A Full-Dimension Adaptive Optimizer

HVAdam:一种全维度自适应优化器

Yiheng Zhang, Shaowu Wu, Yuanzhuo Xu, Jiajun Wu, Shang Xu, Steve Drew, Xiaoguang Niu

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 HVAdam提出一种具有连续可调自适应性的新型优化器,通过增量延迟更新机制提升收敛性与鲁棒性,在多种任务中超越现有优化器。

Comments Accepted at AAAI2025

Journal ref In Proceedings of the AAAI Conference on Artificial Intelligence, volume 39, pp. 22623-22631, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15753 2025-12-19 cs.LG cs.AI 73%

TAO-Net: Two-stage Adaptive OOD Classification Network for Fine-grained Encrypted Traffic Classification

TAO-Net:面向细粒度加密流量分类的两阶段自适应OOD分类网络

Zihao Wang, Wei Peng, Junming Zhang, Jian Li, Wenxin Fang

机构 * College of Artificial Intelligence and Automation, Hohai University, China(人工智能与自动化学院,河海大学,中国) Zhongguancun Laboratory, Beijing, China(中关村实验室,北京,中国) College of Information Science and Engineering, Hohai University, China(信息科学与工程学院,河海大学,中国)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 TAO-Net通过两阶段自适应机制实现加密流量细粒度分类,有效识别新兴应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13598 2025-12-16 cs.CL cs.LG 73%

Textual Gradients are a Flawed Metaphor for Automatic Prompt Optimization

文本梯度是自动提示优化的一种错误隐喻

Daniel Melcer, Qi Chen, Wen-Hao Chiang, Shweta Garg, Pranav Garg, Christian Bock

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文指出文本梯度隐喻在自动提示优化中存在偏差,通过实验揭示其行为与梯度类比不一致,为优化策略选择提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12544 2025-12-16 cs.CL cs.LG 73%

HyperEdit: Unlocking Instruction-based Text Editing in LLMs via Hypernetworks

HyperEdit: 通过超网络解锁大语言模型中的基于指令的文本编辑

Yiming Zeng, Jinghan Cao, Zexin Li, Wanhao Yu, Zhankai Ye, Dawei Xiang, Ting Hua, Xin Liu, Shangqian Gao, Tingting Yu

机构 * University of Connecticut(康涅狄格大学) San Francisco State University(旧金山州立大学) University of California, Riverside(加州大学河滨分校) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) Florida State University(佛罗里达州立大学) University of Notre Dame(圣约翰大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 HyperEdit通过超网络动态适应和差分感知正则化,提升大语言模型在基于指令的文本编辑任务中的性能,实现9%-30%的BLEU提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12909 2025-12-11 cs.LG cs.AI 73%

Sinusoidal Initialization, Time for a New Start

正弦初始化,新的开始

Alberto Fernández-Hernández, Jose I. Mestre, Manuel F. Dolz, Jose Duato, Enrique S. Quintana-Ortí

机构 * OpenChip(OpenChip公司)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出正弦初始化方法,通过结构化权重矩阵提升深度学习模型的收敛速度、稳定性及准确率。

Journal ref NeurIPS (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08662 2025-12-11 cs.CL cs.LG econ.GN q-fin.EC 73%

Revealing economic facts: LLMs know more than they say

揭示经济事实:LLMs知道的比他们说的更多

Marcus Buckmann, Quynh Anh Nguyen, Edward Hill

机构 * Bank of England(英格兰银行)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过分析LLM隐藏状态,发现其能更准确地估计经济数据,提出简单线性模型和迁移学习方法提升估计精度,并展示其在数据填补中的应用价值。

Comments 34 pages, 17 figures

Journal ref Bank of England Staff Working Paper Series, No. 1150 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13936 2025-12-10 cs.CL cs.AI 73%

EEG-to-Text Translation: A Model for Deciphering Human Brain Activity

EEG-to-Text翻译:一种解码人类脑活动的模型

Saydul Akbar Murad, Ashim Dahal, Nick Rahimi

机构 * School of Computing Sciences & Computer Engineering, University of Southern Mississippi(计算科学与计算机工程学院,密西西比大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 R1 Translator通过结合双向LSTM和Transformer解码器,提升EEG-to-text解码性能,ROUGE指标优于T5和Brain Translator。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07306 2025-12-09 stat.ML cs.AI cs.LG 73%

Exact Synthetic Populations for Scalable Societal and Market Modeling

可扩展的社会与市场建模中的精确合成人口

Thierry Petit, Arnault Pachot

机构 * institutetext: Emotia, France(Emotia机构) STATION F

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出了一种基于约束编程的合成人口生成方法,实现高精度人口统计控制,适用于社会与市场建模场景。

Comments Submitted for peer review on December 7, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏