arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-27 至 2026-01-27 共收录 404 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 63 篇

2509.25041 2026-01-27 cs.DC 67%

GRACE-MoE: Grouping and Replication with Locality-Aware Routing for Efficient Distributed MoE Inference

GRACE-MoE:基于局部感知路由的高效分布式MoE推理中的分组与复制

Yu Han, Lehan Pan, Jie Peng, Ziyang Tao, Wuyang Zhang, Yanyong Zhang

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 GRACE-MoE通过局部感知路由和分组复制优化,有效减少分布式MoE推理中的通信开销和计算负载不平衡,实现显著的推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15329 2026-01-27 cs.LG cs.AI cs.CL math.OC 67%

When and How Unlabeled Data Provably Improve In-Context Learning

何时以及如何无标签数据能保证性地提升上下文学习

Yingcong Li, Xiangyu Chang, Muti Kara, Xiaofeng Liu, Amit Roy-Chowdhury, Samet Oymak

机构 * University of Michigan(密歇根大学) University of California, Riverside(加州大学河滨分校) Bilkent University(比尔肯特大学) NJIT(新 jersey 理工学院)

专题命中 效率与部署 :foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了无标签数据如何通过多层或循环变压器模型提升上下文学习效果,揭示了深度对多项式估计器的影响,并验证了半监督学习中循环机制的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18735 2026-01-27 cs.AI cs.LG 62%

Why Keep Your Doubts to Yourself? Trading Visual Uncertainties in Multi-Agent Bandit Systems

为何保留你的怀疑?多智能体老虎机系统中的视觉不确定性交易

Jusheng Zhang, Yijia Fan, Kaitong Cai, Jing Yang, Jiawei Yao, Jian Wang, Guanlong Qu, Ziliang Chen, Keze Wang

机构 * Sun Yat-sen University(中山大学) University of Washington(华盛顿大学) Snap Inc.(Snap公司) Syracuse University(雪城大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 Agora通过去中心化市场交易机制提升多智能体系统在视觉任务中的协调效率与经济性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21447 2026-01-27 eess.AS cs.AI cs.CL 62%

ARTI-6: Towards Six-dimensional Articulatory Speech Encoding

ARTI-6:迈向六维发音语音编码

Jihwan Lee, Sean Foley, Thanathai Lertpetchpun, Kevin Huang, Yoonjeong Lee, Tiantian Feng, Louis Goldstein, Dani Byrd, Shrikanth Narayanan

机构 * Signal Analysis and Interpretation Lab, University of Southern California(南加州大学信号分析与解释实验室) Department of Linguistics, University of Southern California(南加州大学语言学系)

专题命中 效率与部署 :foundation model(abstract);分类 cs.CL、cs.AI

AI总结 ARTI-6通过六维发音特征集和反向合成模型,实现了高效且自然的语音生成与反向建模。

Comments Accepted for ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03008 2026-01-27 cs.CL cs.AI cs.PL cs.SE 62%

MoSE: Hierarchical Self-Distillation Enhances Early Layer Embeddings

MoSE:分层自蒸馏增强早期层嵌入

Andrea Gurioli, Federico Pennino, João Monteiro, Maurizio Gabbrielli

机构 * Apple(苹果公司)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI

AI总结 MoSE通过自蒸馏机制增强早期层嵌入,实现代码检索与分类任务中的性能与准确性的平衡。

Comments Accepted in the AAAI 2026 Main Technical Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17111 2026-01-27 cs.LG cs.AI 62%

Least-Loaded Expert Parallelism: Load Balancing An Imbalanced Mixture-of-Experts

负载最少的专家并行:不平衡专家混合模型的负载平衡

Xuan-Phi Nguyen, Shrey Pandit, Austin Xu, Caiming Xiong, Shafiq Joty

专题命中 效率与部署 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLEP算法,通过动态路由减少MoE模型中专家负载不平衡,提升训练和推理效率,实现5倍速度提升和4倍内存减少。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18620 2026-01-27 cs.LG 57%

CASSANDRA: Programmatic and Probabilistic Learning and Inference for Stochastic World Modeling

CASSANDRA:面向随机世界建模的程序化与概率学习与推理

Panagiotis Lymperopoulos, Abhiramon Rajasekharan, Ian Berlot-Attwell, Stéphane Aroca-Ouellette, Kaheer Suleman

机构 * Skyfall AI Tufts University(塔夫茨大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Toronto(多伦多大学) Vector Instiute(Vector研究所)

专题命中 效率与部署 :LLM(abstract);分类 cs.LG

AI总结 CASSANDRA通过结合LLM的知识先验和概率图模型结构学习,提升随机世界建模中的转移预测与规划能力。

Comments 28 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18130 2026-01-27 cs.AI 57%

RouteMoA: Dynamic Routing without Pre-Inference Boosts Efficient Mixture-of-Agents

RouteMoA: 动态路由无需预推断提升高效混合代理

Jize Wang, Han Wu, Zhiyuan You, Yiming Song, Yijun Wang, Zifei Shan, Yining Li, Songyang Zhang, Xinyi Le, Cailian Chen, Xinping Guan, Dacheng Tao

机构 * Shanghai Jiao Tong University(上海交通大学) CUHK(香港中文大学) Tencent(腾讯) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(新加坡国立大学)

专题命中 效率与部署 :LLM(abstract);分类 cs.AI

AI总结 RouteMoA通过动态路由机制无需预推断提升混合代理效率,显著降低推理成本和延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13001 2026-01-27 cs.SD cs.LG cs.MM eess.AS 57%

Adaptable Symbolic Music Infilling with MIDI-RWKV

可适应的符号音乐填充与MIDI-RWKV

Christian Zhou-Zheng, Philippe Pasquier

机构 * Metacreation Lab, Simon Fraser University(Simon Fraser大学元创作实验室)

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 MIDI-RWKV是一种基于RWKV-7架构的小型基础模型,用于实现高效的音乐共创,并通过低样本量微调实现风格适应。

Comments 31 pages, 15 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12210 2026-01-27 cs.LG 57%

EEG-DLite: Dataset Distillation for Efficient Large EEG Model Training

EEG-DLite: 用于高效大规模EEG模型训练的数据蒸馏

Yuting Tang, Weibang Jiang, Shanglin Li, Yong Li, Chenyu Liu, Xinliang Zhou, Yi Ding, Cuntai Guan

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 EEG-DLite通过数据蒸馏技术提升大规模EEG模型训练效率,实现高效且有效的生理基础建模。

Comments Accepted by AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19327 2026-01-27 cs.CV cs.AI 57%

DeepInsert: Early Layer Bypass for Efficient and Performant Multimodal Understanding

DeepInsert: 早期层绕过以实现高效且高性能的多模态理解

Moulik Choraria, Xinbo Wu, Akhil Bhimaraju, Nitesh Sekhar, Yue Wu, Xu Zhang, Prateek Singhal, Lav R. Varshney

机构 * UIUC(伊利诺伊大学) Amazon(亚马逊) Capital One Apple(苹果) Stony Brook University(石溪大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 DeepInsert通过将多模态令牌插入模型中间层以绕过早期层,从而在降低训练和推理成本的同时保持或提升多模态语言模型的性能。

Comments To be presented at EACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.24201 2026-01-27 cs.CL 57%

LingGen: Scalable Multi-Attribute Linguistic Control via Power-Law Masking

LingGen: 通过幂律掩码实现可扩展的多属性语言控制

Mohamed Elgaar, Hadi Amiri

机构 * University of Massachusetts Lowell(马萨诸塞大学洛文分校)

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 LingGen通过幂律掩码实现多属性语言控制,以高精度和高效性生成受控文本。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17085 2026-01-27 eess.AS cs.LG cs.SD 57%

Recovering Performance in Speech Emotion Recognition from Discrete Tokens via Multi-Layer Fusion and Paralinguistic Feature Integration

通过多层融合和语义特征整合从离散令牌中恢复语音情感识别性能

Esther Sun, Abinay Reddy Naini, Carlos Busso

机构 * Language Technologies Institute, Carnegie Mellon University, USA(语言技术研究所,卡内基梅隆大学,美国)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 本文通过多层融合和语义特征整合方法,解决离散语音令牌在语音情感识别中的性能损失问题,提升其与连续表示的性能一致性。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17927 2026-01-27 cs.CV cs.MM 50%

RemEdit: Efficient Diffusion Editing with Riemannian Geometry

RemEdit: 基于黎曼几何的高效扩散编辑

Eashan Adhikarla, Brian D. Davison

专题命中 效率与部署 :language model(abstract)

AI总结 RemEdit通过基于黎曼几何的潜在空间导航和任务特定注意力剪枝机制,实现了高效且保真的图像编辑,同时保持实时性能。

Journal ref IEEE/CVF Winter Conference on Applications of Computer Vision, WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17608 2026-01-27 cs.HC cs.SD cs.SY eess.AS eess.SY 50%

Home Health System Deployment Experience for Geriatric Care Remote Monitoring

老年护理远程监控系统的部署经验

Dong Yoon Lee, Alyssa Weakley, Hui Wei, Daniel Cardona, Shijia Pan

机构 * University of California, Merced(加州大学默塞德分校) University of California, Davis School Of Medicine(加州大学戴维斯医学院)

专题命中 效率与部署 :LLM(abstract)

AI总结 本文提出了一种基于大语言模型的远程监控系统,通过三次部署经验优化硬件、建模和用户界面,以实现隐私保护的即插即用远程照护解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17221 2026-01-27 cs.DB cs.MM 50%

Vidformer: Drop-in Declarative Optimization for Rendering Video-Native Query Results

Vidformer: 交互式视频数据探索中视频原生查询的声明式优化

Dominik Winecki, Arnab Nandi

专题命中 效率与部署 :LLM(abstract)

AI总结 Vidformer通过声明式优化和并行化显著提升视频原生查询的渲染效率,将播放延迟降至亚秒级,支持实时交互式视频查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13390 2026-01-27 cs.CV 50%

Generalizing WiFi Gesture Recognition via Large-Model-Aware Semantic Distillation and Alignment

通过大模型感知的语义蒸馏与对齐实现WiFi手势识别的泛化

Feng-Qi Cui, Yu-Tong Guo, Tianyue Zheng, Jinyang Huang

机构 * Institute of Advanced Technology, University of Science and Technology of China(科学技术大学先进技术研究院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) School of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程学院)

专题命中 效率与部署 :foundation model(abstract)

AI总结 GLSDA通过大模型感知的语义蒸馏与对齐提升WiFi手势识别的泛化能力,实现领域内和跨领域任务的高性能识别。

Comments Accepted by IEEE ICPADS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09327 2026-01-27 cs.CV 50%

MSSDF: Modality-Shared Self-supervised Distillation for High-Resolution Multi-modal Remote Sensing Image Learning

MSSDF:多模态自监督蒸馏用于高分辨率遥感图像学习

Tong Wang, Guanzhou Chen, Xiaodong Zhang, Chenxi Liu, Jiaqi Wang, Xiaoliang Tan, Wenchao Guo, Qingyuan Yang, Kaiqi Zhang

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(测绘遥感信息工程国家重点实验室,武汉大学) Electronic Information School, Wuhan University(电子信息学院,武汉大学)

专题命中 效率与部署 :pretraining(abstract)

AI总结 MSSDF通过多模态自监督学习提升高分辨率遥感图像的预训练效果,优于现有方法,尤其在语义分割和深度估计任务中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 领域大模型 35 篇

2601.18217 2026-01-27 cs.AI cs.LG 86%

Paying Less Generalization Tax: A Cross-Domain Generalization Study of RL Training for LLM Agents

支付更少的泛化税:RL训练对LLM代理跨域泛化能力的研究

Zhihan Liu, Lin Guan, Yixin Nie, Kai Zhang, Zhuoqun Hao, Lin Chen, Asli Celikyilmaz, Zhaoran Wang, Na Zhang

机构 * Meta Superintelligence Labs(Meta超智能实验室) FAIR at Meta(Meta的FAIR) Northwestern University(西北大学) The Ohio State University(俄亥俄州立大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 领域大模型 :LLM(title,abstract);post-training(abstract);SFT(abstract);分类 cs.AI、cs.LG

AI总结 本研究探讨了RL训练对LLM代理跨域泛化能力的影响,发现增加状态信息丰富度可提升泛化性能,同时指出建模选择对泛化能力的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15058 2026-01-27 cs.CR cs.LG cs.SE 85%

LibLMFuzz: LLM-Augmented Fuzz Target Generation for Black-box Libraries

LibLMFuzz: 用于黑盒库的LLM增强模糊目标生成

Ian Hardgrove, John D. Hastings

机构 * The Beacom College of Computer and Cyber Sciences(计算机与网络科学学院) Dakota State University(达科他州立大学)

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 LibLMFuzz通过结合LLM和轻量级工具链,实现对闭源库的自动模糊测试,生成正确驱动程序并提高覆盖率。

Comments 6 pages, 2 figures, 1 table, 2 listings

Journal ref 2025 IEEE Cyber Awareness and Research Symposium (CARS'25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18796 2026-01-27 cs.CL cs.AI cs.LG 85%

ctELM: Decoding and Manipulating Embeddings of Clinical Trials with Embedding Language Models

ctELM:利用嵌入语言模型解码和操控临床试验嵌入

Brian Ondov, Chia-Hsuan Chang, Yujia Zhou, Mauro Giuffrè, Hua Xu

机构 * Yale School of Medicine(耶鲁医学院)

专题命中 领域大模型 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ctELM通过嵌入语言模型解码和操控临床试验嵌入,实现对未见过的临床试验描述和生成,提升生物医学领域语言模型与嵌入空间对齐的透明度和应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18457 2026-01-27 cs.IR 85%

Token-level Collaborative Alignment for LLM-based Generative Recommendation

基于令牌级的协同对齐用于基于大语言模型的生成推荐

Fake Lin, Binbin Hu, Zhi Zheng, Xi Zhu, Ziqi Liu, Zhiqiang Zhang, Jun Zhou, Tong Xu

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 TCA4Rec通过令牌级协同对齐框架,将协同过滤与大语言模型生成结合,提升推荐系统的准确性和可控性。

Comments 11 pages, 2 figures, 7 tables, WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02599 2026-01-27 cs.CL cs.AI 84%

Next Token Knowledge Tracing: Exploiting Pretrained LLM Representations to Decode Student Behaviour

下一个标记知识追踪:利用预训练大语言模型表示来解码学生行为

Max Norris, Kobi Gal, Sahan Bulathwela

专题命中 领域大模型 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出NTKT方法,利用预训练大语言模型预测学生行为,提升知识追踪任务的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09053 2026-01-27 cs.HC 82%

Who Fails Where? LLM and Human Error Patterns in Endometriosis Ultrasound Report Extraction

谁在何处失败?LLM和人类在内膜异位症超声报告提取中的错误模式

Haiyi Li, Yutong Li, Yiheng Chi, Alison Deslandes, Mathew Leonardi, Shay Freger, Yuan Zhang, Jodie Avery, M. Louise Hull, Hsiang-Ting Chen

专题命中 领域大模型 :LLM(title,abstract);language model(abstract)

AI总结 本研究比较了LLM与人类在内膜异位症超声报告提取中的表现,发现LLM在语法一致性上优于人类,而人类在语义解释上更优,支持人机协作的工作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09897 2026-01-27 cs.IR 82%

PairSem: LLM-Guided Pairwise Semantic Matching for Scientific Document Retrieval

PairSem: 基于大语言模型的成对语义匹配用于科学文档检索

Wonbin Kweon, Runchu Tian, SeongKu Kang, Pengcheng Jiang, Zhiyong Lu, Jiawei Han, Hwanjo Yu

专题命中 领域大模型 :LLM(title);large language model(abstract);language model(abstract)

AI总结 PairSem通过实体-属性对捕捉科学概念的多面性,提升科学文档检索的精度和上下文感知能力。

Comments WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18356 2026-01-27 cs.LG 79%

Making medical vision-language models think causally across modalities with retrieval-augmented cross-modal reasoning

通过检索增强的跨模态推理使医疗视觉-语言模型在多模态中实现因果推理

Weiqin Yang, Haowen Xue, Qingyi Peng, Hexuan Hu, Qian Huang, Tingbo Zhang

机构 * University of Adelaide(阿德莱德大学) Hohai University(河海大学) Amap

专题命中 领域大模型 :language model(title,abstract);分类 cs.LG

AI总结 本文提出多模态因果检索增强生成框架,通过整合因果推理原理与多模态检索,提升医疗VLMs在诊断预测和视觉问答中的事实准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21155 2026-01-27 cs.CL 79%

Learning the Wrong Lessons: Syntactic-Domain Spurious Correlations in Language Models

学习错误的教训:语言模型中的语法-领域虚假相关性

Chantal Shaib, Vinith M. Suriyakumar, Levent Sagun, Byron C. Wallace, Marzyeh Ghassemi

机构 * Northeastern University(东北大学) MIT(麻省理工学院) Meta

专题命中 领域大模型 :language model(title);LLM(abstract);分类 cs.CL

AI总结 研究揭示了语言模型中语法与领域之间的虚假相关性问题,指出训练数据中语法模板可能影响模型性能,并提出需测试此类相关性及确保训练数据多样性以防止错误学习。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17036 2026-01-27 cs.DL cs.CL cs.CY 79%

LLM-Generated or Human-Written? Comparing Review and Non-Review Papers on ArXiv

LLM生成还是人工撰写?比较ArXiv上评论与非评论论文

Yanai Elazar, Maria Antoniak

机构 * Bar-Ilan University(巴伊兰大学) University of Colorado Boulder(科罗拉多大学波德摩尔分校)

专题命中 领域大模型 :LLM(title,abstract);分类 cs.CL

AI总结 本文通过分析ArXiv上评论与非评论论文中LLM生成内容的比例,发现评论论文中LLM生成内容更高,但非评论论文中实际LLM生成论文数量远多于评论论文,政策可能对某些领域造成显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13481 2026-01-27 cs.AI cs.CL cs.CY 79%

neuralFOMO: Can LLMs Handle Being Second Best? Measuring Envy-Like Preferences in Multi-Agent Settings

neuralFOMO: LLMs能否处理第二好?在多智能体设置中测量类似嫉妒的偏好

Arnav Ramamoorthy, Shrey Dhorajiya, Ojas Pungalia, Rashi Upadhyay, Abhishek Mishra, Abhiram H, Tejasvi Alladi, Sujan Yenuganti, Dhruv Kumar

机构 * BITS Pilani, Pilani Campus(比斯学院,帕利尼校区)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 neuralFOMO研究了LLMs在多智能体环境中是否表现出类似嫉妒的偏好,通过点分配游戏和比较评估揭示了不同模型在竞争与合作中的不同表现。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18096 2026-01-27 cs.IR 78%

Enhancing LLM-based Recommendation with Preference Hint Discovery from Knowledge Graph

基于知识图谱的偏好提示发现增强大语言模型推荐

Yuting Zhang, Ziliang Pei, Chao Wang, Ying Sun, Fuzhen Zhuang

专题命中 领域大模型 :LLM(title,abstract)

AI总结 本文提出基于知识图谱的偏好提示发现模型,通过提取关键属性作为提示,提升大语言模型在推荐任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏