arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-29 至 2026-01-29 共收录 210 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 59 篇

2512.00311 2026-01-29 cs.LG cs.AI cs.CY 62%

Tracing Mathematical Proficiency Through Problem-Solving Processes

通过问题解决过程追溯数学能力

Jungyang Park, Suho Kang, Jaewoo Park, Jaehong Kim, Jaewoo Shin, Seonjoon Park, Youngjae Yu

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出StatusKT框架,通过教师-学生-教师三阶段LLM流水线,利用学生问题解决过程提取数学能力,提升知识追溯的预测性能和可解释性。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20843 2026-01-29 cs.AI 57%

Deep Researcher with Sequential Plan Reflection and Candidates Crossover (Deep Researcher Reflect Evolve)

具有序列计划反思和候选交叉的深度研究员(深度研究员反思进化)

Saurav Prateek

机构 * Saurav Prateek(独立研究者)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 深度研究员通过序列计划反思和候选交叉算法,实现对博士级别研究任务的高效处理,取得优于现有方法的性能。

Comments 11 pages, 6 figures, 2 tables, source code: https://github.com/SauravP97/deep-researcher-reflect-evolve/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05470 2026-01-29 cs.CL 57%

Rethinking Creativity Evaluation: A Critical Analysis of Existing Creativity Evaluations

重新思考创造力评估:对现有创造力评估方法的批判性分析

Li-Chun Lu, Miri Liu, Pin-Chun Lu, Yufei Tian, Shao-Hua Sun, Nanyun Peng

机构 * Graduate Institute of Communication Engineering, National Taiwan University(台湾大学通信工程研究院) Computer Science Department, University of California, Los Angeles(加州大学洛杉矶分校计算机科学系) Graduate Institute of Networking and Multimedia, National Taiwan University(台湾大学网络与多媒体研究院) Department of Electrical Engineering, National Taiwan University(台湾大学电子工程系)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文批判性分析现有创造力评估方法,发现其在不同领域和度量标准间存在局限性,需发展更稳健的评估框架。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16033 2026-01-29 cs.HC cs.AI 57%

Helping Johnny Make Sense of Privacy Policies with LLMs

帮助约翰尼理解隐私政策的LLMs

Vincent Freiberger, Arthur Fleig, Erik Buchmann

机构 * Center for Scalable Data Analytics and Artificial Intelligence (ScaDS.AI) Dresden/Leipzig, Leipzig University(可扩展数据分析与人工智能中心(ScaDS.AI)德累斯顿/莱比锡,莱比锡大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 PRISMe通过结合LLM的政策评估与交互式界面,帮助用户更有效地理解和参与隐私政策,同时揭示了设计和技术上的挑战。

Comments 21 pages, 3 figures, 3 tables, ACM CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20598 2026-01-29 cs.CV cs.AI 57%

Person Re-ID in 2025: Supervised, Self-Supervised, and Language-Aligned. What Works?

2025年人重识别:监督、自监督和语言对齐。什么有效?

Lakshman Balasubramanian

机构 * MoiiAi Inc.(摩艾AI公司)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 本文探讨了2025年人重识别中监督、自监督和语言对齐模型的性能,分析了跨域应用中的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20510 2026-01-29 cs.SD cs.AI eess.AS 57%

Audio Deepfake Detection in the Age of Advanced Text-to-Speech models

在先进文本到语音模型时代的声音深度伪造检测

Robin Singh, Aditya Yogesh Nair, Fabio Palumbo, Florian Barbaro, Anna Dyka, Lohith Rachakonda

机构 * UncovAI

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文评估了三种先进TTS模型在声音深度伪造检测中的表现,发现单一范式检测器效果有限,多视角方法更具鲁棒性。

Comments This work was performed using HPC resources from GENCI-IDRIS (Grant 2025- AD011016076)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19944 2026-01-29 cs.LG stat.AP stat.ML 57%

Classifier Calibration at Scale: An Empirical Study of Model-Agnostic Post-Hoc Methods

大规模分类器校准:对模型无关后验方法的实证研究

Valery Manokhin, Daniel Grønhaug

机构 * University of Oslo(奥斯陆大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本研究评估了多种模型无关后验校准方法在二分类任务中的表现,发现文恩-阿伯斯预测器在降低对数损失方面表现最佳,而Platt缩放效果较弱,同时指出某些常用校准方法可能对现代模型产生负面影响。

Comments 61 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08430 2026-01-29 cs.AI 57%

RubricHub: A Comprehensive and Highly Discriminative Rubric Dataset via Automated Coarse-to-Fine Generation

RubricHub: 通过自动化粗到细生成构建一个全面且高度判别性的评分标准数据集

Sunzhu Li, Jiale Zhao, Miteto Wei, Huimin Ren, Yang Zhou, Jingwen Yang, Shunyu Liu, Kaike Zhang, Wei Chen

机构 * Li Auto Inc. Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 RubricHub通过自动化粗到细生成方法构建了一个大规模多领域评分标准数据集,通过后训练流程显著提升了模型在HealthBench上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19112 2026-01-29 eess.IV cs.CV cs.LG 57%

Random forest-based out-of-distribution detection for robust lung cancer segmentation

基于随机森林的分布外检测用于鲁棒肺癌分割

Aneesh Rangnekar, Harini Veeraraghavan

机构 * MSKCC

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

AI总结 本文提出RF-Deep方法,利用预训练变换器编码器的深度特征,通过随机森林检测分布外数据,提升肺癌分割的鲁棒性。

Comments Accepted at SPIE Medical Imaging 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20671 2026-01-29 cs.IR 50%

Overview of the TREC 2025 Tip-of-the-Tongue track

TREC 2025 词语遗忘追踪任务概述

Jaime Arguello, Fernando Diaz, Maik Fröebe, To Eun Kim, Bhaskar Mitra

专题命中 评测与基准 :LLM(abstract)

AI总结 TREC 2025通过扩展任务范围和引入多样化查询源,提升了词语遗忘检索任务的挑战性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20511 2026-01-29 cs.CV 50%

Say Cheese! Detail-Preserving Portrait Collection Generation via Natural Language Edits

说再见吧!通过自然语言编辑生成细节保留的肖像收集

Zelong Sun, Jiahui Wu, Ying Ba, Dong Jing, Zhiwu Lu

专题命中 评测与基准 :language model(abstract)

AI总结 本文提出了一种通过自然语言编辑生成细节保留肖像收集的新任务,并提出了首个大规模数据集和先进框架SCheese,实现了高保真细节和身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 40 篇

2601.19934 2026-01-29 cs.CL cs.AI 90%

Quantifying non deterministic drift in large language models

量化大型语言模型中的非确定性漂移

Claire Nicholson

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过实验量化大型语言模型在无操作员条件下的非确定性漂移,揭示了不同模型大小和部署类型下的输出变化模式,并探讨了语义方法在评估漂移缓解技术中的应用。

Comments 10 pages, 3 figures, 1 table. Empirical measurement study reporting new repeated-run experiments quantifying baseline nondeterministic drift in large language models. This manuscript presents original empirical results (not a review or position paper) and establishes a baseline reference for future drift-mitigation work

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19672 2026-01-29 cs.LG cs.AI cs.SE 90%

ProToken: Token-Level Attribution for Federated Large Language Models

ProToken: 联邦大语言模型中的令牌级归因

Waris Gill, Ahmad Humayun, Ali Anwar, Muhammad Ali Gulzar

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 ProToken通过令牌级归因方法,解决联邦大语言模型中客户端贡献识别问题,提升隐私保护下的模型调试与信任验证能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11300 2026-01-29 cs.CL cs.AI 90%

Beyond Random Sampling: Efficient Language Model Pretraining via Curriculum Learning

超越随机采样:通过课程学习实现高效的语言模型预训练

Yang Zhang, Amr Mohamed, Hadi Abdine, Guokan Shang, Michalis Vazirgiannis

专题命中 效率与部署 :language model(title,abstract);pretraining(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过课程学习优化语言模型预训练,发现压缩比、词汇多样性和可读性是关键难度指标,显著提升训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14569 2026-01-29 cs.LG cs.AI 88%

NoWag: A Unified Framework for Shape Preserving Compression of Large Language Models

NoWag:一种用于大型语言模型形状保持压缩的统一框架

Lawrence Liu, Inesh Chakrabarti, Yixiao Li, Mengdi Wang, Tuo Zhao, Lin F. Yang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Georgia Institute of Technology(佐治亚理工学院) Princeton University(普林斯顿大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 NoWag提出了一种统一的单次形状保持压缩框架,通过向量量化和剪枝技术有效压缩大型语言模型,展示了其在性能上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20704 2026-01-29 cs.LG 85%

Structurally Human, Semantically Biased: Detecting LLM-Generated References with Embeddings and GNNs

结构上的人类,语义上偏见:利用嵌入和图神经网络检测LLM生成的参考文献

Melika Mobini, Vincent Holst, Floriano Tori, Andres Algaba, Vincent Ginis

机构 * Vrije Universiteit Brussel(布鲁塞尔自由大学) SEAS, Harvard University(哈佛大学工程学院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过嵌入和图神经网络检测LLM生成的参考文献,发现其拓扑结构接近人类,但语义特征可被识别。

Comments 34 pages, 20 figures. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19908 2026-01-29 cs.AR cs.LG 85%

CHIME: Chiplet-based Heterogeneous Near-Memory Acceleration for Edge Multimodal LLM Inference

基于芯片组的异构近内存加速用于边缘多模态大语言模型推理

Yanru Chen, Runyang Tian, Yue Pan, Zheyu Li, Weihong Xu, Tajana Rosing

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 CHIME通过异构近内存加速方案,提升边缘多模态大语言模型推理的效率和能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20706 2026-01-29 cs.AR cs.AI cs.DC 83%

Beyond GEMM-Centric NPUs: Enabling Efficient Diffusion LLM Sampling

超越以GEMM为中心的NPUs:使高效的扩散LLM采样成为可能

Binglei Lou, Haoran Wu, Yao Lai, Jiayi Nie, Can Xiao, Xuan Guo, Rika Antonova, Robert Mullins, Aaron Zhao

机构 * Imperial College London(伦敦帝国学院) University of Edinburgh(爱丁堡大学) University of Cambridge(剑桥大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种针对扩散LLM采样的NPU架构优化方案,通过轻量级向量原语、内存重用策略和混合精度内存层次结构,实现了2.53倍的加速性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01256 2026-01-29 cs.CV cs.LG 83%

NLPrompt: Noise-Label Prompt Learning for Vision-Language Models

NLPrompt: 噪声标签提示学习用于视觉-语言模型

Bikang Pan, Qun Li, Xiaoying Tang, Wei Huang, Zhen Fang, Feng Liu, Jingya Wang, Jingyi Yu, Ye Shi

机构 * ShanghaiTech University(上海科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) RIKEN Center for Advanced Intelligence Project(日本RIKEN高级智能项目中心) University of Technology Sydney(悉尼科技大学) University of Melbourne(墨尔本大学)

专题命中 效率与部署 :language model(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 NLPrompt通过结合PromptMAE和PromptOT,提升视觉-语言模型在噪声标签下的提示学习鲁棒性与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03996 2026-01-29 cs.LG cs.NE 79%

Spiking Brain Compression: Post-Training Second-order Compression for Spiking Neural Networks

脉冲神经网络压缩:针对脉冲神经网络的后训练二次压缩

Lianfeng Shi, Ao Li, Benjamin Ward-Cherrier

机构 * School of Engineering Mathematics and Technology, University of Bristol, England(工程数学与技术学院,布里斯托大学,英格兰)

专题命中 效率与部署 :post-training(title,abstract);分类 cs.LG

AI总结 本文提出Spiking Brain Compression(SBC)框架,通过一次性后训练压缩提升脉冲神经网络的效率,实现比传统ANN基线更高的准确率。

Comments Preliminary work accepted at non-archival OPT-ML workshop at NeurIPS 2025. The workshop version is available in an earlier version of this arXiv paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20148 2026-01-29 cs.SE cs.LG 79%

LogSieve: Task-Aware CI Log Reduction for Sustainable LLM-Based Analysis

LogSieve: 任务感知的CI日志缩减以实现基于大语言模型的可持续分析

Marcus Emmanuel Barnes, Taher A. Ghaleb, Safwat Hassan

机构 * Faculty of Information University of Toronto Toronto Ontario Canada(信息学院多伦多大学多伦多安大略加拿大) Department of Computer Science Trent University Peterborough Ontario Canada(计算机科学系特伦特大学彼得伯格安大略加拿大) Faculty of Information University of Toronto Toronto Ontario Ontario(信息学院多伦多大学多伦多安大略安大略) University of Toronto(多伦多大学) Trent University(特伦特大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.LG

AI总结 LogSieve通过任务感知的日志缩减技术,有效减少CI日志体积并提升大语言模型推理的可持续性与可解释性。

Comments Preprint. Accepted for presentation at Mining Software Repositories (MSR'26), co-located ICSE 2026. The final version will appear in the ACM Digital Library as part of the MSR'26 conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11589 2026-01-29 cs.DC cs.AI 79%

LAPS: A Length-Aware-Prefill LLM Serving System

LAPS:一种长度感知的LLM服务系统

Jianshu She, Zonghang Li, Hongchao Du, Shangyu Wu, Wenhao Zheng, Eric Xing, Zhengzhong Liu, Huaxiu Yao, Jason Xue, Qirong Ho

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 LAPS通过长度感知的调度策略优化LLM服务,降低预填充延迟并减少SLO违规,提升吞吐量。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17461 2026-01-29 cs.CV cs.CL 79%

Diagnosing Vision Language Models' Perception by Leveraging Human Methods for Color Vision Deficiencies

通过利用人类方法诊断视觉语言模型的感知能力:针对色觉缺陷的色觉研究

Kazuki Hayashi, Shintaro Ozaki, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技术研究所)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 本研究通过Ishihara测试评估视觉语言模型对色觉差异的感知能力,发现模型无法再现色觉缺陷个体的感知结果,揭示了多模态AI在包容性部署中的不足。

Comments Accepted to appear in the main conference of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11558 2026-01-29 cs.CV cs.AI cs.CL 79%

DaMO: A Data-Efficient Multimodal Orchestrator for Temporal Reasoning with Video LLMs

DaMO:一种数据高效的多模态协调器,用于视频LLM的时序推理

Bo-Cheng Chiu, Jen-Jee Chen, Yu-Chee Tseng, Feng-Chi Chen, An-Zi Yen

机构 * College of Artificial Intelligence, National Yang Ming Chiao Tung University(人工智能学院,阳明交通大学) Institute of Population Health Sciences, National Health Research Institutes(人口健康科学研究所,国家健康研究院) Department of Computer Science, National Yang Ming Chiao Tung University(计算机科学系,阳明交通大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DaMO是一种专为视频LLM设计的数据高效多模态协调器,通过时序感知Fuseformer和四阶段训练范式提升时序推理能力,实现更精确的多模态理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20190 2026-01-29 eess.SP 78%

WirelessJEPA: A Multi-Antenna Foundation Model using Spatio-temporal Wireless Latent Predictions

无线JEPA:一种利用空间-时间无线潜在预测的多天线基础模型

Viet Chu, Omar Mashaal, Hatem Abou-Zeid

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 WirelessJEPA通过空间-时间无线潜在预测,实现多天线信号的通用表示学习,适用于多种下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19910 2026-01-29 cs.AR cs.DC 78%

Understanding Bottlenecks for Efficiently Serving LLM Inference With KV Offloading

理解高效服务大语言模型推理的瓶颈:KV卸载

William Meng, Benjamin Lee, Hong Wang

专题命中 效率与部署 :LLM(title,abstract)

AI总结 本文通过分析KV缓存卸载的瓶颈,提出优化硬件互连、模型架构和调度算法以提升大语言模型推理效率的方法。

Comments Submitted to MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20707 2026-01-29 cs.CV 78%

Mixing Importance with Diversity: Joint Optimization for KV Cache Compression in Large Vision-Language Models

融合重要性与多样性:KV缓存压缩的联合优化

Xuyang Liu, Xiyan Gui, Yuchao Zhang, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 效率与部署 :language model(title,abstract)

AI总结 MixKV通过融合重要性与多样性,优化KV缓存压缩,提升多模态模型的存储效率与推理性能。

Comments Accepted by ICLR 2026. Our code is available at https://github.com/xuyang-liu16/MixKV

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19918 2026-01-29 cs.CL 77%

Lowest Span Confidence: A Zero-Shot Metric for Efficient and Black-Box Hallucination Detection in LLMs

最低跨度置信度:一种用于高效且黑盒幻觉检测的零样本度量

Yitong Qiao, Licheng Pan, Yu Mi, Lei Liu, Yue Shen, Fei Sun, Zhixuan Chu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种名为最低跨度置信度(LSC)的零样本度量,用于高效且黑盒检测大型语言模型中的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19213 2026-01-29 cs.AR 75%

M2XFP: A Metadata-Augmented Microscaling Data Format for Efficient Low-bit Quantization

M2XFP:一种元数据增强的微缩放数据格式,用于高效低比特量化

Weiming Hu, Zihan Zhang, Haoyan Zhang, Chen Zhang, Cong Guo, Yu Feng, Tianchi Hu, Guanglin Li, Guipeng Hu, Junsong Wang, Jingwen Leng

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 M2XFP通过引入元数据增强的微缩放数据格式,实现高效低比特量化,显著降低精度损失并提升加速器性能

Comments 17 pages, 13 figures, ASPLOS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20573 2026-01-29 cs.LG cs.AI cs.DC 73%

Fail Fast, Win Big: Rethinking the Drafting Strategy in Speculative Decoding via Diffusion LLMs

快速失败,大获成功:通过扩散大语言模型重新思考推测解码的起草策略

Rui Pan, Zhuofu Chen, Hongyi Liu, Arvind Krishnamurthy, Ravi Netravali

机构 * Princeton University(普林斯顿大学) University of Washington(华盛顿大学) Google(谷歌) Rice University(里士满大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 FailFast通过动态调整推测长度,利用扩散大语言模型的并行解码优势,实现快速失败和大获成功,提升推测解码效率。

详情

展开后加载摘要…

URL PDF HTML 收藏