arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-26 至 2026-01-26 共收录 147 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 33 篇

2601.15876 2026-01-26 cs.AI 57%

EvoCUA: Evolving Computer Use Agents via Learning from Scalable Synthetic Experience

EvoCUA:通过可扩展的合成经验学习来进化计算机使用代理

Taofeng Xue, Chong Peng, Mianqiu Huang, Linsen Guo, Tiancheng Han, Haozhe Wang, Jianing Wang, Xiaocheng Zhang, Xin Yang, Dengchang Zhao, Jinrui Ding, Xiandi Ma, Yuchen Xie, Peng Pei, Xunliang Cai, Xipeng Qiu

机构 * Meituan(美团) Fudan University(复旦大学) Tongji University(同济大学) The Hong Kong University of Science and Technology(香港理工大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 EvoCUA通过可扩展的合成经验学习进化计算机使用代理,实现更高性能和通用性。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04772 2026-01-26 cs.CL 57%

Identifying Reliable Evaluation Metrics for Scientific Text Revision

识别科学文本修订中的可靠评估指标

Léane Jourdan, Florian Boudin, Richard Dufour, Nicolas Hernandez

机构 * Nantes Université, École Centrale Nantes, CNRS, LS2N, UMR 6004(南特大学、中央理工学院、CNRS、LS2N、UMR 6004)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文提出通过结合LLM评估与领域特定指标的方法,以更准确评估科学文本修订的质量。

Comments V5 contains the English version, (ACL 2025 main, 26 pages) and V4 contains the French version (TALN 2025, 32 pages), both with corrected results for cramer's v and pairwise accuracy

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18710 2026-01-26 q-bio.NC cs.AI 57%

Bridging Critical Gaps in Convergent Learning: How Representational Alignment Evolves Across Layers, Training, and Distribution Shifts

弥合收敛学习中的关键差距:表征对齐如何在层、训练和分布偏移中演变

Chaitanya Kapoor, Sudhanshu Srivastava, Meenakshi Khosla

机构 * Department of Cognitive Science University of California, San Diego(认知科学系加州大学圣地亚哥分校)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 研究通过大规模分析发现,正交变换在对齐表征上效果接近线性方法,且早期层在分布偏移下仍保持紧密对齐,揭示了表征对齐主要由输入统计和架构偏差驱动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16582 2026-01-26 cs.CV 50%

X-Aligner: Composed Visual Retrieval without the Bells and Whistles

X-Aligner:无需炫技的组合视觉检索

Yuqian Zheng, Mariana-Iuliana Georgescu

机构 * Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(亥姆霍兹慕尼黑)

专题命中 评测与基准 :language model(abstract)

AI总结 X-Aligner通过结合视觉和文本查询,提升视频检索性能,采用多阶段训练和交叉注意力模块实现更优的多模态表示对齐。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 18 篇

2601.16219 2026-01-26 cs.CL cs.AI 88%

Domain Specific Specialization in Low-Resource Settings: The Efficacy of Offline Response-Based Knowledge Distillation in Large Language Models

低资源环境下领域特定专业化:基于离线响应的知识蒸馏在大语言模型中的有效性

Erdem Aslan, Pakize Erdoğmuş

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于离线响应的知识蒸馏方法,通过优化硬件资源,在低资源环境下实现高精度领域专用助手,验证了数据质量和结构对齐比数量更重要。

Comments 10 pages, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16615 2026-01-26 cs.CL 88%

AuroraEdge-V-2B: A Faster And Stronger Edge Visual Large Language Model

AuroraEdge-V-2B: 一种更快更强大的边缘视觉大语言模型

Xiang Chen

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 AuroraEdge-V-2B是一种为边缘部署设计的高性能视觉大语言模型,具有紧凑参数、高速推理和强大性能的特点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21310 2026-01-26 cs.CL cs.AI cs.LG 87%

Efficient semantic uncertainty quantification in language models via diversity-steered sampling

通过多样性引导采样实现语言模型中的高效语义不确定性量化

Ji Won Park, Kyunghyun Cho

机构 * Prescient Design, Genentech(普森设计,基因泰克) Center for Data Science, New York University(数据科学中心,纽约大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种多样性引导采样方法,通过注入语义相似性惩罚提升语言模型在问答任务中的不确定性估计效率,实现样本效率提升并覆盖更多语义簇。

Comments 10 pages (+7 appendix), 7 figures. Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14558 2026-01-26 cs.CR cs.AI cs.CL 86%

LLM Jailbreak Detection for (Almost) Free!

几乎免费的LLM劫持检测

Guorui Chen, Yifan Xia, Xiaojun Jia, Zhijiang Li, Philip Torr, Jindong Gu

机构 * School of Information Management, Wuhan University(武汉大学信息管理学院) Nanyang Technological University(南洋理工大学) Torr Vision Group, University of Oxford(牛津大学Torr视觉组)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种几乎免费的LLM劫持检测方法,通过调整输入指令和logits温度来提高检测性能,无需额外计算成本。

Comments EMNLP 2025 (Findings) https://aclanthology.org/2025.findings-emnlp.309/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16390 2026-01-26 cs.CL cs.AI 84%

Cross-Lingual Activation Steering for Multilingual Language Models

多语言激活引导用于多语言语言模型

Rhitabrat Pokharel, Ameeta Agrawal, Tanay Nagar

机构 * Department of Computer Science, Portland State University, USA(波特兰州立大学计算机科学系)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CLAS方法,通过激活引导提升多语言模型在非主导语言上的性能,无需修改模型权重。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02979 2026-01-26 cs.HC cs.AI 80%

Systematizing LLM Persona Design: A Four-Quadrant Technical Taxonomy for AI Companion Applications

对LLM人设设计的系统化:面向AI陪伴应用的四象限技术分类

Esther Sun, Zichu Wu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出四象限技术分类系统,系统化LLM人设设计,涵盖虚拟与具身、情感与功能增强,分析不同应用场景的技术挑战与核心问题。

Comments Accepted to Neurips 2025 workshop: LLM Persona Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09397 2026-01-26 cs.LG cs.AI cs.CC cs.CL 80%

On Fine-Grained I/O Complexity of Attention Backward Passes

关于注意力反向传递中细粒度I/O复杂度

Xiaoyu Li, Yingyu Liang, Zhenmei Shi, Zhao Song, Song Yue, Jiahao Zhang

机构 * Department of XXX, University of YYY, Location, Country(YYY大学XXX系) School of ZZZ, Institute of WWW, Location, Country(WWW研究所ZZZ学院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了注意力机制中细粒度I/O复杂度,提出了一种在小缓存环境下优于现有方法的算法,并为高效LLM训练和推理提供了理论指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21862 2026-01-26 cs.CV cs.AI cs.IR 79%

A Multi-Stage Hybrid Framework for Automated Interpretation of Multi-View Engineering Drawings Using Vision Language Model

一种多阶段混合框架用于利用视觉语言模型自动解释多视图工程图

Muhammad Tayyab Khan, Zane Yong, Lequn Chen, Wenhe Feng, Nicholas Yew Jin Tan, Seung Ki Moon

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 本文提出一种多阶段混合框架,利用视觉语言模型自动解析多视图工程图,通过布局分割、方向感知检测和语义解析提升工程图解读效率。

Comments This draft has been accepted in the 13th International Conference on Industrial Engineering and Applications (ICIEA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16530 2026-01-26 cs.CL cs.LG 79%

Curate-Train-Refine: A Closed-Loop Agentic Framework for Zero Shot Classification

Curate-Train-Refine: 一种闭环代理框架用于零样本分类

Gaurav Maheshwari, Kevin El Haddad

机构 * Diabolocom(迪波利科姆) University of Mons(蒙斯大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 Curate-Train-Refine通过LLM闭环生成和评估提升零样本分类效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16127 2026-01-26 cs.CL cs.AI 79%

Improving Training Efficiency and Reducing Maintenance Costs via Language Specific Model Merging

通过语言特定模型合并提升训练效率并降低维护成本

Alphaeus Dmonte, Vidhi Gupta, Daniel J Perry, Mark Arehart

机构 * Qualtrics(Qualtrics公司) George Mason University(乔治·马歇尔大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过语言特定模型合并提升训练效率并降低维护成本,展示在多语言任务中显著减少训练时间和成本的方法。

Comments Accepted to EACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16507 2026-01-26 cs.SE 75%

REprompt: Prompt Generation for Intelligent Software Development Guided by Requirements Engineering

REprompt:基于需求工程的智能软件开发提示生成

Junjie Shi, Weisong Sun, Zhenpeng Chen, Zhujun Wu, Xiaohong Chen, Zhi Jin, Yang Liu

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 REprompt是一种基于需求工程的多代理提示优化框架,旨在通过根植需求工程原则来优化系统和用户提示,提升智能软件开发中的提示生成效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16596 2026-01-26 cs.CL cs.AI 73%

Attention-MoA: Enhancing Mixture-of-Agents via Inter-Agent Semantic Attention and Deep Residual Synthesis

基于跨代理语义注意力和深度残差合成的混合代理增强

Jianyu Wen, Yang Wei, Xiongxi Yu, Changxuan Xiao, Ke Zeng

机构 * Meituan LongCat Interaction Team(美团LongCat交互团队)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Attention-MoA通过跨代理语义注意力和深度残差合成,提升混合代理系统的性能,优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16489 2026-01-26 cs.SE cs.AI cs.CL 73%

EvoConfig: Self-Evolving Multi-Agent Systems for Efficient Autonomous Environment Configuration

EvoConfig:用于高效自主环境配置的自演化多智能体系统

Xinshuai Guo, Jiayi Kuang, Linyue Pan, Yinghui Li, Yangning Li, Hai-Tao Zheng, Ying Shen, Di Yin, Xing Sun

机构 * Tsinghua University(清华大学) Sun-Yat Sen University(孙逸人大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 EvoConfig通过自演化多智能体系统提升自主环境配置效率,实现更高成功率和更强调试能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19592 2026-01-26 eess.AS cs.AI cs.CL cs.SD 73%

Frame-Stacked Local Transformers For Efficient Multi-Codebook Speech Generation

基于帧堆叠的局部变换器的高效多代码本语音生成

Roy Fejgin, Paarth Neekhara, Xuesong Yang, Edresson Casanova, Ryan Langman, Jaehyeon Kim, Subhankar Ghosh, Shehzeen Hussain, Jason Li

机构 * NVIDIA

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于帧堆叠的局部变换器,用于高效多代码本语音生成,通过自回归和迭代预测方法提升速度并保持语音质量。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16547 2026-01-26 cs.SD cs.AI eess.AS 70%

CORD: Bridging the Audio-Text Reasoning Gap via Weighted On-policy Cross-modal Distillation

CORD:通过加权在线跨模态蒸馏弥合音频-文本推理差距

Jing Hu, Danxiang Zhu, Xianlong Luo, Dan Zhang, Shuwei He, Yishu Lei, Haitao Zheng, Shikun Feng, Jingzhou He, Yu Sun, Hua Wu, Haifeng Wang

机构 * ERNIE Team, Baidu(百度ERNIE团队) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CORD通过加权在线跨模态蒸馏方法,有效弥合音频与文本推理之间的差距,提升音频条件推理能力。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11659 2026-01-26 cs.SE cs.LG 70%

The Llama 4 Herd: Architecture, Training, Evaluation, and Deployment Notes

Llama 4 群:架构、训练、评估与部署说明

Redacted by arXiv

专题命中 效率与部署 :post-training(abstract);SFT(abstract);分类 cs.LG

AI总结 本文详细介绍了Llama 4模型家族的架构、训练方法、评估及部署注意事项,涵盖模型变种、架构特点、训练流程、基准测试结果及实际部署限制。

Comments arXiv admin note: This version has been removed by arXiv administrators due to incorrect authorship. The name of the submitter was also incorrect. The author list and submitter name have been redacted

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16971 2026-01-26 cs.LG 57%

Auto-Regressive Masked Diffusion Models

自回归掩码扩散模型

Mahdi Karami, Ali Ghodsi

机构 * School of Computer Science University of Waterloo, ON, Canada(计算机科学学院,滑铁卢大学,加拿大) Google Research(谷歌研究)

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 本文提出自回归掩码扩散模型,通过结合自回归模型的训练效率与扩散模型的并行生成能力,实现高效且灵活的语言建模,提升性能并减少训练步骤。

Journal ref 29th International Conference on Artificial Intelligence and Statistics (AISTATS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16660 2026-01-26 eess.IV cs.CV cs.LG 57%

Fast, faithful and photorealistic diffusion-based image super-resolution with enhanced Flow Map models

快速、忠实且逼真基于扩散的图像超分辨率与增强的流图模型

Maxence Noble, Gonzalo Iñaki Quintana, Benjamin Aubin, Clément Chadebec

机构 * Jasper Research(Jasper研究机构) CMAP, CNRS, Ecole polytechnique(CMAP、CNRS、巴黎高等师范学院)

专题命中 效率与部署 :prompting(abstract);分类 cs.LG

AI总结 本文提出FlowMapSR,一种基于扩散的图像超分辨率框架,通过增强流图模型和对抗微调提升效率和逼真度,实现高 fidelity 和快速推理。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 领域大模型 16 篇

2512.14228 2026-01-26 cs.AI 90%

Georeferencing complex relative locality descriptions with large language models

利用大型语言模型进行复杂相对局部性描述的地理参考

Aneesha Fernando, Surangika Ranathunga, Kristin Stock, Raj Prasanna, Christopher B. Jones

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文利用大型语言模型自动地理参考复杂局部性描述,提升生物多样性数据的准确性与效率。

Comments Provisionally accepted for publication in the International Journal of Geographical Information Science

Journal ref International Journal of Geographical Information Science (2026) 1-33

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06161 2026-01-26 cs.LG cs.AI 86%

LATTLE: LLM Attention Transplant for Transfer Learning of Tabular Data Across Disparate Domains

LATTLE: LLM注意力移植用于跨异质领域的表格数据迁移学习

Ibna Kowsar, Kazi F. Akhter, Manar D. Samad

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 LATTLE通过LLM注意力移植方法,实现了跨异质领域表格数据的高效迁移学习,无需共享特征或大规模预训练模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16775 2026-01-26 cs.IR stat.AP 85%

LLM-powered Real-time Patent Citation Recommendation for Financial Technologies

基于大语言模型的实时金融技术专利引用推荐

Tianang Deng, Yu Deng, Tianchen Gao, Yonghong Hu, Rui Pan

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出基于大语言模型的实时金融专利引用推荐框架,通过增量索引策略提升动态专利系统的检索效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18261 2026-01-26 cs.IR cs.AI 83%

LLM Reasoning for Cold-Start Item Recommendation

基于大语言模型的冷启动物品推荐

Shijun Li, Yu Wang, Jin Wang, Ying Li, Joydeep Ghosh, Anne Cocos

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 领域大模型 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型的推理能力,改进冷启动物品推荐,通过多种微调方法提升推荐性能,在Netflix数据上取得8%的提升。

Comments Published on Proceedings of the ACM on Web Conference 2026 (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10004 2026-01-26 cs.AI cs.CL 82%

Exploring LLMs for Scientific Information Extraction Using The SciEx Framework

探索使用SciEx框架利用大语言模型进行科学信息提取

Sha Li, Ayush Sadekar, Nathan Self, Yiqi Su, Lars Andersland, Mira Chaplin, Annabel Zhang, Hyoju Yang, James B Henderson, Krista Wigginton, Linsey Marr, T. M. Murali, Naren Ramakrishnan

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出SciEx框架,通过解耦关键组件提升科学信息提取的准确性和一致性,评估结果显示其在多科学领域中的有效性。

Comments Accepted to the KGML Bridge at AAAI 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04037 2026-01-26 cs.AI 79%

Ready Jurist One: Benchmarking Language Agents for Legal Intelligence in Dynamic Environments

Ready Jurist One:为动态环境中的法律智能基准测试语言代理

Zheng Jia, Shengbin Yue, Wei Chen, Siyuan Wang, Yidong Liu, Zejun Li, Yun Song, Zhongyu Wei

专题命中 领域大模型 :language agent(title);LLM(abstract);分类 cs.AI

AI总结 Ready Jurist One通过动态法律环境和细粒度评估框架,揭示了现有LLM在动态法律任务中的执行缺陷,为法律智能研究提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11020 2026-01-26 cs.CR cs.AI 77%

Data Poisoning Vulnerabilities Across Healthcare AI Architectures: A Security Threat Analysis

医疗AI架构中的数据中毒漏洞:安全威胁分析

Farhad Abtahi, Fernando Seoane, Iván Pau, Mario Vega-Barbas

专题命中 领域大模型 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 医疗AI面临数据中毒威胁,需多层防御措施和可解释系统以提高安全性。

Journal ref J Med Internet Res 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09867 2026-01-26 cs.CV cs.AI cs.CL 73%

Hierarchy-Aware Multimodal Unlearning for Medical AI

层次感知的多模态反遗忘用于医疗AI

Fengli Wu, Vaidehi Patil, Jaehong Yoon, Yue Zhang, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Nanyang Technological University(南洋理工大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MedForget提出一个层次感知的多模态反遗忘基准和CHIP方法,有效解决医疗数据中层次结构的遗忘问题,同时保持下游效用。

Comments Dataset and Code: https://github.com/fengli-wu/MedForget

详情

展开后加载摘要…

URL PDF HTML 收藏