arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-01 至 2026-01-01 共收录 193 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 17 篇

2512.22386 2026-01-01 cs.IR 50%

OxygenREC: An Instruction-Following Generative Framework for E-commerce Recommendation

OxygenREC: 一种用于电商推荐的指令遵循生成框架

Xuegang Hao, Ming Zhang, Alex Li, Xiangyu Qian, Zhi Ma, Yanlong Zang, Shijie Yang, Zhongxuan Han, Xiaolong Ma, Jinguang Liu, Zhen Li, Zhida Jiang, Shusheng Wang, Ning Tang, Yanchen Qiao, Chenxiang Yang, Chen Sun, Jincheng Yuan, Chunhua Peng, Heng Hu, Peijun Yang, Baopeng Yuan, Caiyun Qiu, Zhaolong Xing, Haofei Yuan, Haipeng Zhang, Yuzhang Guo, Weijie Ding, Jiahua Gao, Hao Huang, Zhen Chen, Tongxuan Liu, Pinghua Gong

专题命中 领域大模型 :LLM(abstract)

AI总结 OxygenREC通过快慢思考架构和语义对齐机制,实现低延迟多场景的深度推荐推理。

Comments 37 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20676 2026-01-01 cs.CV 50%

SciceVPR: Stable Cross-Image Correlation Enhanced Model for Visual Place Recognition

SciceVPR: 稳定跨图像相关性增强模型用于视觉位置识别

Shanshan Wan, Yingmei Wei, Lai Kang, Tianrui Shen, Haixuan Wang, Yee-Hong Yang

专题命中 领域大模型 :foundation model(abstract)

AI总结 SciceVPR通过增强跨图像相关性,提升视觉位置识别的稳定性和性能,优于现有单阶段和两阶段方法。

Comments This work has been accepted by Neurocomputing. The final version can be accessed via https://www.sciencedirect.com/science/article/pii/S0925231225032114

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 知识编辑与模型理解 5 篇

2512.24560 2026-01-01 cs.SE cs.AI 85%

Localized Calibrated Uncertainty in Code Language Models

代码语言模型中的局部校准不确定性

David Gros, Prem Devanbu

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

AI总结 本研究提出了一种技术,用于在代码语言模型中局部校准不确定性,通过最小意图对齐补丁数据集评估不同探测方法的校准效果,并探讨了其在AI监督中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24440 2026-01-01 physics.ao-ph cs.LG physics.comp-ph 70%

Towards mechanistic understanding in a data-driven weather model: internal activations reveal interpretable physical features

迈向数据驱动天气模型的机理理解:内部激活揭示可解释的物理特征

Theodore MacMillan, Nicholas T. Ouellette

机构 * Stanford University(斯坦福大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过分析GraphCast模型的内部激活,揭示了可解释的物理特征,为数据驱动天气模型的机理理解提供了新视角。

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23722 2026-01-01 cs.CL 70%

Emergent World Beliefs: Exploring Transformers in Stochastic Games

涌现的世界信念:探索变换器在随机游戏中的应用

Adam Kamel, Tanish Rastogi, Michael Ma, Kailash Ranganathan, Kevin Zhu

机构 * University of Waterloo(多伦多大学) University of California, Berkeley(加州大学伯克利分校) Algoverse AI Research(Algoverse人工智能研究)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了LLMs在扑克等信息不完全领域中学习随机环境表示的能力,通过预训练和内部激活探测,展示了模型能自主学习确定性和随机性特征。

Comments Accepted at NeurIPS 2025 Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24842 2026-01-01 cs.CL stat.ML 61%

Triangulation as an Acceptance Rule for Multilingual Mechanistic Interpretability

三角化作为多语言机制可解释性的接受规则

Yanan Long

机构 * StickFlux Labs(StickFlux实验室)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL;LLM(comments)

AI总结 本文提出三角化作为多语言机制可解释性的接受规则,通过因果标准验证模型行为的必要性、充分性和不变性,以提高跨语言解释的可靠性。

Comments NeurIPS 2025 Workshop Evaluating the Evolving LLM Lifecycle: Benchmarks, Emergent Abilities, and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03486 2026-01-01 stat.ML cs.LG 57%

Tight PAC-Bayesian Risk Certificates for Contrastive Learning

对比学习的紧PAC-Bayesian风险证书

Anna Van Elst, Debarghya Ghoshdastidar

机构 * LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎高等理工学院) School of Computation Information and Technology, Technical University of Munich(计算信息与技术学院,慕尼黑技术大学)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 本文提出紧PAC-Bayesian风险证书,针对对比学习中的依赖性和SimCLR框架,改进了对比损失和下游预测的界。

Journal ref SIAM Journal on Mathematics of Data Science, vol. 7, no. 4, pp. 1904-1927, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他LLM 6 篇

2512.24571 2026-01-01 cs.CR cs.AI 86%

SynRAG: A Large Language Model Framework for Executable Query Generation in Heterogeneous SIEM System

SynRAG: 一种用于异构SIEM系统可执行查询生成的大语言模型框架

Md Hasan Saju, Austin Page, Akramul Azim, Jeff Gardiner, Farzaneh Abazari, Frank Eargle

机构 * Department of Electrical, Computer, and Software Engineering (ECSE)(电气、计算机与软件工程系)

专题命中 其他LLM :language model(title,abstract);large language model(title);分类 cs.AI

AI总结 SynRAG是一种用于异构SIEM系统可执行查询生成的大语言模型框架,能够自动从平台无关规范生成多平台查询,提升威胁检测效率。

Journal ref https://conf.researchr.org/home/cascon-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11557 2026-01-01 cs.CL 85%

Invisible Languages of the LLM Universe

LLM宇宙中的隐形语言

Saurabh Khanna, Xinxu Li

机构 * Amsterdam School of Communication Research, University of Amsterdam(阿姆斯特丹通信研究所,阿姆斯特丹大学) Pembroke College, University of Oxford(牛津大学 Pembroke 学院)

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨了LLM宇宙中隐形语言的结构性不平等,揭示了语言活力与数字性之间的不匹配,并指出英语主导AI并非技术必然,而是权力结构的产物。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18536 2026-01-01 cs.IR 82%

Illusions of Relevance: Arbitrary Content Injection Attacks Deceive Retrievers, Rerankers, and LLM Judges

相关性错觉:任意内容注入攻击欺骗检索器、重排序器和LLM判断者

Manveer Singh Tamber, Jimmy Lin

专题命中 其他LLM :LLM(title,abstract);language model(abstract)

AI总结 本文揭示了任意内容注入攻击可欺骗检索器、重排序器和LLM判断者,指出模型在安全性和鲁棒性上的弱点,并呼吁进一步研究。

Comments AACL Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24102 2026-01-01 cs.LG 79%

Autoregressivity in the Latent Space of a GP-VAE Language Model: An Empirical Ablation Study

在GP-VAE语言模型的潜在空间中的自回归性:一项经验消融研究

Yves Ruffenach

机构 * Conservatoire National des Arts et Métiers(法国国家艺术与工艺学院)

专题命中 其他LLM :language model(title,abstract);分类 cs.LG

AI总结 本文通过实验验证了GP-VAE中潜在自回归在组织长距离结构中的有效性,并展示了其与令牌级自回归建模的互补性。

Comments A focused ablation study analyzing the role of latent autoregression in GP-VAE models

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24986 2026-01-01 cs.GR cs.CV 75%

PhysTalk: Language-driven Real-time Physics in 3D Gaussian Scenes

PhysTalk: 基于语言的实时3D高斯场景物理模拟

Luca Collorone, Mert Kiray, Indro Spinelli, Fabio Galasso, Benjamin Busam

机构 * Sapienza University of Rome(萨皮恩扎罗马大学) Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 其他LLM :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 PhysTalk通过实时物理模拟实现基于语言的3D高斯场景交互式动画,无需离线优化,提升创作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23710 2026-01-01 cs.CL cs.AI 62%

Enriching Historical Records: An OCR and AI-Driven Approach for Database Integration

丰富历史记录:一种结合OCR和AI的方法用于数据库整合

Zahra Abedi, Richard M. K. van Dijk, Gijs Wijnholds, Tessa Verhoef

机构 * Leiden Institute of Advanced Computer Science(莱顿先进计算机科学研究所) Leiden University(莱顿大学)

专题命中 其他LLM :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种结合OCR和AI的方法,用于将历史文档数据与现有数据库整合,通过自动化流程解决数据不一致问题,并展示生成式AI在提升OCR性能方面的应用。

Journal ref Computational Linguistics in the Netherlands Journal 14 (2025) 401-420

详情

展开后加载摘要…

URL PDF HTML 收藏