arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-16 至 2026-01-16 共收录 186 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 38 篇

2601.09742 2026-01-16 cs.MA 67%

Adaptive Orchestration: Scalable Self-Evolving Multi-Agent Systems

自适应编排:可扩展的自进化多智能体系统

Sathish Sampath, Anuradha Baskaran

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种自进化多智能体系统,通过动态专家混合方法解决大规模自主代理的泛化-专业化困境,提升任务成功率并减少资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09421 2026-01-16 cs.CL cs.AI 62%

Bias Dynamics in BabyLMs: Towards a Compute-Efficient Sandbox for Democratising Pre-Training Debiasing

BabyLMs中的偏见动态:朝着更高效的计算 sandbox 以民主化预训练去偏研究

Filip Trhlik, Andrew Caines, Paula Buttery

机构 * Department of Computer Science & Technology, University of Cambridge(计算机科学与技术系,剑桥大学) ALTA Institute, University of Cambridge(ALTA研究所,剑桥大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI

AI总结 通过低成本BabyLMs研究偏见动态,降低预训练成本,促进公平语言模型的民主化研究。

Comments 21 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11594 2026-01-16 cs.LG cs.AI cs.AR cs.CV cs.PF 62%

SageAttention3: Microscaling FP4 Attention for Inference and An Exploration of 8-Bit Training

SageAttention3: 微缩放FP4注意力用于推理及8位训练的探索

Jintao Zhang, Jia Wei, Pengle Zhang, Xiaoming Xu, Haofeng Huang, Haoxu Wang, Kai Jiang, Jianfei Chen, Jun Zhu

机构 * Dept. of Comp. Sci. and Tech.(计算机科学与技术系) Institute for AI(人工智能研究院) BNRist Center(BNRist中心) THBI Lab(THBI实验室) Tsinghua-Bosch Joint ML Center(清华大学-博世联合机器学习中心) Tsinghua University(清华大学)

专题命中 效率与部署 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 SageAttention3通过FP4和8位注意力提升推理与训练效率,实现5倍加速和无损微调性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10403 2026-01-16 cs.LG 57%

Discrete Feynman-Kac Correctors

离散费曼-科茨校正器

Mohsin Hasan, Viktor Ohanesian, Artem Gazizov, Yoshua Bengio, Alán Aspuru-Guzik, Roberto Bondesan, Marta Skreta, Kirill Neklyudov

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 本研究提出离散费曼-科茨校正器,通过序贯蒙特卡洛算法在推理时控制离散扩散模型的生成分布,实现高效采样和奖励优化。

Comments Code: https://github.com/hasanmohsin/discrete_fkc

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00138 2026-01-16 cs.AI cs.CV 57%

Explicit Abstention Knobs for Predictable Reliability in Video Question Answering

可预测可靠性中的显式回避调节器用于视频问答

Jorge Ortiz

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Rutgers University(罗格斯大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 本文提出通过置信度阈值控制视频问答中的错误率,验证了在分布偏移下置信度回避机制的可靠性。

Comments Preprint. Diagnostic study of confidence-based abstention under evidence truncation

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10109 2026-01-16 cs.CL 57%

Skill-Aware Data Selection and Fine-Tuning for Data-Efficient Reasoning Distillation

具备技能的数据选择与微调用于数据高效的推理蒸馏

Lechen Zhang, Yunxiang Zhang, Wei Hu, Lu Wang

机构 * University of Michigan(密歇根大学)

专题命中 效率与部署 :SFT(abstract);分类 cs.CL

AI总结 本文提出了一种基于技能的蒸馏框架,通过数据选择和微调提升推理效率,实验证明在数学推理基准上优于随机微调基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10011 2026-01-16 cs.AI 57%

Memo-SQL: Structured Decomposition and Experience-Driven Self-Correction for Training-Free NL2SQL

Memo-SQL: 结构化分解与经验驱动的自我修正以实现无训练的NL2SQL

Zerui Yang, Weichuan Wang, Yanwei Xu, Linqi Song, Yudai Matsuda, Wei Han, Bo Bai

机构 * City University of Hong Kong(香港城市大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 效率与部署 :prompting(abstract);分类 cs.AI

AI总结 Memo-SQL通过结构化分解和经验驱动的自我修正,实现了无训练的NL2SQL系统,在BIRD数据集上达到68.5%的执行准确率,同时资源消耗显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23914 2026-01-16 eess.SY cs.SY 50%

Hardware Acceleration for Neural Networks: A Comprehensive Survey

神经网络的硬件加速:全面综述

Bin Xu, Ayan Banerjee, Sandeep Gupta

专题命中 效率与部署 :LLM(abstract)

AI总结 本文综述了神经网络硬件加速的技术现状,涵盖多种加速器架构和优化方法,探讨了未来神经网络加速的发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 领域大模型 14 篇

2601.10413 2026-01-16 cs.AI cs.CR 89%

LADFA: A Framework of Using Large Language Models and Retrieval-Augmented Generation for Personal Data Flow Analysis in Privacy Policies

LADFA:利用大型语言模型和检索增强生成进行隐私政策中个人数据流分析的框架

Haiyue Yuan, Nikolay Matyunin, Ali Raza, Shujun Li

机构 * Institute of Cyber Security for Society (iCSS) \& School of Computing, University of Kent Canterbury United Kingdom Honda Research Institute Europe GmbH Germany Institute of Cyber Security for Society (iCSS) \& School of Computing, University of Kent Honda Research Institute Europe GmbH

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 LADFA利用大型语言模型和检索增强生成技术,实现对隐私政策中个人数据流的自动化分析与可视化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10167 2026-01-16 cs.CL 88%

Credit C-GPT: A Domain-Specialized Large Language Model for Conversational Understanding in Vietnamese Debt Collection

信用C-GPT:一种面向越南债务催收的领域专用大语言模型

Nhung Nguyen Thi Hong, Cuong Nguyen Dang, Tri Le Ngoc

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 Credit C-GPT是一种针对越南债务催收场景优化的领域专用大语言模型,通过整合多任务对话智能,提升对话理解、情感识别和意图检测等能力,为企业呼叫中心提供实时帮助和分析解决方案。

Comments 8 pages, 0 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03716 2026-01-16 cs.LG cs.AI cs.CY 85%

Evaluating Large Language Models for Fair and Reliable Organ Allocation

评估大型语言模型以实现公平和可靠的器官分配

Brian Hyeongseok Kim, Hannah Murray, Isabelle Lee, Jason Byun, Joshua Lum, Dani Yogatama, Evi Micha

机构 * University of Southern California(南加州大学)

专题命中 领域大模型 :large language model(title);language model(title);分类 cs.AI、cs.LG

AI总结 本文评估了大型语言模型在器官分配中的公平性,发现基于暴露的指标显示公平结果,而基于概率的指标揭示了系统性的偏好排序,强调了对公平性评估和人类监督的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10142 2026-01-16 cs.CE 83%

Actors, Frames and Arguments: A Multi-Decade Computational Analysis of Climate Discourse in Financial News using Large Language Models

行动者、框架和论点:利用大语言模型对金融新闻中气候话语的多十年计算分析

Ruiran Su, Janet B. Pierrehumbert, Markus Leippold

专题命中 领域大模型 :large language model(title);language model(title)

AI总结 利用大语言模型分析金融新闻中气候话语的演变,揭示了从风险与监管负担到经济机会与创新的转变,以及金融机构在其中的主导作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09858 2026-01-16 cs.CL cs.AI cs.LG 80%

OUTLINEFORGE: Hierarchical Reinforcement Learning with Explicit States for Scientific Writing

OUTLINEFORGE: 基于显式状态的分层强化学习用于科学写作

Yilin Bao, Ziyao He, Zayden Yang

机构 * UC San Diego(圣迭戈大学) Ohio State University(俄亥俄州立大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OUTLINEFORGE通过分层强化学习和显式状态管理,提升科学写作的全局结构和引用一致性,改进文档规划和事实准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09727 2026-01-16 cs.CL cs.AI cs.IR cs.LG 80%

SciNets: Graph-Constrained Multi-Hop Reasoning for Scientific Literature Synthesis

SciNets: 图约束多跳推理用于科学文献综合

Sauhard Dubey

机构 * Jaypee Institute of Information Technology(杰伊佩 Institute 信息科技学院)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SciNets通过图约束多跳推理实现科学文献综合,通过多跳路径连接罕见共现的概念,提升机制解释的稳定性和多样性。

Comments 19 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09749 2026-01-16 cs.SE cs.AI cs.LG 79%

R-LAM: Reproducibility-Constrained Large Action Models for Scientific Workflow Automation

R-LAM:具有可重复性约束的大型动作模型用于科学工作流自动化

Suriya Sureshkumar

机构 * 1, Department of AI \& Data Science, RMK Engineering College, Chennai, India

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 R-LAM通过引入结构化动作模式、确定性执行策略和显式溯源跟踪,提升科学工作流自动化的可重复性和可靠性。

Comments 9 pages, 3 figures, 1 Table, 2 Artifacts

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21789 2026-01-16 cs.CL cs.AI cs.CV cs.HC 73%

Five Years of SciCap: What We Learned and Future Directions for Scientific Figure Captioning

五年 SciCap:我们学到了什么以及科学图表描述的未来方向

Ting-Hao 'Kenneth' Huang, Ryan A. Rossi, Sungchul Kim, Tong Yu, Ting-Yao E. Hsu, Ho Yin, Ng, C. Lee Giles

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SciCap项目通过五年研究总结了科学图表描述领域的技术经验,并提出了未来研究的五个关键方向。

Comments Accepted to the 5th Annual AAAI Workshop on AI to Accelerate Science and Engineering (AI2ASE 2026). SciCap Website: http://scicap.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10108 2026-01-16 cs.CL cs.AI cs.MM 73%

SIN-Bench: Tracing Native Evidence Chains in Long-Context Multimodal Scientific Interleaved Literature

SIN-Bench:在长上下文多模态科学交织文献中追踪原生证据链

Yiming Ren, Junjie Wang, Yuxin Meng, Yihang Shi, Zhiqiang Lin, Ruihang Chu, Yiran Xu, Ziming Li, Yunfei Zhao, Zihan Wang, Yu Qiao, Ruiming Tang, Minghao Liu, Yujiu Yang

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) KuaiShou Inc.(快手公司) Stanford University(斯坦福大学) Harvard University(哈佛大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SIN-Bench 通过构建科学交织语料库和四个逐步任务,评估多模态模型在长上下文科学文献中追踪证据链的能力,揭示接地是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09730 2026-01-16 cs.CL cs.AI cs.IR 73%

Clinical Document Metadata Extraction: A Scoping Review

临床文档元数据提取:一项综述

Kurt Miller, Qiuhao Lu, William Hersh, Kirk Roberts, Steven Bedrick, Andrew Wen, Hongfang Liu

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了临床文档元数据提取的研究,分析了方法学趋势和应用,并指出了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09762 2026-01-16 cs.SE cs.AI 70%

Explicating Tacit Regulatory Knowledge from LLMs to Auto-Formalize Requirements for Compliance Test Case Generation

从LLMs中阐释隐性监管知识以实现需求的自动形式化,用于合规测试用例生成

Zhiyi Xue, Xiaohong Chen, Min Zhang

机构 * Shanghai Key Laboratory of Trustworthy Computing, ECNU(上海可信计算实验室,华东师范大学) Dishui Lake International Software Engineering Institute, ECNU(迪希湖国际软件工程研究院,华东师范大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RAFT通过从多个LLMs中阐释隐性监管知识,实现需求自动形式化和合规测试生成,提升测试用例生成的精度和效率。

Comments 16 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10137 2026-01-16 cs.LG cs.AI stat.ML 62%

Step-by-Step Causality: Transparent Causal Discovery with Multi-Agent Tree-Query and Adversarial Confidence Estimation

逐步因果:基于多智能体树查询和对抗性置信度估计的透明因果发现

Ziyi Ding, Chenfei Ye-Hao, Zheyuan Wang, Xiao-Ping Zhang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院) Zhili College, Tsinghua University, Beijing, China(清华大学哲利学院)

专题命中 领域大模型 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Tree-Query框架,通过多专家LLM和对抗性置信度估计,实现透明、可解释的因果发现,提升数据自由环境下的因果推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17444 2026-01-16 cs.CL 57%

Filling in the Clinical Gaps in Benchmark: Case for HealthBench for the Japanese medical system

填补基准测试中的临床空白:日本医疗系统的健康基准案

Shohei Hisada, Endo Sunao, Himi Yamato, Shoko Wakamiya, Eiji Aramaki

机构 * Nara Institute of Science and Technology(奈良科学技术大学)

专题命中 领域大模型 :LLM(abstract);分类 cs.CL

AI总结 本研究指出日本医疗系统中医疗大语言模型评估的空白,提出建立本地化的J-HealthBench以提升评估的准确性和安全性。

Comments draft v0.3 Code and analysis data is available at https://zenodo.org/records/17405321

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10124 2026-01-16 cs.CV 50%

VQ-Seg: Vector-Quantized Token Perturbation for Semi-Supervised Medical Image Segmentation

VQ-Seg: 基于向量量化令牌扰动的半监督医学图像分割

Sicheng Yang, Zhaohu Xing, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 领域大模型 :foundation model(abstract)

AI总结 VQ-Seg通过向量量化和量化扰动模块提升半监督医学图像分割性能,有效解决传统dropout正则化问题。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 知识编辑与模型理解 5 篇

2601.10010 2026-01-16 cs.CV cs.AI 89%

VERHallu: Evaluating and Mitigating Event Relation Hallucination in Video Large Language Models

VERHallu: 评估和缓解视频大语言模型中的事件关系幻觉

Zefan Zhang, Kehua Zhu, Shijie Jiang, Hongyuan Lu, Shengkai Sun, Tian Bai

机构 * College of Computer Science and Technology, Key Laboratory of Symbolic Computation and Knowledge Engineering, Ministry of Education, Jilin University(吉林大学计算机科学与技术学院,符号计算与知识工程重点实验室,教育部,吉林大学) College of Software, Jilin University(吉林大学软件学院) Facemind Group(FaceMind集团) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出VERHallu基准,用于评估和缓解视频大语言模型中的事件关系幻觉,通过关键帧传播策略提升多事件理解能力。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09929 2026-01-16 cs.AI 88%

Hallucination Detection and Mitigation in Large Language Models

大语言模型中的幻觉检测与缓解

Ahmad Pesaranghader, Erin Li

机构 * CIBC(加拿大帝国商业银行)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出了一种系统化的框架,通过分层架构和闭环反馈机制,提升大语言模型在金融等高风险领域的可靠性,减少幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10591 2026-01-16 cs.LG cs.AI q-fin.RM q-fin.TR 81%

ProbFM: Probabilistic Time Series Foundation Model with Uncertainty Decomposition

ProbFM:具有不确定性分解的概率时间序列基础模型

Arundeep Chinta, Lucas Vinh Tran, Jay Katukuri

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 ProbFM提出一种基于变压器的概率模型,利用深度证据回归实现理论基础的不确定性分解,提升金融预测的准确性和不确定性量化能力。

Comments Accepted for oral presentation at the AI Meets Quantitative Finance Workshop at ICAIF 2025. An enhanced version was accepted for oral presentation at the AI for Time Series Analysis Workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07863 2026-01-16 cs.CL 79%

QoSBERT: An Uncertainty-Aware Approach based on Pre-trained Language Models for Service Quality Prediction

QoSBERT:基于预训练语言模型的不确定性感知方法用于服务质量预测

Ziliang Wang, Xiaohong Zhang, Ze Shi Li, Meng Yan

机构 * Key Laboratory of High Confidence Software Technologies (Peking University), Ministry of Education(高可信软件技术重点实验室(北京大学)) School of Computer Science, Peking University(北京大学计算机科学学院) Key Laboratory of Dependable Service Computing in Cyber Physical Society (Chongqing University), Ministry of Education, China(网络物理社会可信服务计算重点实验室(重庆大学)) School of Big Data and Software Engineering, Chongqing University(重庆大学大数据与软件工程学院) Department of Computer Science at the University of Victoria(维多利亚大学计算机科学系)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 QoSBERT基于预训练语言模型,通过不确定性估计提升服务质量预测的准确性和可靠性。

Journal ref IEEE Transactions on Services Computing ( Volume: 18, Issue: 6, Nov.-Dec. 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10242 2026-01-16 cs.CL cs.AI 73%

Loop as a Bridge: Can Looped Transformers Truly Link Representation Space and Natural Language Outputs?

循环作为桥梁:循环变换器能否真正连接表示空间和自然语言输出?

Guanxu Chen, Dongrui Liu, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了循环变换器是否能通过迭代机制弥合内部知识与自然语言输出之间的差距,发现循环次数增加虽缩小差距,但内部知识退化是主因,且表征感知能力仅在最终循环中存在。

Comments 9 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他LLM 9 篇

2410.03055 2026-01-16 cs.LG cs.AI 90%

Permissive Information-Flow Analysis for Large Language Models

宽松的信息流分析用于大型语言模型

Shoaib Ahmed Siddiqui, Radhika Gaonkar, Boris Köpf, David Krueger, Andrew Paverd, Ahmed Salem, Shruti Tople, Lukas Wutschitz, Menglin Xia, Santiago Zanella-Béguelin

机构 * University of Cambridge(剑桥大学) Microsoft(微软公司) Mila

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种更宽松的信息流分析方法,通过传播对模型输出有影响的样本标签来提高大型语言模型的安全性和隐私保护效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09849 2026-01-16 cs.CY 89%

Strategies of cooperation and defection in five large language models

五种大语言模型中的合作与背叛策略

Saptarshi Pal, Abhishek Mallela, Christian Hilbe, Lenz Pracher, Chiyu Wei, Feng Fu, Santiago Schnell, Martin A Nowak

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究五种大语言模型在重复囚徒困境中的合作与背叛策略,分析其在不同参数和框架下的适应性及一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10193 2026-01-16 cs.AI 85%

GFM4GA: Graph Foundation Model for Group Anomaly Detection

基于图的群体异常检测基础模型GFM4GA

Jiujiu Chen, Weijun Zeng, Shaofeng Hu, Sihong Xie, Hui Xiong

机构 * Tencent(腾讯)

专题命中 其他LLM :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GFM4GA是一种用于群体异常检测的新型图基础模型,通过双层对比学习预训练和参数受限的少样本微调,有效提升群体异常检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏