arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-29 至 2026-01-29 共收录 210 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 35 篇

2601.20604 2026-01-29 cs.AI 70%

Dialogical Reasoning Across AI Architectures: A Multi-Model Framework for Testing AI Alignment Strategies

跨AI架构的对话推理:一种多模型框架用于测试AI对齐策略

Gray Cox

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种多模型框架,通过对话推理测试AI对齐策略,展示不同AI模型在处理复杂对齐框架时的表现及新兴见解。

Comments 23 pages, 5 tables, 5 appendices. Code and data: https://github.com/jgraycox-coa/vcw-multi-ai-dialogue

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20014 2026-01-29 cs.AI 70%

Teaching LLMs to Ask: Self-Querying Category-Theoretic Planning for Under-Specified Reasoning

教大语言模型提问:面向不充分推理的自查询范畴规划

Shuhui Qu

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SQ-BCP通过自查询和桥梁假设解决不充分推理问题,显著降低资源违规率并保持高质量计划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19180 2026-01-29 cs.CR cs.AI 70%

Enhancing Model Defense Against Jailbreaks with Proactive Safety Reasoning

通过主动安全推理增强模型对劫持的防御

Xianglin Yang, Gelei Deng, Jieming Shi, Tianwei Zhang, Jin Song Dong

机构 * School of Computing(计算学院) National University of Singapore(新加坡国立大学) School of Computer Science and Engineering(计算机科学与工程学院) Nanyang Technological University(南洋理工大学) Department of Computing(计算系) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SCoT方法,通过主动安全推理提升模型对劫持的防御能力,有效减少对分布外问题和对抗操纵的易感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20552 2026-01-29 cs.CV 67%

DeepSeek-OCR 2: Visual Causal Flow

DeepSeek-OCR 2: 视觉因果流

Haoran Wei, Yaofeng Sun, Yukun Li

机构 * DeepSeek-AI

专题命中 推理与问题求解 :LLM(abstract);language model(abstract)

AI总结 DeepSeek-OCR 2通过两个级联的一维因果推理结构实现二维图像理解,提升视觉处理的语义连贯性与灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19968 2026-01-29 cs.CR 67%

What is the AGI in Offensive Security ?

进攻性安全中的AGI是什么?

Youngwoong Cho

专题命中 推理与问题求解 :LLM(abstract);language model(abstract)

AI总结 本文探讨进攻性安全中的AGI,提出将任务归结为符号语言操作,并通过状态机和符号代理模型分析交互编码问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01544 2026-01-29 cs.LG cs.AI cs.CL 67%

Compositional Reasoning with Transformers, RNNs, and Chain of Thought

基于变换器、RNN和思维链的组合推理

Gilad Yehudai, Noah Amsel, Joan Bruna

机构 * Courant Institute of Mathematical Sciences(Courant数学科学研究所) New York University(纽约大学) Center for Data Science(数据科学中心) Center for Computational Mathematics(计算数学中心) Flatiron Institute(Flatiron研究所)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了变换器、RNN和思维链架构在解决组合推理问题上的表现,证明了不同架构在处理此类问题时各有优劣,无一严格优于其他。

Comments NeurIPS CR version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19915 2026-01-29 cs.CL cs.AI cs.LO 62%

Modeling Next-Token Prediction as Left-Nested Intuitionistic Implication

将下一个词预测建模为左嵌套直觉蕴含

Paul Tarau

机构 * University of North Texas(北卡罗来纳州立大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出了一种基于直觉逻辑的神经架构,通过左嵌套蕴含链实现下一个词预测,展示了其与Transformer和状态空间模型的对比。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20649 2026-01-29 cs.CL 57%

P2S: Probabilistic Process Supervision for General-Domain Reasoning Question Answering

P2S: 通用领域推理问答中的概率过程监督

Wenlin Zhong, Chengyuan Liu, Yiquan Wu, Bovin Tan, Changlong Sun, Yi Wang, Xiaozhong Liu, Kun Kuang

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

AI总结 P2S通过概率过程监督提升通用领域推理问答性能,利用路径忠实度奖励解决奖励稀疏性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20303 2026-01-29 cs.CV cs.AI 57%

Physically Guided Visual Mass Estimation from a Single RGB Image

基于单个RGB图像的物理引导视觉质量估计

Sungjae Lee, Junhan Jeong, Yeonjoo Hong, Kwang In Kim

机构 * Graduate School of Artificial Intelligence, POSTECH, South Korea(人工智能研究生院,POSTECH,韩国) Department of Electrical Engineering, POSTECH, South Korea(电气工程系,POSTECH,韩国)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于物理引导的单图像质量估计方法,通过融合几何、语义和外观信息,实现对物体质量的准确预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20021 2026-01-29 cs.AI 57%

Fuzzy Categorical Planning: Autonomous Goal Satisfaction with Graded Semantic Constraints

模糊分类规划:具有分级语义约束的自主目标满足

Shuhui Qu

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 FCP通过引入模糊度量和Lukasiewicz t-范数提升自然语言规划中模糊约束的处理能力,有效应对多步骤计划中的质量退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19171 2026-01-29 cs.CL 57%

JEPA-Reasoner: Decoupling Latent Reasoning from Token Generation

JEPA-Reasoner:将潜在推理与标记生成解耦

Bingyang Kelvin Liu, Ziyu Patrick Chen, David P. Woodruff

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 JEPA-Reasoner通过解耦潜在推理与标记生成,提升模型在复杂推理任务中的准确率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20737 2026-01-29 cs.HC 50%

A Human-Centred AI System for Multi-Actor Planning and Collaboration in Family Learning

面向家庭学习多主体规划与协作的人机协同AI系统

Si Chen, Jingyi Xie, Yao Li, Ya-Fang Lin, He Zhang, Ge Wang, Gaojian Huang, Rui Yu, Ronald Anthony Metoyer, Ting Hua, Nitesh Chawla

专题命中 推理与问题求解 :LLM(abstract)

AI总结 本文提出ParPal系统,通过分解学习目标并分配任务给照顾者,提升家庭学习中的协作效率,揭示当前LLM在教育知识和现实约束处理上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 59 篇

2504.19254 2026-01-29 cs.CL cs.AI cs.LG 90%

Uncertainty Quantification for Language Models: A Suite of Black-Box, White-Box, LLM Judge, and Ensemble Scorers

语言模型的不确定性量化:一套黑盒、白盒、LLM评判者和集成评分器

Dylan Bouchard, Mohit Singh Chauhan

机构 * CVS Health(CVS健康公司)

专题命中 评测与基准 :LLM(title,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种灵活的框架,利用黑盒、白盒、LLM评判者和集成评分器来检测语言模型的幻觉问题,通过可调节的集成方法提升检测性能。

Comments Accepted by TMLR; UQLM repository: https://github.com/cvs-health/uqlm

Journal ref Transactions on Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19925 2026-01-29 cs.CL cs.AI 90%

Evaluating Large Language Models for Abstract Evaluation Tasks: An Empirical Study

评估大型语言模型用于抽象评估任务:一项实证研究

Yinuo Liu, Emre Sezgin, Eric A. Youngstrom

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了大型语言模型在摘要评估任务中的表现,发现其在客观标准上与人类评审员一致,但在主观维度上表现较弱,表明AI可作为补充工具。

Comments 17 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20727 2026-01-29 cs.CY 89%

Audit Trails for Accountability in Large Language Models

为大型语言模型问责制设计的审计追踪

Victor Ojewale, Harini Suresh, Suresh Venkatasubramanian

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出了一种用于大型语言模型的审计追踪机制,通过生命周期框架和参考架构,实现持续问责,提供可重用的开源实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20546 2026-01-29 cs.CL 88%

Beyond Divergent Creativity: A Human-Based Evaluation of Creativity in Large Language Models

超越发散性创造:基于人类的大型语言模型创造力评估

Kumiko Nakajima, Jan Zuiderveld, Sandro Pezzelle

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出CDAT任务,基于人类创造力理论,评估LLMs在新颖性与适当性之间的平衡,发现较小模型更具创造力,而高级模型更注重适当性。

Comments Accepted to Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23565 2026-01-29 cs.CV cs.AI 88%

RxnBench: A Multimodal Benchmark for Evaluating Large Language Models on Chemical Reaction Understanding from Scientific Literature

RxnBench: 一个用于评估大语言模型在科学文献中理解化学反应的多模态基准

Hanzheng Li, Xi Fang, Yixuan Li, Chaozheng Huang, Junjie Wang, Xi Wang, Hongzhe Bai, Bojun Hao, Shenyu Lin, Huiqi Liang, Linfeng Zhang, Guolin Ke

机构 * DP Technology(DP技术公司) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Peking University(北京大学) New York University(纽约大学) Fudan University(复旦大学) Xiamen University(厦门大学) ShanghaiTech University(上海科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 RxnBench通过两个任务评估大语言模型在化学反应理解上的能力,揭示模型在深度化学逻辑和结构识别上的不足,强调需改进视觉编码和推理能力以推动AI化学发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04715 2026-01-29 cs.CL cs.AI cs.LG 87%

First is Not Really Better Than Last: Evaluating Layer Choice and Aggregation Strategies in Language Model Data Influence Estimation

首先并非真的优于最后:评估语言模型数据影响估计中的层数选择和聚合策略

Dmytro Vitel, Anshuman Chhabra

机构 * Bellini College of Artificial Intelligence, Cybersecurity, and Computing(人工智能、网络安全与计算学院)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过理论和实证分析,证明中间注意力层比第一层更有效,提出新的噪声检测率度量标准,挑战传统影响估计方法。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08734 2026-01-29 cs.CL 86%

NurValues: Real-World Nursing Values Evaluation for Large Language Models in Clinical Context

NurValues: 临床情境下大型语言模型护理价值观的现实评估

Ben Yao, Qiuchi Li, Yazhou Zhang, Siyu Yang, Bohan Zhang, Prayag Tiwari, Jing Qin

机构 * The Hong Kong Polytechnic University(香港理工大学) University of Copenhagen(哥本哈根大学) Tianjin University(天津大学) Tongji Hospital of Tongji Medical College of Huazhong University of Science and Technology(华中科技大学同济医学院同济医院) Beijing University of Chinese Medicine(北京中医药大学) Halmstad University(哈马尔大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

AI总结 NurValues通过首个护理价值对齐基准,评估LLMs在临床情境中是否符合护理核心价值观,发现通用LLMs在公正维度表现最差。

Comments 39 pages, 9 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19904 2026-01-29 cs.AR cs.AI cs.CL cs.DC cs.PF 86%

DABench-LLM: Standardized and In-Depth Benchmarking of Post-Moore Dataflow AI Accelerators for LLMs

DABench-LLM: 大规模语言模型后摩尔数据流AI加速器的标准化与深入基准测试

Ziyu Hu, Zhiqing Zhong, Weijian Zheng, Zhijing Ye, Xuwei Tan, Xueru Zhang, Zheng Xie, Rajkumar Kettimuthu, Xiaodong Yu

机构 * Dept. of Computer Science Stevens Institute of Technology(计算机科学系 斯坦福理工学院) Dept. of Computer Science Binghamton University(计算机科学系 哈伯里顿大学) Engineering The Ohio State University(工程学 俄亥俄州立大学) Learning Division Argonne National Laboratory(学习部 阿贡国家实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DABench-LLM是一个用于评估数据流AI加速器上LLM工作负载的基准测试框架,通过性能分析和可扩展性研究,揭示性能瓶颈并提供优化策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10187 2026-01-29 cs.CL cs.AI 86%

HOMURA: Taming the Sand-Glass for Time-Constrained LLM Translation via Reinforcement Learning

HOMURA:通过强化学习驯服沙漏以实现时间受限的LLM翻译

Ziang Cui, Mengran Yu, Tianjiao Li, Chenyu Shi, Yingxuan Shi, Lusheng Zhang, Hongwei Lin

机构 * Bilibili Inc.(哔哩哔哩公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 HOMURA通过强化学习框架优化语义保持与时间合规性平衡,实现精确的翻译长度控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19970 2026-01-29 cs.CR cs.LG 85%

Benchmarking LLAMA Model Security Against OWASP Top 10 For LLM Applications

根据OWASP Top 10为LLM应用程序的框架对LLAMA模型安全性能进行基准测试

Nourin Shahin, Izzat Alsmadi

机构 * Texas A&M University(德克萨斯A&M大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究通过对比不同LLama模型的安全性能,发现小型专用模型在威胁检测上表现优于大型通用模型,并提供开源数据集支持AI安全研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07972 2026-01-29 cs.LG cs.AI cs.CL 85%

HeuriGym: An Agentic Benchmark for LLM-Crafted Heuristics in Combinatorial Optimization

HeuriGym: 一个用于评估LLM生成启发式算法的代理基准

Hongzheng Chen, Yingheng Wang, Yaohui Cai, Hins Hu, Jiajie Li, Shirley Huang, Chenhui Deng, Rongjian Liang, Shufeng Kong, Haoxing Ren, Samitha Samaranayake, Carla P. Gomes, Zhiru Zhang

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HeuriGym是一个用于评估LLM生成启发式算法的代理基准,通过代码执行反馈和迭代改进,揭示了LLM在组合优化中的局限性。

Comments Accepted to ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20330 2026-01-29 cs.CL cs.LG 84%

PsychePass: Calibrating LLM Therapeutic Competence via Trajectory-Anchored Tournaments

PsychePass:通过轨迹锚定竞赛校准LLM的治疗能力

Zhuang Chen, Dazhen Wan, Zhangkai Zheng, Guanqun Bi, Xiyao Xiao, Binghang Li, Minlie Huang

机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Lingxin AI(灵心AI) South China Normal University(华南师范大学) CoAI Group, DCST, IAI, BNRIST, Tsinghua University(清华人工智能研究院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 PsychePass通过轨迹锚定竞赛校准LLM的治疗能力,利用动态比赛生成稳定评分并提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20299 2026-01-29 cs.LG cs.AI cs.CL cs.GT 83%

Truthfulness Despite Weak Supervision: Evaluating and Training LLMs Using Peer Prediction

在弱监督下保持真实性:利用同伴预测评估和训练大语言模型

Tianyi Alex Qiu, Micah Carroll, Cameron Allen

机构 * Center for Human-Compatible Artificial Intelligence(兼容人类的人工智能中心) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 通过同伴预测方法,利用弱监督提升大语言模型的真实性,有效对抗欺骗并增强评估可靠性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19956 2026-01-29 eess.AS cs.AI cs.SD 83%

VoxPrivacy: A Benchmark for Evaluating Interactional Privacy of Speech Language Models

VoxPrivacy:评估语音语言模型交互隐私的基准

Yuxiang Wang, Hongyu Liu, Dekun Chen, Xueyao Zhang, Zhizheng Wu

专题命中 评测与基准 :language model(title,abstract);SLM(abstract);分类 cs.AI

AI总结 VoxPrivacy是首个评估语音语言模型交互隐私的基准,揭示了多数模型在隐私决策上的薄弱环节,并通过微调提升隐私保护能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13980 2026-01-29 cs.CL 83%

Structure-Aware Decoding Mechanisms for Complex Entity Extraction with Large-Scale Language Models

具有结构意识的解码机制用于大规模语言模型的复杂实体提取

Zhimin Qiu, Di Wu, Feng Liu, Yuxiao Wang

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出一种基于大规模语言模型的结构意识解码方法,用于提升复杂实体提取任务的精度与结构一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19916 2026-01-29 cs.CL 81%

PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review

PaperAudit-Bench: 用于关键自动化同行评审中研究论文错误检测的基准测试

Songjun Tu, Yiwen Ma, Jiahao Lin, Qichao Zhang, Xiangyuan Lan, Junfeng. Li, Nan Xu, Linjing Li, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学) Wenge Technology(文英科技)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 PaperAudit-Bench通过整合结构化错误检测与证据意识的评审生成,提升自动化同行评审的批判性评估能力,并支持轻量级模型训练以实现高效错误检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17087 2026-01-29 cs.HC cs.AI cs.CY cs.LG 81%

Lost in Simulation: LLM-Simulated Users are Unreliable Proxies for Human Users in Agentic Evaluations

陷入模拟:LLM模拟用户在代理评估中是不可靠的人类用户代理

Preethi Seshadri, Samuel Cahyawijaya, Ayomide Odumakinde, Sameer Singh, Seraphina Goldfarb-Tarrant

机构 * UC Irvine(加州大学欧文分校) Cohere(Cohere公司)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究发现LLM模拟用户在代理评估中存在稳健性不足、校准误差和文化差异问题,影响评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20634 2026-01-29 cs.LG 79%

A Foundation Model for Virtual Sensors

虚拟传感器的基础模型

Leon Götz, Lars Frederik Peiss, Erik Sauer, Andreas Udo Sass, Thorsten Bagdonat, Stephan Günnemann, Leo Schwinn

机构 * Volkswagen AG(大众集团) Technical University of Munich(慕尼黑技术大学) Helmholtz AI(海德堡人工智能研究所)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出一种虚拟传感器的基础模型,通过统一框架实现高效预测,减少计算和内存需求,提升可解释性与扩展性。

Comments 18 pages in total, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏