arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-09 至 2026-01-09 共收录 225 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 43 篇

2512.24957 2026-01-09 cs.AI 77%

AMAP Agentic Planning Technical Report

AMAP 代理规划技术报告

AMAP AI Agent Team, Yulan Hu, Xiangwen Zhang, Sheng Ouyang, Hao Yi, Lu Xu, Qinglin Lang, Lide Tan, Xiang Cheng, Tianchen Ye, Zhicong Li, Ge Chen, Wenjin Yang, Zheng Pan, Shaopan Xiong, Siran Yang, Ju Huang, Yan Zhang, Jiamang Wang, Yong Liu, Yinfeng Huang, Ning Wang, Tucheng Lin, Xin Li, Ning Guo

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI

AI总结 STAgent是一种专门用于时空理解的代理大语言模型,通过稳定工具环境、分层数据筛选和级联训练配方,有效解决复杂任务并保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21007 2026-01-09 cs.CL 77%

Can Confidence Estimates Decide When Chain-of-Thought Is Necessary for LLMs?

置信度估计何时决定大语言模型需要链式推理

Samuel Lewis-Lim, Xingwei Tan, Zhixue Zhao, Nikolaos Aletras

机构 * School of Computer Science, University of Sheffield(计算机科学学院,谢菲尔德大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 研究通过置信度门控CoT技术,探讨如何根据置信度估计决定是否需要链式推理,以优化大语言模型的计算资源使用。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04742 2026-01-09 cs.CL 77%

Tool-MAD: A Multi-Agent Debate Framework for Fact Verification with Diverse Tool Augmentation and Adaptive Retrieval

Tool-MAD: 一种用于事实验证的多智能体辩论框架,具有多样化工具增强和自适应检索

Seyeon Jeong, Yeonjun Choi, JongWook Kim, Beakcheol Jang

机构 * Graduate School of Information, Yonsei University(Yonsei大学信息研究生院) Department of Computer Science, Sangmyung University(Sangmyung大学计算机科学系)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Tool-MAD通过多智能体辩论框架结合多样化工具增强和自适应检索,提升事实验证的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04225 2026-01-09 cs.CY cs.AI 77%

Can Consumer Chatbots Reason? A Student-Led Field Experiment Embedded in an "AI-for-All" Undergraduate Course

消费者聊天机器人能推理吗?一个嵌入

Amarda Shehu, Adonyas Ababu, Asma Akbary, Griffin Allen, Aroush Baig, Tereana Battle, Elias Beall, Christopher Byrom, Matt Dean, Kate Demarco, Ethan Douglass, Luis Granados, Layla Hantush, Andy Hay, Eleanor Hay, Caleb Jackson, Jaewon Jang, Carter Jones, Quanyang Li, Adrian Lopez, Logan Massimo, Garrett McMullin, Ariana Mendoza Maldonado, Eman Mirza, Hadiya Muddasar, Sara Nuwayhid, Brandon Pak, Ashley Petty, Dryden Rancourt, Lily Rodriguez, Corbin Rogers, Jacob Schiek, Taeseo Seok, Aarav Sethi, Giovanni Vitela, Winston Williams, Jagan Yetukuri

机构 * George Mason University(乔治·马歇尔大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过学生主导的实地实验,评估了消费者聊天机器人在推理任务中的表现,揭示了其在不同推理类型上的性能差异及教学意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06042 2026-01-09 cs.MA 75%

Agent+P: Guiding UI Agents via Symbolic Planning

Agent+P: 通过符号规划引导UI代理

Shang Ma, Xusheng Xiao, Yanfang Ye

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 AGENT+P通过符号规划引导UI代理,提升UI自动化任务的成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05240 2026-01-09 cs.LG cond-mat.dis-nn cs.AI hep-th 73%

Robust Reasoning as a Symmetry-Protected Topological Phase

鲁棒推理作为对称保护的拓扑相

Ilmo Sung

机构 * Science and Technology Directorate, Department of Homeland Security(国土安全部科学技术管理局)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出鲁棒推理是一种对称保护的拓扑相,通过非阿贝尔规范对称性实现逻辑运算的拓扑不变性,展示了在高噪声环境下保持逻辑一致性的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24556 2026-01-09 cs.CL cs.AI cs.CY 73%

Safe in the Future, Dangerous in the Past: Dissecting Temporal and Linguistic Vulnerabilities in LLMs

未来安全,过去危险:剖析大语言模型中的时间与语言脆弱性

Muhammad Abdullahi Said, Muhammad Sammani Sani

机构 * African Institute for Mathematical Science(非洲数学科学研究所) University of Vienna(维也纳大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究发现大语言模型在不同语言和时间框架下存在显著安全差异,提出不变对齐以提升跨语言和时间的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04210 2026-01-09 cs.CL cs.AI cs.IT math.IT 73%

Complexity Agnostic Recursive Decomposition of Thoughts

无复杂度偏见的思维递归分解

Kaleem Ullah Qasim, Jiashu Zhang, Hafiz Saif Ur Rehman

机构 * Southwest Jiaotong University(西南交通大学) Southwestern University of Finance and Economics(西南财经大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CARD通过预估问题复杂度并递归分解提升多步推理的准确性和效率

Comments 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05073 2026-01-09 cs.LG 70%

Milestones over Outcome: Unlocking Geometric Reasoning with Sub-Goal Verifiable Reward

几何推理的里程碑:通过子目标可验证奖励解锁几何推理

Jianlong Chen, Daocheng Fu, Shengze Xu, Jiawei Chen, Yuan Feng, Yue Yang, Junchi Yan, Hongyuan Zha, Renqiu Xia

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology Beijing(北京科技大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出SGVR框架,通过子目标可验证奖励提升多模态大语言模型在几何推理及泛化能力上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04945 2026-01-09 cs.AI 70%

T-Retriever: Tree-based Hierarchical Retrieval Augmented Generation for Textual Graphs

T-Retriever:基于树的分层检索增强生成用于文本图谱

Chunyu Wei, Huaiyu Qin, Siyuan He, Yunhai Wang, Yueguo Chen

机构 * BRAIN of RUC(北京理工大学脑科学研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 T-Retriever通过语义和结构引导的树状检索方法,改进了图谱检索增强生成,提升复杂查询的连贯性和语境相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04703 2026-01-09 cs.AI 70%

Beyond Monolithic Architectures: A Multi-Agent Search and Knowledge Optimization Framework for Agentic Search

超越单一架构:一种多智能体搜索与知识优化框架用于智能搜索

Yiqun Chen, Lingyong Yan, Zixuan Yang, Erhan Zhang, Jiashu Zhao, Shuaiqiang Wang, Dawei Yin, Jiaxin Mao

机构 * Renmin University of China(中国人民大学) Baidu Inc.(百度公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 M-ASK提出了一种多智能体框架,通过分解智能搜索为搜索行为和知识管理两个角色,提升搜索效率与稳定性,实现更优的答案准确性和训练动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04500 2026-01-09 cs.AI 70%

GUITester: Enabling GUI Agents for Exploratory Defect Discovery

GUITester: 使GUI代理用于探索性缺陷发现

Yifei Gao, Jiang Wu, Xiaoyi Chen, Yifan Yang, Zhe Cui, Tianyi Ma, Jiaming Zhang, Jitao Sang

机构 * Beijing Jiaotong University(北京交通大学) Hithink Research(慧思科技) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GUITester通过解耦导航与验证的多代理框架,有效解决了探索性GUI测试中目标导向遮蔽和执行偏差归因的问题,实现了48.90%的F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03948 2026-01-09 cs.AI q-fin.TR 70%

Trade-R1: Bridging Verifiable Rewards to Stochastic Environments via Process-Level Reasoning Verification

Trade-R1: 通过过程级推理验证弥合可验证奖励与随机环境

Rui Sun, Yifan Sun, Sheng Xu, Li Zhao, Jing Li, Daxin Jiang, Cheng Hua, Zuo Bai

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Trade-R1通过过程级推理验证,将可验证奖励与随机金融环境连接,减少奖励黑客问题,DSR在跨市场泛化中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22836 2026-01-09 cs.AI 70%

Rethinking the Text-Vision Reasoning Imbalance in MLLMs through the Lens of Training Recipes

通过训练食谱的视角重新思考MLLMs中的文本-视觉推理不平衡

Guanyu Yao, Qiucheng Wu, Yang Zhang, Zhaowen Wang, Handong Zhao, Shiyu Chang

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) MIT-IBM Watson AI Lab(麻省理工-IBM Watson人工智能实验室) Adobe Research(Adobe研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过分析训练食谱,提出减少多模态大语言模型中文本与视觉推理不平衡的方法,旨在提升视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03905 2026-01-09 cs.AI cs.CL cs.LG 67%

Current Agents Fail to Leverage World Model as Tool for Foresight

当前智能体无法利用世界模型作为前瞻性工具

Cheng Qian, Emre Can Acikgoz, Bingxuan Li, Xiusi Chen, Yuji Zhang, Bingxiang He, Qinyu Luo, Dilek Hakkani-Tür, Gokhan Tur, Yunzhu Li, Heng Ji

机构 * UIUC(伊利诺伊大学香槟分校) THU(清华大学) JHU(约翰霍普金斯大学) Columbia(哥伦比亚大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了当前智能体能否利用世界模型作为工具提升前瞻性认知,发现其在模拟调用和结果整合方面存在显著不足。

Comments 36 Pages, 13 Figures, 17 Tables (Meta data updated)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04577 2026-01-09 cs.AI cs.LG 62%

Sci-Reasoning: A Dataset Decoding AI Innovation Patterns

Sci-Reasoning:一个解码AI创新模式的数据集

Jiachen Liu, Maestro Harmon, Zechen Zhang

机构 * Orchestra Research(Orchestra研究)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 Sci-Reasoning数据集通过分析AI研究中的15种思维模式,揭示了高影响力论文的创新机制,为训练下一代AI研究代理提供结构化推理轨迹。

Comments 22 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 48 篇

2510.17652 2026-01-09 cs.CL 91%

Qomhra: A Bilingual Irish and English Large Language Model

Qomhra: 一种双语爱尔兰语和英语大语言模型

Joseph McInerney, Khanh-Tung Tran, Liam Lonergan, Ailbhe Ní Chasaide, Neasa Ní Chiaráin, Barry Devereux

机构 * Trinity College Dublin(三一学院) University College Cork(科克大学) Queen’s University Belfast(贝尔法斯特女王大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

AI总结 Qomhra是一种双语爱尔兰语和英语大语言模型,通过低资源约束下的方法生成人类偏好数据,显著提升了爱尔兰语和英语的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04202 2026-01-09 cs.CL cs.AI cs.LG 90%

TeleTables: A Benchmark for Large Language Models in Telecom Table Interpretation

TeleTables: 电信表格解释中的大语言模型基准

Anas Ezzakri, Nicola Piovesan, Mohamed Sana, Antonio De Domenico, Fadhel Ayed, Haozhe Zhang

机构 * Paris Research Center, Huawei Technologies(巴黎研究中心,华为技术)

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract);pretraining(abstract)

AI总结 TeleTables 是一个用于评估大语言模型在电信表格解释能力的基准,揭示了在电信标准上进行领域微调的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04534 2026-01-09 cs.CL cs.AI 90%

BanglaLorica: Design and Evaluation of a Robust Watermarking Algorithm for Large Language Models in Bangla Text Generation

BanglaLorica: 大型语言模型在孟加拉语文本生成中的鲁棒水印算法设计与评估

Amit Bin Tariqul, A N M Zahid Hossain Milkan, Sahab-Al-Chowdhury, Syed Rifat Raiyan, Hasan Mahmud, Md Kamrul Hasan

机构 * Systems and Software Lab (SSL) Department of Computer Science and Engineering(系统与软件实验室(SSL)计算机科学与工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出分层水印策略,提升孟加拉语LLM在RTT攻击下的检测精度,实现3-4倍的相对提升。

Comments Under review, 12 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04895 2026-01-09 cs.AI 89%

DVD: A Robust Method for Detecting Variant Contamination in Large Language Model Evaluation

DVD:一种检测大规模语言模型评估中变体污染的稳健方法

Renzhao Liang, Jingru Chen, Bo Jia, Bo Deng, Chenggang Xie, Yidong Wang, Ke Jin, Xin Wang, Linfeng Zhang, Cunxiang Wang

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 DVD通过分析生成分布的方差检测大规模语言模型评估中的变体污染,优于多种现有检测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16036 2026-01-09 cs.CL 89%

OpenEthics: A Comprehensive Ethical Evaluation of Open-Source Generative Large Language Models

OpenEthics: 对开源生成大语言模型的全面伦理评估

Yıldırım Özen, Burak Erinç Çetin, Kaan Engür, Elif Naz Demiryılmaz, Cagri Toraman

机构 * Middle East Technical University(中东技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究对29个开源生成大语言模型进行全面伦理评估,评估鲁棒性、可靠性、安全性和公平性,发现较大模型在伦理表现上更优,禁言模板对多数模型无效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16070 2026-01-09 cs.SE 89%

LLM4Perf: Large Language Models Are Effective Samplers for Multi-Objective Performance Modeling

LLM4Perf: 大语言模型在多目标性能建模中的有效性

Xin Wang, Zhenhao Li, Zishuo Ding

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 LLM4Perf通过大语言模型实现多目标性能建模,展现了其在配置空间修剪和反馈优化方面的有效性,提升了性能建模的准确性。

Comments ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04540 2026-01-09 cs.SE cs.AI 88%

AdaptEval: A Benchmark for Evaluating Large Language Models on Code Snippet Adaptation

AdaptEval: 一个用于评估大型语言模型在代码片段适应上的基准

Tanghaoran Zhang, Xinjun Mao, Shangwen Wang, Yuxin Zhao, Yao Lu, Jin Zhang, Zhang Zhang, Kang Yang, Yue Yu

机构 * College of Computer Science and Technology(计算机科学与技术学院) National University of Defense and Technology(国防科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 AdaptEval是一个用于评估大型语言模型在代码片段适应能力的基准,通过多粒度标注和细粒度测试框架,首次实证研究了六种LLMs在代码适应任务上的表现。

Comments 13 pages, 7 figures, Accepted by ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06346 2026-01-09 cs.AI cs.CL 86%

LPFQA: A Long-Tail Professional Forum-based Benchmark for LLM Evaluation

LPFQA: 一个基于长尾专业论坛的LLM评估基准

Liya Zhu, Peizhuang Cong, Jingzhe Ding, Aowei Ji, Wenya Wu, Jiani Hou, Chunjie Wu, Xiang Gao, Jingkai Liu, Zhou Huan, Xuelei Sun, Yang Yang, Jianpeng Jiao, Liang Hu, Xinjie Chen, Jiashuo Liu, Tong Yang, Zaiyuan Wang, Ge Zhang, Wenhao Huang

机构 * ByteDance Seed Peking University(字节跳动种子北京大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LPFQA是一个基于真实专业论坛的长尾知识基准,用于评估LLM在专业领域推理和领域术语理解方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05022 2026-01-09 cs.CR 85%

Knowledge-to-Data: LLM-Driven Synthesis of Structured Network Traffic for Testbed-Free IDS Evaluation

知识到数据:基于大语言模型的结构化网络流量合成用于无测试床IDS评估

Konstantinos E. Kampourakis, Vyron Kampourakis, Efstratios Chatzoglou, Georgios Kambourakis, Stefanos Gritzalis

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出利用大语言模型生成结构化网络流量数据集,以实现无测试床的IDS评估,通过显式约束提升数据真实性,使分类器在真实样本上的F1分数达到0.956。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24307 2026-01-09 cs.HC 85%

Exploring Similarity between Neural and LLM Trajectories in Language Processing

探索神经与大语言模型在语言处理中的相似性

Xin Xiao, Kaiwen Wei, Jiang Zhong, Xuekai Wei, Mingliang Zhou

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究通过比较LLMs与人类大脑在语言处理中的轨迹相似性,揭示了语义整合机制和实时处理动态的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13655 2026-01-09 cs.CL cs.SE 83%

Comparative Analysis of LLM Abliteration Methods: A Cross-Architecture Evaluation

大语言模型擦除方法的比较分析:跨架构评估

Richard J. Young

机构 * University of Nevada Las Vegas(内华达大学拉斯维加斯分校)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究比较了四种擦除工具在不同模型架构上的效果,发现数学推理能力对擦除干预最敏感,且单次通过方法在保持能力方面表现更优。

Comments 25 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17542 2026-01-09 cs.SE 82%

AssertFlip: Reproducing Bugs via Inversion of LLM-Generated Passing Tests

AssertFlip: 通过翻转LLM生成的通过测试来复现错误

Lara Khatib, Noble Saji Mathews, Meiyappan Nagappan

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 AssertFlip通过翻转LLM生成的通过测试来复现错误,有效提升错误复现效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04455 2026-01-09 cs.IR cs.AI cs.CL cs.LG 80%

Re-Rankers as Relevance Judges

重排序器作为相关性判断者

Chuan Meng, Jiqun Liu, Mohammad Aliannejadi, Fengran Mo, Jeff Dalton, Maarten de Rijke

机构 * The University of Edinburgh(爱丁堡大学) University of Oklahoma(俄克拉荷马大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出将重排序器作为相关性判断者的方法,通过两种适应策略在重排序任务中实现优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05114 2026-01-09 cs.AI 79%

Evaluative Fingerprints: Stable and Systematic Differences in LLM Evaluator Behavior

评估指纹:大语言模型评估器行为的稳定性和系统性差异

Wajid Nasser

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 大语言模型评估器行为存在稳定且系统性的差异,其分歧模式可作为指纹,揭示不同模型对质量的隐含理论。

Comments 23 pages, 6 figures, code and artifacts at : https://github.com/wajid-nasser/evaluative-fingerprints

详情

展开后加载摘要…

URL PDF HTML 收藏