arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-08 至 2026-01-08 共收录 218 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 44 篇

2601.03164 2026-01-08 cs.CL 77%

WebAnchor: Anchoring Agent Planning to Stabilize Long-Horizon Web Reasoning

WebAnchor: 通过锚定代理规划稳定长周期网络推理

Xinmiao Yu, Liwen Zhang, Xiaocheng Feng, Yong Jiang, Bing Qin, Pengjun Xie, Jingren Zhou

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 WebAnchor通过两阶段强化学习框架,解决长周期网络推理中规划不稳定的问题,提升任务成功率和工具效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00340 2026-01-08 cs.AI 77%

Better Call CLAUSE: A Discrepancy Benchmark for Auditing LLMs Legal Reasoning Capabilities

更好的CLAUSE:用于审计LLM法律推理能力的差异基准

Manan Roy Choudhury, Adithya Chandramouli, Mannan Anand, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CLAUSE是一个用于评估LLM法律推理能力的基准,通过生成现实扰动合同检测细微法律错误,揭示LLM在识别和解释法律缺陷方面的不足。

Comments 42 pages, 4 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27251 2026-01-08 cs.MA 76%

FinPos: A Position-Aware Trading Agent System for Real Financial Markets

FinPos:一种面向真实金融市场的位置感知交易代理系统

Bijia Liu, Ronghao Dang

专题命中 推理与问题求解 :LLM(abstract,comments);large language model(abstract);language model(abstract)

AI总结 FinPos提出了一种位置感知的交易代理系统,通过专业信息解读、双代理决策结构和多时间尺度奖励信号,提升对连续仓位的管理能力,实验证明其在真实市场条件下的优越性。

Comments LLM Applications, LLM Agents, Financial Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03878 2026-01-08 cs.SE 75%

Understanding Specification-Driven Code Generation with LLMs: An Empirical Study Design

通过LLM理解基于规范的代码生成:一项实证研究设计

Giovanni Rosa, David Moreno-Lumbreras, Gregorio Robles, Jesús M. González-Barahona

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文通过实证研究设计,探讨人类干预在基于规范的LLM代码生成过程中对代码质量和动态的影响。

Comments This paper is a Stage 1 Registered Report. The study protocol and analysis plan were peer reviewed and accepted at SANER 2026 with a Continuity Acceptance (CA) score for Stage 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03768 2026-01-08 cs.PL 75%

Agentic Proof Automation: A Case Study

代理证明自动化:一个案例研究

Yichen Xu, Martin Odersky

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出代理证明自动化方案,利用LLM代理高效完成证明工程任务,通过案例研究展示其在形式化系统中的应用与成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03398 2026-01-08 cs.RO 75%

Towards Zero-Knowledge Task Planning via a Language-based Approach

通过语言方法实现零知识任务规划

Liam Merz Hoffmeister, Brian Scassellati, Daniel Rakita

机构 * Department of Computer Science, Yale University(计算机科学系,耶鲁大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出利用大型语言模型实现零知识任务规划,通过分解自然语言指令生成行为树并实时调整,提升任务执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08930 2026-01-08 cs.GR 75%

How Does a Virtual Agent Decide Where to Look? Symbolic Cognitive Reasoning for Embodied Head Rotation

虚拟代理如何决定看向何处?基于具身头部旋转的符号认知推理

Juyeong Hwang, Seong-Eun Hong, JaeYoung Seon, Hyeongyeop Kang

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出SCORE框架,通过符号认知推理实现具身头部旋转,结合视觉-语言模型和大语言模型,使虚拟代理能合理预测头部运动及背后动机。

Comments 13 pages, 8 figures. Accepted to SIGGRAPH Asia Conference Papers '25

Journal ref SIGGRAPH Asia Conference Papers '25, December 15-18, 2025, Hongkong

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03537 2026-01-08 cs.AI cs.CL 73%

STAR-S: Improving Safety Alignment through Self-Taught Reasoning on Safety Rules

通过安全规则的自教推理提升安全性

Di Wu, Yanyan Zhao, Xin Lu, Mingzhe Li, Bing Qin

机构 * Research Center for Social Computing and Information Retrieval(社会计算与信息检索研究中心) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 STAR-S通过自教推理提升大型语言模型的安全性,有效防御对抗攻击。

Comments 19 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00088 2026-01-08 cs.RO cs.AI cs.LG 73%

Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail

Alpamayo-R1: 联结推理与动作预测以实现通用的自动驾驶在长尾场景

NVIDIA, :, Yan Wang, Wenjie Luo, Junjie Bai, Yulong Cao, Tong Che, Ke Chen, Yuxiao Chen, Jenna Diamond, Yifan Ding, Wenhao Ding, Liang Feng, Greg Heinrich, Jack Huang, Peter Karkus, Boyi Li, Pinyi Li, Tsung-Yi Lin, Dongran Liu, Ming-Yu Liu, Langechuan Liu, Zhijian Liu, Jason Lu, Yunxiang Mao, Pavlo Molchanov, Lindsey Pavao, Zhenghao Peng, Mike Ranzinger, Ed Schmerling, Shida Shen, Yunfei Shi, Sarah Tariq, Ran Tian, Tilman Wekel, Xinshuo Weng, Tianjun Xiao, Eric Yang, Xiaodong Yang, Yurong You, Xiaohui Zeng, Wenyuan Zhang, Boris Ivanovic, Marco Pavone

机构 * NVIDIA

专题命中 推理与问题求解 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 Alpamayo-R1通过整合因果推理与轨迹规划,提升了自动驾驶在长尾场景中的规划准确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04086 2026-01-08 cs.CL 70%

KDCM: Reducing Hallucination in LLMs through Explicit Reasoning Structures

KDCM:通过显式推理结构减少大语言模型中的幻觉

Jinbo Hao, Kai Yang, Qingzhen Su, Yifan Li, Chao Jiang

机构 * School of Computer Engineering, Jiangsu Ocean University(江苏海洋大学计算机工程学院) School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 KDCM通过显式推理结构减少大语言模型中的幻觉,提升预测可靠性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03823 2026-01-08 cs.CL 70%

Step Potential Advantage Estimation: Harnessing Intermediate Confidence and Correctness for Efficient Mathematical Reasoning

阶梯势能优势估计:利用中间置信度和正确性以实现高效的数学推理

Fei Wu, Zhenrong Zhang, Qikai Chang, Jianshu Zhang, Quan Liu, Jun Du

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(iFLYTEK研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出阶梯势能优势估计(SPAE)方法,通过提取中间置信度和正确性,实现高效数学推理的细粒度信用分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03822 2026-01-08 cs.AI 70%

ROI-Reasoning: Rational Optimization for Inference via Pre-Computation Meta-Cognition

ROI-Reasoning: 为推理的理性优化 via 预计算元认知

Muyang Zhao, Qi Qi, Hao Sun

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ROI-Reasoning通过预计算元认知,为LLMs提供预算感知的理性优化,提升推理性能并减少计算资源浪费。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11830 2026-01-08 cs.CV cs.AI 70%

VISTA: Mitigating Semantic Inertia in Video-LLMs via Training-Free Dynamic Chain-of-Thought Routing

VISTA: 通过无训练动态推理路由缓解视频大语言模型中的语义惯性

Hongbo Jin, Jiayu Ding, Siyi Xie, Guibo Luo, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 VISTA通过动态推理路由和潜在推理共识机制,缓解视频大语言模型中的语义惯性问题,提升视频理解性能。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03723 2026-01-08 cs.LG 70%

ETR: Outcome-Guided Elastic Trust Regions for Policy Optimization

ETR: 以结果为导向的弹性信任区域用于策略优化

Shijie Zhang, Kevin Zhang, Zheyuan Gu, Xiang Guo, Rujun Guo, Shaoyu Liu, Guanjun Jiang, Xiaozhao Wang

机构 * Alibaba Group(阿里巴巴集团) Peking University(北京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 ETR通过动态信任区域机制,提升策略优化的信号利用效率和探索稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03717 2026-01-08 cs.CL 70%

MIND: From Passive Mimicry to Active Reasoning through Capability-Aware Multi-Perspective CoT Distillation

MIND:通过能力感知的多视角CoT蒸馏从被动模仿到主动推理

Jin Cui, Jiaqi Guo, Jiepeng Zhou, Ruixuan Yang, Jiayi Lu, Jiajun Xu, Jiangcheng Song, Boran Zhao, Pengju Ren

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, National Engineering Research Center for Visual Information and Applications, and Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人机混合增强智能国家重点实验室、视觉信息与应用国家工程研究中心、人工智能与机器人研究所) Nankai University(南开大学) The Hong Kong University of Science and Technology(Guangzhou)(香港科技大学(广州)) School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MIND通过能力感知的多视角CoT蒸馏,从被动模仿转向主动推理,提升模型在分布内和分布外任务中的性能。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03550 2026-01-08 cs.AI 70%

ReEfBench: Quantifying the Reasoning Efficiency of LLMs

ReEfBench: 量化大语言模型的推理效率

Zhizhang Fu, Yuancheng Gu, Chenkai Hu, Hanmeng Liu, Yue Zhang

机构 * Westlake University(西湖大学) Imperial College London(帝国理工学院) New York University(纽约大学) Hainan University(海南大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ReEfBench通过神经符号框架量化LLM推理效率,揭示推理性能提升源于真实推理而非冗长性,并指出训练中混合长短CoT数据的风险及蒸馏模型的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22351 2026-01-08 cs.CV cs.AI 70%

VULCAN: Tool-Augmented Multi Agents for Iterative 3D Object Arrangement

VULCAN:工具增强的多智能体用于迭代3D物体排列

Zhengfei Kuang, Rui Lin, Long Zhao, Gordon Wetzstein, Saining Xie, Sanghyun Woo

机构 * Stanford University(斯坦福大学) Google(谷歌) New York University(纽约大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 VULCAN通过引入MCP API、视觉工具和多智能体框架,提升了3D物体排列任务中MLLMs的视觉接地能力与迭代处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07198 2026-01-08 cs.CV cs.CL 70%

Generating Storytelling Images with Rich Chains-of-Reasoning

通过丰富的推理链生成叙事图像

Xiujie Song, Qi Jia, Shota Watanabe, Xiaoyi Pang, Ruijie Chen, Mengyue Wu, Kenny Q. Zhu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, China(X-LANCE实验室,计算机科学学院,上海交通大学,中国) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室,中国) East China University of Technology, China(东华大学,中国) University of Texas at Arlington, USA(德克萨斯大学阿灵顿分校,美国)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出StorytellingPainter,通过结合大语言模型推理与文本到图像合成,生成具有丰富推理链的叙事图像,并引入评估框架和轻量级模型以提升生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17306 2026-01-08 cs.CV 67%

Deep But Reliable: Advancing Multi-turn Reasoning for Thinking with Images

深度但可靠:提升图像思考的多轮推理

Wenhao Yang, Yu Xia, Jinlong Huang, Shiyin Lu, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Yuanyu Wan, Lijun Zhang

专题命中 推理与问题求解 :language model(abstract);SFT(abstract)

AI总结 DRIM通过多阶段流程提升图像思考的多轮推理能力,通过冗余惩罚策略优化实现自我反思的推理模式,从而在视觉理解任务中取得优越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03940 2026-01-08 cs.CL cs.AI 62%

Large-Scale Aspect-Based Sentiment Analysis with Reasoning-Infused LLMs

基于推理注入的大型方面基于情感分析

Paweł Liskowski, Krzysztof Jankowski

机构 * Snowflake Inc.(Snowflake公司)

专题命中 推理与问题求解 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 Arctic-ABSA通过引入推理注入技术,提升了大型多语言方面情感分析模型的准确性和泛化能力,实现了在多个领域和语言上的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04056 2026-01-08 cs.CL 57%

Bridging the Discrete-Continuous Gap: Unified Multimodal Generation via Coupled Manifold Discrete Absorbing Diffusion

弥合离散-连续鸿沟:通过耦合流形离散吸收扩散实现统一多模态生成

Yuanfeng Xu, Yuhao Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Lab of Big Data Analysis & Processing(广东省大数据分析与处理重点实验室) X-Era AI Lab(X-Era AI实验室)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 CoM-DAD通过耦合流形离散吸收扩散框架,实现离散与连续数据的统一多模态生成,解决多模态对齐与训练稳定性问题。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03914 2026-01-08 cs.CL 57%

When Models Decide and When They Bind: A Two-Stage Computation for Multiple-Choice Question-Answering

当模型决策时与当它们绑定时:多选题问答的两阶段计算

Hugh Mee Wong, Rick Nouwen, Albert Gatt

机构 * Utrecht University(乌特勒支大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 本文研究了多选题问答中模型如何通过两阶段机制先在内容空间选择胜者,再绑定到输出符号。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08525 2026-01-08 cs.CL 57%

Investigating CoT Monitorability in Large Reasoning Models

探究大型推理模型中的CoT可监控性

Shu Yang, Junchao Wu, Xilin Gong, Xuansheng Wu, Derek Wong, Ninghao Liu, Di Wang

机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证明负责任的人工智能与数据分析师实验室) King Abdullah University of Science and Technology(卡布斯大学) University of Georgia(佐治亚大学) University of Macau(澳门大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

AI总结 本文探讨了大型推理模型中CoT可监控性的挑战与潜力,提出MoME范式以通过CoT监控其他模型的误行并提供结构化判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10390 2026-01-08 cs.CL cs.CR 57%

Jailbreaking Commercial Black-Box LLMs with Explicitly Harmful Prompts

通过显式有害提示对商用黑盒大语言模型进行劫持

Chiyu Zhang, Lu Zhou, Xiaogang Xu, Jiafei Wu, Liming Fang, Zhe Liu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang Lab(浙江实验室)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

AI总结 本文提出DH-CoT攻击方法,通过整合多种劫持技巧和恶意内容检测框架,有效劫持了包括GPT-5和Claude-4在内的商用大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03649 2026-01-08 cs.CL 57%

SyncThink: A Training-Free Strategy to Align Inference Termination with Reasoning Saturation

SyncThink: 一种无需训练的策略,用于将推理饱和与推理终止对齐

Gengyang Li, Wang Cai, Yifeng Gao, Yunfang Wu

机构 * National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家级重点实验室) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Computer Science, Peking University(北京大学计算机科学学院)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL

AI总结 SyncThink是一种无需训练的解码方法,通过监控模型自身的推理过渡信号来终止推理,从而减少CoT的开销并提高推理效率。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03400 2026-01-08 cs.CV cs.AI 57%

Eye-Q: A Multilingual Benchmark for Visual Word Puzzle Solving and Image-to-Phrase Reasoning

Eye-Q:一个多语言视觉词谜解决和图像到短语推理的基准

Ali Najar, Alireza Mirrokni, Arshia Izadyari, Sadegh Mohammadian, Amir Homayoon Sharifizade, Asal Meskin, Mobin Bagherian, Ehsaneddin Asgari

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 Eye-Q提出一个多语言视觉词谜基准,评估模型在复杂视觉推理中的能力,发现现有模型在抽象和跨语言推理上存在显著差距。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03298 2026-01-08 cs.LO cs.AI cs.SC 57%

130k Lines of Formal Topology in Two Weeks: Simple and Cheap Autoformalization for Everyone?

130k条形式拓扑在两周内:为每个人提供的简单且便宜的自动形式化

Josef Urban

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 该项目通过简单且低成本的方法,在两周内用LLM和证明检查器实现了大量拓扑学形式化,展示了自动形式化的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13683 2026-01-08 cs.CV 50%

I-Scene: 3D Instance Models are Implicit Generalizable Spatial Learners

I-Scene: 3D实例模型是隐式可泛化的空间学习者

Lu Ling, Yunhao Ge, Yichen Sheng, Aniket Bera

机构 * Purdue University(普渡大学) NVIDIA Research(英伟达研究)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 I-Scene提出了一种基于3D实例模型的隐式空间学习方法,通过重新编程生成器实现跨场景的泛化能力,展示了其在空间推理和生成中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 60 篇

2601.03265 2026-01-08 cs.CL cs.CR cs.LG 90%

Jailbreak-Zero: A Path to Pareto Optimal Red Teaming for Large Language Models

Jailbreak-Zero:大型语言模型安全评估的帕累托最优渗透测试路径

Kai Hu, Abhinav Aggarwal, Mehran Khodabandeh, David Zhang, Eric Hsin, Li Chen, Ankit Jain, Matt Fredrikson, Akash Bharadwaj

机构 * Meta Superintelligence Labs(Meta超智能实验室) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 Jailbreak-Zero通过生成多样化对抗性提示并微调攻击模型,实现了LLM安全评估的帕累托最优,提高了攻击成功率并减少了人工干预需求。

Comments Socially Responsible and Trustworthy Foundation Models at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04034 2026-01-08 cs.CR cs.AI 89%

HoneyTrap: Deceiving Large Language Model Attackers to Honeypot Traps with Resilient Multi-Agent Defense

HoneyTrap: 通过坚韧的多智能体防御欺骗大语言模型攻击者以诱捕陷阱

Siyuan Li, Xi Lin, Jun Wu, Zehao Liu, Haoyu Li, Tianjie Ju, Xiang Chen, Jianhua Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 HoneyTrap通过多智能体协作防御机制,有效降低大语言模型劫持攻击的成功率,提升防御效率与资源消耗效果。

详情

展开后加载摘要…

URL PDF HTML 收藏