arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-12 至 2026-01-12 共收录 38 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 38 篇

2601.05632 2026-01-12 eess.SY cs.SY 91%

LLM-DMD: Large Language Model-based Power System Dynamic Model Discovery

基于大语言模型的电力系统动态模型发现:LLM-DMD

Chao Shen, Zihan Guo, Ke Zuo, Wenqi Huang, Mingyang Sun

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 LLM-DMD通过结合大语言模型的推理和代码生成能力,利用两个循环发现电力系统动态方程并强制代数约束,从而实现高保真动态模型的构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05445 2026-01-12 cs.CR cs.LG 89%

Knowledge-Driven Multi-Turn Jailbreaking on Large Language Models

基于知识的多轮对抗攻击大语言模型

Songze Li, Ruishi He, Xiaojun Jia, Jun Wang, Zhihui Fu

机构 * Southeast University(东南大学) Nanyang Technological University(南洋理工大学) OPPO Research Institute(OPPO研究院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 Mastermind通过动态知识库和分层规划架构,实现对大语言模型的高效多轮对抗攻击,显著提升攻击效果和防御韧性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09896 2026-01-12 cs.CR 89%

ChatIoT: Large Language Model-based Security Assistant for Internet of Things with Retrieval-Augmented Generation

ChatIoT: 基于大语言模型的物联网安全助手与检索增强生成

Ye Dong, Yan Lin Aung, Sudipta Chattopadhyay, Jianying Zhou

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 ChatIoT是一种基于大语言模型的物联网安全助手,通过检索增强生成技术整合安全信息,提升用户在物联网安全实践中的指导与响应能力。

Comments preprint, under revision, 19 pages, 13 figures, 8 tables

Journal ref ACNS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08098 2026-01-12 cs.CL cs.AI 88%

The Price of Thought: A Multilingual Analysis of Reasoning, Performance, and Cost of Negotiation in Large Language Models

思考的成本:多语言下大型语言模型谈判能力、表现与成本的分析

Sherzod Hakimov, Roland Bernard, Tim Leiber, Karl Osswald, Kristina Richert, Ruilin Yang, Raffaella Bernardi, David Schlangen

机构 * Computational Linguistics, Department of Linguistics University of Potsdam(波恩-博兹恩大学语言学系) German Research Center for Artificial Intelligence (DFKI), Berlin(德国人工智能研究中心(DFKI)) Free University of Bozen-Bolzano(博兹恩-博尔扎诺自由大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究分析了多语言环境下大型语言模型谈判能力的表现与成本,发现启用推理能提升谈判效果但增加计算成本,且开源模型在多语言谈判中倾向于使用英语推理。

Comments Accepted at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09993 2026-01-12 cs.AI 86%

SPAN: Benchmarking and Improving Cross-Calendar Temporal Reasoning of Large Language Models

SPAN:大型语言模型跨日历时间推理的基准测试与改进

Zhongjian Miao, Hao Fu, Chen Wei

机构 * Li Auto(利亚特)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.AI

AI总结 SPAN通过开发时间代理提升大型语言模型跨日历时间推理能力,实验显示其准确率高达95.31%

Comments Accepted at the AAAI 2026 conference. This version includes the supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05616 2026-01-12 cs.LG 85%

Dual-Phase LLM Reasoning: Self-Evolved Mathematical Frameworks

双阶段LLM推理:自演化数学框架

ShaoZhen Liu, Xinting Huang, Houwen Peng, Xin Chen, Xinyang Song, Qi Li, Zhenan Sun

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出双阶段训练框架,通过自动生成的长链式思考数据增强模型自我纠正能力,提升数学问题解决性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05172 2026-01-12 cs.CV cs.AI 85%

CoV: Chain-of-View Prompting for Spatial Reasoning

CoV:基于视角链的立体推理

Haoyu Zhao, Akide Liu, Zeyu Zhang, Weijie Wang, Feng Chen, Ruihan Zhu, Gholamreza Haffari, Bohan Zhuang

机构 * ZIP Lab, Zhejiang University(浙江大学ZIP实验室) Monash University(墨尔本大学) AIML, Adelaide University(阿德莱德大学AIML)

专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);language model(abstract);分类 cs.AI

AI总结 CoV通过链式视角提示方法提升3D具身问答中的空间推理能力,无需额外训练。

Comments Code link https://github.com/ziplab/CoV

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05606 2026-01-12 cs.MA 85%

Conformity Dynamics in LLM Multi-Agent Systems: The Roles of Topology and Self-Social Weighting

LLM多智能体系统中的从众动力学:拓扑结构与自我-社会权重的作用

Chen Han, Jin Tan, Bohan Yu, Wenzhen Zheng, Xijin Tang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了LLM多智能体系统中网络拓扑和自我-社会权重对集体决策效率、鲁棒性及失败模式的影响。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05539 2026-01-12 cs.SE 85%

LIDL: LLM Integration Defect Localization via Knowledge Graph-Enhanced Multi-Agent Analysis

LIDL: 通过知识图谱增强的多智能体分析进行LLM集成缺陷定位

Gou Tan, Zilong He, Min Li, Pengfei Chen, Jieke Shi, Zhensu Sun, Ting Zhang, Danwen Chen, Lwin Khin Shar, Chuanfu Zhang, David Lo

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 LIDL通过知识图谱增强的多智能体分析,有效定位LLM集成软件中的缺陷,提升准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05705 2026-01-12 cs.AI cs.CL cs.LO 84%

Logic-Parametric Neuro-Symbolic NLI: Controlling Logical Formalisms for Verifiable LLM Reasoning

逻辑参数化神经符号推理:通过可控逻辑形式实现可验证的大语言模型推理

Ali Farjami, Luca Redondi, Marco Valentino

机构 * University of Luxemburg(卢森堡大学) University of Sheffield(谢菲尔德大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出逻辑参数化框架,通过可控逻辑形式提升神经符号推理的鲁棒性与适应性,实验表明内部逻辑策略在不同领域具有更优表现。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05336 2026-01-12 cs.RO 83%

Intent at a Glance: Gaze-Guided Robotic Manipulation via Foundation Models

意图一目了然:通过基础模型实现的注视引导的机器人操作

Tracey Yee Hsin Tay, Xu Yan, Jonathan Ouyang, Daniel Wu, William Jiang, Jonathan Kao, Yuchen Cui

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理与问题求解 :foundation model(title,abstract);language model(abstract)

AI总结 GAMMA通过结合基础模型和注视技术,实现无需特定任务训练的机器人操作自主控制,提升人机交互的直观性和可扩展性。

Comments Accepted to 2025 RSS Robot Planning in the Era of Foundation Models (FM4RoboPlan) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06931 2026-01-12 cs.RO 82%

Non-Prehensile Tool-Object Manipulation by Integrating LLM-Based Planning and Manoeuvrability-Driven Controls

通过整合基于大语言模型的规划和机动性驱动的控制实现非抓取工具-物体 manipulation

Hoi-Yin Lee, Peng Zhou, Anqing Duan, Wanyu Ma, Chenguang Yang, David Navarro-Alarcon

机构 * organization= Department of Mechanical Engineering, The Hong Kong Polytechnic University , addressline= KLN, Hong Kong organization= School of Advanced Engineering, The Great Bay University , addressline= Dongguan, China organization= Department of Robotics, Mohamed Bin Zayed University of Artificial Intelligence , addressline= Abu Dhabi, UAE organization= Department of Surgery, The Chinese University of Hong Kong , addressline= NT, Hong Kong organization= Department of Computer Science, University of Liverpool , addressline= Liverpool, UK

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出了一种结合大语言模型和机动性驱动控制的方法,用于实现非抓取工具-物体 manipulation任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16769 2026-01-12 cs.AI cs.CL 81%

See or Say Graphs: Agent-Driven Scalable Graph Structure Understanding with Vision-Language Models

见或说图:基于视觉语言模型的 agent 驱动可扩展图结构理解

Shuo Han, Yukun Cao, Zezhong Ding, Zengyi Gao, S Kevin Zhou, Xike Xie

机构 * University of Science and Technology of China(中国科学技术大学) Data Darkness Lab, MIRACLE Center, USTC(数据黑暗实验室,MIRACLE中心,USTC) MIRACLE Center, Suzhou Institute for Advance Research, USTC(MIRACLE中心,苏州先进研究所,USTC)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 GraphVista 是一种基于视觉语言模型的 agent 驱动框架,通过分层图检索和模态协调机制,实现大规模图结构理解的可扩展性和性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05870 2026-01-12 cs.LG cs.AI 79%

IIB-LPO: Latent Policy Optimization via Iterative Information Bottleneck

IIB-LPO: 通过迭代信息瓶颈进行潜在策略优化

Huilin Deng, Hongchen Luo, Yue Zhu, Long Li, Zhuoyue Chen, Xinghao Zhao, Ming Li, Jihai Zhang, Mengchang Wang, Yang Cao, Yu Kang

机构 * DeepSeek-AI

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 IIB-LPO通过迭代信息瓶颈方法,解决LLM推理中的探索崩溃问题,实现更多样化的推理路径和更高的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05600 2026-01-12 cs.CV cs.CL cs.LG 79%

SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes

SceneAlign: 在复杂视觉场景中将多模态推理对齐到场景图

Chuhan Wang, Xintong Li, Jennifer Yuntong Zhang, Junda Wu, Chengkai Huang, Lina Yao, Julian McAuley, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) University of Toronto(多伦多大学) University of New South Wales(新南威尔士大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 SceneAlign通过利用场景图进行结构干预,提升多模态推理在复杂视觉场景中的准确性和忠实性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05455 2026-01-12 cs.AI cs.LG 79%

ART: Adaptive Reasoning Trees for Explainable Claim Verification

ART:可解释性声明验证的自适应推理树

Sahil Wadhwa, Himanshu Kumar, Guanqun Yang, Abbaas Alif Mohamed Nishar, Pranab Mohanty, Swapnil Shinde, Yue Wu

机构 * Capital One Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 ART通过自适应推理树提升声明验证的可解释性和可靠性,通过分层论证结构和法官LLM裁决实现透明且可挑战的决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05256 2026-01-12 cs.AI cs.CL cs.CV cs.IR 79%

Naiad: Novel Agentic Intelligent Autonomous System for Inland Water Monitoring

Naiad:一种新型智能自主系统用于内陆水体监测

Eirini Baltzi, Tilemachos Moumouris, Athena Psalta, Vasileios Tsironis, Konstantinos Karantzalos

机构 * National Technical University of Athens(希腊国家技术大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Naiad是一种基于大语言模型和外部工具的智能系统,用于通过地球观测数据实现内陆水体的全面监测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05520 2026-01-12 cs.CL 77%

CHisAgent: A Multi-Agent Framework for Event Taxonomy Construction in Ancient Chinese Cultural Systems

CHisAgent:一种用于古代中国文化系统事件分类的多智能体框架

Xuemei Tang, Chengxi Yan, Jinghang Gu, Chu-Ren Huang

机构 * The Hong Kong Polytechnic University(香港理工大学) Renmin University of China(中国人民大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CHisAgent通过多智能体框架实现古代中国历史事件的自动分类,提升历史知识组织与跨文化理解能力。

Comments 22 pages, 13 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04992 2026-01-12 cs.CL 77%

Learning from Mistakes: Negative Reasoning Samples Enhance Out-of-Domain Generalization

从错误中学习:负推理样本增强领域外泛化

Xueyun Tian, Minghua Ma, Bingbing Xu, Nuoyan Lyu, Wei Li, Heng Dong, Zheng Chu, Yuanzhuo Wang, Huawei Shen

机构 * CAS Key Laboratory of AI Safety, Institute of Computing Technology, CAS, Beijing, China(中国科学院人工智能安全重点实验室,计算技术研究所,中国科学院,北京,中国) Harbin Institute of Technology, Harbin, China(哈尔滨工业大学,哈尔滨,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Tsinghua University, Beijing, China(清华大学,北京,中国)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL

AI总结 通过引入负例推理样本,GLOW方法有效提升了大语言模型在领域外任务中的泛化能力,通过调节损失下降和提升策略熵来减少过拟合并促进探索。

Comments Code and data are available at https://github.com/Eureka-Maggie/GLOW

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11930 2026-01-12 cs.CV cs.AI 77%

AtomThink: Multimodal Slow Thinking with Atomic Step Reasoning

AtomThink: 多模态慢思考与原子步骤推理

Kun Xiang, Zhili Liu, Terry Jingchen Zhang, Yinya Huang, Yunshuang Nie, Kaixin Cai, Yiyang Yin, Runhui Huang, Hanhui Li, Yihan Zeng, Yu-Jie Yuan, Jianhua Han, Lanqing Hong, Hang Xu, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ETH Zurich(苏黎世联邦理工学院) Hong Kong University of Science and Technology(香港科技大学) University of Hong Kong(香港大学) Noah’s Ark Lab(诺亚实验室) Yinwang Intelligent Technology Co., Ltd.(亿纬智能科技有限公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI

AI总结 AtomThink通过引入原子步骤推理,提升多模态大语言模型的推理性能和效率。

Comments TPAMI accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11314 2026-01-12 cs.MA cs.AI 77%

Simulating Multi-Stakeholder Decision-Making with Generative Agents in Urban Planning

用生成代理模拟城市规划中的多利益相关者决策

Jin Gao, Hanyong Xu, Luc Dao

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 本研究通过多生成代理系统模拟城市规划中的多利益相关者决策,探讨人口因素对集体决策的影响,并提升决策的公平性和效率。

Journal ref Advances in Transdisciplinary Engineering, Vol. 76, pp. 40-49, IOS Press, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02954 2026-01-12 cs.CL 77%

DQ-LoRe: Dual Queries with Low Rank Approximation Re-ranking for In-Context Learning

DQ-LoRe:双查询与低秩近似重排序用于上下文学习

Jing Xiong, Zixuan Li, Chuanyang Zheng, Zhijiang Guo, Yichun Yin, Enze Xie, Zhicheng Yang, Qingxing Cao, Haiming Wang, Xiongwei Han, Jing Tang, Chengming Li, Xiaodan Liang

机构 * Sun Yat-Sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Huawei Noah’s Ark Lab(华为诺亚实验室) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) MBZUAI The Hong Kong University of Science and Technology(香港科学与技术大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学) DarkMatter AI Research(DarkMatter AI研究)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DQ-LoRe通过双查询与低秩近似重排序方法提升GPT-4上下文学习性能,实现94.2%的性能提升。

Comments Accepted in ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21825 2026-01-12 cs.LG cs.AI cs.CL 75%

Let Me Think! A Long Chain-of-Thought Can Be Worth Exponentially Many Short Ones

让我思考!一个长的推理链可能比许多短的链多出指数倍

Parsa Mirtaheri, Ezra Edelman, Samy Jelassi, Eran Malach, Enric Boix-Adsera

机构 * UC San Diego(UC圣地亚哥大学) University of Pennsylvania(宾夕法尼亚大学) Harvard University(哈佛大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了推理链扩展策略,证明在特定图连通性问题中顺序扩展比并行扩展更有效。

Comments Published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05478 2026-01-12 cs.CL 74%

The Facade of Truth: Uncovering and Mitigating LLM Susceptibility to Deceptive Evidence

真相的 facade:揭示并缓解 LLM 对欺骗性证据的易感性

Herun Wan, Jiaying Wu, Minnan Luo, Fanxiao Li, Zhi Zeng, Min-Yen Kan

机构 * Xi’an Jiaotong University(西安交通大学) National University of Singapore(新加坡国立大学) Yunnan University(云南大学)

专题命中 推理与问题求解 :LLM(title);分类 cs.CL

AI总结 本文提出 MisBelief 框架揭示 LLM 对复杂欺骗性证据的脆弱性,并提出 DIS 机制缓解这一问题,提升模型对误导性证据的抵御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04651 2026-01-12 cs.AI cs.IR cs.MA 74%

Adversarial Yet Cooperative: Multi-Perspective Reasoning in Retrieved-Augmented Language Models

对抗 yet 合作:检索增强语言模型中的多视角推理

Can Xu, Lingyong Yan, Jiayi Wu, Haosen Wang, Shuaiqiang Wang, Yuchen Li, Jizhou Huang, Dawei Yin, Xiang Li

机构 * East China Normal University(华东师范大学) Baidu Inc.(百度公司) Southeast University(东南大学)

专题命中 推理与问题求解 :language model(title);分类 cs.AI

AI总结 本文提出对抗推理RAG框架,通过推理与验证的对抗机制提升检索增强语言模型的多视角推理能力与验证严谨性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01937 2026-01-12 cs.LG cs.AI stat.ML 73%

Shorter but not Worse: Frugal Reasoning via Easy Samples as Length Regularizers in Math RLVR

更短但不更差:通过易样本作为长度正则化器进行节俭推理

Abdelaziz Bounhar, Hadi Abdine, Evan Dufraisse, Ahmad Chamma, Amr Mohamed, Dani Bouch, Michalis Vazirgiannis, Guokan Shang

机构 * MBZUAI Ecole Polytechnique(巴黎政治学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 通过易样本作为长度正则化器,使模型在不增加输出长度的情况下更高效地解决复杂问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05459 2026-01-12 cs.CL cs.AI 73%

Do LLMs Need Inherent Reasoning Before Reinforcement Learning? A Study in Korean Self-Correction

LLMs是否需要在强化学习前具备内在推理能力?韩国自我修正研究

Hongjin Kim, Jaewook Lee, Kiyoung Lee, Jong-hun Shin, Soojong Lim, Oh-Woog Kwon

机构 * ETRI

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨LLMs在强化学习前是否需要具备内在推理能力,通过韩国自我修正研究发现,对齐模型内部推理与韩语输入关键,提升多语言推理效果。

Comments IJCNLP-AACL 2025 (Main), Outstanding Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05300 2026-01-12 cs.LG cs.CL 73%

TIME: Temporally Intelligent Meta-reasoning Engine for Context Triggered Explicit Reasoning

TIME:面向上下文触发的显式推理的时序智能元推理引擎

Susmit Das

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 TIME通过引入时序智能元推理引擎,改进对话模型的显式推理能力,提升时间感知和推理效率。

Comments 14 pages, 3 figures with 27 page appendix. See https://github.com/The-Coherence-Initiative/TIME and https://github.com/The-Coherence-Initiative/TIMEBench for associated code

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11847 2026-01-12 cs.LG cs.AI 73%

Tiny Recursive Models on ARC-AGI-1: Inductive Biases, Identity Conditioning, and Test-Time Compute

在ARC-AGI-1上使用小型递归模型:归纳偏差、身份条件和测试时计算

Antonio Roye-Azar, Santiago Vargas-Naranjo, Dhruv Ghai, Nithin Balamurugan, Rayan Amir

机构 * Western University(西部大学) Varonova Tech Inc.(Varonova科技公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究分析了TRM在ARC-AGI-1上的表现,发现其性能源于效率、任务特定条件和测试时计算的相互作用,而非深度推理。

Comments 13 pages, 0 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03731 2026-01-12 cs.SE cs.AI 70%

From Laboratory to Real-World Applications: Benchmarking Agentic Code Reasoning at the Repository Level

从实验室到现实应用:在仓库级别评估代理代码推理

Jia Li, Yuxin Su, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Sun Yat-sen University(中山大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 RepoReason提出了一种白盒诊断基准测试,通过执行驱动的突变框架和动态程序切片,量化推理能力,揭示集成宽度是代理代码推理的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏