arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-29 至 2025-12-29 共收录 58 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 10 篇

2512.21481 2025-12-29 cs.MA 75%

The AI Committee: A Multi-Agent Framework for Automated Validation and Remediation of Web-Sourced Data

AI委员会:一种多智能体框架,用于自动验证和修复网络来源的数据

Sunith Vallabhaneni, Thomas Berkane, Maimuna Majumder

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);self-correction(abstract)

AI总结 AI委员会是一种多智能体框架,通过自动化验证和修复网络数据集,提升数据质量和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22009 2025-12-29 cs.CV 67%

iSHIFT: Lightweight Slow-Fast GUI Agent with Adaptive Perception

iSHIFT: 轻量级慢-快 GUI 代理与自适应感知

Sarthak Mehrotra, Sairam V C Rebbapragada, Mani Hemanth Reddy Bonthu, Vineeth N Balasubramanian

机构 * Indian Institute of Technology, Bombay(印度理工学院,孟买) Indian Institute of Technology, Hyderabad(印度理工学院,海得拉巴)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)

AI总结 iSHIFT是一种轻量级GUI代理,通过慢-快混合推理和灵活标记实现高效与精确的视觉交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07849 2025-12-29 cs.CY cs.CL cs.MA 57%

AI Urban Scientist: Multi-Agent Collaborative Automation for Urban Research

AI城市科学家:面向城市研究的多智能体协作自动化

Tong Xia, Jiankun Zhang, Ruiwen You, Ao Xu, Linghao Zhang, Tengyao Tu, Jingzhi Wang, Jinghua Piao, Yunke Zhang, Fengli Xu, Yong Li

机构 * Vanke School of Public Health, Tsinghua University, Beijing, China(范克学校公共卫生学院,清华大学,北京,中国) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) Department of Electronic Engineering, Tsinghua University, Beijing, China(电子工程系,清华大学,北京,中国)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出AI城市科学家,通过多智能体协作自动化,整合异构数据生成城市研究的结构化知识,提升自主研究效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21354 2025-12-29 cs.CR cs.AI cs.SE 57%

Reflection-Driven Control for Trustworthy Code Agents

基于反射的可信代码代理控制

Bin Wang, Jiazheng Quan, Xingrui Yu, Hansen Hu, Yuhao, Ivor Tsang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出反射驱动控制方法,通过内部反思循环提升代码生成的安全性和合规性,实现自主、安全且可审计的AI代码代理。

Comments Accepted to AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00741 2025-12-29 cond-mat.mtrl-sci 50%

Accelerated Inorganic Materials Design with Generative AI Agents

利用生成式AI代理加速无机材料设计

Izumi Takahara, Teruyasu Mizoguchi, Bang Liu

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 MatAgent通过结合生成模型和预测模型,利用大语言模型的推理能力,实现高效、可解释的无机材料设计与发现。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 19 篇

2511.01470 2025-12-29 cs.CL 85%

BARD: budget-aware reasoning distillation

BARD: 带预算意识的推理蒸馏

Lujie Niu, Lei Shen, Yi Jiang, Caixia Yuan, Xiaojie Wang, Wenbo Su, Bo zheng

机构 * Taobao & Tmall Group of Alibaba(淘宝与天猫集团)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 BARD通过两阶段训练实现推理能力蒸馏与预算控制,使模型在不同预算下高效完成推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19855 2025-12-29 cs.LG cs.HC 79%

Inducing Causal World Models in LLMs for Zero-Shot Physical Reasoning

在LLM中诱导因果世界模型以实现零样本物理推理

Aditya Sharma, Ananya Gupta, Chengyu Wang, Chiamaka Adebayo, Jakub Kowalski

机构 * Department of Electrical Engineering(电气工程系) Indian Institute of Technology Bombay(印度理工学院孟买分校) Department of Computer Science and Automation(计算机科学与自动化系) Indian Institute of Science(印度科学研究所) Department of Computer Science(计算机科学系) San Francisco State University(旧金山州立大学) University of Lagos(拉各斯大学) Faculty of Mathematics, Informatics, and Mechanics(数学、信息学与力学学院) University of Warsaw(华沙大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出CWMI框架,通过引入因果物理模块和因果干预损失,使LLM具备因果推理能力,在零样本物理推理任务中取得显著成效。

Comments 12 pages, 4 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21482 2025-12-29 cs.AI 79%

LogicLens: Visual-Logical Co-Reasoning for Text-Centric Forgery Analysis

LogicLens:面向文本导向伪造分析的视觉-逻辑协同推理

Fanwei Zeng, Changtao Miao, Jing Huang, Zhiya Tan, Shutao Gong, Xiaoming Yu, Yang Wang, Huazhe Tan, Weibin Yao, Jianshu Li

机构 * Ant Group(蚂蚁集团) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 LogicLens通过视觉-逻辑协同推理框架,提升文本导向伪造分析的准确性和鲁棒性,其在多个基准测试中表现优异。

Comments 11 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21711 2025-12-29 cs.CL cs.AI 79%

Do Latent Tokens Think? A Causal and Adversarial Analysis of Chain-of-Continuous-Thought

潜在标记是否思考?对连续思维链的因果和对抗分析

Yuyi Zhang, Boyu Tang, Tianjie Ju, Sufeng Duan, Gongshen Liu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文通过因果和对抗分析揭示COCONUT作为伪推理机制的问题,指出其依赖捷径而非真实推理。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18286 2025-12-29 cs.CV 75%

RoadSceneVQA: Benchmarking Visual Question Answering in Roadside Perception Systems for Intelligent Transportation System

RoadSceneVQA: 用于智能交通系统 roadside 系统的视觉问答基准测试

Runwei Guan, Rongsheng Hu, Shangshu Chen, Ningyuan Xiao, Xue Xia, Jiayang Liu, Beibei Chen, Ziren Tang, Ningwei Ouyang, Shaofeng Liang, Yuxuan Fan, Wanjie Sun, Yutao Yue

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 RoadSceneVQA 通过大规模标注数据和 CogniAnchor 融合模块,提升多模态大语言模型在交通感知与推理任务中的性能。

Comments 10 pages, 6 figures, accepted by AAAI 2026. The model is also called Dream, to the other me in the world forever

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18848 2025-12-29 cs.CL cs.AI cs.LG stat.ME 75%

A Causal Lens for Evaluating Faithfulness Metrics

一种评估忠实度度量的因果视角

Kerem Zaman, Shashank Srivastava

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出因果诊断性框架,用于评估自然语言解释的忠实度度量,通过生成忠实-不忠实解释对,发现Filler Tokens在多任务中表现最佳,连续度量更优但易受噪声影响。

Comments Published at EMNLP 2025; 25 pages, 22 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21878 2025-12-29 cs.MA cs.AI 74%

MASFIN: A Multi-Agent System for Decomposed Financial Reasoning and Forecasting

MASFIN:一种用于分解金融推理和预测的多智能体系统

Marc S. Montalvo, Hamed Yaghoobian

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 MASFIN通过整合LLMs与结构化财务指标和非结构化新闻,提出了一种模块化的多智能体系统,以提高金融预测的透明性和可重复性,实现优于基准的短期投资回报。

Comments Accepted to the NeurIPS 2025 Workshop on Generative AI in Finance

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21431 2025-12-29 cs.SE cs.LG 74%

Cerberus: Multi-Agent Reasoning and Coverage-Guided Exploration for Static Detection of Runtime Errors

Cerberus:多智能体推理与覆盖引导探索用于运行时错误的静态检测

Hridya Dhulipala, Xiaokai Rong, Tien N. Nguyen

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 推理评测 :reasoning(title);分类 cs.LG

AI总结 Cerberus通过多智能体推理和覆盖引导探索,实现无执行的运行时错误静态检测,提高测试效率和错误发现能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21902 2025-12-29 cs.CL 70%

Explainable Statute Prediction via Attention-based Model and LLM Prompting

基于注意力模型和大语言模型提示的可解释法规预测

Sachin Pawar, Girish Keshav Palshikar, Anindita Sinha Banerjee, Nitin Ramrakhiyani, Basit Ali

机构 * TCS Research(TCS研究)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出基于注意力模型和大语言模型提示的法规预测方法,通过生成可解释的预测结果提升法律AI系统的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07148 2025-12-29 cs.CL 70%

TCM-Eval: An Expert-Level Dynamic and Extensible Benchmark for Traditional Chinese Medicine

TCM-Eval: 一个专家级动态且可扩展的中医基准测试

Zihao Cheng, Yuheng Lu, Huaiqian Ye, Zeming Liu, Minqi Wang, Jingjing Liu, Zihan Li, Wei Fan, Yuanfang Guo, Ruiji Fu, Shifeng She, Gang Wang, Yunhong Wang

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Beijing Zhimingtang Technology Co., Ltd.(北京智明堂科技有限公司) Beijing Zhiyan AI Technology Co., Ltd.(北京智言AI科技有限公司) Guangzhou University of Chinese Medicine(广州中医药大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 TCM-Eval通过动态可扩展的基准测试和SI-CoTE方法,开发出ZMT模型,显著超越人类中医从业者水平,推动中医领域LLM研究发展。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21871 2025-12-29 cs.CL cs.AI cs.CR cs.CY 62%

Bridging the Copyright Gap: Do Large Vision-Language Models Recognize and Respect Copyrighted Content?

弥合版权鸿沟:大型视觉-语言模型是否能识别并尊重受版权保护的内容?

Naen Xu, Jinghuai Zhang, Changjiang Li, Hengyu An, Chunyi Zhou, Jun Wang, Boyu Xu, Yuyuan Li, Tianyu Du, Shouling Ji

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究大型视觉-语言模型在处理受版权保护内容时的合规性问题,提出了一种新的工具增强防御框架以降低侵权风险。

Comments AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21849 2025-12-29 cs.CL cs.AI 62%

HeartBench: Probing Core Dimensions of Anthropomorphic Intelligence in LLMs

HeartBench: 探索大语言模型中拟人智能的核心维度

Jiaxin Liu, Peiyi Tu, Wenyu Chen, Yihong Zhuang, Xinxia Ling, Anji Zhou, Chenxi Wang, Zhuo Han, Zhengkai Yang, Junbo Zhao, Zenan Huang, Yuanyuan Wang

机构 * Ant Group(蚂蚁集团) Xiamen University(厦门大学) Beijing Normal University(北京师范大学) Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 HeartBench通过理论驱动的分类体系评估中文大语言模型的情感、文化和伦理维度,揭示其在拟人智能方面的性能上限及改进方向。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13464 2025-12-29 cs.CL cs.AI 62%

Unveiling the Learning Mind of Language Models: A Cognitive Framework and Empirical Study

揭示语言模型的学习心智:一种认知框架与实证研究

Zhengyu Hu, Jianxun Lian, Zheyuan Xiao, Seraphina Zhang, Tianfu Wang, Nicholas Jing Yuan, Xing Xie, Hui Xiong

机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou), China(香港科学与技术大学人工智能研究所) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology Hong Kong SAR, China(香港科学与技术大学计算机科学与工程系) Microsoft Research Asia(微软亚洲研究院) University of Cambridge(剑桥大学) Microsoft(微软)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种认知框架,将学习能力分解为三个维度,并通过实证研究揭示LLMs在不同学习场景下的表现与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02519 2025-12-29 cs.AI cs.LG 62%

Creative Agents: Empowering Agents with Imagination for Creative Tasks

创意代理:通过想象力赋能代理以完成创意任务

Penglin Cai, Chi Zhang, Yuhui Fu, Haoqi Yuan, Zongqing Lu

机构 * School of Computer Science Peking University(北京大学计算机学院)

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出通过增强想象力的创意代理,首次在Minecraft生存模式中实现多样化建筑创建,利用大语言模型和扩散模型提升创造力表现。

Comments The first two authors contribute equally

Journal ref Proceedings of the 41st Conference on Uncertainty in Artificial Intelligence (UAI 2025), PMLR 244:471-496

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00846 2025-12-29 cs.CV cs.AI 57%

OmniBrainBench: A Comprehensive Multimodal Benchmark for Brain Imaging Analysis Across Multi-stage Clinical Tasks

OmniBrainBench: 一种全面的多模态基准,用于跨多阶段临床任务的脑影像分析

Zhihao Peng, Cheng Wang, Shengyuan Liu, Zhiying Liang, Zanting Ye, Minjie Ju, PeterYM Woo, Yixuan Yuan

机构 * Chinese University of Hong Kong(香港中文大学) Sun Yat-sen Memorial Hospital, Sun Yat-sen University(中山大学孙逸仙纪念医院) Southern Medical University(南方医科大学) Zhongshan Hospital, Fudan University(复旦大学中山医院) Department of Neurosurgery, Prince of Wales Hospital(威尔士王室医院神经外科部)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 OmniBrainBench是一个全面的多模态基准,用于评估脑影像分析中MLLMs的多模态理解能力,揭示了其在复杂临床任务中的挑战和与医生的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10436 2025-12-29 cs.CL 57%

RefactorCoderQA: Benchmarking LLMs for Multi-Domain Coding Question Solutions in Cloud and Edge Deployment

RefactorCoderQA: 评估LLMs在云和边缘部署中多领域编程问题解决方案的基准测试

Shadikur Rahman, Aroosa Hameed, Gautam Srivastava, Syed Muhammad Danish

机构 * York University and Algoma University(约克大学和阿尔戈马大学) Algoma University(阿尔戈马大学) Department of Systems and Computer Engineering, Carleton University(系统与计算机工程系,卡尔顿大学) Department of Math and Computer Science, Brandon University(数学与计算机科学系,布兰登大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 RefactorCoderQA通过云-边缘协作架构和RefactorCoder-MoE模型,在多领域编程任务中提升LLMs的性能,准确率达76.84%。

Comments 12 pages, 5 figures, Submitted to IEEE Transactions on Services Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21625 2025-12-29 cs.CL 57%

Rethinking Sample Polarity in Reinforcement Learning with Verifiable Rewards

重新思考强化学习中的样本极性与可验证奖励

Xinyu Tang, Yuliang Zhan, Zhixun Li, Wayne Xin Zhao, Zhenduo Zhang, Zujie Wen, Zhiqiang Zhang, Jun Zhou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出A3PO方法,通过自适应非对称令牌级别优势塑造,提升强化学习中样本极性对推理能力的优化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21373 2025-12-29 cs.SE cs.AI cs.PL 57%

AInsteinBench: Benchmarking Coding Agents on Scientific Repositories

AInsteinBench:在科学仓库中评估编码代理的基准测试

Titouan Duston, Shuo Xin, Yang Sun, Daoguang Zan, Aoyan Li, Shulin Xin, Kai Shen, Yixiao Chen, Qiming Sun, Ge Zhang, Jiashuo Liu, Huan Zhou, Jingkai Liu, Zhichen Pu, Yuanheng Wang, Bo-Xuan Ge, Xin Tong, Fei Ye, Zhi-Chao Zhao, Wen-Biao Han, Zhoujian Cao, Yueran Zhao, Weiluo Ren, Qingshen Long, Yuxiao Liu, Anni Huang, Yidi Du, Yuanyuan Rong, Jiahao Peng

机构 * Princeton University(普林斯顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 AInsteinBench通过评估大型语言模型在科学计算开发中的能力,提供了一个基于真实科研软件生态系统的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21402 2025-12-29 cs.CV 50%

Understanding Virality: A Rubric based Vision-Language Model Framework for Short-Form Edutainment Evaluation

理解病毒性:一种基于Rubric的视觉-语言模型框架用于短形式教育娱乐内容评估

Arnav Gupta, Gurekas Singh Sahney, Hardik Rathi, Abhishek Chandwani, Ishaan Gupta, Pratik Narang, Dhruv Kumar

机构 * Birla Institute of Technology and Science, Pilani(比拉理工学院和科学学院,比里尼)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出基于Rubric的视觉-语言模型框架,用于评估短形式教育娱乐视频的病毒性,通过提取音频视觉特征并训练回归评估器,实现可解释且可扩展的参与度预测。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他推理 4 篇

2512.21706 2025-12-29 cs.CL cs.AI 81%

Enabling Conversational Behavior Reasoning Capabilities in Full-Duplex Speech

实现全双工语音中对话行为推理能力

Shuchang Pan, Siddharth Banerjee, Dhruv Hebbar, Siddhant Patel, Akshaj Gupta, Kan Jen Cheng, Hanjo Kim, Zeyi Austin Li, Martin Q. Ma, Tingle Li, Gopala Anumanchipalli, Jiachen Lian

机构 * Zhejiang University(浙江大学) University of California, Berkeley(加州大学伯克利分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于图的思维框架,通过建模对话行为的因果推断,实现全双工语音交互中的行为推理与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18564 2025-12-29 cs.AI 57%

Vox Deorum: A Hybrid LLM Architecture for 4X / Grand Strategy Game AI -- Lessons from Civilization V

Vox Deorum:一种用于4X/大战略游戏AI的混合LLM架构——来自《文明V》的启示

John Chen, Sihan Cheng, Can Gurkan, Ryan Lay, Moez Salahuddin

机构 * University of Arizona(亚利桑那大学) Northwestern University(西北大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Independent Researcher(独立研究者)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 Vox Deorum提出了一种混合LLM架构用于4X游戏AI,通过宏观战略推理与子系统协同,展示了LLM在复杂游戏中的应用潜力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21526 2025-12-29 cs.IR cs.AI 57%

Selective LLM-Guided Regularization for Enhancing Recommendation Models

选择性LLM引导的正则化以增强推荐模型

Shanglin Yang, Zhan Shi

机构 * SCU(四川大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出选择性LLM引导正则化方法,通过离线方式利用LLM的排序能力,提升推荐模型在冷启动和长尾场景中的表现。

Journal ref WSDM 2026 Workshop on Generative AI for Recommender Systems and Personalization

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21404 2025-12-29 cs.CR cs.AI 57%

LLM-Driven Feature-Level Adversarial Attacks on Android Malware Detectors

基于大语言模型的Android恶意软件检测器特征级对抗攻击

Tianwei Lan, Farid Naït-Abdesselam

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出LAMLAD框架,利用大语言模型生成特征扰动以对抗恶意软件检测器,实验显示攻击成功率高达97%,并提出对抗训练防御策略提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏