arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-24 至 2025-12-24 共收录 41 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3 篇

2505.17266 2025-12-24 cs.CL cs.AI 90%

Select2Reason: Efficient Instruction-Tuning Data Selection for Long-CoT Reasoning

Select2Reason: 为长链推理实现高效的指令微调数据选择

Cehao Yang, Xueyuan Lin, Xiaojun Wu, Chengjin Xu, Xuhui Jiang, Honghao Liu, Hui Xiong, Jian Guo

机构 * DataArc Tech Ltd.(DataArc科技有限公司) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) IDEA Research, International Digital Economy Academy(IDEA研究所,国际数字经济学院) Hithink RoyalFlush Information Network Co., Ltd(Hithink RoyalFlush信息网络有限公司)

专题命中 数学推理 :reasoning(title,abstract);CoT(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 Select2Reason通过高效数据选择提升长链推理性能,实验证明其在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23129 2025-12-24 cs.LG cs.AI cs.CL 82%

C$^2$GSPG: Confidence-calibrated Group Sequence Policy Gradient towards Self-aware Reasoning

C$^2$GSPG:基于置信度校准的群体序列策略梯度方法,用于自感知推理

Haotian Liu, Shuo Wang, Hongteng Xu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高陵人工智能学院) Tsinghua University(清华大学) Beijing Key Laboratory of Research on Large Models(北京大模型研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索工程研究中心)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 C$^2$GSPG通过置信度校准群体序列策略梯度方法提升推理性能并抑制过度自信,适用于逻辑和数学推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04872 2025-12-24 cs.AI 74%

FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI

FrontierMath: 一个评估人工智能高级数学推理能力的基准

Elliot Glazer, Ege Erdil, Tamay Besiroglu, Diego Chicharro, Evan Chen, Alex Gunning, Caroline Falkman Olsson, Jean-Stanislas Denain, Anson Ho, Emily de Oliveira Santos, Olli Järviniemi, Matthew Barnett, Robert Sandler, Matej Vrzala, Jaime Sevilla, Qiuyu Ren, Elizabeth Pratt, Lionel Levine, Grant Barkley, Natalie Stewart, Bogdan Grechuk, Tetiana Grechuk, Shreepranav Varma Enugandla, Mark Wildon

机构 * Epoch AI University of Leicester(利兹大学) RWTH Aachen University(亚琛工业大学) King’s College London(伦敦大学国王学院) University of Bristol(布里斯托大学) Iowa State University(爱荷华州立大学) MIT(麻省理工学院) University of North Carolina(北卡罗来纳大学) CNRS - Université Paris-Saclay(法国国家科学研究中心-巴黎-萨克雷大学) University of Siegen(锡根大学) Knox College at Charlotte(夏洛特克恩学院) James Madison University(詹姆斯麦迪逊大学) ICMC, USP(巴西圣保罗大学ICMC分校) Masaryk University(马萨里克大学) UC Berkeley(伯克利加州大学) Cornell University(康奈尔大学) Rutgers University(罗格斯大学) Harvard University(哈佛大学) ETH Zurich(苏黎世联邦理工学院) Independent(独立研究者)

专题命中 数学推理 :reasoning(title);分类 cs.AI

AI总结 FrontierMath是一个由专家数学家设计的数学问题基准,用于评估AI在高级数学推理能力上的表现,揭示了当前AI与数学界能力之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 2 篇

2512.20457 2025-12-24 cs.MA cs.LO 50%

When Natural Strategies Meet Fuzziness and Resource-Bounded Actions (Extended Version)

当自然策略与模糊性及资源受限行动相遇(扩展版本)

Marco Aruta, Francesco Improta, Vadim Malvone, Aniello Murano

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出HumanATLF逻辑,结合模糊语义和资源受限行动,解决自然策略中成本和不确定性的问题,并证明模型检查的复杂性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18885 2025-12-24 cs.PL 50%

A Minimalist Proof Language for Neural Theorem Proving over Isabelle/HOL

为Isabelle/HOL上的神经定理证明设计的最小化证明语言

Qiyuan Xu, Renxi Wang, Peixin Wang, Haonan Li, Conrad Watt

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 本文提出Minilang,一种简洁的证明语言,用于提升神经定理证明在形式证明中的性能。

Comments Accepted in OOPSLA'26

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 1 篇

2512.20275 2025-12-24 cs.AI cs.NI 57%

Graph-Symbolic Policy Enforcement and Control (G-SPEC): A Neuro-Symbolic Framework for Safe Agentic AI in 5G Autonomous Networks

图符号政策执行与控制(G-SPEC):一种用于5G自治网络安全代理AI的神经符号框架

Divya Vijay, Vignesh Ethiraj

机构 * NetoAI Solutions Ltd(NetoAI解决方案有限公司)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 G-SPEC是一种神经符号框架,通过确定性验证约束概率规划,提升5G自治网络中代理AI的安全性和可靠性。

Comments 15 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 8 篇

2512.20586 2025-12-24 cs.AI cs.CL cs.HC 90%

Automated stereotactic radiosurgery planning using a human-in-the-loop reasoning large language model agent

利用人类在回路的推理大型语言模型代理进行自动化立体定向放射手术计划

Humza Nusrat, Luke Francisco, Bing Luo, Hassan Bagher-Ebadian, Joshua Kim, Karen Chin-Snyder, Salim Siddiqui, Mira Shah, Eric Mellon, Mohammad Ghassemi, Anthony Doemer, Benjamin Movsas, Kundan Thind

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用人类在回路的推理大型语言模型代理进行自动化立体定向放射手术计划,通过对比推理模型与非推理模型,展示了推理模型在剂量优化和计划行为上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20618 2025-12-24 cs.AI cs.CV cs.LG cs.MA 84%

LongVideoAgent: Multi-Agent Reasoning with Long Videos

LongVideoAgent: 多智能体推理与长视频

Runtao Liu, Ziyi Liu, Jiaqi Tang, Yue Ma, Renjie Pi, Jipeng Zhang, Qifeng Chen

机构 * Hong Kong University of Science and Technology(香港理工大学)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 LongVideoAgent通过多智能体框架实现长视频的多模态推理,利用强化学习提升多智能体协作效率,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20237 2025-12-24 cs.AI 74%

MemR$^3$: Memory Retrieval via Reflective Reasoning for LLM Agents

MemR$^3$: 通过反思推理实现LLM代理的记忆检索

Xingbo Du, Loka Li, Duzhen Zhang, Le Song

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 规划推理 :reasoning(title);分类 cs.AI

AI总结 MemR$^3$通过反思推理实现LLM代理的记忆检索,提升检索准确性和闭环控制能力。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20475 2025-12-24 cs.RO 71%

Drift-Corrected Monocular VIO and Perception-Aware Planning for Autonomous Drone Racing

校正漂移的单目视觉惯性里程计与感知感知的自主无人机竞速

Maulana Bisyir Azhari, Donghun Han, Je In You, Sungjun Park, David Hyunchul Shim

机构 * Department of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(电气工程系,韩国科学技术院(KAIST))

专题命中 规划推理 :planning(title)

AI总结 本文提出了一种校正VIO漂移的方法,结合YOLO门检测器和卡尔曼滤波器,以提升无人机竞速中的视觉惯性里程计精度与感知规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19841 2025-12-24 cs.MA 67%

A Multi-Agent Retrieval-Augmented Framework for Work-in-Progress Predictio

一种用于工作进行中预测的多智能体检索增强框架

Yousef Mehrdad Bibalan, Behrouz Far, Mohammad Moshirpour, Bahareh Ghiyasian

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出一种多智能体检索增强框架,用于提升工作进行中预测的准确性,通过结合RAG和协同推理,在两个基准数据集上取得优于传统方法的性能。

Comments 15th International Conference on Digital Image Processing and Pattern Recognition (DPPR 2025), December 20 ~ 21, 2025, Sydney, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20482 2025-12-24 cs.SE cs.AI 57%

SweRank+: Multilingual, Multi-Turn Code Ranking for Software Issue Localization

SweRank+: 多语言、多轮次代码排名用于软件问题定位

Revanth Gangi Reddy, Ye Liu, Wenting Zhao, JaeHyeok Doo, Tarun Suresh, Daniel Lee, Caiming Xiong, Yingbo Zhou, Semih Yavuz, Shafiq Joty

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Salesforce AI Research(Salesforce AI研究院) KAIST AI(韩国科学技术院AI研究中心)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 SweRank+结合跨语言代码排名工具和代理搜索设置,实现多轮次的代码库推理,提升多语言软件问题定位的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08674 2025-12-24 cs.AI cs.MA 57%

Multi-Agent Intelligence for Multidisciplinary Decision-Making in Gastrointestinal Oncology

多智能体智能在胃肠肿瘤多学科决策中的应用

Rongzhao Zhang, Junqiao Wang, Shuyun Yang, Mouxiao Bian, Chihao Zhang, Dongyang Wang, Qiujuan Yan, Yun Zhong, Yuwei Bai, Guanxu Zhu, Kangkun Mao, Miao Wang, Chao Ding, Renjie Lu, Lei Wang, Lei Zheng, Tao Zheng, Xi Wang, Zhuo Fan, Bing Han, Meiling Liu, Luyi Jiang, Dongming Shan, Wenzhong Jin, Jiwei Yu, Zheng Wang, Jie Xu, Meng Luo

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Ninth People’s Hospital, Shanghai Jiao Tong University School of Medicine(上海第九人民医院,上海交通大学医学院) Renji Hospital, Shanghai Jiao Tong University School of Medicine(仁济医院,上海交通大学医学院) Shanghai Institute of Infectious Disease and Biosecurity, Fudan University(上海市传染病防治研究所暨生物安全研究所,复旦大学) Shanghai Health Development Research Center (Shanghai Medical Information Center)(上海市卫生健康发展研究中心(上海市医疗信息中心)) Shanghai Kupas Technology Co., Ltd.(上海库帕斯科技有限公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于多智能体的框架,用于提升胃肠肿瘤多学科决策的自动化支持,通过模拟多学科团队协作,提高推理逻辑和医疗准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20083 2025-12-24 cs.SE cs.RO 50%

Detecting Non-Optimal Decisions of Embodied Agents via Diversity-Guided Metamorphic Testing

通过多样性引导的元形态测试检测具身代理的非最优决策

Wenzhao Wu, Yahui Tang, Mingfei Cheng, Wenbing Tang, Yuan Zhou, Yang Liu

机构 * National Supercomputing Center(国家超算中心) School of Computer(计算机学院) Singapore Management University(新加坡国立大学) College of Information Engineering(信息工程学院) School of Computer Science and Technology(计算机科学与技术学院) College of Computing and Data Science(计算与数据科学学院)

专题命中 规划推理 :planning(abstract)

AI总结 通过多样性引导的元形态测试检测具身代理的非最优决策,提出NoD-DGMT框架,有效识别规划中的效率低下问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 4 篇

2503.11006 2025-12-24 cs.CV cs.AI 79%

Fine-Grained Instruction-Guided Graph Reasoning for Vision-and-Language Navigation

细粒度指令引导的图推理用于视觉-语言导航

Yaohua Liu, Xinyuan Song, Yunfu Deng, Yifan Xie, Binkai Ou, Yan Zhong

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Department of Computer Science, Emory University(埃默里大学计算机科学系) Department of Computer Science, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) Tsinghua University(清华大学) Innovation and Research and Development Department, BoardWare Information System Company(BoardWare信息系统公司创新与研发部) School of Mathematics, Peking University(北京大学数学学院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出细粒度指令引导的图推理框架OIKG,通过解耦角度与视觉提示并增强空间表示,提升视觉-语言导航中指令理解和跨模态对齐能力。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19280 2025-12-24 cs.CV 78%

RemoteReasoner: Towards Unifying Geospatial Reasoning Workflow

RemoteReasoner: 向统一地理空间推理流程迈进

Liang Yao, Fan Liu, Hongbo Lu, Chuanyi Zhang, Rui Min, Shengxiang Xu, Shimin Di, Pai Peng

机构 * COWARobot

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 RemoteReasoner通过强化学习实现统一地理空间推理流程,具备多粒度任务处理能力和自主推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20188 2025-12-24 cs.RO cs.AI 57%

Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation

异步快速-慢速视觉-语言-动作策略用于全身机器人操作

Teqiang Zou, Hongliang Zeng, Yuxuan Nong, Yifan Li, Kehui Liu, Haotian Yang, Xinyang Ling, Xin Li, Lianyang Ma

机构 * AstriBot Team(AstriBot团队)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 DuoCore-FS通过异步快速-慢速框架提升全身机器人操作的实时性能与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20557 2025-12-24 cs.CV 50%

Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models

在4D中学习推理:面向视觉语言模型的动态空间理解

Shengchao Zhou, Yuxin Chen, Yuying Ge, Wei Huang, Jiehong Lin, Ying Shan, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) ARC Lab, Tencent PCG(腾讯PCG实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本研究提出DSR套件,通过生成多选题-答案对和轻量级几何选择模块提升视觉语言模型的动态空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 2 篇

2512.01457 2025-12-24 cs.LG cs.AI cs.CL 82%

Zero-Overhead Introspection for Adaptive Test-Time Compute

无开销的适应性测试时间计算 introspection

Rohin Manvi, Joey Hong, Tim Seyde, Maxime Labonne, Mathias Lechner, Sergey Levine

机构 * UC Berkeley(加州大学伯克利分校) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Liquid AI

专题命中 测试时计算 :test-time compute(title);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ZIP-RC通过无开销的实时自我反省预测奖励和成本,提升推理效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20514 2025-12-24 cs.LG 57%

Explainable time-series forecasting with sampling-free SHAP for Transformers

基于Transformer的无采样SHAP可解释时间序列预测

Matthias Hertel, Sebastian Pütz, Ralf Mikut, Veit Hagenmeyer, Benjamin Schäfer

机构 * Institute for Automation and Applied Informatics (IAI)(自动化与应用信息学院) Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院)

专题命中 测试时计算 :planning(abstract);分类 cs.LG

AI总结 本文提出基于Transformer架构的SHAPformer模型,通过无采样注意力机制实现快速且准确的时间序列预测解释,适用于电力负荷等实际场景。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 复杂问题求解 5 篇

2512.20469 2025-12-24 cs.AI 57%

Bohrium + SciMaster: Building the Infrastructure and Ecosystem for Agentic Science at Scale

Bohrium + SciMaster: 构建大规模智能科学的基础设施和生态系统

Linfeng Zhang, Siheng Chen, Yuzhu Cai, Jingyi Chai, Junhan Chang, Kun Chen, Zhi X. Chen, Zhaohan Ding, Yuwen Du, Yuanpeng Gao, Yuan Gao, Jing Gao, Zhifeng Gao, Qiangqiang Gu, Yanhui Hong, Yuan Huang, Xi Fang, Xiaohong Ji, Guolin Ke, Zixing Lei, Xinyu Li, Yongge Li, Ruoxue Liao, Hang Lin, Xiaolu Lin, Yuxiang Liu, Xinzijian Liu, Zexi Liu, Jintan Lu, Tingjia Miao, Haohui Que, Weijie Sun, Yanfeng Wang, Bingyang Wu, Tianju Xue, Rui Ye, Jinzhe Zeng, Duo Zhang, Jiahui Zhang, Linfeng Zhang, Tianhan Zhang, Wenchang Zhang, Yuzhi Zhang, Zezhong Zhang, Hang Zheng, Hui Zhou, Tong Zhu, Xinyu Zhu, Qingguo Zhou, Weinan E

机构 * DP Technology Beijing China(北京DP技术有限公司) AI for Science Institute Beijing China(北京AI for Science研究院) Shanghai Jiao Tong University Shanghai China(上海交通大学) Beihang University Beijing China(北京航空航天大学) Peking University Beijing China(北京大学) Institute of Theoretical Physics Chinese Academy of Sciences Beijing China(中国科学院理论物理研究所) Shanghai Innovation Institute Shanghai China(上海创新研究院) East China Normal University Shanghai China(华东师范大学) Zhongguancun Academy Beijing China(中关村学院) University of Science and Technology of China Hefei China(中国科学技术大学) Tongji University Shanghai China(同济大学) The Hong Kong University of Science and Technology Hong Kong China(香港科技大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 Bohrium+SciMaster通过构建基础设施和生态系统,实现大规模智能科学的高效工作流编排与执行,显著提升科学产出效率和可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20061 2025-12-24 cs.AI 57%

Scaling Reinforcement Learning for Content Moderation with Large Language Models

利用大语言模型扩展强化学习用于内容审核

Hamed Firooz, Rui Liu, Yuchen Lu, Zhenyu Hou, Fangzhou Xiong, Xiaoyang Zhang, Changshu Jian, Zhicheng Zhu, Jiayuan Ma, Jacob Tao, Chaitali Gupta, Xiaochang Peng, Shike Mei, Hang Cui, Yang Qin, Shuo Tang, Jason Gaedtke, Arpit Mittal

机构 * Meta AI

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出利用强化学习扩展大语言模型,以提升内容审核的准确性和效率,特别是在标签稀疏和政策复杂的情况下。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08151 2025-12-24 cs.AI 57%

Trust Semantics Distillation for Collaborator Selection via Memory-Augmented Agentic AI

基于记忆增强代理AI的信任语义蒸馏用于协作者选择

Botao Zhu, Jeslyn Wang, Dusit Niyato, Xianbin Wang

机构 * Western University(西方大学) University of Toronto(多伦多大学) Nanyang Technological University(南洋理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于记忆增强代理AI的任务特定信任语义蒸馏模型,通过教师-学生架构实现高效协作者选择,提升信任评估的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13256 2025-12-24 cs.AI cs.CY cs.MA 57%

CardAIc-Agents: A Multimodal Framework with Hierarchical Adaptation for Cardiac Care Support

CardAIc-Agents: 一种用于心脏护理支持的多模态框架,具有分层适应性

Yuting Zhang, Karina V. Bunting, Asgher Champsi, Xiaoxia Wang, Wenqi Lu, Alexander Thorley, Sandeep S Hothi, Zhaowen Qiu, Baturalp Buyukates, Dipak Kotecha, Jinming Duan

机构 * School of Computer Science, University of Birmingham, UK(英国伯明翰大学计算机科学学院) Department of Cardiovascular Sciences, University of Birmingham, UK(英国伯明翰大学心血管科学系) NIHR Birmingham Biomedical Research Centre and West Midlands NHS Secure Data Environment, University Hospitals Birmingham NHS Foundation Trust, UK(英国伯明翰大学医院 NHS 基础信任机构) Department of Computing and Mathematics, Manchester Metropolitan University, UK(曼彻斯特 Metropolitan 大学计算与数学系) Department of Cardiology, Heart and Lung Centre, Royal Wolverhampton NHS Trust, UK(皇家沃尔夫汉普顿 NHS 委员会心内科部门) College of Computer and Control Engineering, Northeast Forestry University, China(中国东北林业大学计算机与控制工程学院) Julius Center, University Medical Center Utrecht, the Netherlands(荷兰乌得勒支大学医学中心朱利叶斯中心) Division of Informatics, Imaging and Data Sciences, University of Manchester, UK(英国曼彻斯特大学信息学、成像与数据科学系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 CardAIc-Agents通过多模态框架和分层适应性,提升心脏护理支持的效率和灵活性,有效解决传统AI代理在适应性推理、工具支持、知识更新和视觉输出方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20166 2025-12-24 cs.RO 50%

LoLA: Long Horizon Latent Action Learning for General Robot Manipulation

LoLA:面向通用机器人操作的长周期隐式动作学习

Xiaofan Wang, Xingyu Gao, Jianlong Fu, Zuolei Li, Dean Fortier, Galen Mullins, Andrey Kolobov, Baining Guo

机构 * Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) University of Chinese Academy of Sciences(中国科学院大学) Microsoft Research(微软研究院)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 LoLA通过整合长期多视角观察和机器人本体感觉,实现长周期、语言引导的机器人操作任务,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 推理评测 11 篇

2512.20595 2025-12-24 cs.CL cs.AI cs.CV 84%

Cube Bench: A Benchmark for Spatial Visual Reasoning in MLLMs

Cube Bench: 一个用于多模态大语言模型空间视觉推理的基准测试

Dhruv Anand, Ehsan Shareghi

机构 * Department of Data Science and AI, Monash University(数据科学与人工智能系,墨尔本大学)

专题命中 推理评测 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 Cube Bench通过评估多模态大语言模型在空间视觉推理中的能力,揭示了模型在复杂任务中的表现差异及自我纠正的局限性。

Comments 27 pages, 5 figures, 9 tables. Cube available at https://github.com/dana-23/cube-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20324 2025-12-24 cs.CL 83%

Can LLMs Solve My Grandma's Riddle? Evaluating Multilingual Large Language Models on Reasoning Traditional Bangla Tricky Riddles

LLMs能解决我奶奶的谜题吗?评估多语言大语言模型在推理传统孟加拉谜题上的能力

Nurul Labib Sayeedi, Md. Faiyaz Abdullah Sayeedi, Khushnur Binte Jahangir, Swakkhar Shatabda, Sarah Masud Preum

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本研究评估了多语言大语言模型在解决传统孟加拉谜题上的能力,发现其在推理任务中表现有限,但为低资源隐喻推理提供了新的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04826 2025-12-24 cs.CL cs.AI 81%

Persistent Instability in LLM's Personality Measurements: Effects of Scale, Reasoning, and Conversation History

大语言模型人格测量中的持久不稳定性:规模、推理和对话历史的影响

Tommaso Tosato, Saskia Helbling, Yorguin-Jose Mantilla-Ramos, Mahmood Hegazy, Alberto Tosato, David John Lemay, Irina Rish, Guillaume Dumas

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究发现大语言模型在人格测量中存在持续不稳定性,规模扩大、推理和对话历史等干预措施未能有效提升稳定性。

Comments Accepted at AAAI 2026, Track on AI Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20403 2025-12-24 cs.LG 79%

BRIDGE: Budget-aware Reasoning via Intermediate Distillation with Guided Examples

BRIDGE:通过引导示例的中间蒸馏实现预算感知推理

Xuan-An Le, Minh-Nam Tran, Son Nguyen

机构 * Faculty of Information Technology, VNU University of Engineering and Technology(信息技术学院,越南工程技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 BRIDGE通过中间蒸馏和预算不对称性,在减少教师查询的同时提升小型模型性能,实现更高效的模型蒸馏

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20092 2025-12-24 cs.CL 79%

Memory-T1: Reinforcement Learning for Temporal Reasoning in Multi-session Agents

Memory-T1: 基于强化学习的多会话代理时间推理

Yiming Du, Baojun Wang, Yifan Xiang, Zhaowei Wang, Wenyu Huang, Boyang Xue, Bin Liang, Xingshan Zeng, Fei Mi, Haoli Bai, Lifeng Shang, Jeff Z. Pan, Yuxin Jiang, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Technologies Co.,Ltd(华为技术有限公司) HKUST(香港科技大学) The University of Edinburgh(爱丁堡大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 Memory-T1通过强化学习提升多会话代理的时间推理能力,实现7B模型在Time-Dialog基准上的67.0%高分,优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏