arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45335 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3246 篇

2601.03017 2026-01-07 cs.CL 57%

MMFormalizer: Multimodal Autoformalization in the Wild

MMFormalizer: 多模态自动形式化

Jing Xiong, Qi Han, Yunta Hsieh, Hui Shen, Huajian Xin, Chaofan Tao, Chenyang Zhao, Hengyuan Zhang, Taiqiang Wu, Zhen Zhang, Haochen Wang, Zhongwei Wan, Lingpeng Kong, Ngai Wong

机构 * The University of Hong Kong(香港大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) University of Edinburgh(爱丁堡大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Ohio State University(俄亥俄州立大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 MMFormalizer通过整合适应性定位与现实世界数学物理领域实体,实现多模态自动形式化,首次处理经典力学、相对论、量子力学和热力学等复杂领域。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02569 2026-01-07 cs.CL 57%

LoRA-Drop: Temporal LoRA Decoding for Efficient LLM Inference

LoRA-Drop:用于高效LLM推理的时序LoRA解码

Hossein Rajabzadeh, Maryam Dialameh, Chul B. Park, Il-Min Kim, Hyock Ju Kwon

机构 * University of Waterloo(滑铁卢大学) University of Toronto(多伦多大学) Queen’s University(皇后大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 LoRA-Drop通过时序计算计划和低秩LoRA校正,实现高效LLM推理,提升解码速度2.6倍并减少45-55%的KV缓存占用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13102 2026-01-07 cs.AI 57%

Socratic Students: Teaching Language Models to Learn by Asking Questions

苏格拉底学生:教语言模型通过提问学习

Rajeev Bhatt Ambati, Tianyi Niu, Aashu Singh, Shlok Mishra, Snigdha Chaturvedi, Shashank Srivastava

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Meta

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ODQS框架,通过任务结果训练语言模型提问技能,提升交互推理的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00885 2026-01-06 cs.AI 57%

Counterfactual Self-Questioning for Stable Policy Optimization in Language Models

反事实自问法用于语言模型中的稳定策略优化

Mandar Parab

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 反事实自问法通过内部生成的监督提升语言模型的推理准确性和训练稳定性,实现自我改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00121 2026-01-05 cs.AI cs.HC 57%

Ask, Clarify, Optimize: Human-LLM Agent Collaboration for Smarter Inventory Control

提问、澄清、优化:人类-大语言模型代理协作以实现更智能的库存控制

Yaqi Duan, Yichun Hu, Jiashuo Jiang

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出混合代理框架,利用LLM作为智能接口,通过分离语义推理与数学计算,降低库存成本32.1%,证明LLM作为自然语言接口使优化策略更易被非专家使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22944 2025-12-30 cs.LG 57%

Multiple Token Divergence: Measuring and Steering In-Context Computation Density

多令牌分歧:测量和引导上下文计算密度

Vincent Herrmann, Eric Alcaide, Michael Wand, Jürgen Schmidhuber

机构 * The Swiss AI Lab IDSIA/USI/SUPSI(瑞士人工智能实验室IDSIA/USI/SUPSI) King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 多令牌分歧通过测量语言模型的计算努力,提供了一种轻量级工具,用于分析和引导生成文本的计算动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18841 2025-12-30 cs.CL 57%

MDToC: Metacognitive Dynamic Tree of Concepts for Boosting Mathematical Problem-Solving of Large Language Models

MDToC:元认知动态概念树用于提升大语言模型的数学问题解决能力

Tung Duong Ta, Tim Oates, Thien Van Luong, Huan Vu, Tien Cuong Nguyen

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) National Economics University(国家经济大学) VNPT AI

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 MDToC通过构建概念树和多数投票机制,提升大语言模型在数学问题解决中的准确性与验证能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21911 2025-12-29 cs.CL 57%

Accelerate Speculative Decoding with Sparse Computation in Verification

通过验证中的稀疏计算加速推测解码

Jikai Wang, Jianchao Tan, Yuxuan Hu, Jiayu Qin, Yerui Sun, Yuchen Xie, Xunliang Cai, Juntao Li, Min Zhang

机构 * Key Laboratory of Data Intelligence and Advanced Computing, Soochow University(数据智能与先进计算 key laboratory,苏州大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种稀疏验证框架,通过联合稀疏化注意力、FFN和MoE组件,减少验证阶段的计算成本,并结合检索重用策略提升效率-准确性平衡。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02864 2025-12-23 cs.NE cs.AI math.CA math.CO math.MG 57%

Mathematical exploration and discovery at scale

大规模数学探索与发现

Bogdan Georgiev, Javier Gómez-Serrano, Terence Tao, Adam Zsolt Wagner

机构 * Google DeepMind(谷歌DeepMind) Department of Mathematics, Brown University(布朗大学数学系) Institute for Advanced Study(高级研究院) UCLA Department of Mathematics(加州大学洛杉矶分校数学系)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 AlphaEvolve通过进化搜索发现数学构造,提升数学问题解决效率

Comments 81 pages, 35 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11496 2025-12-23 cs.CV cs.AI 57%

AndesVL Technical Report: An Efficient Mobile-side Multimodal Large Language Model

AndesVL 技术报告:一种高效的移动端多模态大语言模型

Zhiwei Jin, Xiaohui Song, Nan Wang, Yafei Liu, Chao Li, Xin Li, Ruichen Wang, Zhihao Li, Qi Qi, Long Cheng, Dongze Hao, Quanlong Zheng, Yanhao Zhang, Haobo Ji, Jian Ma, Zhitong Zheng, Zhenyi Lin, Haolin Deng, Xin Zou, Xiaojie Yin, Ruilin Wang, Liankai Cai, Haijing Liu, Yuqing Qiu, Ke Chen, Zixian Li, Chi Xie, Huafei Li, Chenxing Li, Chuangchuang Wang, Kai Tang, Zhiguang Zhu, Kai Tang, Wenmei Gao, Rui Wang, Jun Wu, Chao Liu, Qin Xie, Chen Chen, Haonan Lu

机构 * AndesVL Team(AndesVL团队) OPPO AI Center(OPPO人工智能中心)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 AndesVL 是一种高效的移动端多模态大语言模型,通过 1+N LoRA 架构和 QALFT 框架实现高效任务适应和模型压缩,部署在 MediaTek Dimensity 9500 芯片上,达到 6.7 倍解码加速和 30.9% 内存减少。

Comments Tech report of OPPO AndesVL Team

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11792 2025-12-23 cs.AI 57%

Solver-Informed RL: Grounding Large Language Models for Authentic Optimization Modeling

Solver-Informed RL: 为真实优化建模奠定大语言模型基础

Yitian Chen, Jingfan Xia, Siyu Shao, Dongdong Ge, Yinyu Ye

机构 * Cardinal Operations, China(中国卡迪纳尔运营公司) Shanghai University of Finance and Economics(上海财经大学) The University of Hong Kong(香港大学) Antai School of Economics and Management, Shanghai Jiao Tong University(上海交通大学安泰经济管理学院) Department of Management Science and Engineering, Stanford University(斯坦福大学管理科学与工程系)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 SIRL通过强化学习与外部优化求解器结合,提升大语言模型在优化建模中的准确性与实用性。

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16649 2025-12-19 cs.CL 57%

JustRL: Scaling a 1.5B LLM with a Simple RL Recipe

JustRL: 通过简单强化学习方法扩展1.5B语言模型

Bingxiang He, Zekai Qu, Zeyuan Liu, Yinghao Chen, Yuxin Zuo, Cheng Qian, Kaiyan Zhang, Weize Chen, Chaojun Xiao, Ganqu Cui, Ning Ding, Zhiyuan Liu

机构 * Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Shanghai AI Lab(上海人工智能实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 JustRL通过简单强化学习方法在1.5B语言模型上实现高性能,省去复杂训练流程,展现稳定训练效果。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14744 2025-12-18 q-fin.CP cs.AI 57%

VERAFI: Verified Agentic Financial Intelligence through Neurosymbolic Policy Generation

VERAFI:通过神经符号策略生成实现验证的代理金融智能

Adewale Akinfaderin, Shreyas Subramanian

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 VERAFI通过神经符号策略生成实现验证的代理金融智能,显著提升金融领域事实正确性与合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10691 2025-12-12 cs.AI cs.CV 57%

Enhancing Radiology Report Generation and Visual Grounding using Reinforcement Learning

通过强化学习增强放射学报告生成和视觉基础识别

Benjamin Gundersen, Nicolas Deperrois, Samuel Ruiperez-Campillo, Thomas M. Sutter, Julia E. Vogt, Michael Moor, Farhad Nooralahzadeh, Michael Krauthammer

机构 * University of Zurich(苏黎世大学) ETH Zurich(苏黎世联邦理工学院) Zurich University of Applied Sciences(苏黎世应用科学大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过强化学习和思考机制提升放射学报告生成和视觉基础识别的性能,展示了在医学VLMs中RL作为SFT的有效补充。

Comments 10 pages main text (3 figures, 3 tables), 31 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09108 2025-12-11 cs.SE cs.AI 57%

Evolving Excellence: Automated Optimization of LLM-based Agents

精益求精:基于大语言模型的代理的自动化优化

Paul Brookes, Vardan Voskanyan, Rafail Giavrimis, Matthew Truscott, Mina Ilieva, Chrystalla Pavlou, Alexandru Staicu, Manal Adham, Will Evers- Hood, Jingzhi Gong, Kejia Zhang, Matvey Fedoseev, Vishal Sharma, Roman Bauer, Zheng Wang, Hema Nair, Wei Jie, Tianhua Xu, Aurora Constantin, Leslie Kanthan, Michail Basios

机构 * University of Leeds(利兹大学) City, University of London(伦敦城市大学) University of West London(西伦敦大学) University of Edinburgh(爱丁堡大学) University of Surrey(萨里大学) University of Warwick(沃里克大学) King's College London(伦敦国王学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 ARTEMIS通过语义感知的进化算法,自动优化基于大语言模型的代理配置,显著提升多个任务的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05382 2025-12-11 physics.data-an cs.AI hep-ph physics.comp-ph physics.hist-ph 57%

Large Physics Models: Towards a collaborative approach with Large Language Models and Foundation Models

大规模物理模型:迈向与大规模语言模型和基础模型的协作方法

Kristian G. Barman, Sascha Caron, Emily Sullivan, Henk W. de Regt, Roberto Ruiz de Austri, Mieke Boon, Michael Färber, Stefan Fröse, Faegheh Hasibi, Andreas Ipp, Rukshak Kapoor, Gregor Kasieczka, Daniel Kostić, Michael Krämer, Tobias Golling, Luis G. Lopez, Jesus Marco, Sydney Otten, Pawel Pawlowski, Pietro Vischia, Erik Weber, Christoph Weniger

机构 * CLPS - Centre for Logic and Philosophy of Science(逻辑与哲学科学中心) UGent(根特大学) IMAPP, Radboud University and Nikhef(IMAPP、拉德堡德大学和荷兰皇家科学院) Utrecht University(乌特勒支大学) Institute for Science in Society, Radboud University(社会科学研究院,拉德堡德大学) Instituto de Física Corpuscular (IFIC), CSIC-UV, Spain(Corpuscular 物理研究所(IFIC),CSIC-UV,西班牙) University of Twente(代尔夫特理工大学) TU Dresden & ScaDS.AI(德累斯顿技术大学及ScaDS.AI) ErUM-Data-Hub & TU Dortmund University(ErUM-Data-Hub及多特蒙德技术大学) Computing and Information Science, Radboud University(计算与信息科学,拉德堡德大学) TU Wien(维也纳技术大学) Thapar Institute of Engineering & Technology (TIET), Patiala, India(泰帕尔工程与技术学院(TIET),帕蒂亚,印度) Universität Hamburg(汉堡大学) Institute of Philosophy, University of Leiden(哲学研究所,莱顿大学) RWTH Aachen University(亚琛工业大学) University of Geneva(日内瓦大学) Munich Center for Mathematical Philosophy, LMU Munich(慕尼黑数学哲学中心,慕尼黑大学) Institute of Physics of Cantabria (IFCA), CSIC-UC, Spain(坎塔布里亚物理研究所(IFCA),CSIC-UC,西班牙) Radboud University(拉德堡德大学) Ippen Digital, Germany(Ippen 数字,德国) Universidad de Oviedo and ICTEA, Spain(奥维多大学及ICTEA,西班牙) CLPS - Centre for Logic and Philosophy of Science, UGent(逻辑与哲学科学中心) GRAPPA, Institute of Physics, University of Amsterdam(GRAPPA,物理研究所,阿姆斯特丹大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过跨学科协作开发大规模物理模型,旨在解决物理研究中的特定需求。

Journal ref Eur. Phys. J. C 85, 1066 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03817 2025-12-10 cs.AI cs.MA 57%

Learning to Deliberate: Meta-policy Collaboration for Agentic LLMs with Multi-agent Reinforcement Learning

学习 deliberation:基于多智能体强化学习的元策略协作用于代理语言模型

Wei Yang, Jesse Thomason

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出元策略推理框架MPDF,结合SoftRankPO算法,通过学习动态推理策略提升多智能体LLM在复杂推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05757 2025-12-09 cs.AI 57%

Hyperbolic Large Language Models

双曲大语言模型

Sarang Patil, Zeyong Zhang, Yiran Huang, Tengfei Ma, Mengjia Xu

机构 * Department of Data Science, New Jersey Institute of Technology(数据科学系,新泽西理工学院) Department of Biomedical Informatics, Stony Brook University(生物医学信息学系,石溪大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出双曲大语言模型,通过双曲几何提升语义表示学习和多尺度推理能力。

Comments 27 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04748 2025-12-05 cs.CL 57%

Model Whisper: Steering Vectors Unlock Large Language Models' Potential in Test-time

模型Whisper:引导向量解锁大型语言模型在测试时的潜力

Xinyue Kang, Diwei Shi, Li Chen

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 Model Whisper通过轻量级引导向量在测试时提升大型语言模型的推理能力,实现高效且稳定的性能提升。

Comments accepted to aaai2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03442 2025-12-04 cs.CL 57%

PretrainZero: Reinforcement Active Pretraining

PretrainZero:强化主动预训练

Xingrun Xing, Zhiyuan Fan, Jie Lou, Guoqi Li, Jiajun Zhang, Debing Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Xiaohongshu Inc.(小红书公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 PretrainZero通过主动预训练和自监督学习方法,提升通用推理能力,并在多个基准测试中取得显著成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02556 2025-12-03 cs.CL 57%

DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models

DeepSeek-V3.2: 推动开放大规模语言模型的前沿

DeepSeek-AI, Aixin Liu, Aoxue Mei, Bangcai Lin, Bing Xue, Bingxuan Wang, Bingzheng Xu, Bochao Wu, Bowei Zhang, Chaofan Lin, Chen Dong, Chengda Lu, Chenggang Zhao, Chengqi Deng, Chenhao Xu, Chong Ruan, Damai Dai, Daya Guo, Dejian Yang, Deli Chen, Erhang Li, Fangqi Zhou, Fangyun Lin, Fucong Dai, Guangbo Hao, Guanting Chen, Guowei Li, H. Zhang, Hanwei Xu, Hao Li, Haofen Liang, Haoran Wei, Haowei Zhang, Haowen Luo, Haozhe Ji, Honghui Ding, Hongxuan Tang, Huanqi Cao, Huazuo Gao, Hui Qu, Hui Zeng, Jialiang Huang, Jiashi Li, Jiaxin Xu, Jiewen Hu, Jingchang Chen, Jingting Xiang, Jingyang Yuan, Jingyuan Cheng, Jinhua Zhu, Jun Ran, Junguang Jiang, Junjie Qiu, Junlong Li, Junxiao Song, Kai Dong, Kaige Gao, Kang Guan, Kexin Huang, Kexing Zhou, Kezhao Huang, Kuai Yu, Lean Wang, Lecong Zhang, Lei Wang, Liang Zhao, Liangsheng Yin, Lihua Guo, Lingxiao Luo, Linwang Ma, Litong Wang, Liyue Zhang, M. S. Di, M. Y Xu, Mingchuan Zhang, Minghua Zhang, Minghui Tang, Mingxu Zhou, Panpan Huang, Peixin Cong, Peiyi Wang, Qiancheng Wang, Qihao Zhu, Qingyang Li, Qinyu Chen, Qiushi Du, Ruiling Xu, Ruiqi Ge, Ruisong Zhang, Ruizhe Pan, Runji Wang, Runqiu Yin, Runxin Xu, Ruomeng Shen, Ruoyu Zhang, S. H. Liu, Shanghao Lu, Shangyan Zhou, Shanhuang Chen, Shaofei Cai, Shaoyuan Chen, Shengding Hu, Shengyu Liu, Shiqiang Hu, Shirong Ma, Shiyu Wang, Shuiping Yu, Shunfeng Zhou, Shuting Pan, Songyang Zhou, Tao Ni, Tao Yun, Tian Pei, Tian Ye, Tianyuan Yue, Wangding Zeng, Wen Liu, Wenfeng Liang, Wenjie Pang, Wenjing Luo, Wenjun Gao, Wentao Zhang, Xi Gao, Xiangwen Wang, Xiao Bi, Xiaodong Liu, Xiaohan Wang, Xiaokang Chen, Xiaokang Zhang, Xiaotao Nie, Xin Cheng, Xin Liu, Xin Xie, Xingchao Liu, Xingkai Yu, Xingyou Li, Xinyu Yang, Xinyuan Li, Xu Chen, Xuecheng Su, Xuehai Pan, Xuheng Lin, Xuwei Fu, Y. Q. Wang, Yang Zhang, Yanhong Xu, Yanru Ma, Yao Li, Yao Li, Yao Zhao, Yaofeng Sun, Yaohui Wang, Yi Qian, Yi Yu, Yichao Zhang, Yifan Ding, Yifan Shi, Yiliang Xiong, Ying He, Ying Zhou, Yinmin Zhong, Yishi Piao, Yisong Wang, Yixiao Chen, Yixuan Tan, Yixuan Wei, Yiyang Ma, Yiyuan Liu, Yonglun Yang, Yongqiang Guo, Yongtong Wu, Yu Wu, Yuan Cheng, Yuan Ou, Yuanfan Xu, Yuduan Wang, Yue Gong, Yuhan Wu, Yuheng Zou, Yukun Li, Yunfan Xiong, Yuxiang Luo, Yuxiang You, Yuxuan Liu, Yuyang Zhou, Z. F. Wu, Z. Z. Ren, Zehua Zhao, Zehui Ren, Zhangli Sha, Zhe Fu, Zhean Xu, Zhenda Xie, Zhengyan Zhang, Zhewen Hao, Zhibin Gou, Zhicheng Ma, Zhigang Yan, Zhihong Shao, Zhixian Huang, Zhiyu Wu, Zhuoshu Li, Zhuping Zhang, Zian Xu, Zihao Wang, Zihui Gu, Zijia Zhu, Zilin Li, Zipeng Zhang, Ziwei Xie, Ziyi Gao, Zizheng Pan, Zongqing Yao, Bei Feng, Hui Li, J. L. Cai, Jiaqi Ni, Lei Xu, Meng Li, Ning Tian, R. J. Chen, R. L. Jin, S. S. Li, Shuang Zhou, Tianyu Sun, X. Q. Li, Xiangyue Jin, Xiaojin Shen, Xiaosha Chen, Xinnan Song, Xinyi Zhou, Y. X. Zhu, Yanping Huang, Yaohui Li, Yi Zheng, Yuchen Zhu, Yunxian Ma, Zhen Huang, Zhipeng Xu, Zhongyu Zhang, Dongjie Ji, Jian Liang, Jianzhong Guo, Jin Chen, Leyi Xia, Miaojun Wang, Mingming Li, Peng Zhang, Ruyi Chen, Shangmian Sun, Shaoqing Wu, Shengfeng Ye, T. Wang, W. L. Xiao, Wei An, Xianzu Wang, Xiaowen Sun, Xiaoxiang Wang, Ying Tang, Yukun Zha, Zekai Zhang, Zhe Ju, Zhen Zhang, Zihua Qu

机构 * DeepSeek-AI

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 DeepSeek-V3.2通过高效注意力机制、强化学习框架和大规模代理任务合成流水线,在计算效率与推理能力上取得突破,超越GPT-5并获国际竞赛金牌。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18649 2025-12-02 cs.CL 57%

Evaluating Large Language Models on the 2026 Korean CSAT Mathematics Exam: Measuring Mathematical Ability in a Zero-Data-Leakage Setting

评估大型语言模型在2026年韩国CSAT数学考试中的表现:在零数据泄漏环境下测量数学能力

Goun Pyeon, Inbum Heo, Jeesu Jung, Taewook Hwang, Hyuk Namgoong, Hyein Seo, Yerim Han, Eunbin Kim, Hyeonseok Kang, Sangkeun Jung

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究评估了24种LLM在2026年韩国CSAT数学考试中的表现,发现文本输入优于图像输入,GPT-5系列模型在特定配置下达到满分,同时揭示了微积分领域表现最差,且高难度问题对模型性能影响显著。

Comments 52 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00344 2025-12-02 cs.AI 57%

Echo-N1: Affective RL Frontier

Echo-N1:情感强化学习前沿

Naifan Zhang, Ruihan Sun, Ruixi Su, Shiqi Ma, Shiya Zhang, Xianna Weng, Xiaofan Zhang, Yuhan Zhan, Yuyang Xu, Zhaohan Chen, Zhengyuan Pan, Ziyi Song

机构 * Echo-N1: Affective RL Frontier Team(情感强化学习前沿团队)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 Echo-N1通过实时推断用户个性并优化个性化对话偏好,开创了情感强化学习的新领域,显著提升了人类般的交互质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22173 2025-12-01 cs.CL 57%

RefineBench: Evaluating Refinement Capability of Language Models via Checklists

RefineBench: 通过检查表评估语言模型的细化能力

Young-Jun Lee, Seungone Kim, Byung-Kwan Lee, Minkyeong Moon, Yechan Hwang, Jong Myoung Kim, Graham Neubig, Sean Welleck, Ho-Jin Choi

机构 * KAIST(韩国科学技术院) Carnegie Mellon University(卡内基梅隆大学) NVIDIA(英伟达) Independent Researcher(独立研究者)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 RefineBench通过检查表评估语言模型的细化能力,发现指导细化能显著提升响应质量,而自我细化则需进一步突破。

Comments Project website: https://passing2961.github.io/refinebench-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21756 2025-12-01 cs.CL cs.CE 57%

Dissecting the Ledger: Locating and Suppressing "Liar Circuits" in Financial Large Language Models

拆解账本:在金融大型语言模型中定位并抑制‘骗子电路’

Soham Mirajkar

机构 * Soham Mirajkar ( November 24, 2025 )(Soham Mirajkar)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出通过因果追溯在金融LLM中定位并抑制导致算术幻觉的'骗子电路',通过实验验证了中间层和晚期层的双阶段机制,并展示了抑制特定层可显著降低幻觉输出的置信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21631 2025-12-01 cs.CV cs.AI 57%

Qwen3-VL Technical Report

Qwen3-VL 技术报告

Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, Wenbin Ge, Zhifang Guo, Qidong Huang, Jie Huang, Fei Huang, Binyuan Hui, Shutong Jiang, Zhaohai Li, Mingsheng Li, Mei Li, Kaixin Li, Zicheng Lin, Junyang Lin, Xuejing Liu, Jiawei Liu, Chenglong Liu, Yang Liu, Dayiheng Liu, Shixuan Liu, Dunjie Lu, Ruilin Luo, Chenxu Lv, Rui Men, Lingchen Meng, Xuancheng Ren, Xingzhang Ren, Sibo Song, Yuchong Sun, Jun Tang, Jianhong Tu, Jianqiang Wan, Peng Wang, Pengfei Wang, Qiuyue Wang, Yuxuan Wang, Tianbao Xie, Yiheng Xu, Haiyang Xu, Jin Xu, Zhibo Yang, Mingkun Yang, Jianxin Yang, An Yang, Bowen Yu, Fei Zhang, Hang Zhang, Xi Zhang, Bo Zheng, Humen Zhong, Jingren Zhou, Fan Zhou, Jing Zhou, Yuanzhi Zhu, Ke Zhu

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 Qwen3-VL 是一款强大的多模态模型,具备强大的纯文本理解、长上下文处理和多模态推理能力,适用于图像推理、代理决策和多模态代码智能。

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00234 2025-12-01 cs.LG cs.CV cs.NA math.NA physics.comp-ph stat.ML 57%

Fast Solvers for Discrete Diffusion Models: Theory and Applications of High-Order Algorithms

离散扩散模型的快速求解器:高阶算法的理论与应用

Yinuo Ren, Haoxuan Chen, Yuchen Zhu, Wei Guo, Yongxin Chen, Grant M. Rotskoff, Molei Tao, Lexing Ying

机构 * Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出高阶算法用于离散扩散模型,提升推断效率和样本质量,适用于文本、图像等生成任务。

Comments Accepted at NeurIPS 2025 as a Poster (https://openreview.net/forum?id=OuklL6Q3sO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21610 2025-11-27 cs.CL 57%

Auxiliary Metrics Help Decoding Skill Neurons in the Wild

辅助度量帮助解码野生中的技能神经元

Yixiu Zhao, Xiaozhi Wang, Zijun Yao, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种方法,通过辅助度量解码技能神经元,验证了其在多种任务中的有效性。

Comments 7 pages, 7 figures. Includes additional appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13841 2025-11-19 cs.LG 57%

Beat the long tail: Distribution-Aware Speculative Decoding for RL Training

Zelei Shao, Vikranth Srivatsa, Sanjana Srivastava, Qingyang Wu, Alpay Ariyak, Xiaoxia Wu, Ameen Patel, Jue Wang, Percy Liang, Tri Dao, Ce Zhang, Yiying Zhang, Ben Athiwaratkun, Chenfeng Xu, Junxiong Wang

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13027 2025-11-18 cs.AI 57%

Scaling Generative Verifiers For Natural Language Mathematical Proof Verification And Selection

Sadegh Mahdavi, Branislav Kisacanin, Shubham Toshniwal, Wei Du, Ivan Moshkov, George Armstrong, Renjie Liao, Christos Thrampoulidis, Igor Gitman

机构 * NVIDIA University of British Columbia(不列颠哥伦比亚大学) Institute for AI R&D of Serbia(塞尔维亚人工智能研究与发展研究所)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏