SatLM: Satisfiability-Aided Language Models Using Declarative Prompting
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.CL、cs.AI
Comments NeurIPS 2023
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.CL、cs.AI
Comments NeurIPS 2023
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
Comments 12 pages, 6 figures, 4 tables. Accepted by NLLP 2022 (EMNLP workshop)
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Virginia(弗吉尼亚大学) ; Google DeepMind(谷歌DeepMind) ; Google Research(谷歌研究院) ; Princeton University(普林斯顿大学)
专题命中 数学推理 :reasoning(abstract,comments);chain-of-thought(abstract);CoT(abstract);分类 cs.LG
Comments A multi-turn direct preference learning framework for tool-integrated reasoning tasks
BRUCE:面向科学视觉-语言推理的污染升级下鲁棒性基准测试
机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)
专题命中 数学推理 :reasoning(title,abstract)
AI总结 该研究提出BRUCE基准测试框架,通过RCI与T-RCI指标分析VLMs在科学视觉-语言推理任务中随污染升级的鲁棒性退化,实现可解释的失败分析。
EC-Bench:超长视频的枚举与计数基准
机构 * The University of Tokyo, Japan(东京大学) ; Institute of Science Tokyo, Japan(东京科学大学) ; National Institute of Informatics, Japan(国立信息学研究所)
专题命中 数学推理 :reasoning(title,abstract)
AI总结 EC-Bench针对超长视频的枚举与计数问题,通过152部超过30分钟的视频和1699个查询,评估多模态大语言模型的性能,揭示模型在时间推理和计数任务中的局限性。
Comments The first two authors are equally contributed. The data and code are publicly available at: https://github.com/matsuolab/EC-Bench
从答案生成器到推理促进者:为高风险环境中的数学推理设计AI导师
专题命中 数学推理 :reasoning(title,abstract)
AI总结 本研究设计并部署了AITutor系统,通过分层工作示例、步骤链接视觉基础和元认知支架等功能,帮助初中生在高压考试中从被动获取答案转向主动修复推理过程,提出了以推理为中心的产品循环。
通过快速与慢速思考学习进行机器视觉推理
机构 * Centre for Bioengineering, Queen Mary University of London(伦敦玛丽女王大学生物工程中心) ; Digital Environment Research Institute, Queen Mary University of London(伦敦玛丽女王大学数字环境研究所) ; School of Engineering and Materials Science, Queen Mary University of London(伦敦玛丽女王大学工程与材料科学学院) ; UCL Hawkes Institute, University College London(伦敦大学学院UCL霍克斯研究所) ; Department of Medical Physics and Biomedical Engineering, University College London(伦敦大学学院医学物理与生物医学工程系) ; Centre for Urology Imaging, Prostate, AI and Surgical Studies (COMPASS) Research Group, Division of Surgery and Interventional Science, University College London(伦敦大学学院外科与介入科学部泌尿影像、前列腺、人工智能与手术研究(COMPASS)组中心) ; Department of Urology, Comprehensive Cancer Center, Medical University of Vienna(维也纳医科大学综合癌症中心泌尿科) ; Division of Surgery and Interventional Science, University College London(伦敦大学学院外科与介入科学部) ; Department of Computer Science, University College London(伦敦大学学院计算机科学系)
专题命中 数学推理 :reasoning(title,abstract)
AI总结 受人类双过程认知理论启发,提出结合快速系统I和慢速系统II的视觉推理范式,通过推理时计算提升数据稀缺场景下的性能,在计算机视觉基准和五器官癌症定位任务中超越大规模监督学习和人类专家。
Journal ref Nat Commun (2026)
通过迭代AI推理发现动力学暗能量状态方程的物理引导
专题命中 数学推理 :reasoning(title,abstract)
AI总结 提出迭代AI推理框架,利用大语言模型生成并优化暗能量状态方程,结合文献检索和自动评估,发现两种新参数化形式,在超新星、重子声学振荡和Planck数据上优于传统模型。
Comments 6 figures, 45 pages, submitted. Code: https://iadev.cbpf.br/labia/cosmoai
多LLM能量推理用于无二进制零日物联网检测
专题命中 数学推理 :reasoning(title,abstract)
AI总结 提出一种无需二进制文件、架构无关的方法,通过三LLM推理架构和能量感知符号负载模型,利用高层描述符估计零日漏洞可能性,模拟评估显示高风险条件下预测概率提升20-35%。
通过形式数学AI推理重新思考无线通信
专题命中 数学推理 :reasoning(title,abstract)
AI总结 本文提出通过形式数学AI推理重新构建无线通信理论,提出验证、推导和发现三层框架,推动无线数学知识的建立。
SiLVR:一种简单的基于语言的视频推理框架
机构 * Department of Computer Science(计算机科学系) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 数学推理 :reasoning(title,abstract)
AI总结 SiLVR通过将复杂视频理解分解为两个阶段,利用多感官输入生成语言表示,并通过强大推理LLM解决复杂视频-语言任务,实现了在多个视频评估任务上的最佳表现。
Comments Accepted by TMLR (01/2026)
利用大语言模型的数学推理实现高效的GPU线程映射
专题命中 数学推理 :reasoning(title,abstract)
AI总结 本文提出利用大语言模型的符号推理自动化GPU非矩形域线程映射,通过上下文学习推导出精确的O(1)和O(log N)映射方程,显著优于传统符号回归方法,实现高效能资源优化。
Comments 11 pages, 5 figures, 8 tables. Submitted to IEEE Transactions on Parallel and Distributed Systems (TPDS)
即使更少也是更好:用于代理、推理和编码LLM的更优方案
专题命中 数学推理 :reasoning(title,abstract)
AI总结 本文提出STITCH框架,通过过滤低价值噪声和保留决策关键标记,以更少但高质量的训练轨迹提升代理能力,在多个框架和语言中实现显著提升。
Comments 17 pages, 5 figures
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) ; Pengcheng Laboratory(鹏城实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
专题命中 数学推理 :reasoning(title,abstract)
Comments 12pages, 11 figures
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
专题命中 数学推理 :reasoning(title,abstract)
专题命中 数学推理 :reasoning(title,abstract)
专题命中 数学推理 :reasoning(title,abstract)
机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) ; Hupan Lab(虎扑实验室) ; Zhejiang University(浙江大学) ; Singapore University of Technology and Design(新加坡科技设计大学)
专题命中 数学推理 :reasoning(title,abstract)
Comments Home page: https://alibaba-damo-academy.github.io/VCBench/
专题命中 数学推理 :reasoning(title,abstract)
专题命中 数学推理 :reasoning(title,abstract)
专题命中 数学推理 :reasoning(title,abstract)
StreamReason-Bench:大型语言模型能否推理事件时间流处理语义?
机构 * Northeastern University(东北大学)
专题命中 数学推理 :CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI
AI总结 该研究构建了StreamReason-Bench基准测试,发现LLM在事件时间流处理语义推理任务上表现不佳,思维链可提升其性能,难点在于事件时间与延迟数据处理。
TCPO:回合级信用策略优化
机构 * Moore Threads AI(摩尔线程人工智能)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);verifier(abstract);分类 cs.AI
AI总结 该研究针对验证器引导多回合强化学习的信用分配问题,提出TCPO方法,在多类任务和模型上提升了LLM的多回合推理与智能体性能。
卡尔曼与课程学习结合:面向自适应RL微调的高效动态提示选择
机构 * Beihang University(北京航空航天大学) ; Zhongguancun Academy(中关村学院) ; Nanyang Technological University(南洋理工大学) ; Communication University of China(中国传媒大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);planning(abstract);分类 cs.LG
AI总结 本文提出KGPS方法,将提示选择转化为动态状态估计问题,适配RL训练动态,在多推理基准和RL算法上较基线提升准确率与rollout效率,在在线提示选择中达最优。
超越Token:基于LLM的多智能体系统中潜在通信的统一框架
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.CL
AI总结 提出一个三维统一框架(通信内容、发送-接收对齐、信息融合方式),系统分类2024-2026年间18种潜在通信方法,识别五种设计模式并揭示开放挑战。
通过有限自动机上的高效推理实现扩散语言模型的约束解码
机构 * Stanford University(斯坦福大学)
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);planning(abstract);分类 cs.LG
AI总结 研究扩散语言模型的约束解码问题,提出基于有限自动机高效推理的算法,能保证约束满足,支持多种解码方式,经实验验证在多种任务上提升准确率且推理开销小。
通过局部分支路由实现高效且可训练的语言模型测试时扩展
机构 * Northwestern University(西北大学) ; Rutgers University(罗格斯大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Carnegie Mellon University(卡内基梅隆大学) ; LMSYS Org(LMSYS组织) ; Tilde Research(Tilde研究) ; University of California, Santa Barbara(加州大学圣塔芭芭拉分校) ; University of Toronto(多伦多大学) ; University of British Columbia(不列颠哥伦比亚大学) ; University of California, San Diego(加州大学圣迭戈分校)
专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.CL
AI总结 提出局部分支路由(LBR)框架,通过轻量级路由器选择局部前瞻树中的深度-1子路径,实现令牌级测试时扩展,在数学推理基准上优于链式思维和软令牌分支基线。
ExpRL: 用于LLM中期训练的探索性强化学习
机构 * Stanford University(斯坦福大学) ; Carnegie Mellon University(卡内基梅隆大学) ; OpenAI ; Rogo
专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);self-correction(abstract);分类 cs.LG
AI总结 提出ExpRL方法,利用人类编写的问答数据作为奖励支架,通过密集奖励强化推理过程中的部分进展和有用行为,在数学推理任务上优于SFT、稀疏奖励GRPO和自蒸馏,并为后续稀疏奖励RL提供更好的初始化。
相对分数策略优化用于扩散语言模型
机构 * University of Science and Technology of China(中国科学技术大学) ; The Chinese University of Hong Kong(香港中文大学) ; The University of Hong Kong(香港大学)
专题命中 数学推理 :reasoning(abstract);planning(abstract);verifier(abstract);分类 cs.CL
AI总结 本文提出RSPO方法,通过可验证奖励校准扩散语言模型中的噪声似然估计,提升推理能力,在规划任务中表现优异。
教语言模型用代码思考
机构 * Korea University(韩国大学) ; AIGEN Sciences(AIGEN科技)
专题命中 数学推理 :reasoning(abstract);planning(abstract);verifier(abstract);分类 cs.CL
AI总结 本文提出ThinC框架,通过代码自身进行推理而非依赖自然语言,提升了数学问题解决能力,其在多个基准测试中表现优异。
Comments Preprint