arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-07 至 2026-01-07 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 7 篇

2601.03205 2026-01-07 cs.CL cs.AI 84%

UltraLogic: Enhancing LLM Reasoning through Large-Scale Data Synthesis and Bipolar Float Reward

UltraLogic: 通过大规模数据合成和双极浮点奖励增强大语言模型推理

Yile Liu, Yixian Liu, Zongwei Li, Yufei Huang, Xinhua Feng, Zhichao Hu, Jinglu Hu, Jianfeng Yan, Fengzong Lian, Yuhong Liu

机构 * Hunyuan, Tencent(腾讯 Hunyuan) Waseda University(早稻田大学)

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 UltraLogic通过大规模数据合成和双极浮点奖励机制,提升大语言模型的推理能力,强调任务多样性和难度匹配对训练效率的促进作用。

Comments 19 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19542 2026-01-07 cs.CV 82%

CVBench: Benchmarking Cross-Video Synergies for Complex Multimodal Reasoning

CVBench: 多视频协同推理的基准测试

Nannan Zhu, Yonghao Dong, Teng Wang, Xueqian Li, Shengjun Deng, Yijia Wang, Zheng Hong, Tiantian Geng, Guo Niu, Hanyan Huang, Xiongfei Yao, Shuaiwei Jiao

机构 * Sun Yat-sen University(中山大学) University of Hong Kong(香港大学) Foshan University(佛山大学) University of Birmingham(伯明翰大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 CVBench通过跨视频关系推理基准测试,揭示多模态大语言模型在跨视频时空推理中的性能差距及架构瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03217 2026-01-07 cs.CL 79%

MalruleLib: Large-Scale Executable Misconception Reasoning with Step Traces for Modeling Student Thinking in Mathematics

MalruleLib: 大规模可执行的错误推理与步骤追踪用于数学学生思维建模

Xinghe Chen, Naiming Liu, Shashank Sonkar

机构 * Rice University(里士大学) University of Central Florida(中央佛罗里达大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 MalruleLib通过可执行的错误推理和步骤追踪,建模数学学生思维,实现跨模板的误解预测与反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02732 2026-01-07 cs.SE cs.AI 79%

Agentic Memory Enhanced Recursive Reasoning for Root Cause Localization in Microservices

基于代理记忆的递归推理用于微服务根因定位

Lingzhe Zhang, Tong Jia, Yunpeng Zhai, Leyi Pan, Chiming Duan, Minghua He, Mengxi Jia, Ying Li

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学) Institute of Artificial Intelligence(人工智能研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出AMER-RCL框架,通过递归推理和代理记忆提升微服务根因定位的准确性和效率。

Comments accepted by ICSE-SEIP'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02669 2026-01-07 cs.CL 57%

Towards Comprehensive Stage-wise Benchmarking of Large Language Models in Fact-Checking

面向大规模语言模型事实核查的全面阶段性基准评估

Hongzhan Lin, Zixin Chen, Zhiqi Shen, Ziyang Luo, Zhen Ye, Jing Ma, Tat-Seng Chua, Guandong Xu

机构 * Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) Salesforce AI Research(Salesforce AI 研究院) The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) The Education University of Hong Kong(香港教育大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 FactArena提出一个全面的LLM事实核查阶段基准评估框架,通过标准化流程和动态生成挑战性声明,揭示LLM在事实推理中的鲁棒性与准确性差异。

Comments 17 pages, 21 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02632 2026-01-07 cs.SE cs.AI 57%

TAAF: A Trace Abstraction and Analysis Framework Synergizing Knowledge Graphs and LLMs

TAAF:一种结合知识图谱和大语言模型的跟踪抽象与分析框架

Alireza Ezaz, Ghazal Khodabandeh, Majid Babaei, Naser Ezzati-Jivan

机构 * Brock University(布鲁克大学) Mcgil University(麦吉尔大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 TAAF结合知识图谱和大语言模型,通过时间索引技术将大规模跟踪数据转化为可操作的洞察,提升复杂系统分析的准确性和效率。

Comments Accepted to ICSE 2026. DOI 10.1145/3744916.3787832

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02559 2026-01-07 cs.SE cs.HC 50%

PerspectiveCoach: Exploring LLMs for Developer Reflection

PerspectiveCoach:探索LLM在开发者反思中的应用

Lauren Olson, Emitzá Guzmán, Florian Kunneman

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 PerspectiveCoach通过LLM帮助开发者反思软件设计对边缘化社区的影响,提升伦理意识和用户视角理解。

Comments 48th International Conference of Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏