arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10472 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10472 篇

2602.17053 2026-02-24 cs.AI cs.CL 81%

RFEval: Benchmarking Reasoning Faithfulness under Counterfactual Reasoning Intervention in Large Reasoning Models

RFEval: 在大推理模型中评估推理忠实性下的反事实推理干预基准测试

Yunseok Han, Yejoon Lee, Jaeyoung Do

机构 * AIDAS Laboratory(AIDAS实验室) IPAI ECE(电子工程系) Seoul National University(首尔国立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 RFEval通过反事实推理干预评估大推理模型的推理忠实性,发现49.7%的输出不忠实,主要源于立场不一致,强调准确性不能作为忠实性的可靠代理。

Comments Accepted in ICLR 2026 Poster: https://iclr.cc/virtual/2026/poster/10011763

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13370 2026-02-24 cs.MA cs.AI cs.CL 81%

G2CP: A Graph-Grounded Communication Protocol for Verifiable and Efficient Multi-Agent Reasoning

G2CP:一种基于图的可验证和高效的多智能体推理通信协议

Karim Ben Khaled, Davy Monticolo

机构 * University of Lorraine, LORIA(洛林大学,LORIA)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 G2CP通过图操作实现多智能体高效、可验证的推理通信,提升任务准确率并消除幻觉传播。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18493 2026-02-24 cs.LG cs.AI 81%

Learning to Remember: End-to-End Training of Memory Agents for Long-Context Reasoning

学习记忆:为长上下文推理端到端训练记忆代理

Kehao Zhang, Shangtong Gui, Sheng Yang, Wei Chen, Yang Feng

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences (ICT/CAS)(智能信息处理重点实验室,计算技术研究所,中国科学院) Key Laboratory of AI Safety, Chinese Academy of Sciences(人工智能安全重点实验室,中国科学院) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Li Auto Inc.(利亚德公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 UMA通过端到端强化学习框架,整合记忆操作与问答,提升长上下文推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14404 2026-02-17 cs.AI cs.LG cs.NE 81%

Boule or Baguette? A Study on Task Topology, Length Generalization, and the Benefit of Reasoning Traces

面包还是法棍?一项关于任务拓扑、长度泛化和推理轨迹益处的研究

William L. Tong, Ege Cakar, Cengiz Pehlevan

机构 * School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院) Kempner Institute for the Study of Artificial and Natural Intelligence, Harvard University(哈佛大学人工智能与自然智能研究所) Center for Brain Sciences, Harvard University(哈佛大学脑科学中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究通过PITA数据集探讨推理轨迹在不同任务拓扑和长度泛化中的表现,揭示了RT模型在广度任务中的优势及深度任务的局限性。

Comments 38 pages, 11 figures, code available at https://github.com/wtong98/boule-or-baguette

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14189 2026-02-17 cs.CL cs.AI 81%

Knowing When Not to Answer: Abstention-Aware Scientific Reasoning

知道何时不回答:具有退避意识的科学推理

Samir Abdaljalil, Erchin Serpedin, Hasan Kurban

机构 * Texas A&M University(德克萨斯农工大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种具有退避意识的科学推理框架,通过分解科学主张并利用自然语言推理评估证据,以减少错误风险,强调退避在科学验证中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01055 2026-02-17 cs.LG cs.AI q-bio.BM q-bio.QM 81%

FGBench: A Dataset and Benchmark for Molecular Property Reasoning at Functional Group-Level in Large Language Models

FGBench: 一个用于大语言模型中功能基团级分子属性推理的数据集和基准

Xuan Liu, Siru Ouyang, Xianrui Zhong, Jiawei Han, Huimin Zhao

机构 * Department of Chemical and Biomolecular Engineering, University of Illinois Urbana-Champaign(化学与生物分子工程系,伊利诺伊大学厄巴纳-香槟分校) Department of Computer Science, University of Illinois Urbana-Champaign(计算机科学系,伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 FGBench通过构建包含功能基团级信息的数据集,提升大语言模型在分子属性推理任务中的能力。

Comments NeurIPS 2025 (Datasets and Benchmarks Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13274 2026-02-17 cs.AI cs.CL 81%

ProMoral-Bench: Evaluating Prompting Strategies for Moral Reasoning and Safety in LLMs

ProMoral-Bench:评估大语言模型中道德推理与安全性的提示策略

Rohan Subramanian Thomas, Shikhar Shiromani, Abdullah Chaudhry, Ruizhe Li, Vasu Sharma, Kevin Zhu, Sunishchal Dev

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 ProMoral-Bench通过统一道德安全评分评估多种提示策略,发现紧凑示例引导框架在道德和安全方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12968 2026-02-16 cs.IR cs.AI cs.CL 81%

RGAlign-Rec: Ranking-Guided Alignment for Latent Query Reasoning in Recommendation Systems

RGAlign-Rec: 基于排名引导的潜在查询推理中的对齐方法

Junhua Liu, Yang Jihao, Cheng Chang, Kunrong LI, Bin Fu, Kwan Hui Lim

机构 * Forth AI Singapore(Forth AI新加坡) Shopee Singapore(Shopee新加坡) Singapore Uni. of Tech. and Design(新加坡技术与设计大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 RGAlign-Rec通过闭环对齐框架结合语义推理和增强查询模型,提升电子商务推荐系统的预测准确性和服务质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12422 2026-02-16 cs.AR cs.AI cs.LG 81%

CacheMind: From Miss Rates to Why -- Natural-Language, Trace-Grounded Reasoning for Cache Replacement

CacheMind: 从缺失率到原因 -- 基于自然语言和跟踪数据的缓存替换推理

Kaushal Mhapsekar, Azam Ghanbari, Bita Aslrousta, Samira Mirbagher-Ajorpaz

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 CacheMind通过自然语言和跟踪数据推理提升缓存替换性能,实现高准确率和实际应用效果。

Comments 16 pages, 13 figures, ASPLOS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12196 2026-02-13 cs.CL cs.AI 81%

Visual Reasoning Benchmark: Evaluating Multimodal LLMs on Classroom-Authentic Visual Problems from Primary Education

视觉推理基准:评估多模态大语言模型在小学课堂真实视觉问题上的能力

Mohamed Huti, Alasdair Mackintosh, Amy Waldock, Dominic Andrews, Maxime Lelièvre, Moritz Boos, Tobias Murray, Paul Atherton, Robin A. A. Ince, Oliver G. B. Garrod

机构 * Fab AI

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出视觉推理基准,用于评估多模态大语言模型在小学课堂真实视觉问题上的能力,揭示模型在静态与动态任务上的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12143 2026-02-13 cs.AI cs.LG 81%

STAR : Bridging Statistical and Agentic Reasoning for Large Model Performance Prediction

STAR:连接统计推理与代理推理以提升大模型性能预测

Xiaoxiao Wang, Chunxiao Li, Junying Wang, Yijin Guo, Zijian Chen, Chunyi Li, Xiaohong Liu, Zicheng Zhang, Guangtao Zhai

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 STAR框架通过结合统计推理与代理推理,有效提升大模型性能预测的准确性与可靠性,尤其在数据稀疏情况下表现突出。

Comments 10 pages, 8 figures, 17 tables. Code available at https://github.com/xiaoxiaostudy/star

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16858 2026-02-12 cs.CL cs.AI 81%

MTBench: A Multimodal Time Series Benchmark for Temporal Reasoning and Question Answering

MTBench: 一种多模态时间序列基准,用于时间推理和问答

Jialin Chen, Aosong Feng, Ziyu Zhao, Juan Garza, Gaukhar Nurbek, Cheng Qin, Ali Maatouk, Leandros Tassiulas, Yifeng Gao, Rex Ying

机构 * Yale University, New Haven, CT, USA(耶鲁大学) McGill University, Montreal, QC, Canada(麦吉尔大学) University of Texas Rio Grande Valley, TX, USA(德克萨斯大学里奥格兰德谷分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 MTBench是一种多模态时间序列基准,用于评估大型语言模型在金融和天气领域的时间推理和问答能力。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16814 2026-02-12 cs.LG cs.CL 81%

From Belief Entrenchment to Robust Reasoning in LLM Agents

从信念固化到LLM代理的稳健推理

Jihwan Oh, Minchan Jeong, Jongwoo Ko, Se-Young Yun

机构 * KAIST AI(韩国科学技术院人工智能研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 DReaMAD通过引入多样化推理和动态辩论机制,有效缓解了LLM代理中的信念固化问题,提升了推理准确性与胜率。

Comments Accepted to TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14986 2026-02-12 cs.AI cs.CL 81%

Implicit Probabilistic Reasoning Does Not Reflect Explicit Answers in Large Language Models

隐式概率推理不反映大语言模型中的显式答案

Manuel Mondal, Ljiljana Dolamic, Gérôme Bovet, Philippe Cudré-Mauroux, Julien Audiffren

机构 * University of Fribourg, Switzerland(弗里堡大学) armasuisse S+T, Switzerland(armasuisse S+T)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究发现大语言模型在显式概率推理中表现良好,但在隐式概率推理中预测与真实情况存在显著差异,且传统评估方法无法检测此类错误。

Comments Published in Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08382 2026-02-10 cs.CL cs.AI 81%

Dynamic Long Context Reasoning over Compressed Memory via End-to-End Reinforcement Learning

通过端到端强化学习实现压缩内存中的动态长上下文推理

Zhuoen Chen, Dongfang Li, Meishan Zhang, Baotian Hu, Min Zhang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于端到端强化学习的框架,通过分块压缩和选择性记忆回溯实现高效长上下文推理,提升了多跳推理任务的准确性和效率。

Comments 26 pages, 7 figures. Code and models will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20694 2026-02-10 cs.AI astro-ph.SR cs.LG physics.space-ph 81%

Reasoning With a Star: A Heliophysics Dataset and Benchmark for Agentic Scientific Reasoning

用恒星进行推理:一个用于代理科学推理的太阳物理数据集和基准

Kevin Lee, Russell Spiewak, James Walsh

机构 * Frontier Development Lab(前沿发展实验室) Department of Mechanical and Aerospace Engineering, UCLA(机械与航空航天工程系,加州大学洛杉矶分校) Trillium Technologies Inc.(Trillium技术公司) Department of Engineering, University of Cambridge(工程系,剑桥大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出一个太阳物理数据集和基准,用于评估代理在科学推理中的表现,发现系统工程原则在演绎推理任务中优于直接提示方法。

Comments Accepted at NeurIPS 2025 Machine Learning and the Physical Sciences (ML4PS) Workshop. Dataset: https://huggingface.co/datasets/SpaceML/ReasoningWithAStar

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07820 2026-02-10 cs.AI cs.CL 81%

Certainty-Guided Reasoning in Large Language Models: A Dynamic Thinking Budget Approach

在大语言模型中的确定性引导推理:一种动态思维预算方法

João Paulo Nogueira, Wentao Sun, Alonso Silva, Laith Zumot

机构 * Nokia Bell Labs, France(诺基亚贝尔实验室,法国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 CGR通过动态调整推理预算,在保持准确性的同时减少token使用,通过确定性评估实现高效的推理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15487 2026-02-10 cs.CL cs.AI 81%

ExpliCa: Evaluating Explicit Causal Reasoning in Large Language Models

ExpliCa:评估大型语言模型中的显式因果推理

Martina Miliani, Serena Auriemma, Alessandro Bondielli, Emmanuele Chersoni, Lucia Passaro, Irene Sucameli, Alessandro Lenci

机构 * CoLing Lab, Department of Philology, Literature, and Linguistics, University of Pisa, Italy(皮尔森大学哲学、文学与语言学系协作语言实验室) Department of Informatics, University of Pisa, Italy(皮尔森大学信息学系) Department of Chinese and Bilingual Studies, The Hong Kong Polytechnic University(香港理工大学中文与双语研究系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 ExpliCa数据集用于评估大型语言模型在显式因果推理中的能力,发现顶级模型在准确率上仍存在显著不足,且模型性能受语言顺序和大小影响明显。

Comments Accepted for publication in Findings of ACL 2025

Journal ref In Findings of the Association for Computational Linguistics: ACL 2025, pages 17335-17355, Vienna, Austria. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11239 2026-02-10 cs.AI cs.CL 81%

Nondeterministic Polynomial-time Problem Challenge: An Ever-Scaling Reasoning Benchmark for LLMs

非确定多项式时间问题挑战:为大语言模型构建的持续扩展推理基准

Chang Yang, Ruiyu Wang, Junzhe Jiang, Qi Jiang, Qinggang Zhang, Yanchen Deng, Shuxin Li, Shuyue Hu, Bo Li, Florian T. Pokorny, Xiao Huang, Xinrun Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) KTH Royal Institute of Technology(皇家理工学院) Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Singapore Management University(新加坡管理学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 NPPC是一个持续扩展的推理基准,通过三个模块评估LLMs的推理能力,揭示其性能极限和改进方向。

Comments Accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02581 2026-02-04 cs.LG cs.AI 81%

QuantLRM: Quantization of Large Reasoning Models via Fine-Tuning Signals

QuantLRM:通过微调信号对大推理模型进行量化

Nan Zhang, Eugene Kwek, Yusen Zhang, Muyu Pan, Suhang Wang, Prasenjit Mitra, Rui Zhang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 QuantLRM通过微调信号对大推理模型进行量化,通过拟合二次函数保护两端,提升量化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02497 2026-02-04 cs.CL cs.AI 81%

STEMVerse: A Dual-Axis Diagnostic Framework for STEM Reasoning in Large Language Models

STEMVerse: 一种用于大型语言模型中STEM推理的双轴诊断框架

Xuzhao Li, Xuchen Li, Jian Zhao, Shiyu Hu

机构 * NTU(国立科技大学) ZGCA(智能计算协会) ZGCI(智能计算研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 STEMVerse通过双轴诊断框架系统分析LLM在STEM领域的推理能力,揭示其结构失败模式,提供科学推理的深入理解。

Comments Preprint, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02125 2026-02-04 cs.AI cs.CL 81%

Do AI Models Perform Human-like Abstract Reasoning Across Modalities?

AI模型在不同模态下是否能进行类人抽象推理?

Claas Beger, Ryan Yi, Shuhao Fu, Kaleda Denton, Arseny Moskvichev, Sarah W. Tsai, Sivasankaran Rajamanickam, Melanie Mitchell

机构 * Santa Fe Institute, New Mexico, USA(圣菲研究所) Sandia National Laboratories, New Mexico, USA(桑迪亚国家实验室) Advanced Micro Devices Inc., Texas, USA(先进微器件公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了AI模型在不同模态下进行抽象推理的能力,发现其在文本和视觉模态中的表现存在显著差异,表明仅依赖准确率评估抽象推理能力存在偏差。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01477 2026-02-03 cs.LG cs.AI 81%

Achieving Time Series Reasoning Requires Rethinking Model Design, Tasks Formulation, and Evaluation

实现时间序列推理需要重新思考模型设计、任务制定和评估

Yaxuan Kong, Yiyuan Yang, Shiyu Wang, Chenghao Liu, Yuxuan Liang, Ming Jin, Stefan Zohren, Dan Pei, Yan Liu, Qingsong Wen

机构 * University of Oxford, UK(牛津大学) Hong Kong University of Science(香港科学大学) Griffith University, Australia(格里菲斯大学) Tsinghua University, China(清华大学) University of Southern California, USA(南加州大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文指出时间序列推理需重新审视模型设计、任务制定和评估,提出统一框架以提升现实应用中的鲁棒性、可解释性和决策相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15746 2026-02-03 cs.CL cs.AI cs.CV 81%

End-to-End Agentic RAG System Training for Traceable Diagnostic Reasoning

端到端代理RAG系统训练用于可追溯的诊断推理

Qiaoyu Zheng, Yuze Sun, Chaoyi Wu, Weike Zhao, Pengcheng Qiu, Yongguo Yu, Kun Sun, Jian Zhang, Yanfeng Wang, Ya Zhang, Weidi Xie

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 Deep-DxSearch通过端到端强化学习训练代理RAG系统,实现可追溯的诊断推理,显著提升诊断准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06822 2026-02-02 cs.AI cs.CL 81%

RAFFLES: Reasoning-based Attribution of Faults for LLM Systems

基于推理的LLM系统故障归因

Chenyang Zhu, Spencer Hong, Jingyu Wu, Kushal Chawla, Charlotte Tang, Youbing Yin, Nathan Wolfe, Erin Babinsky, Daben Liu

机构 * Capital One

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 RAFFLES通过整合迭代推理的离线评估架构,实现了对LLM系统中步骤级故障的自动化检测,显著提高了故障识别的准确率。

Comments Accepted at EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21000 2026-01-30 cs.CL cs.AI 81%

UrduBench: An Urdu Reasoning Benchmark using Contextually Ensembled Translations with Human-in-the-Loop

UrduBench: 一种基于上下文融合翻译的人工参与推理基准测试

Muhammad Ali Shafique, Areej Mehboob, Layba Fiaz, Muhammad Usman Qadeer, Hamza Farooq

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出UrduBench,通过上下文融合翻译和人工参与验证,构建乌尔都语推理基准测试,评估不同模型在多种提示策略下的表现,揭示多步骤推理在乌尔都语中的挑战及语言对齐的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20221 2026-01-29 cs.AI cs.CL 81%

Scaling Medical Reasoning Verification via Tool-Integrated Reinforcement Learning

通过工具集成强化学习扩展医学推理验证

Hang Zhang, Ruheng Wang, Yuelyu Ji, Mingu Kwak, Xizhi Wu, Chenyu Li, Li Zhang, Wenqi Shi, Yifan Peng, Yanshan Wang

机构 * University of Pittsburgh(匹兹堡大学) UT Southwestern Medical Center(西南医学中心) Cornell University(康奈尔大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出$\method$,通过工具集成强化学习实现医学推理验证的扩展,显著提升验证效果并降低采样预算需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18984 2026-01-28 cs.LG cs.CL 81%

Save the Good Prefix: Precise Error Penalization via Process-Supervised RL to Enhance LLM Reasoning

保存好的前缀:通过过程监督强化学习实现精确误差惩罚以增强大语言模型推理

Haolin Liu, Dian Yu, Sidi Lu, Yujun Zhou, Rui Liu, Zhenwen Liang, Haitao Mi, Chen-Yu Wei, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) University of Virginia(弗吉尼亚大学) University of Notre Dame(圣母大学) University of Maryland(马里兰大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 通过过程监督强化学习实现精确误差惩罚,提升大语言模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15600 2026-01-28 cs.AI cs.CL 81%

Unleashing Scientific Reasoning for Bio-experimental Protocol Generation via Structured Component-based Reward Mechanism

通过结构化组件奖励机制解锁生物实验协议生成中的科学推理

Haoran Sun, Yankai Jiang, Zhenyu Tang, Yaning Pan, Shuang Gu, Zekai Lin, Lilong Wang, Wenjie Lou, Lei Liu, Lei Bai, Xiaosong Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 通过结构化组件奖励机制,Thoth在多个基准测试中超越了现有LLMs,实现了更准确的生物实验协议生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10132 2026-01-27 cs.AI cs.LG 81%

Is More Context Always Better? Examining LLM Reasoning Capability for Time Interval Prediction

更多上下文总是更好吗?检验LLM在时间间隔预测中的推理能力

Yanan Cao, Farnaz Fallahi, Murali Mohana Krishna Dandu, Lalitesh Morishetti, Kai Zhao, Luyi Ma, Sinduja Subramaniam, Jianpeng Xu, Evren Korpeoglu, Kaushiki Nag, Sushant Kumar, Kannan Achan

机构 * Walmart Global Tech(沃尔玛全球技术)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究LLM在时间间隔预测中的推理能力,发现尽管LLM在某些任务中表现良好,但其在捕捉定量时间结构方面存在局限,且过多上下文反而可能降低性能。

Comments Accepted at The Web Conference 2026 (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏