arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5021 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5021 篇

2412.07977 2024-12-12 cs.AI 80%

Thinking Fast and Laterally: Multi-Agentic Approach for Reasoning about Uncertain Emerging Events

Stefan Dernbach, Alejandro Michel, Khushbu Agarwal, Christopher Brissette, Geetika Gupta, Sutanay Choudhury

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

Comments Presented in The 1st Workshop on System-2 Reasoning at Scale (NeurIPS 2024), Vancouver, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.13007 2020-01-01 cs.LG stat.ML 80%

World Programs for Model-Based Learning and Planning in Compositional State and Action Spaces

Marwin H. S. Segler

专题命中 复杂问题求解 :planning(title,abstract);分类 cs.LG;reasoning(comments)

Comments Accepted at the Generative Modeling and Model-Based Reasoning for Robotics and AI workshop at ICML 2019. Presented on June 14th 2019. See https://sites.google.com/view/mbrl-icml2019

Journal ref https://sites.google.com/view/mbrl-icml2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12483 2026-07-20 cs.SE 版本更新 80%

MoT: Modularization-of-Thought Prompting for Effective Code Generation

MoT:用于有效代码生成的思维模块化提示

Ruwei Pan, Hongyu Zhang

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 研究针对大语言模型代码生成中现有提示技术不足,提出MoT技术,利用模块化原则分解问题,用MLR图构建推理过程,经实验对比六种基线技术,在八个基准上显著提升代码生成性能,Pass@1分数达58.1%至95.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03502 2026-07-07 cs.CL cs.AI cs.LG 新提交 80%

Reading Between the Dots: Decoding Hidden Computation across Filler Tokens

解读点之间的信息:解码跨填充令牌的隐藏计算

Kaley Brauer, Claudio Mayrink Verdun, Samuel Marks

机构 * Harvard University(哈佛大学) Cambridge Boston Alignment Initiative(剑桥波士顿对齐计划) Massachusetts Institute of Technology(麻省理工学院) Anthropic

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究前沿语言模型对无内容填充令牌的隐藏计算,通过分析两个前沿模型在四个任务家族中的表现,介绍无监督解码管道,能从隐藏状态恢复中间值,证明隐藏计算可从残差流读取。

Comments Accepted to ICML 2026 Mech Interp Workshop, 10 main paper pages, 20 appendix pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17278 2026-04-21 cs.CV 80%

PestVL-Net: Enabling Multimodal Pest Learning via Fine-grained Vision-Language Interaction

PestVL-Net: 通过细粒度视觉-语言交互实现多模态害虫学习

Xueheng Li, Tao Hu, Ke Cao, Runsheng Qi, Huixin Zhang, Rui Li, Jie Zhang, Chengjun Xie

机构 * Institute of Intelligent Machines, Hefei Institutes of Physical Science, Chinese Academy of Sciences(智能机器研究所,合肥物理科学研究院,中国科学院) University of Science and Technology of China(中国科学技术大学) Zhongke Hefei Institute of Technology Innovation Engineering(中科合肥技术创新工程研究院)

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出PestVL-Net框架,结合视觉与语言模型,解决细粒度害虫识别难题,通过RWKV架构和多模态大语言模型实现高效害虫学习。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02249 2026-03-24 cs.CL cs.AI cs.LG 80%

Explore Briefly, Then Decide: Mitigating LLM Overthinking via Cumulative Entropy Regulation

briefly, Then Decide: 通过累积熵调节缓解LLM过度思考

Yi Bin, Tianyi Jiang, Yujuan Ding, Kainian Zhu, Fei Ma, Jingkuan Song, Yang Yang, Heng Tao Shen

机构 * Tongji University(同济大学) Hong Kong Polytechnic University(香港理工大学) Shanghai University of Electric and Power(上海电力大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy(广东省人工智能与数字经济实验室) University of Electronic Science and Technology of China(电子科技大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TECA指标和

Comments Code: https://github.com/AusertDream/CumulativeEntropyRegulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17871 2026-03-04 cs.CL cs.AI cs.LG 80%

LLM Probability Concentration: How Alignment Shrinks the Generative Horizon

LLM概率集中:对齐如何缩小生成范围

Chenghao Yang, Sida Li, Ari Holtzman

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现对齐微调通过减少生成多样性,使LLM生成更一致,从而影响复杂推理稳定性。

Comments Codebase: https://github.com/yangalan123/LLMBranchingFactor. V3: Significantly rewrite the whole paper for a clearer structure. Correct problems in the theory parts (Remove emphasis on AEP, discussions on variable LLM generation lengths) and strengthen asymptotic analysis. Add Qwen and OLMo2 experiments. Preliminary SFT v.s. RL comparison to better understand the alignment effects on BF

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03519 2026-01-13 cs.RO 80%

A Vision-Language-Action Model with Visual Prompt for OFF-Road Autonomous Driving

一种具有视觉提示的视觉-语言-动作模型用于越野自动驾驶

Liangdong Zhang, Yiming Nie, Haoyang Li, Fanjie Kong, Baobao Zhang, Shunxin Huang, Kai Fu, Chen Min, Liang Xiao

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 本文提出OFF-EMMA模型,通过视觉提示和COT-SC策略提升越野自动驾驶轨迹规划的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10320 2025-10-14 cs.CL cs.AI cs.LG 80%

J1: Incentivizing Thinking in LLM-as-a-Judge via Reinforcement Learning

Chenxi Whitehouse, Tianlu Wang, Ping Yu, Xian Li, Jason Weston, Ilia Kulikov, Swarnadeep Saha

机构 * FAIR at Meta(Meta 公司)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 10 pages, 13 tables, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02173 2025-10-10 cs.CL cs.AI cs.LG 80%

Learning to Reason for Hallucination Span Detection

Hsuan Su, Ting-Yao Hu, Hema Swetha Koppula, Kundan Krishna, Hadi Pouransari, Cheng-Yu Hsieh, Cem Koc, Joseph Yitan Cheng, Oncel Tuzel, Raviteja Vemulapalli

机构 * National Taiwan University(国立台湾大学) Apple(苹果公司)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18929 2025-05-27 cs.AI cs.CL 80%

Meta-aware Learning in text-to-SQL Large Language Model

Wenda Zhang

机构 * Walmart Global Tech(沃尔玛全球科技)

专题命中 复杂问题求解 :chain-of-thought(abstract,comments);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Keywords: text-to-SQL LLM, fine-tuning, meta-aware leanring, metadata, chain-of-thought, BigQuery SQL, business database

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18575 2026-08-20 cs.CL 新提交 79%

Beyond LLM-Based Reasoning: Lightweight GNNs for Agent Failure Attribution

超越基于大语言模型的推理:用于智能体故障归因的轻量级图神经网络

Ting-Wei Li, Yuanchen Bei, Xiao Lin, Hanghang Tong

机构 * University of Illinois(伊利诺伊大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究针对多智能体系统故障归因任务,提出轻量级图框架AFANet,其参数少、推理成本低,在域内基准上性能匹配或优于LLM基线,分布外基准可经低成本自适应提升,证明轻量级结构化方法可实现优异故障归因效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18242 2026-08-20 cs.LG 新提交 79%

ClosureBench: A Constructive Benchmark for Compositional Graph Reasoning

ClosureBench:面向组合图推理的构造式基准

Stefano Goria

机构 * AIM Research Lab(AIM研究实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 本研究推出ClosureBench基准,评估不同规模模型在组合图推理任务的表现,发现模型存在记忆效应、组合推理瓶颈,微调输出程序的模型可提升性能。

Comments 30 pages, 5 figures, 11 tables. Code and data: https://github.com/egolabs-ai/closurebench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06185 2026-08-20 cs.AI cs.CV 版本更新 79%

Event-Causal RAG: A Retrieval-Augmented Generation Framework for Long Video Reasoning in Complex Scenarios

事件因果RAG:一种用于长视频复杂场景中长视频推理的检索增强生成框架

Peizheng Yan, Yu Zhao, Liang Xie, Juntong Qi, Mingming Wang, Erwei Yin

机构 * Tianjin Key Lab of Intelligent Unmanned Swarm Tech & System(天津智能集群技术与系统重点实验室) Tianjin University(天津大学) Institute of Computing and Intelligence(计算与智能研究所) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Tianjin Artificial Intelligence Innovation Center(天津人工智能创新中心) Defense Innovation Institute Academy of Military Sciences(国防科技创新研究院) School of Future Technology(未来技术学院) Shanghai University(上海大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Event-Causal RAG框架,通过事件因果图和双存储记忆实现长视频推理,优于传统方法,在多事件整合和因果推理任务中表现更优,同时提升内存效率和流式性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16742 2026-08-18 cs.SE cs.AI 新提交 79%

TDD-Agent: Test-Driven Reasoning for Code Generation

TDD-Agent:用于代码生成的测试驱动推理

Hongyue Yu, Kefan Li, Jiakun Li, Hongzheng Chai, Yuan Yuan, Rui He, Junyi Wei

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 TDD-Agent将测试驱动开发范式应用于代码生成,通过测试优先推理和迭代双轨优化,在LiveCodeBench和RepoEval上均优于相关基线,提升了代码及测试的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14804 2026-08-18 cs.AI 新提交 79%

Generated Context versus Governed State: Functional Conditions for Accountable Longitudinal Clinical Reasoning

生成式上下文与受控状态:可问责纵向临床推理的功能条件

Augusto Bernardo Pissarra, Victor Lorena de Farias Souza

机构 * MyndwareMed(迈恩德韦尔医疗)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文区分生成式上下文与受控状态,定义可问责临床AI的审计标准与信息要求,提出六级成熟度框架,将当前LLM临床实践定位于高能力低成熟度,为可问责临床AI提供概念与审计工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14452 2026-08-17 cs.AI 新提交 79%

SheetCompass: Hierarchical Relation Graphs for Agentic Spreadsheet Reasoning

SheetCompass:面向智能体电子表格推理的分层关系图

Panjing He, Mingyue Cheng, Yucong Luo, Li Li, Xiaohan Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 针对LLM处理电子表格时丢失多维结构语义的问题,提出SheetCompass框架,通过显式建模表内外结构关系并结合内存机制,提升智能体对复杂工作簿的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14290 2026-08-17 cs.AI 新提交 79%

Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning

Intern-S2-Mobius:知识与推理解耦的基础模型

Kai Chen, Jifeng Ding, Ning Ding, Jiaye Ge, Lixin Gu, Yicheng Gu, Qipeng Guo, Ermo Hua, Haian Huang, Haozheng Hou, Jie Hou, Xiangyu Hong, Che Jiang, Minxi Jin, Cheng Liang, Dahua Lin, Dawei Liu, Kuikun Liu, Chengqi Lv, Haijun Lv, Han Lv, Ningsheng Ma, Biqing Qi, Jianmin Qian, Shiya Su, Youbang Sun, Huanze Tang, Zhongbo Tian, Hanjing Wang, Rui Wang, Ting Wang, Yi Wang, Baiting Wu, Jun Xu, Bowen Yang, Hui Wang, Weida Wang, Haochen Ye, Jiashuo Yu, Shan Yu, Xiaoyi Yu, Qirui Zeng, Qi Zhang, Ming Zhang, Wenwei Zhang, Bowen Zhou, Xinyu Zhou

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究提出知识与推理解耦的Mobius-v0架构,基于此构建的7B模型和Intern-S2-Mobius模型,分别在减少训练数据和提升推理速度的同时保持了相近的下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11252 2026-08-13 cs.AI cs.ET cs.GT cs.MA 新提交 79%

Local verification cannot detect non-transportability: a cohomological theory of context preservation in agentic reasoning

局部验证无法检测不可迁移性:智能体推理中上下文保持的上同调理论

Suyash Mishra

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出智能体推理上下文保持的上同调理论,证明局部验证无法检测不可迁移性,提出Ksetra方法并通过外汇市场验证了所提检验的有效性。

Comments 17 pages, 10 figures. Includes an exact F-test for non-transportability with verified size and power, its precision-whitened generalisation, and a foreign-exchange case where the null hypothesis is known analytically rather than estimated

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03031 2026-08-12 cs.AI 版本更新 79%

CastFSR: A Fast--Slow--Reflect Agentic Reasoning Framework for Context-Aware Time Series Forecasting

CastFSR:用于上下文感知时间序列预测的快慢反思智能体推理框架

Xiaoyu Tao, Mingyue Cheng, Bokai Pan, Chuang Jiang, Huanjian Zhang, Tian Gao, Yaguo Liu, Qi Liu, Enhong Chen

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出CastFSR智能体框架,将上下文感知时间序列预测建模为快慢反思工作流,通过实验证明其在公共数据集上的表现优于代表性基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10129 2026-08-12 cs.CV cs.AI 版本更新 79%

LaViT: Aligning Latent Visual Thoughts for Multi-modal Reasoning

LaViT:对齐潜在视觉思维以进行多模态推理

Linquan Wu, Tianxiang Jiang, Yifei Dong, Haoyu Yang, Fengji Zhang, Shichaang Meng, Ai Xuan, Linqi Song, Jacky Keung

机构 * City University of Hong Kong(香港城市大学) University of Science and Technology of China(中国科学技术大学) Utrecht University(乌特勒支大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 LaViT通过对齐潜在视觉思维提升多模态推理能力,实现视觉感知增强和模型性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07931 2026-08-11 cs.AI 新提交 79%

REIN: Bridging the Gap between Reasoning and Reliability via Reflection and Abstention Alignment

REIN:通过反思与弃权对齐缩小推理与可靠性之间的差距

Zhengze Huang, Luyang Yu, Di Hong, Xinzhe Huang, Wanyu Lin, Zhixuan Chu, Zhan Qin, Tianhang Zheng

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 REIN是一个对齐框架,通过训练大型推理模型生成结构化推理序列,引入奖励机制鼓励模型在无正确推理链时弃权,在单次前向传播中减少幻觉、提升选择性准确率并保持高覆盖率。

Comments 26 pages and 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05833 2026-08-11 cs.AI 版本更新 79%

ViSR-KGC: Visual Subgraph Reasoning with Vision-Language Models for Multimodal Knowledge Graph Completion

ViSR-KGC:结合视觉语言模型的视觉子图推理用于多模态知识图谱补全

Jiafan Li, Mengxue Yang, Jiaqi Zhu, Liang Chang, Ying Li, Hongan Wang

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) CITIC Securities(中信证券) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 针对多模态知识图谱补全的痛点,提出ViSR-KGC方法,结合表示学习、视觉语言模型与预训练常识,通过提取查询感知子图并转换为可视化内容辅助VLM推理缺失实体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03972 2026-08-05 cs.AI 新提交 79%

ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning

ReflectRL:通过反思到直接推理从优质负轨迹中学习

Jinhe Bi, Chennan Zhou, Zengjie Jin, Aniri, Shuo Lu, Wenke Huang, Hu Cao, Xun Xiao, Zhihong Zhu, Volker Tresp, Fei Shen, Yunpu Ma, Tat-Seng Chua

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 ReflectRL是一种轻量即插即用框架,将专家失败的优质负轨迹作为反思对象而非丢弃,经反思推理与策略转换,在多基准、多模型及多训练方法上以极小开销提升大语言模型推理性能。

Comments Project page: https://github.com/bibisbar/ReflectRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02291 2026-08-04 cs.AI 新提交 79%

Shared Prefixes, Better Credit: Adaptive Routing for Multi-Agent Reasoning

共享前缀,更优信用:面向多智能体推理的自适应路由

Yiqing Liu, Zihao Wang, Hantao Yao, Wu Liu, Yongdong Zhang

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究针对现有多智能体推理自适应路由方法的粗粒度监督缺陷,提出TreeCredit共享前缀信用分配框架,通过状态匹配下游比较估计算子效用,在六个推理基准上实现了准确率与推理成本的更优权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24140 2026-08-04 cs.AI 版本更新 79%

HyperGuide: Hyperbolic Guidance for Efficient Multi-Step Reasoning in Large Language Models

HyperGuide: 用于大型语言模型高效多步推理的双曲引导

Yuyu Liu, Haotian Xu, Yanan He, Sarang Rajendra Patil, Mengjia Xu, Tengfei Ma

机构 * Department of Computer Science(计算机科学系) Stony Brook University(石英布鲁克大学) Department of Applied Mathematics and Statistics(应用数学与统计学系) Yale University(耶鲁大学) Department of Data Science(数据科学系) New Jersey Institute of Technology(新泽西理工学院) Department of Biomedical Informatics(生物医学信息学系)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 针对多步推理中单次生成效率高但精度低、树搜索计算量大的问题,提出通过将推理进度蒸馏为双曲几何信号来引导逐步生成,利用双曲空间的距离和角度特性编码解接近度与分支区分,训练轻量头投影隐状态并微调适配器,在多个基准上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29185 2026-08-03 cs.CL 新提交 79%

Learning Latent Reasoning Traces for Scalar Reward Models End-to-End

学习标量奖励模型的端到端潜在推理轨迹

Sanwoo Lee, Clive Bai, Hsiu-Yuan Huang, Kun Liang, Weijie Liu, Yunfang Wu

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 针对奖励模型范式不匹配问题,提出LatentRM框架,将推理轨迹作为潜在变量端到端优化,在多任务上优于各类基准奖励模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19435 2026-07-31 cs.CL 79%

Route to Reason: Adaptive Routing for LLM and Reasoning Strategy Selection

Zhihong Pan, Kai Zhang, Yuze Zhao, Yupeng Han

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

Journal ref Proceedings of the ACM Web Conference 2026, pp. 5568-5578

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22713 2026-07-28 cs.AI 新提交 79%

SEGRA: Structured Experience-Guided Graph Reasoning Agent for Gremlin Based Question Answering

SEGRA:用于基于Gremlin的问答的结构化经验引导图推理代理

Saiyue Lyu, Mariam Dundua, Vishaal Kapoor, Sarthak Ahuja, Neda Kordjazi, Evren Yortucboylu, Harsh Amin, Rebecca Steinert

机构 * University of British Columbia(英属哥伦比亚大学) Amazon(亚马逊)

专题命中 复杂问题求解 :reasoning(title);chain-of-thought(abstract);分类 cs.AI

AI总结 针对企业文本到Gremlin问答难题,SEGRA引入经验引导代理,集成多种技术,包括意图路由、查询生成等。在企业IT支持基准测试中成绩出色,平均评判分数大幅提高,技能库还降低了成本,提升了企业图问答的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13751 2026-07-28 cs.CL 版本更新 79%

Which Models Perform Better in Inheritance Reasoning?

哪些模型在继承推理中表现更好?

Mohammed Amine Mouhoub, Chahinez Bouchekif

机构 * Paris Dauphine University(巴黎多芬纳大学) University of Abou Bekr Belkaïd(阿布·贝克尔·贝尔卡伊德大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文比较了商业和开源大语言模型在伊斯兰继承推理任务中的表现,发现商业模型在识别继承人、应用排除规则和保持推理一致性方面更优,其中Gemini 2.5 Flash表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏