arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-04 至 2026-02-04 共收录 126 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 12 篇

2602.02863 2026-02-04 cs.AI cs.LG 81%

"I May Not Have Articulated Myself Clearly": Diagnosing Dynamic Instability in LLM Reasoning at Inference Time

我可能没有表达清楚:在推理时间诊断LLM推理中的动态不稳定性

Jinkun Chen, Fengxiang Cheng, Sijia Han, Vlado Keselj

机构 * Dalhousie University(达尔豪斯大学) University of Amsterdam(阿姆斯特丹大学) Tsinghua University(清华大学) Meta

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过分析LLM推理过程中的动态不稳定性,发现早期不稳定性可能预示后续正确答案,而晚期不稳定性更易导致失败,提出基于分布偏移和熵的诊断方法。

Comments 21 pages, 12 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18795 2026-02-04 cs.LG cs.AI cs.CL 67%

Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy Prefixes

重用FLOPs:通过条件化非常离策略前缀来扩展RL在困难问题上的应用

Amrith Setlur, Zijian Wang, Andrew Cohen, Paria Rashidinejad, Sang Michael Xie

机构 * Meta Carnegie Mellon University(卡内基梅隆大学) University of Southern California(南加州大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过条件化离策略前缀提升RL在困难问题上的学习效率,实现更快的训练奖励和更高的最终奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03143 2026-02-04 cs.LG cs.AI cs.CL stat.ML 67%

Self-Hinting Language Models Enhance Reinforcement Learning

自我提示语言模型增强强化学习

Baohao Liao, Hanze Dong, Xinxing Xu, Christof Monz, Jiang Bian

机构 * Microsoft Research(微软研究院) Language Technology Lab, University of Amsterdam(语言技术实验室,阿姆斯特丹大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SAGE通过注入自我提示提升GRPO在稀疏奖励下的表现,有效增强大语言模型的对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10398 2026-02-04 cs.CL cs.AI cs.LG cs.SE 67%

Confucius Code Agent: Scalable Agent Scaffolding for Real-World Codebases

孔子代码代理:面向真实世界代码库的可扩展代理构建

Sherman Wong, Zhenting Qi, Zhaodong Wang, Nathan Hu, Samuel Lin, Jun Ge, Erwin Gao, Wenlin Chen, Yilun Du, Minlan Yu, Ying Zhang

机构 * Meta

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 孔子代码代理通过可扩展的代理构建框架,在真实世界软件工程任务中实现高性能,超越现有研究和商业成果。

Comments The latest version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03053 2026-02-04 cs.AI cs.CL cs.MA 62%

MAS-ProVe: Understanding the Process Verification of Multi-Agent Systems

MAS-ProVe: 理解多智能体系统的进程验证

Vishal Venkataramani, Haizhou Shi, Zixuan Ke, Austin Xu, Xiaoxiao He, Yingbo Zhou, Semih Yavuz, Hao Wang, Shafiq Joty

机构 * Rutgers University(罗杰斯大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MAS-ProVe研究多智能体系统进程验证的有效性,发现LLM作为法官表现优于奖励方法,但验证过程仍面临上下文长度与性能的权衡问题。

Comments Preprint; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07182 2026-02-04 cs.LG cs.AI 62%

PRPO: Aligning Process Reward with Outcome Reward in Policy Optimization

PRPO:在策略优化中对过程奖励与结果奖励的对齐

Ruiyi Ding, Yongxuan Lv, Xianhui Meng, Jiahe Song, Chao Wang, Chen Jiang, Yuan Cheng

机构 * Shanghai University(上海大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学) Artificial Intelligence Incubation and Innovation Institute, Fudan University(复旦大学人工智能孵化与创新研究院) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 PRPO通过结合结果可靠性与过程级指导,在无批评者框架中提升策略优化效率,实现对过程奖励与结果奖励的对齐,从而提高模型在多步推理任务中的性能。

Comments 8 pages, 2 figures Code is available at: https://github.com/SchumiDing/srpocode

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18793 2026-02-04 cs.AI cs.LG 62%

NEZHA: A Zero-sacrifice and Hyperspeed Decoding Architecture for Generative Recommendations

NEZHA:一种零牺牲和超高速解码架构用于生成推荐

Yejing Wang, Shengyu Zhou, Jinyu Lu, Ziwei Liu, Langming Liu, Maolin Wang, Wenlin Zhang, Feng Li, Wenbo Su, Pengjie Wang, Jian Xu, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Alibaba Group(阿里巴巴集团)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 NEZHA 提出了一种无需牺牲推荐质量的超高速解码架构,通过集成灵活的自回归草稿头和高效验证器,提升生成推荐系统的性能和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00611 2026-02-04 cs.AI 57%

Structured Self-Consistency:A Multi-Task Evaluation of LLMs on VirtualHome

结构自一致性:基于虚拟家庭的多任务评估

Jiaqi Xu, Tao Huang, Kai Zhang

专题命中 测试时计算 :planning(abstract);分类 cs.AI

AI总结 本文提出结构自一致性方法,评估两种大型语言模型在虚拟家庭任务中的表现,发现不同模型在不同任务中各有优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03589 2026-02-04 cs.CV 50%

SlowFocus: Enhancing Fine-grained Temporal Understanding in Video LLM

SlowFocus: 提升视频大语言模型中的细粒度时间理解

Ming Nie, Dan Ding, Chunwei Wang, Yuanfan Guo, Jianhua Han, Hang Xu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Noah’s Ark Lab, Huawei(华为诺亚实验室) Yinwang Intelligent Technology Co., Ltd.(亿万象智能科技有限公司)

专题命中 测试时计算 :reasoning(abstract)

AI总结 SlowFocus通过提升等效采样频率和引入多频率混合注意力模块,提升视频大语言模型对细粒度时间理解的能力。

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 复杂问题求解 14 篇

2602.03630 2026-02-04 cs.AI 83%

Can LLMs Do Rocket Science? Exploring the Limits of Complex Reasoning with GTOC 12

大语言模型能做火箭科学吗?通过GTOC 12探索复杂推理的极限

Iñaki del Campo, Pablo Cuervo, Victor Rodriguez-Fernandez, Roberto Armellin, Jack Yarndley

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本研究通过GTOC 12竞赛评估大语言模型在复杂轨道优化任务中的表现,发现其在战略规划上能力显著提升,但在实际执行中存在物理一致性等关键问题。

Comments Extended version of the paper presented at AIAA SciTech 2026 Forum. Includes futher experiments, corrections and new appendix

Journal ref Proceedings of the AIAA SciTech 2026 Forum, January 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00642 2026-02-04 cs.CL 83%

LegalOne: A Family of Foundation Models for Reliable Legal Reasoning

LegalOne:一种用于可靠法律推理的基础模型家族

Haitao Li, Yifan Chen, Shuo Miao, Qian Dong, Jia Chen, Yiran Hu, Junjie Chen, Minghao Qin, Yueyue Wu, Yujia Zhou, Qingyao Ai, Yiqun Liu, Cheng Luo, Quan Zhou, Ya Zhang, Jikun Hu

机构 * Department of Computer Science, Tsinghua University(清华大学计算机科学系) Quancheng Laboratory(清华云城实验室) University of Waterloo, Canada(加拿大滑铁卢大学) China University of Political Science and Law(中国政法大学) MegaTech.AI Inc(MegaTech.AI公司)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

AI总结 LegalOne通过三阶段流程提升法律推理能力,结合领域适应、代理推理蒸馏和课程强化学习,在法律任务中取得超越通用LLMs的性能。

Comments 25 pages, v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02313 2026-02-04 cs.AI cs.CL cs.LG 82%

Interpreting and Controlling LLM Reasoning through Integrated Policy Gradient

通过集成策略梯度解释和控制大语言模型的推理

Changming Li, Kaixing Zhang, Haoyun Xu, Yingdong Shi, Zheng Zhang, Kaitao Song, Kan Ren

机构 * Independent Researcher(独立研究者) ShanghaiTech University(上海科技大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出集成策略梯度框架,通过反向传播复合结果信号,实现对大语言模型推理行为的精确解释与控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03485 2026-02-04 cs.CL cs.AI cs.LG 82%

Self-Verification Dilemma: Experience-Driven Suppression of Overused Checking in LLM Reasoning

自我验证困境:经验驱动的过度验证抑制在大语言模型推理中

Quanyu Long, Kai Jie Jiang, Jianda Chen, Xu Guo, Leilei Gan, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种经验驱动的测试时框架,通过抑制过度的自我验证步骤,减少大语言模型推理中的token使用,同时保持或提升准确性。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03279 2026-02-04 cs.AI cs.LG 81%

Agentic Proposing: Enhancing Large Language Model Reasoning via Compositional Skill Synthesis

代理提案:通过组合技能合成增强大语言模型推理

Zhengbo Jiao, Shaobo Wang, Zifan Zhang, Xuan Ren, Wei Wang, Bing Zhao, Hu Wei, Linfeng Zhang

机构 * AI DATA, Alibaba Group Holding Limited(阿里数据,阿里巴巴集团控股有限公司) EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Shanghai University of Finance(上海财经大学) Wuhan University(武汉大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 Agentic Proposing通过组合技能合成生成高质量训练数据,使大语言模型在数学、编程和科学领域实现更高效的推理和泛化能力。

Comments 23page4

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03578 2026-02-04 cs.CL cs.AI 62%

Use Graph When It Needs: Efficiently and Adaptively Integrating Retrieval-Augmented Generation with Graphs

在需要时使用图:高效且适应性地整合检索增强生成与图

Su Dong, Qinggang Zhang, Yilin Xiao, Shengyuan Chen, Chuang Zhou, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EA-GraphRAG框架,通过动态整合RAG和GraphRAG,根据查询复杂度灵活选择检索策略,提升处理混合场景的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03569 2026-02-04 cs.AI cs.LG 62%

EHRWorld: A Patient-Centric Medical World Model for Long-Horizon Clinical Trajectories

EHRWorld: 一个以患者为中心的医疗世界模型用于长周期临床轨迹

Linjie Mu, Zhongzhen Huang, Yannian Gu, Shengqian Qin, Shaoting Zhang, Xiaofan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 EHRWorld通过因果序列范式训练,有效解决长周期临床模拟中的误差累积问题,提升医疗世界模型的稳定性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02598 2026-02-04 physics.soc-ph cs.AI cs.CL cs.CY cs.MA 62%

Social Catalysts, Not Moral Agents: The Illusion of Alignment in LLM Societies

社交催化剂,而非道德主体:LLM社会中的对齐幻觉

Yueqing Hu, Yixuan Jiang, Zehua Jiang, Xiao Wen, Tianhong Wang

机构 * Institute of Neuroscience, Chinese Academy of Sciences(中国科学院神经科学研究所) School of Philosophy, Anhui University(安徽大学哲学学院) Department of Psychology and Behavioral Sciences, Zhejiang University(浙江大学心理学与行为科学系) Mental Health Education Center, North China Electric Power University(华北电力大学心理健康教育中心)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了锚定智能体在促进合作中的作用,发现其效果源于战略合规而非真实价值对齐,揭示了人工社会中行为修改与真实价值对齐之间的差距。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04601 2026-02-04 cs.LG cs.CL 62%

Natural Language Actor-Critic: Scalable Off-Policy Learning in Language Space

自然语言行为-批评者:在语言空间中可扩展的非策略学习

Joey Hong, Kang Liu, Zhan Ling, Jiecao Chen, Sergey Levine

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出NLAC算法,利用生成式LLM批评者生成自然语言反馈,实现更高效稳定的LLM智能体训练。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22926 2026-02-04 cs.LG 57%

Simple Denoising Diffusion Language Models

简单去噪扩散语言模型

Huaisheng Zhu, Zhengyu Chen, Shijie Zhou, Zhihui Xie, Yige Yuan, Shiqi Chen, Zhimeng Guo, Siyuan Xu, Hangfan Zhang, Vasant Honavar, Teng Xiao

机构 * Penn State University(宾夕法尼亚州立大学) University at Buffalo(布法罗大学) University of Washington(华盛顿大学) The University of Hong Kong(香港大学) City University of Hong Kong(城市大学) Alibaba Group(阿里巴巴集团) Allen Institute for AI (AI2)(人工智能研究所(AI2))

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.LG

AI总结 本文提出了一种简化且改进的去噪损失公式,用于均匀状态扩散模型,以提高训练稳定性与效率,并在大规模模型上展示了良好的扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22975 2026-02-04 cs.AI 57%

Golden Goose: A Simple Trick to Synthesize Unlimited RLVR Tasks from Unverifiable Internet Text

金 Goose:从不可验证的互联网文本中合成无限 RLVR 任务的简单技巧

Ximing Lu, David Acuna, Jaehun Jung, Jian Hu, Di Zhang, Shizhe Diao, Yunheng Zou, Shaokun Zhang, Brandon Cui, Mingjie Liu, Hyunwoo Kim, Prithviraj Ammanabrolu, Jan Kautz, Yi Dong, Yejin Choi

机构 * NVIDIA(NVIDIA公司) University of Washington(华盛顿大学) University of California San Diego(圣地亚哥大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 Golden Goose 通过从不可验证的互联网文本中合成无限 RLVR 任务,提升大型语言模型在复杂推理和网络安全领域的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09241 2026-02-04 cs.CL 57%

When to Trust: A Causality-Aware Calibration Framework for Accurate Knowledge Graph Retrieval-Augmented Generation

何时信任:一种因果意识校准框架用于准确的知识图谱检索增强生成

Jing Ren, Bowen Li, Ziqi Xu, Xikun Zhang, Haytham Fayek, Xiaodong Li

机构 * RMIT University(皇家墨尔本理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 Ca2KG通过整合反事实提示和重新评分机制,提升KG-RAG在高风险领域的可靠性与准确性。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02280 2026-02-04 cs.CV cs.CL 57%

SAIL-RL: Guiding MLLMs in When and How to Think via Dual-Reward RL Tuning

SAIL-RL: 通过双奖励强化学习调优引导MLLM在何时以及如何思考

Fangxun Shu, Yongjie Ye, Yue Liao, Zijian Kang, Weijie Yin, Jiacong Wang, Xiao Liang, Shuicheng Yan, Chao Feng

机构 * National University of Singapore(新加坡国立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 SAIL-RL通过双奖励强化学习调优,提升多模态大语言模型的推理能力和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12960 2026-02-04 cs.MA 50%

ENGRAM: Effective, Lightweight Memory Orchestration for Conversational Agents

ENGRAM: 有效的、轻量级的内存编排用于对话代理

Daivik Patel, Shrenik Patel

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 ENGRAM通过轻量级内存编排实现对话代理的长周期一致性,利用类型化内存和密集检索在多个基准测试中取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理评测 31 篇

2602.02496 2026-02-04 cs.CL 83%

The Hypocrisy Gap: Quantifying Divergence Between Internal Belief and Chain-of-Thought Explanation via Sparse Autoencoders

虚假差距:通过稀疏自编码器量化内部信念与思维链解释之间的分歧

Shikhar Shiromani, Archie Chaudhury, Sri Pranav Kunda

机构 * Independent(独立研究者)

专题命中 推理评测 :chain-of-thought(title);reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 通过稀疏自编码器量化模型内部信念与生成回答之间的差异,以检测模型的不忠实行为。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03130 2026-02-04 cs.CV cs.CE 82%

FinMTM: A Multi-Turn Multimodal Benchmark for Financial Reasoning and Agent Evaluation

FinMTM:面向金融推理和智能体评估的多轮多模态基准

Chenxi Zhang, Ziliang Gan, Liyun Zhu, Youwei Pang, Qing Zhang, Rongjunchen Zhang

机构 * HiThink Research(HiThink研究机构) Wuhan University(武汉大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Shanghai Institute of Technology(上海理工大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract)

AI总结 FinMTM提出一个多轮多模态基准,用于评估金融推理和智能体任务,通过多样化数据和任务设计,揭示了VLMs在视觉感知、推理和复杂工作流中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02975 2026-02-04 cs.CL cs.AI cs.LG 82%

Where Norms and References Collide: Evaluating LLMs on Normative Reasoning

规范与参照的碰撞:评估大语言模型在规范推理中的能力

Mitchell Abrams, Kaveh Eskandari Miandoab, Felix Gervits, Vasanth Sarathy, Matthias Scheutz

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SNIC测试平台,评估大语言模型在基于规范的参照解析任务中的能力,发现现有模型在处理隐含或冲突规范时存在显著不足。

Comments Accepted to the 40th AAAI Conference on Artificial Intelligence (AAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02581 2026-02-04 cs.LG cs.AI 81%

QuantLRM: Quantization of Large Reasoning Models via Fine-Tuning Signals

QuantLRM:通过微调信号对大推理模型进行量化

Nan Zhang, Eugene Kwek, Yusen Zhang, Muyu Pan, Suhang Wang, Prasenjit Mitra, Rui Zhang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 QuantLRM通过微调信号对大推理模型进行量化,通过拟合二次函数保护两端,提升量化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02497 2026-02-04 cs.CL cs.AI 81%

STEMVerse: A Dual-Axis Diagnostic Framework for STEM Reasoning in Large Language Models

STEMVerse: 一种用于大型语言模型中STEM推理的双轴诊断框架

Xuzhao Li, Xuchen Li, Jian Zhao, Shiyu Hu

机构 * NTU(国立科技大学) ZGCA(智能计算协会) ZGCI(智能计算研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 STEMVerse通过双轴诊断框架系统分析LLM在STEM领域的推理能力,揭示其结构失败模式,提供科学推理的深入理解。

Comments Preprint, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02125 2026-02-04 cs.AI cs.CL 81%

Do AI Models Perform Human-like Abstract Reasoning Across Modalities?

AI模型在不同模态下是否能进行类人抽象推理?

Claas Beger, Ryan Yi, Shuhao Fu, Kaleda Denton, Arseny Moskvichev, Sarah W. Tsai, Sivasankaran Rajamanickam, Melanie Mitchell

机构 * Santa Fe Institute, New Mexico, USA(圣菲研究所) Sandia National Laboratories, New Mexico, USA(桑迪亚国家实验室) Advanced Micro Devices Inc., Texas, USA(先进微器件公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了AI模型在不同模态下进行抽象推理的能力,发现其在文本和视觉模态中的表现存在显著差异,表明仅依赖准确率评估抽象推理能力存在偏差。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03340 2026-02-04 cs.AI 79%

MentalSeek-Dx: Towards Progressive Hypothetico-Deductive Reasoning for Real-world Psychiatric Diagnosis

MentalSeek-Dx: 向现实世界精神病诊断的渐进性假说-演绎推理迈进

Xiao Sun, Yuming Yang, Junnan Zhu, Jiang Zhong, Xinyu Zhou, Kaiwen Wei

机构 * School of Computer Science Chongqing University(重庆大学计算机学院) MAIS Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所MAIS研究所) The First Affiliated Hospital of Chongqing Medical University(重庆医科大学第一附属医院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 MentalSeek-Dx通过监督轨迹构建和课程强化学习,实现了在现实世界精神病诊断中的渐进性假说-演绎推理,以提升临床诊断的可靠性。

Comments 36 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏