arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-06 至 2026-01-06 共收录 108 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 14 篇

2601.01718 2026-01-06 cs.AI 57%

Yuan3.0 Flash: An Open Multimodal Large Language Model for Enterprise Applications

Yuan3.0 Flash:面向企业应用的开源多模态大语言模型

YuanLab. ai, :, Shawn Wu, Sean Wang, Louie Li, Darcy Chen, Allen Wang, Jiangang Luo, Xudong Zhao, Joseph Shen, Gawain Ma, Jasper Jia, Marcus Mao, Claire Wang, Hunter He, Carol Wang, Zera Zhang, Jason Wang, Chonly Shen, Leo Zhang, Logan Chen, Qasim Meng, James Gong, Danied Zhao, Penn Zheng, Owen Zhu, Tong Yu

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 Yuan3.0 Flash通过RAPO算法提升企业任务性能,实现高效多模态大语言模型开源

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00845 2026-01-06 cs.AI 57%

Enhancing Temporal Awareness in LLMs for Temporal Point Processes

增强大语言模型在时序点过程中的时间感知能力

Lili Chen, Wensheng Gan, Shuang Liang, Philip S. Yu

机构 * School of Computer Science and Technology, Tongji University, Shanghai 201804, China(计算机科学与技术学院,同济大学) College of Cyber Security, Jinan University, Guangzhou 510632, China(网络安全学院,暨南大学) Department of Computer Science, University of Illinois Chicago, Chicago, USA(计算机科学系,伊利诺伊大学芝加哥分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 TPP-TAL通过增强LLMs的时间感知能力,改进了时序点过程中的时间似然估计和事件预测准确性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00882 2026-01-06 cs.PL 50%

BALI: Branch-Aware Loop Invariant Inference with Large Language Models

BALI: 基于分支的循环不变式推断与大语言模型

Mingxiu Wang, Jiawei Wang, Xiao Cheng

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 BALI通过结合大语言模型和分支感知分析,提升循环不变式的推断和验证精度,实现更高效和自动化的不变式发现。

Comments 4 pages, 1 figure, AAAI-26 Bridge Program B10: Making Embodied AI Reliable with Testing and Formal Verification

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 31 篇

2504.16505 2026-01-06 cs.CV cs.MM 87%

TraveLLaMA: A Multimodal Travel Assistant with Large-Scale Dataset and Structured Reasoning

TraveLLaMA: 一种基于大规模数据集和结构化推理的多模态旅行助手

Meng Chu, Yukang Chen, Haokun Gui, Shaozuo Yu, Yi Wang, Jiaya Jia

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 TraveLLaMA通过结构化推理框架和大规模数据集,提升旅行推荐和场景理解能力,实现用户满意度和系统性能的显著提升。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01825 2026-01-06 cs.CL 83%

CSCBench: A PVC Diagnostic Benchmark for Commodity Supply Chain Reasoning

CSCBench: 一种用于商品供应链推理的PVC诊断基准

Yaxin Cui, Yuanqiang Zeng, Jiapeng Yan, Keling Lin, Kai Ji, Jianhui Zeng, Sheng Zhang, Xin Luo, Binzhu Su, Chaolai Shen, Jiahao Yu

机构 * Xiamen SmartChain Innovations Co., Ltd.(厦门智能链创新有限公司) Xiamen ITG Digital Technology Co., Ltd.(厦门ITG数字科技有限公司) Xiamen C&D Co., Ltd.(厦门C&D有限公司) Xiamen Xiangyu Co., Ltd.(厦门翔宇有限公司)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL

AI总结 CSCBench通过PVC 3D评估框架,为商品供应链推理提供诊断基准,评估LLMs在过程、品种和认知轴上的表现,发现其在品种轴上尤其存在显著下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01407 2026-01-06 cs.CL 83%

From Emotion Classification to Emotional Reasoning: Enhancing Emotional Intelligence in Large Language Models

从情绪分类到情绪推理:提升大语言模型情感智能

Arjhun Sreedar, Rohan Pillay, Laukik Patade

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文通过合成情绪链式思维数据提升大语言模型的情感推理能力,实验表明微调后模型在情绪理解与意识评估上显著提升。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26122 2026-01-06 cs.CL 83%

Reasoning Path Divergence: A New Metric and Curation Strategy to Unlock LLM Diverse Thinking

推理路径分歧:一种新的度量和筛选策略,以解锁LLM多样化思考

Feng Ju, Zeyu Qin, Rui Min, Zhitao He, Lingpeng Kong, Yi R. Fung

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of Science and Technology of China(中国科学技术大学) The University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出了一种新的训练范式1PNS和度量RPD,通过增加推理多样性提升LLM的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01532 2026-01-06 cs.AI cs.CL cs.LG 82%

Aletheia: Quantifying Cognitive Conviction in Reasoning Models via Regularized Inverse Confusion Matrix

Aletheia: 通过正则化逆混淆矩阵量化推理模型中的认知信念

Fanzhe Fu

机构 * Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Aletheia通过正则化逆混淆矩阵量化推理模型中的认知信念,探索AI科学诚信的测量方法。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25070 2026-01-06 cs.LG cs.CL 81%

Scaling Open-Ended Reasoning to Predict the Future

扩大开放性推理以预测未来

Nikhil Chandak, Shashwat Goel, Ameya Prabhu, Moritz Hardt, Jonas Geiping

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所) Tübingen AI Center(图宾根人工智能中心) University of Tübingen(图宾根大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种基于开放性推理的预测系统,通过合成全球事件问题并训练专用模型,提升了预测的准确性、校准性和一致性,并开源所有资源促进研究。

Comments 45 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05434 2026-01-06 cs.CL cs.AI 81%

LTLBench: Towards Benchmarks for Evaluating Temporal Reasoning in Large Language Models

LTLBench: 为评估大语言模型中的时间推理能力而设计的基准测试

Weizhi Tang, Kwabena Nuamah, Vaishak Belle

机构 * University of Edinburgh(爱丁堡大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 LTLBench通过线性时序逻辑评估大语言模型的时间推理能力,构建包含2000个挑战的数据集并测试12个模型,揭示时间推理中的主要问题及复杂性影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24052 2026-01-06 cs.SD cs.AI cs.CL cs.MM 81%

AHA: Aligning Large Audio-Language Models for Reasoning Hallucinations via Counterfactual Hard Negatives

AHA: 通过反事实硬负样本对齐大音频-语言模型以缓解推理幻觉

Yanxi Chen, Wenhui Zhu, Xiwen Chen, Zhipeng Wang, Xin Li, Peijie Qiu, Hao Wang, Xuanzhao Dong, Yujian Xiong, Anderson Schneider, Yuriy Nevmyvaka, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆斯大学) Washington University in St.Louis(圣路易斯华盛顿大学) Rice University(Rice 大学) Morgan Stanley(摩根大通)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 AHA通过反事实硬负样本对齐大音频-语言模型,有效减少推理幻觉,提升时间推理能力,并在多个基准测试中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20866 2026-01-06 cs.CL cs.LG 81%

On the Robustness of Answer Formats in Medical Reasoning Models

医学推理模型中答案格式的鲁棒性研究

Pittawat Taveekitworachai, Natpatchara Pongjirapat, Krittaphas Chaisutyakorn, Piyalitt Ittichaiwong, Tossaporn Saengja, Kunat Pipatanakul

机构 * SCB 10X R&D(SCB 10X 研发部) SCB 10X SCBX Group(SCBX 团体) Faculty of Medicine Siriraj Hospital(素里雅医院医学学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究了医学推理模型在不同答案格式下的鲁棒性,发现监督微调更稳定,而强化微调易出现跨格式脆性,需谨慎评估以应用于实际医疗场景。

Comments 62 pages, 47 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12880 2026-01-06 cs.CL cs.AI 81%

nvBench 2.0: Resolving Ambiguity in Text-to-Visualization through Stepwise Reasoning

nvBench 2.0:通过分步推理解决文本到可视化中的歧义

Tianqi Luo, Chuhan Huang, Leixian Shen, Boyan Li, Shuyu Shen, Wei Zeng, Nan Tang, Yuyu Luo

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 nvBench 2.0通过分步推理解决文本到可视化中的歧义问题,提出Step-Text2Vis模型在模糊场景中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01341 2026-01-06 cs.CL 79%

Reasoning Over Recall: Evaluating the Efficacy of Generalist Architectures vs. Specialized Fine-Tunes in RAG-Based Mental Health Dialogue Systems

基于回忆的推理:评估基于RAG的心理健康对话系统中通用架构与专门微调的有效性

Md Abdullah Al Kafi, Raka Moni, Sumit Kumar Banshal

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过比较通用推理模型与领域特定微调模型,发现通用模型在同理心和上下文理解方面表现更优,表明强大的推理能力比专门训练更能提升心理健康对话系统的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24572 2026-01-06 cs.CL 79%

Korean Canonical Legal Benchmark: Toward Knowledge-Independent Evaluation of LLMs' Legal Reasoning Capabilities

韩国规范法律基准:迈向独立于领域知识的LLM法律推理能力评估

Hongseok Oh, Wonseok Hwang, Kyoung-Woon On

机构 * University of Seoul(首尔大学) LBOX

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 韩国规范法律基准通过问题级支持先例评估LLM法律推理能力,揭示领域知识依赖下的模型差距,展示推理专用模型的优越性。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04308 2026-01-06 cs.RO cs.AI cs.CV 79%

RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics

RoboRefer: 向视觉语言模型在机器人中的空间指称推理迈进

Enshen Zhou, Jingkun An, Cheng Chi, Yi Han, Shanyu Rong, Chi Zhang, Pengwei Wang, Zhongyuan Wang, Tiejun Huang, Lu Sheng, Shanghang Zhang

机构 * School of Software, Beihang University(北京航空航天大学软件学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 RoboRefer通过整合深度编码器和强化微调方法,实现了视觉语言模型在机器人中的空间指称推理,提升了复杂场景下的交互能力。

Comments Accepted by NeurIPS 2025. Project page: https://zhoues.github.io/RoboRefer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03104 2026-01-06 cs.AI 79%

ChatTS: Aligning Time Series with LLMs via Synthetic Data for Enhanced Understanding and Reasoning

通过合成数据对齐时间序列,利用大语言模型进行增强的理解与推理

Zhe Xie, Zeyan Li, Xiao He, Longlong Xu, Xidao Wen, Tieying Zhang, Jianjun Chen, Rui Shi, Dan Pei

机构 * Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ChatTS通过合成数据生成方法,首次实现了多变量时间序列的多模态大语言模型,显著提升了时间序列的理解与推理性能。

Comments accepted by VLDB' 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12692 2026-01-06 cs.CL 79%

FormulaReasoning: A Dataset for Formula-Based Numerical Reasoning

FormulaReasoning:一个用于基于公式的数值推理的数据集

Xiao Li, Bolin Zhu, Kaiwen Shi, Sichen Liu, Yin Zhu, Yiwei Liu, Gong Cheng

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(南京大学新型软件技术国家重点实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 FormulaReasoning数据集通过引入基于物理原理的数值推理任务,提供细粒度注释和扩展版本,评估多种推理框架,揭示公式推理中的关键挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02314 2026-01-06 cs.AI 77%

Project Ariadne: A Structural Causal Framework for Auditing Faithfulness in LLM Agents

Project Ariadne: 一种用于审计大语言模型代理忠实性的结构因果框架

Sourena Khanzadeh

机构 * Sourena Khanzadeh(独立研究者)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 Project Ariadne提出一种结构因果框架,通过因果干预评估大语言模型代理推理的忠实性,揭示代理推理与决策之间的因果脱节问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01743 2026-01-06 cs.AI 77%

AI Agent Systems: Architectures, Applications, and Evaluation

AI代理系统:架构、应用与评估

Bin Xu

机构 * School of Electrical, Computer and Energy Engineering, Arizona State University(电气、计算机与能源工程学院,亚利桑那州立大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI

AI总结 本文综述了AI代理系统在架构、应用与评估方面的最新进展,探讨了代理组件、协调模式及部署设置,并分析了设计权衡与评估挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01498 2026-01-06 cs.CL 77%

From Failure to Mastery: Generating Hard Samples for Tool-use Agents

从失败到精通:为工具使用代理生成困难样本

Bingguang Hao, Zengzhuang Xu, Yuntao Wen, Xinyi Xu, Yang Liu, Tong Zhao, Maolin Wang, Long Chen, Dong Wang, Yicheng Chen, Cunyin Peng, Xiangyu Zhao, Chenyi Zhuang, Ji Zhang

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出HardGen方法,通过生成具有可验证推理的困难样本,提升工具使用代理的训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00998 2026-01-06 cs.CV 75%

DVGBench: Implicit-to-Explicit Visual Grounding Benchmark in UAV Imagery with Large Vision-Language Models

DVGBench: 面向无人机影像的隐式到显式视觉 grounding 评估基准

Yue Zhou, Jue Chen, Zilun Zhang, Penghui Huang, Ran Ding, Zhentao Zou, PengFei Gao, Yuchen Wei, Ke Li, Xue Yang, Xue Jiang, Hongxin Yang, Jonathan Li

机构 * Hinton STAI Institute(Hinton STAI研究所) Key Laboratory of Geographic Information Science (Ministry of Education), East China Normal University(地理信息科学重点实验室(教育部)) School of Geospatial Artificial Intelligence, East China Normal University(地理空间人工智能学院) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Information Engineering University(信息工程大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 DVGBench 是一个面向无人机影像的隐式到显式视觉 grounding 评估基准,通过设计 DroneVG-R1 模型提升 LVLM 的推理能力。

Comments 20 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16202 2026-01-06 cs.AI 74%

Multi-Agent Collaborative Reward Design for Enhancing Reasoning in Reinforcement Learning

多智能体协作奖励设计以增强强化学习中的推理

Pei Yang, Ke Zhang, Ji Wang, Xiao Chen, Yuxin Tang, Eric Yang, Lynn Ai, Bill Shi

机构 * Gradient Waseda University(早稻田大学) Columbia University(哥伦比亚大学) Hong Kong Polytechnic University(香港理工大学) Rice University(莱斯大学)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 多智能体协作奖励模型通过分解偏好评估和引入集中化聚合器,提升强化学习中的鲁棒性和可解释性,同时提供透明的奖励建模方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03663 2026-01-06 cs.CL cs.CV 70%

UNIDOC-BENCH: A Unified Benchmark for Document-Centric Multimodal RAG

UNIDOC-BENCH: 一个统一的文档中心多模态RAG基准

Xiangyu Peng, Can Qin, Zeyuan Chen, Ran Xu, Caiming Xiong, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 UniDoc-Bench是首个大规模文档中心多模态RAG基准,通过多模态问答对评估文本-图像融合与联合检索性能,揭示多模态嵌入不足及视觉上下文补充机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01952 2026-01-06 cs.SE 67%

Context-Adaptive Requirements Defect Prediction through Human-LLM Collaboration

基于人类与大语言模型协作的上下文自适应需求缺陷预测

Max Unterbusch, Andreas Vogelsang

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出基于人类与大语言模型协作的上下文自适应需求缺陷预测方法,通过反馈循环和少量样本学习提升预测性能,优于传统方法。

Comments Accepted at ICSE-NIER 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03860 2026-01-06 cs.CL cs.AI cs.LG 67%

Hallucination to Truth: A Review of Fact-Checking and Factuality Evaluation in Large Language Models

幻觉与事实:大型语言模型中事实核查与事实性评估的综述

Subhey Sadi Rahman, Md. Adnanul Islam, Md. Mahbub Alam, Musarrat Zeba, Md. Abdur Rahman, Sadia Sultana Chowa, Mohaimenul Azam Khan Raiaan, Sami Azam

机构 * Department of Computer Science and Engineering, United International University, Dhaka 1212, Bangladesh(乌姆特国际大学计算机科学与工程系) Department of Computer Science and Engineering, Daffodil International University, Dhaka-1341, Bangladesh(达芙尼国际大学计算机科学与工程系) Faculty of Science and Technology, Charles Darwin University, Casuarina, NT 0909, Australia(查尔斯·达尔文大学科学与技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了大型语言模型中事实核查与事实性评估的关键挑战及方法,强调了提升事实准确性的重要性。

Journal ref Artif. Intell. Rev. (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14772 2026-01-06 cs.CL cs.LG stat.ML 62%

Knowledge Distillation and Dataset Distillation of Large Language Models: Emerging Trends, Challenges, and Future Directions

大型语言模型的知识蒸馏与数据集蒸馏:新兴趋势、挑战与未来方向

Luyang Fang, Xiaowei Yu, Jiazhang Cai, Yongkai Chen, Shushan Wu, Zhengliang Liu, Zhenyuan Yang, Haoran Lu, Xilin Gong, Yufang Liu, Terry Ma, Wei Ruan, Ali Abbasi, Jing Zhang, Tao Wang, Ehsan Latif, Weihang You, Hanqi Jiang, Wei Liu, Wei Zhang, Soheil Kolouri, Xiaoming Zhai, Dajiang Zhu, Wenxuan Zhong, Tianming Liu, Ping Ma

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文综述了大型语言模型的知识蒸馏与数据集蒸馏技术,探讨了其在压缩模型、保持推理能力及语言多样性方面的挑战与未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07890 2026-01-06 cs.CL cs.AI 62%

GRAPHMOE: Amplifying Cognitive Depth of Mixture-of-Experts Network via Introducing Self-Rethinking Mechanism

GRAPHMOE: 通过引入自我反思机制提升混合专家网络的认知深度

Bo Lv, Chen Tang, Zifan Zheng, Bohao Yang, Kun Zhao, Ning Liao, Xiaoxing Wang, Feiyu Xiong, Zhiyu Li, Nayu Liu, Jingchi Jiang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Institute for Advanced Algorithms Research, Shanghai(上海先进算法研究所) The University of Manchester(曼彻斯特大学) The University of Pittsburgh(匹兹堡大学) Harbin Institute of Technology(哈尔滨工业大学) University of Sydney(悉尼大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 GRAPHMOE通过引入自我反思机制,提升混合专家网络的认知深度,实现语言模型的先进性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01118 2026-01-06 cs.IR cs.AI cs.DL 57%

ScienceDB AI: An LLM-Driven Agentic Recommender System for Large-Scale Scientific Data Sharing Services

ScienceDB AI: 基于大语言模型的代理推荐系统用于大规模科学数据共享服务

Qingqing Long, Haotian Chen, Chenyang Zhao, Xiaolei Du, Xuezhi Wang, Pengyao Wang, Chengzan Li, Yuanchun Zhou, Hengshu Zhu

机构 * Computer Network Information Center, Chinese Academy of Sciences, Beijing, China(中国科学院计算机网络信息中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 ScienceDB AI 是首个基于大语言模型的对话推荐系统,专为大规模科学数据共享服务设计,通过自然语言对话和深度推理实现精准的数据集推荐。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24181 2026-01-06 cs.CL 57%

MedKGI: Iterative Differential Diagnosis with Medical Knowledge Graphs and Information-Guided Inquiring

MedKGI: 基于医学知识图谱和信息引导提问的迭代诊断

Qipeng Wang, Rui Sheng, Yafei Li, Huamin Qu, Yushi Sun, Min Zhu

机构 * Sichuan University(四川大学) HKUST(香港科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 MedKGI通过整合医学知识图谱和信息引导提问,提升临床诊断的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏