arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10549 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10549 篇

2601.20465 2026-01-29 cs.CL 57%

BMAM: Brain-inspired Multi-Agent Memory Framework

基于大脑的多智能体记忆框架 BMAM

Yang Li, Jiaxiang Liu, Yusong Wang, Yujie Wu, Mingkun Xu

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Institute of Science Tokyo(东京科学研究所) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 BMAM 提出了一种基于大脑认知机制的多智能体记忆框架,通过分解记忆为事件型、语义型等子系统,提升长时间交互中的信息保持和行为一致性,实验显示其在 LoCoMo 基准上达到 78.45% 的准确率。

Comments Submitted to ACL (ARR 2026 January submission); non-anonymous preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20311 2026-01-29 cs.HC cs.AI 57%

DiagLink: A Dual-User Diagnostic Assistance System by Synergizing Experts with LLMs and Knowledge Graphs

DiagLink:通过融合专家与LLM和知识图谱的双用户诊断辅助系统

Zihan Zhou, Yinan Liu, Yuyang Xie, Bin Wang, Xiaochun Yang, Zezheng Feng

机构 * Northeastern University(东北大学) Northeastern University School of Computer Science(东北大学计算机科学学院) Northeastern University Software College(东北大学软件学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 DiagLink通过融合LLM、知识图谱和专家,构建双用户诊断辅助系统,提升诊断效率和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20141 2026-01-29 cs.CY cs.AI 57%

Large language models accurately predict public perceptions of support for climate action worldwide

大型语言模型能准确预测全球对气候行动的支持感知

Nattavudh Powdthavee, Sandra J. Geiger

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 大型语言模型能准确预测全球对气候行动的支持感知,为评估气候行动中的感知差距提供快速工具,尤其在资源丰富的国家可作为替代调查手段。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20102 2026-01-29 cs.CL 57%

Counterfactual Cultural Cues Reduce Medical QA Accuracy in LLMs: Identifier vs Context Effects

反事实文化线索降低大语言模型医学问答准确性:标识符效应与情境效应

Amirhossein Haji Mohammad Rezaei, Zahra Shakeri

机构 * Institute of Health Policy, Management, and Evaluation (IHPME)(健康政策、管理与评估研究所) Dalla Lana School of Public Health(达拉兰公共卫生学院) University of Toronto(多伦多大学) Faculty of Information(信息学院) Schwartz Reisman Institute(施瓦茨-雷曼研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过反事实文化线索测试,发现文化相关信息显著降低大语言模型医学问答准确性,尤其在标识符与情境共同存在时影响最大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19916 2026-01-29 cs.CL 57%

PaperAudit-Bench: Benchmarking Error Detection in Research Papers for Critical Automated Peer Review

PaperAudit-Bench: 用于关键自动化同行评审中研究论文错误检测的基准测试

Songjun Tu, Yiwen Ma, Jiahao Lin, Qichao Zhang, Xiangyuan Lan, Junfeng. Li, Nan Xu, Linjing Li, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学) Wenge Technology(文英科技)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 PaperAudit-Bench通过整合结构化错误检测与证据意识的评审生成,提升自动化同行评审的批判性评估能力,并支持轻量级模型训练以实现高效错误检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08430 2026-01-29 cs.AI 57%

RubricHub: A Comprehensive and Highly Discriminative Rubric Dataset via Automated Coarse-to-Fine Generation

RubricHub: 通过自动化粗到细生成构建一个全面且高度判别性的评分标准数据集

Sunzhu Li, Jiale Zhao, Miteto Wei, Huimin Ren, Yang Zhou, Jingwen Yang, Shunyu Liu, Kaike Zhang, Wei Chen

机构 * Li Auto Inc. Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 RubricHub通过自动化粗到细生成方法构建了一个大规模多领域评分标准数据集,通过后训练流程显著提升了模型在HealthBench上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23565 2026-01-29 cs.CV cs.AI 57%

RxnBench: A Multimodal Benchmark for Evaluating Large Language Models on Chemical Reaction Understanding from Scientific Literature

RxnBench: 一个用于评估大语言模型在科学文献中理解化学反应的多模态基准

Hanzheng Li, Xi Fang, Yixuan Li, Chaozheng Huang, Junjie Wang, Xi Wang, Hongzhe Bai, Bojun Hao, Shenyu Lin, Huiqi Liang, Linfeng Zhang, Guolin Ke

机构 * DP Technology(DP技术公司) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Peking University(北京大学) New York University(纽约大学) Fudan University(复旦大学) Xiamen University(厦门大学) ShanghaiTech University(上海科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 RxnBench通过两个任务评估大语言模型在化学反应理解上的能力,揭示模型在深度化学逻辑和结构识别上的不足,强调需改进视觉编码和推理能力以推动AI化学发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07286 2026-01-29 cs.CL cs.IR 57%

Arce: Augmented Roberta with Contextualized Elucidations for Ner in Automated Rule Checking

Arce:增强的RoBERTa与上下文澄清用于自动规则检查中的命名实体识别

Jian Chen, Jiabao Dou

机构 * Ningxia Research Institute of Transport Science(宁夏交通运输科学研究院) Department of Computer Science(计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 ARCE通过增强RoBERTa并结合上下文澄清,有效解决了AEC领域自动规则检查中的命名实体识别问题,实现了77.20%的Macro-F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19325 2026-01-28 cs.CV cs.AI 57%

Innovator-VL: A Multimodal Large Language Model for Scientific Discovery

Innovator-VL:一种用于科学发现的多模态大语言模型

Zichen Wen, Boxue Yang, Shuang Chen, Yaojie Zhang, Yuhang Han, Junlong Ke, Cong Wang, Yicheng Fu, Jiawang Zhao, Jiangchao Yao, Xi Fang, Zhen Wang, Henxing Cai, Lin Yao, Zhifeng Gao, Yanhui Hong, Nang Yuan, Yixuan Li, Guojiang Zhao, Haoyi Tao, Nan Wang, Han Lyu, Guolin Ke, Ning Liao, Xiaoxing Wang, Kai Chen, Zhiyu Li, Feiyu Xiong, Sihan Hu, Kun Chen, Yanfeng Wang, Weinan E, Linfeng Zhang, Linfeng Zhang

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Institute of Theoretical Physics, Chinese Academy of Sciences(中国科学院理论物理研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Innovator-VL通过高效数据选择和透明训练方法,在科学发现中实现高性能多模态模型。

Comments Innovator-VL tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19202 2026-01-28 cs.CL 57%

Do Images Speak Louder than Words? Investigating the Effect of Textual Misinformation in VLMs

图像胜过言语吗?探讨文本误导在VLMs中的影响

Chi Zhang, Wenxuan Ding, Jiale Liu, Mingrui Wu, Qingyun Wu, Ray Mooney

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Pennsylvania State University(宾夕法尼亚州立大学) New York University(纽约大学) University of Chinese Academy of Sciences(中国科学院大学) AG2ai, Inc.(AG2ai公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究探讨了文本误导对视觉-语言模型(VLMs)的影响,发现模型易受误导性文本提示影响,导致性能显著下降。

Comments 24 pages, 10 figures. Accepted at EACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19063 2026-01-28 cs.CL cs.SD 57%

Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback

通过AI反馈强化学习优化语音对话系统的对话质量

Siddhant Arora, Jinchuan Tian, Jiatong Shi, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe

机构 * Carnegie Mellon University(卡内基梅隆大学) Sony Group Corporation(索尼集团)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出多奖励RLAIF框架,通过结合语义、音频质量和情感一致性奖励,提升语音对话系统的对话质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10246 2026-01-28 cs.CL 57%

coTherapist: A Behavior-Aligned Small Language Model to Support Mental Healthcare Experts

coTherapist:一种行为对齐的小语言模型,用于支持心理健康专家

Prottay Kumar Adhikary, Reena Rawat, Tanmoy Chakraborty

机构 * IIT Delhi(德里印度理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 coTherapist通过小语言模型和领域微调等技术,为心理健康专家提供支持,展现出高同理心和临床可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01509 2026-01-28 cs.CL 57%

PROPHET: An Inferable Future Forecasting Benchmark with Causal Intervened Likelihood Estimation

PROPHET:一个基于因果干预似然估计的可推断未来预测基准

Zhengwei Tao, Pu Wu, Zhi Jin, Xiaoying Bai, Haiyan Zhao, Chengfeng Dou, Xiancai Chen, Jia Li, Linyu Li, Chongyang Tao, Wentao Zhang

机构 * Peking University(北京大学) Wuhan University(武汉大学) Beihang University(北京航空航天大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 PROPHET引入了基于因果干预似然估计的可推断未来预测基准,通过CIL评估预测问题的可推断性,提升未来事件预测的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18771 2026-01-28 cs.LG cs.SI 57%

Exploring Graph Learning Tasks with Pure LLMs: A Comprehensive Benchmark and Investigation

探索纯大语言模型在图学习任务中的应用:全面的基准测试与调查

Yuxiang Wang, Xinnan Dai, Wenqi Fan, Yao Ma

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Michigan State University(密歇根州立大学) The Hong Kong Polytechnic University(香港理工大学) Rensselaer Polytechnic Institute(纽约理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本研究探讨纯大语言模型在图学习任务中的应用,通过全面的基准测试与分析,发现指令微调的LLMs在少样本设置中表现优异,具备强大的领域迁移能力和良好的泛化与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18334 2026-01-27 cs.CL 57%

Overalignment in Frontier LLMs: An Empirical Study of Sycophantic Behaviour in Healthcare

前沿大语言模型中的过度趋同:医疗领域中趋炎附势行为的实证研究

Clément Christophe, Wadood Mohammed Abdul, Prateek Munjal, Tathagata Raha, Ronnie Rajan, Praveenkumar Kanithi

机构 * M42, Abu Dhabi(阿布扎比M42)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过实证研究揭示前沿大语言模型在医疗领域中因趋炎附势行为导致的过度迎合问题,并提出调整后的趋炎附势评分以评估模型的抗性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13358 2026-01-27 cs.CL 57%

Bridging the Editing Gap in LLMs: FineEdit for Precise and Targeted Text Modifications

弥合大语言模型的编辑差距:FineEdit用于精确且有针对性的文本修改

Yiming Zeng, Wanhao Yu, Zexin Li, Tao Ren, Yu Ma, Jinghan Cao, Xiyan Chen, Tingting Yu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 FineEdit通过专门训练的编辑模型,实现了在多领域中的精确文本修改,显著提升了单轮和多轮编辑任务的性能。

Comments We resolved some issues in this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00435 2026-01-27 cs.AI cs.HC cs.RO 57%

Towards Real-time Adaptation of Embodied Agent in Human-Robot Collaboration

面向人机协作中具身代理的实时适应

Shipeng Liu, Boshen Zhang, Zhehui Huang

机构 * University of Southern California Department of Electrical(南加州大学电气与计算机工程系) University of Southern California Department of Computer Science Los Angeles CA USA(南加州大学计算机科学系洛杉矶加州美国) University of Southern California(南加州大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MonTA框架,通过轻量级监控和高效适配器提升人机协作中具身代理的实时适应能力,实现更高效的协作性能。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17916 2026-01-27 cs.LG 57%

UniPACT: A Multimodal Framework for Prognostic Question Answering on Raw ECG and Structured EHR

UniPACT:一种多模态框架,用于基于原始ECG和结构化EHR的预后问题回答

Jialu Tang, Tong Xia, Yuan Lu, Aaqib Saeed

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 UniPACT通过多模态融合和结构化提示机制,实现对ECG和EHR的预后问题回答,取得优异的AUROC性能。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17828 2026-01-27 cs.AI 57%

Aligning Medical Conversational AI through Online Reinforcement Learning with Information-Theoretic Rewards

通过在线强化学习与信息论奖励对齐医疗对话AI

Tanvi Verma, Yang Zhou, Rick Siow Mong Goh, Yong Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出IGFT方法,通过在线强化学习与信息论奖励训练医疗对话AI,提升患者访谈和现病史生成能力,优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17728 2026-01-27 cs.CL 57%

Unsupervised Elicitation of Moral Values from Language Models

无监督从语言模型中提取道德价值观

Meysam Alizadeh, Fabrizio Gilardi, Zeynab Samei

机构 * University of Zurich(苏黎世大学) IPM(伊朗高等教育科学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 通过无监督方法ICM,研究发现预训练语言模型具备潜在的道德推理能力,能有效减少社会偏见,为AI对齐提供新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17722 2026-01-27 cs.AI 57%

EntWorld: A Holistic Environment and Benchmark for Verifiable Enterprise GUI Agents

EntWorld: 一个综合环境和基准,用于可验证的企业GUI代理

Ying Mo, Yu Bai, Dapeng Sun, Yuqian Shi, Yukai Miao, Li Chen, Dan Li

机构 * Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 EntWorld是一个综合的企业GUI代理基准,通过基于模式的任务生成和SQL验证机制,评估代理在企业环境中的表现,揭示当前代理能力的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17706 2026-01-27 cs.CL cs.CV 57%

A Computational Approach to Visual Metonymy

一种视觉隐喻的计算方法

Saptarshi Ghosh, Linfeng Liu, Tianyu Jiang

机构 * University of Cincinnati(辛辛那提大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种基于符号学理论的计算方法,通过构建ViMET数据集评估多模态语言模型在理解视觉隐喻方面的认知推理能力,并揭示了机器在处理间接视觉参考上的局限性。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17692 2026-01-27 cs.IR cs.CL 57%

LegalMALR:Multi-Agent Query Understanding and LLM-Based Reranking for Chinese Statute Retrieval

LegalMALR:多代理查询理解与基于大语言模型的重排序法用于中文法律条文检索

Yunhan Li, Mingjie Xie, Gaoli Kang, Zihan Gong, Gengshen Wu, Min Yang

机构 * Faculty of Data Science(数据科学学院) City University of Macau(澳门城市大学) Shenzhen Key Laboratory for High Performance Data Mining(深圳高性能数据挖掘重点实验室) Shenzhen Institutes of Advanced Technology(深圳先进技术研究所) Chinese Academy of Sciences(中国科学院) Southern University of Science and Technology(南方科技大学) Artificial Intelligence Research Institute(人工智能研究院) Shenzhen University of Advanced Technology(深圳大学先进技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 LegalMALR通过多代理查询理解和大语言模型重排序技术,提升中文法律条文检索的准确性和适用性。

Comments 31pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17399 2026-01-27 cs.CV cs.AI 57%

ReLE: A Scalable System and Structured Benchmark for Diagnosing Capability Anisotropy in Chinese LLMs

ReLE:一种可扩展的系统和结构化基准,用于诊断中文大语言模型的能力异质性

Rui Fang, Jian Li, Wei Chen, Bin Hu, Ying-Cong Chen, Xin Tang, Liang Diao

机构 * Sun Yat-sen University(中山大学) ReLE Benchmark Team(ReLE基准团队) NSFOCUS Technologies Co., Ltd.(NSFOCUS技术有限公司) HKUST-GZ(香港科技大学-广州) Huawei(华为) Ping An Property & Casualty Insurance Company of China, Ltd(平安财产保险股份有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 ReLE通过可扩展系统和结构化基准诊断中文大语言模型的能力异质性,提升评估效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17191 2026-01-27 cs.CV cs.CL 57%

VaseVQA: Multimodal Agent and Benchmark for Ancient Greek Pottery

VaseVQA: 古代希腊陶器的多模态代理与基准

Jinchao Ge, Tengfei Cheng, Biao Wu, Zeyu Zhang, Shiya Huang, Judith Bishop, Gillian Shepherd, Meng Fang, Ling Chen, Yang Zhao

机构 * University of Adelaide(阿德莱德大学) University of Liverpool(利物浦大学) University of Technology Sydney(悉尼技术大学) The Australian National University(澳大利亚国立大学) La Trobe University(拉特罗布大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 VaseVQA通过引入VaseVL强化学习方法,提升对古代希腊陶器的多模态推理能力,尤其在复杂推理任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18951 2026-01-27 cs.DB cs.AI 57%

SWE-SQL: Illuminating LLM Pathways to Solve User SQL Issues in Real-World Applications

SWE-SQL:揭示LLM解决现实应用中用户SQL问题的路径

Jinyang Li, Xiaolong Li, Ge Qu, Per Jacobsson, Bowen Qin, Binyuan Hui, Shuzheng Si, Nan Huo, Xiaohan Xu, Yue Zhang, Ziwei Tang, Yuanshuai Li, Florensia Widjaja, Xintong Zhu, Feige Zhou, Yongfeng Huang, Yannis Papakonstantinou, Fatma Ozcan, Chenhao Ma, Reynold Cheng

机构 * HKU STAR Lab(香港大学STAR实验室) Google Cloud(谷歌云) CUHKSZ(香港中文大学) CUHK(香港中文大学) THU(清华大学) The BIRD Team(BIRD团队)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 SWE-SQL通过引入BIRD-CRITIC基准和Six-Gym训练环境,提升开源模型解决SQL问题的能力,实现对复杂SQL调试任务的突破。

Comments 29 pages, 10 figures, NeurIPS 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16621 2026-01-26 cs.CL 57%

How Does Personalized Memory Shape LLM Behavior? Benchmarking Rational Preference Utilization in Personalized Assistants

个性化记忆如何塑造大语言模型行为?个性化助手中的理性偏好利用基准测试

Xueyang Feng, Weinan Gan, Xu Chen, Quanyu Dai, Yong Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出RPEval基准,通过分析个性化记忆对LLM行为的影响,引入RP-Reasoner方法,有效缓解非理性个性化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16466 2026-01-26 cs.CL 57%

Persona Jailbreaking in Large Language Models

大型语言模型中的身份劫持

Jivnesh Sandhan, Fei Cheng, Tushar Sandhan, Yugo Murawaki

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 PHISH通过隐含引导历史的身份劫持框架,揭示LLM身份操控的新漏洞,实现对身份的可控操控。

Comments Accepted at EACL26 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11003 2026-01-26 cs.SE cs.AI 57%

EmbedAgent: Benchmarking Large Language Models in Embedded System Development

EmbedAgent: 在嵌入式系统开发中评估大型语言模型

Ruiyang Xu, Jialun Cao, Mingyuan Wu, Wenliang Zhong, Yaojie Lu, Ben He, Xianpei Han, Shing-Chi Cheung, Le Sun

机构 * University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Peng Cheng Laboratory(鹏城实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出EmbedAgent和Embedbench,用于评估LLMs在嵌入式系统开发中的能力,发现通用LLMs在特定任务中表现不佳,提出检索增强生成和编译器反馈策略以提升性能。

Comments 12 pages, accepted by International Conference on Software Engineering (ICSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09849 2026-01-26 cs.LG cs.HC 57%

A Survey on Human-Centered Evaluation of Explainable AI Methods in Clinical Decision Support Systems

可解释人工智能在临床决策支持系统中的人本评估综述

Alessandro Gambetti, Qiwei Han, Hong Shen, Claudia Soares

机构 * Nova School of Science and Technology, Universidade NOVA de Lisboa(诺瓦科学与技术学院,诺瓦里斯本大学) Nova School of Business and Economics, Universidade NOVA de Lisboa(诺瓦商学院与经济学院,诺瓦里斯本大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文综述了XAI在临床决策支持系统中的人本评估,指出多数研究采用事后方法,提出以利益相关者为中心的评估框架以提升XAI的临床可信度。

Comments 19 pages, 2 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏