HeartLLM: Discretized ECG Tokenization for LLM-Based Diagnostic Reasoning
HeartLLM: 12导联心电图离散化编码用于基于大语言模型的诊断推理
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 HeartLLM通过离散化ECG信号生成令牌,使LLM能处理心电图与自然语言输入,实现医疗诊断推理。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
HeartLLM: 12导联心电图离散化编码用于基于大语言模型的诊断推理
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 HeartLLM通过离散化ECG信号生成令牌,使LLM能处理心电图与自然语言输入,实现医疗诊断推理。
VMMU:一个多任务多模态理解和推理基准
机构 * KAIST(韩国科学技术院) ; MBZUAI(慕布扎伊大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 VMMU是一个评估视觉语言模型在非英语环境下多模态理解和推理能力的基准,通过2500个多模态问题测试模型对视觉和文本信息的整合与推理能力。
Chat-TS: 提升时间序列与自然语言数据的多模态推理能力
机构 * Electrical and Computer Engineering, Queen’s University(皇后大学电气与计算机工程学院) ; Mechanical and Materials Engineering, Queen’s University(皇后大学机械与材料工程学院) ; Ingenuity Labs Research Institute, Queen’s University(皇后大学创新实验室研究 institute)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 Chat-TS通过整合时间序列标记提升多模态推理能力,提供新数据集和训练策略,在保持自然语言能力的同时增强时间序列推理性能。
MolecularIQ: 通过分子图上的符号验证来表征化学推理能力
机构 * ELLIS Unit Linz and LIT AI Lab, Institute for Machine Learning, Johannes Kepler University, Linz, Austria(林茨ELLIS单元和LIT人工智能实验室,机器学习研究所,约翰·凯撒大学,林茨,奥地利) ; Clinical Research Institute Medical Artificial Intelligence, Johannes Kepler University, Linz, Austria(医学人工智能临床研究研究所,约翰·凯撒大学,林茨,奥地利)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 MolecularIQ是一个专注于分子图符号验证的化学推理基准测试,旨在评估模型对分子结构推理能力的细粒度评估并揭示模型在特定任务和分子结构上的表现。
DARC:解耦的非对称推理课程用于LLM进化
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 DARC通过解耦的非对称推理课程框架,提升大型语言模型的自我进化能力,实现无需人工标注的性能提升。
DermaBench:一种用于皮肤科视觉问答和推理的临床标注基准数据集
机构 * Imperial College London(帝国理工学院伦敦分校) ; Istanbul Medeniyet University(伊斯坦布尔医学大学) ; Usak Research and Training Hospital(Usak研究与培训医院) ; Istanbul Research and Training Hospital(伊斯坦布尔研究与培训医院) ; Ipswich Hospital(伊普斯韦奇医院) ; Medicana Atakoy Hospital(Medicana阿塔基医院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 DermaBench是首个由临床专家标注的皮肤科视觉问答基准数据集,通过精细标注和开放式描述提升多模态模型在皮肤科图像理解与临床推理中的评估能力。
推理稳定点:一种训练时的信号,用于稳定证据和捷径依赖
机构 * Arizona State University(亚利桑那州立大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出推理稳定点(RSP)作为训练时的信号,用于监测微调过程中决策证据的变化,并帮助选择稳定证据区域的检查点。
Comments 8 pages, Submitted to ACL Rolling Review and is under review
PerCoR:通过多项选择句完成评估波斯语的常识推理
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 PerCoR是首个大规模波斯语常识推理基准测试,通过多项选择句完成问题评估常识推理能力,展示了DRESS-AF方法在提升数据集难度和模型性能方面的有效性。
Comments 20 pages, 17 figures, Accepted to IJCNLP-AACL 2025 (Main Conference)
基于推理模型的ICD-9代码社会决定因素预测
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; University of Illinois Chicago Peoria(伊利诺伊大学芝加哥分校皮奥里亚分校)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出利用推理模型和传统大语言模型,在MIMIC-III数据集上对医院入院的多标签社会决定因素ICD-9代码进行分类,实现了89%的F1分数,并发现139次入院中缺失的SDoH代码。
Comments Published as part of Machine Learning for Health (ML4H) 2025 Findings Track
识别符号,缺失文化:探究视觉-语言模型在火 imagery 和文化意义上的推理
机构 * Duncan of Jordanstone College of Art & Design (DJCAD), University of Dundee(邓迪大学邓迪艺术与设计学院(DJCAD)) ; Guangzhou Institute of Science and Technology (GZIST)(广州科学技术研究院) ; Faculty of Arts, Xiamen University(厦门大学艺术学院) ; University of Birmingham(伯明翰大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 研究发现视觉-语言模型在处理火主题文化图像时存在系统性偏见,需通过文化评估确保公平性和可解释性。
Comments 8 pages, 5 figures, 4 tables. Submitted to WiNLP 2025 Workshop at COLING 2025
Journal ref Proceedings of the 9th Widening NLP Workshop (WiNLP 2025), pages 1-8, Suzhou, China. Association for Computational Linguistics
多跳推理的亲属数据基准
机构 * University of York(约克大学) ; Department of Computer Science(计算机科学系)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 KinshipQA通过生成文化特定的家谱数据,评估多跳推理能力,揭示模型在不同文化背景下的推理差异。
Comments 11 pages, 2 figures, 9 tables
超越静态工具:科学推理中的测试时工具进化
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Xiamen University(厦门大学) ; University of Macau(澳门大学) ; Tsinghua University(清华大学) ; Hangzhou Dianzi University(杭州电子科技大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出TTE框架,通过在推理过程中动态合成和进化工具,提升科学推理任务的准确性和工具效率,同时支持跨领域适应。
陷入噪声中:推理模型在上下文干扰中的失败
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出RARE方法,通过激励识别噪声中的有用信息,提升模型在上下文干扰下的鲁棒性,揭示增加计算量反而导致噪声环境下性能下降的反比例趋势。
Comments Preprint
Amory:通过代理推理构建连贯的叙事驱动代理记忆
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Amazon(亚马逊)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 Amory通过增强代理推理构建连贯的叙事驱动记忆,提升长期对话代理的推理性能与响应效率。
在大语言模型和推理模型中评估时空推理:能力和挑战
机构 * Department of Electrical and Computer Engineering, UCLA(电气与计算机工程系,加州大学洛杉矶分校)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出STARK基准测试,评估大语言模型和推理模型在时空推理任务中的能力和挑战,发现推理模型在复杂任务中表现更优。
WildSci: 从真实文献中推进科学推理
机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 WildSci通过自动合成领域特定科学问题数据集,提升科学推理的可扩展性和可持续性。
PILOT-Bench:一个以专利领域法律推理为核心的基准,包含与IRAC对齐的分类任务
机构 * Pukyong National University(浦项国立大学) ; Tomocube Inc.(Tomocube公司)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 PILOT-Bench通过IRAC对齐的分类任务评估专利领域法律推理能力,揭示闭源与开源模型在推理性能上的显著差异。
Comments Accepted at the NLLP Workshop at EMNLP 2025
Sci-Reasoning:一个解码AI创新模式的数据集
机构 * Orchestra Research(Orchestra研究)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 Sci-Reasoning数据集通过分析AI研究中的15种思维模式,揭示了高影响力论文的创新机制,为训练下一代AI研究代理提供结构化推理轨迹。
Comments 22 pages, 9 figures
解构小型语言模型中的物理推理:从教育视角的多维分析
机构 * Computational and Data Sciences, Indian Institute of Science, India(计算机与数据科学,印度科学研究院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文从教育视角出发,通过Physbench评估了小型语言模型在物理推理中的可靠性,发现其在多步骤推理中存在显著的可靠性缺口,且失败模式随模型能力变化,强调评估需更注重推理过程而非最终答案。
CMDAR:一个包含多样挑战的中文多场景动态音频推理基准
机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) ; Shanghai Jiao Tong University(上海交通大学) ; IEIT Systems Co Ltd(IEIT系统有限公司)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 CMDAR是一个中文多场景动态音频推理基准,旨在评估模型在复杂音频推理任务中的表现,通过精心设计的问题-答案对和多样化音频片段,揭示现有音频语言模型在复杂推理任务中的局限性。
Comments 25 pages, 7 figures
扩大开放性推理以预测未来
机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; ELLIS Institute Tübingen(图宾根ELLIS研究所) ; Tübingen AI Center(图宾根人工智能中心) ; University of Tübingen(图宾根大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出了一种基于开放性推理的预测系统,通过合成全球事件问题并训练专用模型,提升了预测的准确性、校准性和一致性,并开源所有资源促进研究。
Comments 45 pages
LTLBench: 为评估大语言模型中的时间推理能力而设计的基准测试
机构 * University of Edinburgh(爱丁堡大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 LTLBench通过线性时序逻辑评估大语言模型的时间推理能力,构建包含2000个挑战的数据集并测试12个模型,揭示时间推理中的主要问题及复杂性影响。
AHA: 通过反事实硬负样本对齐大音频-语言模型以缓解推理幻觉
机构 * Arizona State University(亚利桑那州立大学) ; Clemson University(克莱姆斯大学) ; Washington University in St.Louis(圣路易斯华盛顿大学) ; Rice University(Rice 大学) ; Morgan Stanley(摩根大通)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 AHA通过反事实硬负样本对齐大音频-语言模型,有效减少推理幻觉,提升时间推理能力,并在多个基准测试中取得显著成效。
医学推理模型中答案格式的鲁棒性研究
机构 * SCB 10X R&D(SCB 10X 研发部) ; SCB 10X ; SCBX Group(SCBX 团体) ; Faculty of Medicine Siriraj Hospital(素里雅医院医学学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 本文研究了医学推理模型在不同答案格式下的鲁棒性,发现监督微调更稳定,而强化微调易出现跨格式脆性,需谨慎评估以应用于实际医疗场景。
Comments 62 pages, 47 figures
nvBench 2.0:通过分步推理解决文本到可视化中的歧义
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 nvBench 2.0通过分步推理解决文本到可视化中的歧义问题,提出Step-Text2Vis模型在模糊场景中表现更优。
EXAONE Deep:增强推理能力的语言模型
机构 * LG AI Research(LG人工智能研究)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 EXAONE Deep通过训练专用推理数据集,在数学和编码任务中展现出优于同类模型的能力,并提供大模型版本供研究使用。
人格推理中的认知对齐:利用原型理论进行MBTI推断
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 ProtoMBTI通过原型理论与认知对齐,提升文本人格推断的准确性和泛化能力。
Comments The authors have decided to withdraw this version to substantially revise and extend the work
大语言模型人格测量中的持久不稳定性:规模、推理和对话历史的影响
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 研究发现大语言模型在人格测量中存在持续不稳定性,规模扩大、推理和对话历史等干预措施未能有效提升稳定性。
Comments Accepted at AAAI 2026, Track on AI Alignment
当推理遇见其定律
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Massachusetts Institute of Technology(麻省理工学院) ; University of Pennsylvania(宾夕法尼亚大学) ; New York University(纽约大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出推理定律(LoRe)框架,通过单调性和组合性属性评估推理模型,开发微调方法提升推理性能。
从事实到结论:在检索增强的大语言模型中整合演绎推理
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种增强RAG框架,通过结构化推理和冲突分析提升模型在冲突信息下的回答准确性与可解释性。
Comments Under Review