arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12597 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 12597 篇

2607.01431 2026-07-03 cs.CL cs.AI 新提交 82%

IsoSci: A Benchmark of Isomorphic Cross-Domain Science Problems for Evaluating Reasoning versus Knowledge Retrieval in LLMs

IsoSci: 用于评估LLM中推理与知识检索的同构跨域科学问题基准

Samir Abdaljalil, Erchin Serpedin, Hasan Kurban

机构 * Texas A&M University(德克萨斯农工大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 领域大模型 :LLM(title_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出IsoSci基准,通过逻辑结构相同但领域知识不同的科学问题对,分离推理能力与领域知识检索,发现91.3%的推理增益依赖于知识而非结构,挑战了思维链推理提升科学问题解决的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27973 2026-06-29 cs.CL cs.AI 新提交 82%

From Black-Box to Clinical Insight: A Multi-Stage Explainable Framework for Speech-Based Cognitive Impairment Detection

从黑盒到临床洞察:用于语音认知障碍检测的多阶段可解释框架

Yasaman Haghbin, Sina Rashidi, Ali Zolnour, Fatemeh Taherinezhad, Ali Fartoot, Hossein Azadmaleki, James M Noble, Maryam Dadkhah, Maryam Zolnoori

机构 * Independent Researcher(独立研究者) Columbia University(哥伦比亚大学) Chalmers University of Technology(查尔姆斯理工大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出多阶段可解释框架,结合SHAP、语言学特征和LLM推理,将黑盒Transformer预测转化为临床叙事,在NIA PREPARE基准上F1=72.11%,医生评估显示与患者认知特征高度一致,SUS评分82/100。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26728 2026-06-26 cs.AI cs.LG cs.MA 新提交 82%

Scientific discovery as meta-optimization: a combinatorial optimization case study

科学发现作为元优化:一个组合优化案例研究

Yuan-Hang Zhang, Chesson Sipling, Massimiliano Di Ventra

机构 * University of California San Diego(加州大学圣迭戈分校)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出将科学研究形式化为元优化,通过共识目标聚合方法,在3-SAT算法发现中实现从O(N^2.51)到O(N^1.33)的规模改进,最大实例加速约67倍。

Comments 35 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19852 2026-06-26 cs.CL cs.LG 新提交 82%

Prompt, Plan, Extract: Zero-Shot Agentic LLMs Workflows for Lung Pathology Extraction from Clinical Narratives

提示、规划、提取:用于从临床叙述中提取肺部病理学的零样本智能体LLM工作流

Aman Pathak, Cheng Peng, Mengxian Lyu, Ziyi Chen, Reema Solan, Sankalp Talankar, Yasir Khan, Hiren Mehta, Aokun Chen, Yi Guo, Yonghui Wu

机构 * Department of Health Outcomes and Biomedical Informatics, College of Medicine, University of Florida(健康结果与生物医学信息学系,医学院,佛罗里达大学) Division of Pulmonary, Critical Care and Sleep Medicine, Department of Medicine, College of Medicine, University of Florida(呼吸科、重症医学科和睡眠医学科,医学系,医学院,佛罗里达大学) College of Nursing, Florida State University(护理学院,佛罗里达州立大学)

专题命中 领域大模型 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出零样本智能体工作流,利用开源大语言模型从肺切除病理报告中提取13个CAP字段,在无训练下达到0.893 Micro-F1,接近监督方法。

Comments 7 pages, 2 figures, 3 tables. Affiliations: (1) Department of Health Outcomes and Biomedical Informatics, College of Medicine, University of Florida, Gainesville, FL, USA (2) Division of Pulmonary, Critical Care and Sleep Medicine, Department of Medicine, College of Medicine, University of Florida, Gainesville, FL, USA (3) College of Nursing, Florida State University, Tallahassee, FL, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19812 2026-06-19 cs.AI cs.LG 新提交 82%

Human-on-the-Loop Orchestration for AI-Assisted Legal Discovery

AI辅助法律发现中的人机协同编排

Anushree Sinha, Srivaths Ranganathan, Abhishek Dharmaratnakar, Debanshu Das

机构 * Google LLC(谷歌公司) Mountain View, CA, USA(美国加利福尼亚州山景城)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对AI代理在电子取证中因多步推理错误导致的法律风险,提出一种四层验证架构,通过人机协同阈值减少特权豁免风险达61%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16000 2026-06-18 cs.CL cs.LG 新提交 82%

GRACE-DS: a Guarded Reward-guided Agent Correction Environment in Data Science

GRACE-DS:数据科学中的受保护奖励引导智能体修正环境

Aleksandr Tsymbalov, Danis Zaripov, Artem Epifanov, Anastasiya Palienko

机构 * ITMO University(ITMO大学) HSE University(高等经济学院)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 提出GRACE-DS,一个用于评估LLM驱动的AutoML智能体在部署前性能的隔离环境,通过隐藏的可执行验证器衡量预测性能、泄漏避免、可重复性等指标,实验证明其灵活迭代交互模式优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13924 2026-06-12 cs.LG cs.AI cs.CV 版本更新 82%

ASTER: Latent Pseudo-Anomaly Generation for Unsupervised Time-Series Anomaly Detection

ASTER: 用于无监督时间序列异常检测的潜在伪异常生成

Romain Hermary, Samet Hicsonmez, Dan Pineau, Abd El Rahman Shabayek, Djamila Aouada

机构 * University of Montreal(蒙特利尔大学) Université de Montréal(蒙特利尔大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出ASTER框架,在潜在空间生成伪异常训练Transformer分类器,结合预训练LLM增强表示,在三个基准数据集上达到最优性能。

Comments Published in ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13591 2026-06-12 cs.AI cs.CL 版本更新 82%

DSAEval: Evaluating Data Science Agents on a Wide Range of Real-World Data Science Problems

DSAEval:在广泛真实世界数据科学问题上评估数据科学智能体

Maojun Sun, Yifei Xie, Yue Wu, Ruijian Han, Binyan Jiang, Defeng Sun, Yancheng Yuan, Jian Huang

机构 * Department of Data Science and Artificial Intelligence, Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) Department of Applied Mathematics, Hong Kong Polytechnic University(应用数学系,香港理工大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出包含641个真实数据科学问题的基准DSAEval,涵盖多模态环境感知、多查询交互和多维评估,系统评估13个先进LLM智能体,发现Claude-Sonnet-4.5综合最优,多模态感知提升视觉任务性能2.04%-11.30%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11456 2026-06-11 cs.CL cs.AI cs.CY 新提交 82%

AI Coding Agents in Social Science: Methodologically Diverse, Empirically Consistent, Interpretively Vulnerable

社会科学中的AI编码智能体:方法多样,经验一致,解释脆弱

Meysam Alizadeh, Fabrizio Gilardi, Mohsen Mosleh, Enkelejda Kasneci

机构 * University of Oxford(牛津大学) University of Zurich(苏黎世大学) Technical University of Munich(慕尼黑工业大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 研究LLM智能体在科学分析中的方法多样性与解释脆弱性,通过20次独立实验发现智能体在设计层匹配或超越人类多样性,但在裁决层易受提示影响,偏差源于解释而非估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11023 2026-06-10 cs.IR cs.CL cs.LG 新提交 82%

Generative Archetype-Grounded Item Representations for Sequential Recommendation

生成式原型驱动的物品表示用于序列推荐

Yifan Li, Jiahong Liu, Xinni Zhang, Hao Chen, Yankai Chen, Wenhao Yu, Jianting Chen, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) McGill University(麦吉尔大学) Tongji University(同济大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出GenAIR框架,利用大语言模型生成物品原型描述并提取嵌入,结合行为校准目标弥合语义与行为差距,显著提升序列推荐性能。

Comments Accepted by WWW 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07704 2026-06-09 cs.LG cs.AI 新提交 82%

FunctionEvolve: Structure-Guided Symbolic Regression with LLMs

FunctionEvolve: 基于结构引导的符号回归与大型语言模型

Zeyu Xia, Jun Zhu, Dong Yan

机构 * Bosch Center for Artificial Intelligence(博世人工智能中心) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Tsinghua-Bosch Joint Center for ML, Tsinghua University(清华大学-博世联合机器学习中心)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出FunctionEvolve框架,利用表达式树组织符号回归搜索,通过结构摘要、局部树编辑和结构感知系数拟合,在LLM-SRBench合成子集上以Claude Opus 4.6实现82.9%的SA@50,较同基线提升4.5倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06915 2026-06-08 cs.CL cs.LG 版本更新 82%

A Dynamic Self-Evolving Extraction System

一种动态自演化抽取系统

Moin Amin-Naseri, Hannah Kim, Estevam Hruschka

机构 * Megagon Labs(Megagon实验室)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 提出DySECT系统,通过LLM抽取三元组构建知识库,结合概率知识和图推理丰富知识,再反馈优化抽取器,形成闭环持续提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05436 2026-06-05 cs.AI cs.CL cs.IR 82%

Ten Headache Specialists versus Artificial Intelligence for Clinical Literature Summarization: A Critical Evaluation and Comparison

十位头痛专家与人工智能在临床文献总结中的比较:一项关键评估与对比

Alejandro Lozano, Keiko Ihara, Ping-Hao Yang, Carrie E. Robertson, Jennifer Stern, Allan Purdy, Hsiangkuo Yuan, Pengfei Zhang, Yulia Orlova, Olga Fermo, Jennifer Hranilovich, Fred Cohen, Todd J. Schwedt, Jenelle A. Jindal, Serena Yeung-Levy, Chia-Chun Chiang

机构 * Stanford University Palo Alto CA USA(斯坦福大学) Department of Neurology Mayo Clinic Rochester MN USA(梅奥诊所神经科) Department of Neurology Dalhousie University Halifax Canada(达尔豪斯大学神经科) Jefferson Headache Center Department of Neurology Thomas Jefferson University PA USA(泰勒大学神经科) Beth Israel Deaconess Medical Center Boston MA USA(贝斯以色列医疗中心) Department of Neurology University of Florida Gainesville FL USA(佛罗里达大学神经科) University of Colorado School of Medicine Department of Pediatrics Division of Child Neurology Aurora CO USA(科罗拉多医学院儿科部儿童神经科) Department of Medicine Mount Sinai Hospital Icahn School of Medicine at Mount Sinai New York NY USA(西奈医院医学部) Department of Neurology Mayo Clinic Scottsdale AZ USA(梅奥诊所Scottsdale分部) Harvard Medical School Boston MA USA(哈佛医学院) Department of Neurology Mount Sinai Hospital Icahn School of Medicine at Mount Sinai New York NY USA(西奈医院神经科)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过构建基于RAG的AI框架,比较了三种大语言模型与十位头痛专家在临床文献总结方面的表现,发现专家撰写的摘要更受青睐,但专家有时难以区分人类与AI生成的摘要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04177 2026-06-04 cs.CL cs.AI 82%

A Systematic Analysis of Linguistic Features in AI-Generated Text Detection Across Domains and Models

跨领域与模型的人工智能生成文本检测中语言特征的系统分析

Yassir El Attar, Esra Dönmez, Maximilian Maurer, Agnieszka Falenska

机构 * Institute for Natural Language Processing, University of Stuttgart(斯图加特大学自然语言处理研究所) Interchange Forum for Reflecting on Intelligent Systems, University of Stuttgart(智能系统反思交流论坛,斯图加特大学) GESIS Leibniz Institute for the Social Sciences(莱比锡社会科学院) Heinrich-Heine University Düsseldorf(杜塞尔多夫海因里希-海涅大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 通过大规模实证研究,系统评估284个可解释语言特征在27个LLM和10个文本领域中的鲁棒性,发现词汇丰富度是跨模型和领域的最可靠信号。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01421 2026-06-04 cs.AI cs.CL 82%

SciDER: Scientific Data-centric End-to-end Researcher

SciDER: 以科学数据为中心的端到端研究者

Ke Lin, Owais Aijaz, Yilin Lu, Yiyang Luo, Xuehang Guo, Preslav Nakov

专题命中 领域大模型 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出SciDER多智能体系统,通过数据驱动方法和动态多模态技能系统,自动化科学研究的全生命周期,并在六个基准测试中取得领先结果。

Comments 10 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00272 2026-06-02 cs.AI cs.CL cs.CY 82%

On Wednesdays, We Ask Questions: Optimizing "Active Listening" in Automated Legal Triage and Referral

在周三,我们提问:优化自动化法律分诊与转介中的“主动倾听”

Quinten Steenhuis, Jacqueline Harvey

机构 * Suffolk University Law School(苏福克大学法学院)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文通过专家律师和LLM评估FETCH分类器的追问问题方法,发现低成本LLM在分类任务中表现良好但生成高质量问题需高成本模型,并提出法律分诊问题评估标准。

Comments Working paper submitted as accepted to AIDA2J workshop at International Conference for AI and Law in Singapore, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00125 2026-06-02 cs.IR cs.AI cs.LG cs.MM 82%

Multimodal Music Recommendation System using LLMs

使用LLMs的多模态音乐推荐系统

Srikar Prabhas Kandagatla, Sreehitha R. Narayana, Chandana Magapu, Swetha Mohan, Shamanth Kuthpadi, Hongjie Chen, Ryan A. Rossi, Franck Dernoncourt, Nesreen Ahmed

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Dolby Laboratories(Dolby实验室) Adobe Research(Adobe研究) Cisco Research(Cisco研究)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出一个多模态框架,通过融合音频、歌词、LLM生成的语义元数据和收听完成率,在基于会话的音乐推荐中显著提升Recall和NDCG。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06448 2026-06-02 cs.LG cs.AI 82%

Principle-Evolvable Scientific Discovery via Uncertainty Minimization

通过不确定性最小化实现原理可演化的科学发现

Yingming Pu, Tao Lin, Hongyu Chen

机构 * Westlake University(西lake大学) Zhejiang University(浙江大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出PiEvo框架,将科学发现视为原理空间上的贝叶斯优化,通过信息导向假设选择与异常驱动增强机制,使智能体自主演化理论世界观,在四个基准上平均解质量达90.81%~93.15%,收敛速度提升83.3%。

Comments Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026. Copyright 2026 by the author(s)

Journal ref Proc. 43rd Intl. Conf. on Machine Learning (ICML 2026), PMLR 306

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31099 2026-06-01 cs.CL cs.AI 82%

KnowledgeGain: Evaluating and Optimizing Science News Generation for Reader Learning

KnowledgeGain: 评估和优化面向读者学习的科学新闻生成

Dominik Soós, Meng Jiang, Jian Wu

机构 * Old Dominion University(旧 Dominion 大学) University of Notre Dame(诺特大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出KnowledgeGain指标,通过测量读者知识增益来评估科学新闻质量,并利用LLM模拟器优化生成,提升读者学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30646 2026-06-01 cs.CL cs.AI 82%

Same Patient, Different Words, Different Diagnosis? Evaluating Semantic Stability in Clinical LLMs

同一患者,不同措辞,不同诊断?评估临床大语言模型中的语义稳定性

Mahdi Alkaeed, Adnan Qayyum, Nabeel Abo Kashreef, Muhammad Bilal, Junaid Qadir

机构 * Department of Computer Science and Engineering, College of Engineering, Qatar University(卡塔尔大学计算机科学与工程系) College of Science and Engineering, Hamad Bin Khalifa University (HBKU)(哈马德·本·卡伊夫大学(HBKU)理学院) Primary Health Care Corporation (PHCC)(初级卫生保健公司) Birmingham City University(伯明翰城市大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对临床大语言模型对语义等价但措辞不同的提示敏感的问题,提出基于自然语言推理的语义验证框架和三个量化指标,评估16个开源通用与医学模型,发现领域专业化并不一致地提升或降低鲁棒性。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16215 2026-06-01 cs.AI cs.CL 82%

Fully Open Meditron: An Auditable Pipeline for Clinical LLMs

完全开放的Meditron:临床大语言模型的可审计流水线

Xavier Theimer-Lienhard, Mushtaha El-Amin, Fay Elhassan, Sahaj Vaidya, Victor Cartier-Negadi, David Sasu, Lars Klein, Mary-Anne Hartley

机构 * EPFL(苏黎世联邦理工学院)

专题命中 领域大模型 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出首个完全开放的临床大语言模型构建流水线Fully Open Meditron,通过可审计的数据集、可复现的训练框架和对齐评估协议,在不牺牲可审计性和可复现性的前提下实现了领域最新性能。

Comments Preprint. 31 pages, 10 figures. Code, models, and data: https://github.com/EPFLiGHT/FullyOpenMeditron

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27249 2026-05-27 cs.AI cs.CL 82%

Gumbel Machine: Counterfactual Student Writing Generation via Gumbel Noise Steering

Gumbel机器:通过Gumbel噪声引导生成反事实学生写作

Hunter McNichols, Alexander Scarlatos, Mihai Dascalu, Danielle McNamara, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University Politehnica of Bucharest(布加勒斯特理工大学) Arizona State University(亚利桑那州立大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Gumbel机器,一种利用β-Hindsight控制解码算法生成既符合评分标准又与学生原文相似的反事实文本的模块化方法。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07028 2026-05-27 cs.MA cs.AI cs.CL 82%

Strategic Persuasion with Trait-Conditioned Multi-Agent Systems for Iterative Legal Argumentation

基于特质条件的多智能体系统在迭代法律论证中的战略说服

Philipp D. Siedler

机构 * Aleph Alpha Research(Aleph Alpha研究)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出战略法庭框架,通过特质条件化的大语言模型智能体模拟多轮法律辩论,发现异质团队表现更优,并引入强化学习特质编排器动态优化辩护策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10450 2026-05-27 cs.LG cs.AI math.OC 82%

Constructing Industrial-Scale Optimization Modeling Benchmark

构建工业规模优化建模基准

Zhong Li, Hongliang Lu, Tao Wei, Yuxuan Chen, Wenyu Liu, Yuan Lan, Fan Zhang, Zaiwen Wen

机构 * Great Bay University(大湾大学) Peking University(北京大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出MIPLIB-NL基准,通过结构感知逆向构建方法从真实混合整数线性规划中生成自然语言规范与求解器代码,以评估大语言模型在工业规模优化建模中的性能。

Comments This paper was accepted by ICML'26 for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21035 2026-05-19 cs.AI cs.LG cs.MA q-bio.GN 82%

GenoMAS: A Multi-Agent Framework for Scientific Discovery via Code-Driven Gene Expression Analysis

GenoMAS:通过代码驱动的基因表达分析进行科学发现的多智能体框架

Haoyang Liu, Yijiang Li, Haohan Wang

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出GenoMAS多智能体框架,通过类型消息传递协议协调六个专门的LLM代理,以实现基因表达数据的高效处理和科学发现,其在数据预处理和基因识别任务上均优于现有方法。

Comments 51 pages (14 pages for the main text, 10 pages for references, and 27 pages for the appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15161 2026-05-14 cs.CL cs.AI 82%

Automated Rubrics for Reliable Evaluation of Medical Dialogue Systems

用于医疗对话系统可靠评估的自动化评分标准

Yinzhu Chen, Abdine Maiga, Hossein A. Rahmani, Emine Yilmaz

机构 * AI Center, University College London(伦敦大学学院人工智能中心)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种检索增强的多智能体框架,用于自动生成实例特定的评估评分标准,通过权威医学证据生成可验证的细粒度评估标准,并在HealthBench和LLMEval-Med数据集上取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11143 2026-05-13 cs.CL cs.AI cs.IR 82%

ClinicalBench: Stress-Testing Assertion-Aware Retrieval for Cross-Admission Clinical QA on MIMIC-IV

ClinicalBench: 用于MIMIC-IV跨入院临床问答的应力测试型断言感知检索

Alex Stinard

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 ClinicalBench通过400个问题测试43名MIMIC-IV患者,评估断言敏感类别下的检索性能,采用EpiKG知识图谱检索方法,通过六种LLM模型测试,发现断言感知检索在临床问答中提升22个百分点。

Comments 46 pages including appendices (two-column preprint format). Under review at JAMIA. Code, frozen evaluator, and benchmark released at https://huggingface.co/datasets/alexstinard/epikg-clinicalbench. ClinicalBench v2 is a 400-question MIMIC-IV stress test for assertion-aware retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08670 2026-05-12 cs.AI cs.CL cs.MA 82%

MIND-Skill: Quality-Guaranteed Skill Generation via Multi-Agent Induction and Deduction

MIND-Skill: 通过多智能体归纳与演绎保证技能质量

Yixuan Li, Mingshu Cai, Ziyang Xiao, Wanyuan Wang, Yanchen Deng, Bo An

机构 * Nanyang Technological University(南洋理工大学) Waseda University(早稻田大学) Zhejiang University(浙江大学) Southeast University(东南大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MIND-Skill框架,通过归纳与演绎自动生成可复用的技能,结合三种损失函数保证质量,实验显示其在AppWorld和BFCL-v3上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00336 2026-05-04 cs.CL cs.AI 82%

Budget-Aware Routing for Long Clinical Text

面向预算的路由:长临床文本

Khizar Qureshi, Geoffrey Martin, Yifan Peng

机构 * MIT, Cambridge, MA(麻省理工学院,马萨诸塞州剑桥) Cornell University, Ithaca, NY(康奈尔大学,纽约州伊萨克中心) Weill Cornell Medicine, New York, NY(韦尔医学院,纽约市)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在预算限制下选择临床文本上下文的方法,提出RCD目标平衡相关性、覆盖性和多样性,并通过实验展示不同单位化策略和路由启发式方法的效果差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01020 2026-05-04 cs.AI cs.CL 82%

Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics

用法律问题树准则评估法律推理轨迹

Jinu Lee, Kyoung-Woon On, Simeng Han, Arman Cohan, Julia Hockenmaier

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) LBOX Stanford(斯坦福) Yale(耶鲁)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出 LEGIT 数据集,用于评估 LLM 在法律领域推理轨迹的质量,发现法律问题覆盖度和正确性影响 LLM 推理能力,RAG 和带准则的 RL 分别提升整体能力与正确性。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏