arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12659 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 12659 篇

2604.26233 2026-08-06 cs.AI cs.CY 版本更新 88%

Assessing and Explaining the Persuadability of Large Language Models as Legal Decision Tools

说服性与大语言模型作为法律决策工具

Oisin Suttle, David Lillis

机构 * School of Law Criminology Maynooth University Maynooth Ireland School of Computer Science University College Dublin Dublin Ireland Criminology Maynooth University School of Computer Science University College Dublin

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究大语言模型在法律决策中的说服性,分析其对法律论点的响应机制及影响因素,探讨模型在法律和行政领域的应用可行性。

Comments v2 is the conference version, accepted for the Proceedings of the 21st International Conference on Artificial Intelligence and Law (ICAIL 2026), (DOI: 10.1145/3836937.3837003). v3 is a substantially extended version for journal submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00285 2026-08-06 cs.CL 版本更新 88%

Enhancing Trustworthy Clinical Diagnosis Decision-Making in Large Language Models via Etiology-Aware Attention Supervision

通过病因感知注意力监督增强大型语言模型在临床诊断决策中的可信性

Peixian Li, Yu Tian, Ruiqi Tu, Chengkai Wu, Jingjing Ren, Jingsong Li

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究提出病因感知注意力监督框架,通过引入临床病因模式对大型语言模型进行参数高效微调,在两类诊断队列上提升了诊断准确率与注意力聚焦性,增强了模型临床诊断的可信性。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28119 2026-07-31 cs.CL cs.SI 新提交 88%

Challenges in annotations by humans and LLMs: A case study of evaluative language

人类与大语言模型(LLM)的标注挑战:评价性语言的案例研究

Mirela Imamovic, Aenne Cecilia Kristine Knierim, Khushi Pitroda, Ekaterina Lapshinova-Koltunski

专题命中 领域大模型 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文以TED演讲语料库为对象,对比受训语言学者、专业学者与LLM在评价性语言标注上的表现,发现LLM经微调后F1值达0.77,表现优于专业学者,可辅助复杂标注任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26984 2026-07-30 physics.chem-ph cs.LG 新提交 88%

Using large language models to probe the limits of atom-centered structural descriptors

利用大语言模型探究原子中心结构描述符的极限

Michelangelo Domina, Michele Ceriotti

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 该研究借助大语言模型发现原子中心结构描述符在考虑至多七个邻原子簇时仍存在简并,揭示了AI在跨领域转化成果、加速科学突破的新应用模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14429 2026-07-29 cs.DL cs.AI cs.CY cs.ET 版本更新 88%

Measuring the State of Open Science in Transportation Using Large Language Models

利用大型语言模型衡量交通运输领域开放科学的状态

Junyi Ji, Ruth Lu, Linda Belkessa, Liming Wang, Silvia Varotto, Yongqi Dong, Nicolas Saunier, Mostafa Ameli, Gregory S. Macfarlane, Bahman Madadi, Cathy Wu

机构 * Massachusetts Institute of Technology(麻省理工学院) Vanderbilt University(范德比大学) Portland State University(波特兰州立大学) Delft University of Technology(代尔夫特理工大学) Brigham Young University(Brigham Young 大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文利用大型语言模型自动评估交通研究中数据和代码的开放科学实践,发现仅有少数论文共享代码或数据,揭示了开放科学与传统学术指标之间的不一致,需通过结构性干预促进实践改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24352 2026-07-28 cs.CL 新提交 88%

Retrieval-Augmented Large Language Models as Components of Cognitive Computing architecture for Regulatory Knowledge Management

作为监管知识管理认知计算架构组件的检索增强大语言模型

Dariusz Nowak-Nova

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究探讨将大语言模型与检索增强生成架构集成用于监管知识管理,提出本地部署LLMs的架构方法,经实验验证,此集成提升了生成文本质量,引入可审计性等,增强后的LLMs可作为认知计算基础设施的语义处理模块。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21936 2026-07-27 cs.CL 新提交 88%

Leveraging External Knowledge for Historical Document Restoration via Retrieval-Augmented Large Language Models

通过检索增强大语言模型利用外部知识进行历史文献修复

Gabeen Kim, Kyeongpil Kang

机构 * Kangwon National University(江原国立大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对历史文献因物理损坏难以辨认及现有修复方法在恢复命名实体上的局限,提出利用检索增强大语言模型的修复框架,结合预训练模型隐含知识与外部上下文,实验表明该方法性能优于基线,是历史记录分析实用工具。

Comments Accepted to Findings of ACL 2026

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 43290-43304, 2026

URL PDF HTML 收藏
2607.21570 2026-07-24 cs.CL cs.HC 新提交 88%

MedGame: Storytelling Gamification Empowered by Large Language Models for Medical Education

MedGame:由大语言模型赋能的用于医学教育的故事化游戏化

Qian Wu, Xinrong Zhou, Zizhan Ma, Kai Chen, Zheyao Gao, Xun Lin, Hongqiu Wu, Longfei Gou, Yixiao Liu, Ann Sin Nga Lau, Qi Dou

机构 * CUHK(香港中文大学) Southern Medical University(南方医科大学) Peking University(北京大学) Tencent(腾讯)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究旨在利用大语言模型助力医学教育,提出MedGame框架,通过双引擎设计将临床病例转化为故事化游戏,构建MedGame Bench进行评估,实验显示特定任务微调提升开源模型表现,学生研究表明其更具吸引力和实用性。

Comments Work in Progress; an explorational design and study on AI+Education+Game

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16022 2026-07-23 cs.CL 版本更新 88%

Enhancing LLMs for Identifying and Prioritizing Important Medical Jargons from Electronic Health Record Notes Utilizing Data Augmentation: A Comparative Study

通过数据增强提升LLM识别和优先级排序电子健康记录笔记中的重要医学术语

Won Seok Jang, Sharmin Sultana, Zonghai Yao, Hieu Tran, Zhichao Yang, Sunjae Kwon, Hong Yu

机构 * Miner School of Computer and Information Sciences, UMass Lowell, MA, USA(UMass Lowell 计算机与信息科学学院) Manning College of Information and Computer Sciences, UMass Amherst, MA, USA(UMass Amherst 信息与计算机科学学院) Center for Healthcare Organization and Implementation Research, VA Bedford Health Care, MA, USA(VA Bedford医疗中心医疗组织与实施研究中心)

专题命中 领域大模型 :LLM(title_cn,summary_cn);prompting(abstract);分类 cs.CL

AI总结 本文通过数据增强提升LLM在低资源环境下识别和优先级排序电子健康记录中的医学术语,评估了闭源和开源模型的性能,发现微调和数据增强能提升模型表现。

Comments 28pages, 5 figures, 6 tables

Journal ref JMIR AI. 17.Jul.2026 in Vol 5 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08258 2026-07-21 cs.DL cs.AI cs.IR 88%

Large Language Models for Scholarly Ontology Generation: An Extensive Analysis in the Engineering Field

大型语言模型在学术本体生成中的应用:工程领域的广泛分析

Tanay Aggarwal, Angelo Salatino, Francesco Osborne, Enrico Motta

机构 * Knowledge Media Institute, The Open University(知识媒体研究所,开放大学) Department of Business and Law, University of Milano Bicocca(商业与法律系,米兰比可卡大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文研究了大型语言模型在工程领域生成学术本体的能力,通过评估多种模型发现,小型量化模型在优化后可达到大型专有模型的性能,且计算资源需求更低。

Comments Now accepted to Information Processing & Management. this is the camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13608 2026-07-16 cs.AI math.DS 新提交 88%

Automatic Ordinary Differential Equations Discovery For Biological Systems Using Large Language Model Powered Agentic System

使用由大语言模型驱动的智能体系统自动发现生物系统中的常微分方程

David Krongauz, Arad Zulti, Eran Segal, Teddy Lazebnik

机构 * Weizmann Institute of Science(魏茨曼科学研究所) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Haifa(海法大学) Jonkoping University(延雪平大学)

专题命中 领域大模型 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究旨在用大语言模型驱动智能体系统自动发现生物系统常微分方程。提出MEDA系统,能检索知识、定义变量、生成约束等。通过多种任务评估,该系统可恢复正确变量,实现结构恢复,生成合理模型,还明确关键组成部分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06294 2026-07-15 q-bio.QM cs.AI 88%

Enhancing Phenotype Recognition in Clinical Notes Using Large Language Models: PhenoBCBERT and PhenoGPT

利用大型语言模型增强临床笔记中的表型识别:PhenoBCBERT和PhenoGPT

Jingye Yang, Cong Liu, Wendy Deng, Da Wu, Chunhua Weng, Yunyun Zhou, Kai Wang

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究提出PhenoBCBERT和PhenoGPT两种模型,利用大型语言模型提升临床笔记中表型术语的自动识别与提取,从而推动疾病相关生物学研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06748 2026-07-09 cs.SE cs.AI 新提交 88%

SmartHomeSecure: Automated Detection and Repair of Smart Home Configuration Errors Using Large Language Models

智能家居安全:使用大语言模型自动检测和修复智能家居配置错误

Yizhi Wang, Xinghua Gao, Reachsak Ly, Alireza Shojaei

机构 * Myers-Lawson School of Construction, Virginia Polytechnic Institute and State University(Myers-Lawson工程学院,弗吉尼亚理工学院和州立大学) School of Technology, Eastern Illinois University(技术学院,东伊利诺伊大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究智能家居配置文件错误问题,提出SmartHomeSecure原型,结合轻量级程序分析与约束引导大语言模型生成,实现自动检测与修复,经实验评估,四个模型测试结果显示该方法能有效提高智能家居配置修复的可靠性和可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12015 2026-07-09 cs.CL 88%

Disentangling Ambiguity from Instability in Large Language Models: A Clinical Text-to-SQL Case Study

解构大型语言模型中的歧义与不稳定性:一项临床文本到SQL的案例研究

Angelo Ziletti, Leonardo D'Ambrosi

机构 * Bayer AG(勃林格殷曼集团)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出CLUES框架,通过将文本到SQL分解为两个阶段(解释->答案)来区分输出多样性两种不同原因:输入歧义和模型不稳定性,并在临床文本到SQL基准测试中提高了故障预测性能。

Journal ref In Proceedings of the 8th Workshop on Clinical Natural Language Processing (Clinical NLP) @ LREC 2026 (pp. 369-380). European Language Resources Association (ELRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14074 2026-07-08 cs.CL 版本更新 88%

Transferring Natural Language Datasets Between Languages Using Large Language Models for Modern Decision Support and Sci-Tech Analytical Systems

使用大语言模型在语言之间转移自然语言数据集以用于现代决策支持和科技分析系统

Dmitrii Popov, Egor Terentev, Danil Serenko, Ilya Sochenkov, Igor Buyanov

机构 * Faculty of Physics and Mathematics and Natural Sciences, RUDN University(俄罗斯人民友谊大学物理与数学及自然科学学院) Institute for Information Transmission Problems of the Russian Academy of Sciences(俄罗斯科学院信息传输问题研究所) Ivannikov Institute for System Programming of the Russian Academy of Sciences(俄罗斯科学院伊万诺夫系统编程研究所)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究如何用大语言模型在语言间转移自然语言数据集,以助力研发决策。通过英语和俄语对实验翻译DEFT语料库,提供注释转移管道,并在翻译数据集上训练基于BERT的模型建立基线,推动不同语言间知识共享。

Journal ref Big Data Cogn. Comput. 2025, 9(5), 116

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04424 2026-07-07 cs.CL 版本更新 88%

Gavel: Agent Meets Checklist for Evaluating LLMs on Long-Context Legal Summarization

Gavel: 智能体结合检查表评估LLM长上下文法律摘要

Yao Dou, Benjamin Mamut, Wei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 领域大模型 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出Gavel框架,通过参考评估和免参考智能体评估12个前沿LLM在多文档法律摘要中的表现,发现模型易遗漏关键信息而非幻觉,且性能随案件长度增加而下降。

Comments webpage at https://yao-dou.github.io/gavel/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28332 2026-06-30 cs.CY cs.AI 88%

When Medical Safety Alignment Fails: A Benchmark for Evaluating LLMs on High-Risk Medical Queries

当医疗安全对齐失败:评估LLMs在高风险医疗查询上的基准

Yige Li, Jun Sun, Wei Zhao, Zhe Li, Yutao Wu, Hanxun Huang, Xiang Zheng, Xingjun Ma

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出MedHarm基准,包含1100个高风险医疗查询,评估15个LLM在毒理学、药理学等10个安全关键类别上的表现,发现对齐模型仍可能产生不安全响应,医疗微调会加剧危害,外部护栏存在脆弱性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22306 2026-06-23 cs.SE cs.AI 新提交 88%

Leveraging Large Language Models to Obscure Code Stylometry: A Comparative Study of GPT-3.5 and GPT-4

利用大型语言模型混淆代码风格计量学:GPT-3.5与GPT-4的对比研究

Saman Pordanesh, Benjamin Tan

机构 * UNIVERSITY OF CALGARY(卡尔加里大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究GPT-3.5和GPT-4在保持代码功能的同时混淆代码风格计量学的能力,通过随机森林分类器评估不同提示工程策略的效果,发现单次与多次提示方法存在显著差异,并强调了详细结构化提示的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07530 2026-06-15 cs.DL cs.AI cs.CY cs.SI 版本更新 88%

The Shrinking Lifespan of LLMs in Science

科学领域中LLM的生命周期缩短

Ana Trišović

机构 * Computer Science & Artificial Intelligence Laboratory(计算机科学与人工智能实验室) Massachusetts Institute of Technology(麻省理工学院)

专题命中 领域大模型 :LLM(title_cn,summary_cn);language model(abstract);分类 cs.AI

AI总结 本研究通过分析62个LLM在超过10万篇引用论文中的科学采纳轨迹,发现模型的生命周期主要由发布年份决定,且每个后续发布年份的峰值时间和寿命分别缩短27%和23%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10467 2026-06-10 cs.CL 新提交 88%

Large Language Models as Modal Models in Linguistics

大语言模型作为语言学中的模态模型

Haruto Suzuki, Saku Sugawara

机构 * Keio University(庆应义塾大学) National Institute of Informatics(国立信息学研究所) University of Tokyo(东京大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文应用科学哲学中的模态建模框架,论证大语言模型作为最小模型具有真正的认知价值,能提供“如何可能解释”,但当前尚不满足“如何实际解释”的条件,其解释力位于两者之间的连续统上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09632 2026-06-09 cs.CL 新提交 88%

Civil Court Simulation with Large Language Models

基于大型语言模型的民事法庭模拟

Yifan Chen, Haitao Li, Kaiyuan Zhang, Yueyue Wu, Qingyao Ai, Yiqun Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出多智能体民事法庭模拟框架,通过五阶段审判程序、记忆模块和法规检索实现可靠判决,在责任分配和多项裁决上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07570 2026-06-09 cs.DL cs.LG 新提交 88%

Can LLMs extract scientific consensus? A case study in high-temperature superconductivity

LLMs能否提取科学共识?以高温超导为例

Mouyang Cheng, Wenhao He, Zhuotao Jin, Bowen Yu, Ju Li, Boris Kozinsky, Yao Wang, Pavel Volkov, Liangzi Deng, Ching-Wu Chu, Xiao-Gang Wen, Mingda Li

机构 * Center for Computational Science and Engineering, MIT(MIT计算科学与工程中心) Department of Materials Science and Engineering, MIT(MIT材料科学与工程系) Department of Physics, MIT(MIT物理系) Department of Nuclear Science and Engineering, MIT(MIT核科学与工程系) John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛大学约翰·A·保罗森工程与应用科学学院) Department of Chemistry, Emory University(埃默里大学化学系) Department of Physics, University of Connecticut(康涅狄格大学物理系) Department of Physics and Texas Center for Superconductivity, University of Houston(休斯顿大学物理系和德克萨斯超导中心)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究以高温超导领域为测试平台,利用近18,000篇高被引文献构建知识图谱,发现LLM提取的表征能恢复出连贯且物理可解释的结构,表明LLM可作为解码竞争性科学知识的可扩展工具。

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03399 2026-06-03 cs.CL cs.CR 88%

Selective Token-Level Cryptographic Redaction for Privacy-Preserving Clinical Deployment of Large Language Models

选择性令牌级密码学编辑用于大型语言模型的隐私保护临床部署

Farhan Sheth, Ziyuan Yang, Yongying Lan, Si Yong Yeo

机构 * MedVisAI Lab, Singapore(新加坡MedVisAI实验室) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine, China(中国上海交通大学医学院瑞金医院) Lee Kong Chian School of Medicine, Nanyang Technological University, Singapore(新加坡南洋理工大学Lee Kong Chian医学院)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出HERALD框架,通过令牌级密码学编辑仅加密敏感令牌,在保护隐私的同时保持下游模型效用,在分类和医疗问答任务上接近明文性能。

Comments 33 pages, 8 figures, 26 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00029 2026-06-03 cs.CL 88%

Embracing Anisotropy: Turning Massive Activations into Interpretable Control Knobs for Large Language Models

拥抱各向异性:将大规模激活转化为大型语言模型的可解释控制旋钮

Youngji Roh, Hyunjin Cho, Jaehyung Kim

机构 * Yonsei University(延世大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出一种基于幅度的无训练方法识别领域关键维度,将其作为可解释的语义检测器,并通过仅对这些维度进行激活引导,在领域适应和越狱场景中优于传统全维度引导方法。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17670 2026-05-29 cs.PL cs.AI 88%

Grammar-Aware Literate Generative Mathematical Programming with Compiler-in-the-Loop

语法感知的 literate 生成式数学编程与编译器在环

Roberto Rossi, Steven D. Prestwich

机构 * Business School, University of Edinburgh(爱丁堡大学商学院) Insight Centre for Data Analytics, University College Cork(科克大学数据分析研究所)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出 SyntAGM 系统,通过迭代生成-编译-评估-修正循环,利用编译器反馈和 LLM 对齐判断,生成可读的代数建模语言优化模型,实现成本与质量的更优权衡。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28338 2026-05-28 cs.AI 88%

SafeMed-R1: Clinician-Audited Safety and Ethics Alignment for Medical Large Language Models

SafeMed-R1: 临床医生审计的安全与伦理对齐用于医疗大语言模型

Chao Ding, Mouxiao Bian, Tianbin Li, Minjia Yuan, Yidong Jiang, Yankai Jiang, Jinru Ding, Jiayuan Chen, Zhuangzhi Gao, Pengcheng Chen, Zhao He, Rongzhao Zhang, Meiling Liu, Luyi Jiang, Jie Xu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Joint Laboratory of Biomedical Artificial Intelligence(生物医学人工智能联合实验室) Shanghai Institute of Infectious Disease and Biosecurity(上海传染病与生物安全研究院) Shanghai Health Development Research Center (Shanghai Medical Information Center)(上海健康发展战略研究中心(上海医疗信息中心)) University of Washington(华盛顿大学) Department of Eye and Vision Sciences, University of Liverpool(利物浦大学眼科与视觉科学系) Liverpool Centre for Cardiovascular Science, University of Liverpool(利物浦大学心血管科学中心) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出SafeMed-R1模型,通过可追溯的临床信任信号管道和红队压力测试实现安全与伦理对齐,在临床基准上达到79.6%的宏平均准确率,并将不安全输出减少约3-5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26567 2026-05-27 cs.AI 88%

MedGuideX: Internalizing Decision Logic from Executable Guidelines into Large Language Models for Clinical Reasoning

MedGuideX: 将可执行指南中的决策逻辑内化到大型语言模型中以进行临床推理

Yuhao Shen, Lang Cao, Simo Du, Yuqing Wang, Juexiao Zhou, Hao Peng, Yue Guo

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Albert Einstein College of Medicine(爱因斯坦医学院)

专题命中 领域大模型 :large language model(title);language model(title);LLM(abstract);post-training(abstract)

AI总结 提出一种将临床实践指南转化为可执行决策逻辑并生成事实与反事实问答数据的训练流程,通过微调医学大语言模型得到MedGuideX,在四个临床推理基准上平均准确率相对提升10.28%,且医生评估显示其推理步骤更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18907 2026-05-27 cs.LG cs.CV cs.CY 88%

DeepInterestGR: Mining Deep Multi-Interest Using Multi-Modal LLMs for Generative Recommendation

DeepInterestGR: 利用多模态大语言模型挖掘深度多兴趣用于生成式推荐

Yangchen Zeng, Zhenyu Yu, Zhiyuan Hu, Wenxin Zhang, Jinze Wang, Rongfeng Guo

机构 * Southeast University(东南大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);prompting(abstract);分类 cs.LG

AI总结 提出DeepInterestGR框架,通过多LLM兴趣挖掘、奖励标记深度兴趣和兴趣增强物品离散化,解决生成式推荐中的浅层兴趣问题,在三个Amazon数据集上显著提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22971 2026-05-25 cs.CL cs.HC 88%

Can AI Guess What You Know? Performance Comparison of Large Language Models for Human Domain Knowledge Estimation From Communication Logs

AI 能猜出你知道什么吗?从通信日志中估计人类领域知识的大型语言模型性能比较

Ko Watanabe, Shoya Ishimaru

机构 * Osaka Metropolitan University(大阪 metropolitan 大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究通过分析 Slack 日志,比较了七种大型语言模型在零样本设置下估计用户领域知识的能力,发现 Gemini 2.5 Flash 误差最低(MAE 21.13%),且估计精度与消息量弱相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21076 2026-05-21 cs.CL 88%

GradeLegal: Automated Grading for German Legal Cases

GradeLegal: 自动化评分德国法律案例

Abdullah Al Zubaer, Lorenz Wendlinger, Simon Alexander Nonn, Michael Granitzer, Jelena Mitrovic

机构 * University of Passau(帕绍大学) Deggendorf Institute of Technology(德格多夫技术学院)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究探讨了大型语言模型能否用于自动化评分德国刑事和公法案例解决方案,通过系统评估27个专有和开源LLM,发现基于样本解决方案和评分标准的提示策略能有效模拟专家评分,尤其在公法领域达到0.91的QWK值,而在刑事法律领域仅为0.60,表明刑事法律评分任务更难。此外,集成方法能进一步提高评分一致性,并为更强的闭源单模型提供替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏