arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12705 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 12705 篇

2603.28986 2026-04-01 cs.AI cs.LG cs.MA 79%

Mimosa Framework: Toward Evolving Multi-Agent Systems for Scientific Research

Mimosa框架:迈向科学研究的演进多智能体系统

Martin Legrand, Tao Jiang, Matthieu Feraud, Benjamin Navet, Yousouf Taghzouti, Fabien Gandon, Elise Dumont, Louis-Félix Nothias

机构 * Université Côte d’Azur(蔚蓝海岸大学) CNRS(法国国家科学研究中心) ICN(化学研究所) Interdisciplinary Institute for Artificial Intelligence (3iA) Côte d’Azur(蔚蓝海岸跨学科人工智能研究所) Inria(法国国家信息与自动化研究所) I3S(信息系统与软件工程实验室)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Mimosa框架通过自动合成任务特定的多智能体工作流并迭代优化,提升科学研究的适应性与效率,其在ScienceAgentBench上实现43.1%的成功率,展示了动态工作流演进的优势。

Comments 48 pages, 4 figures, 1 table. Clean arXiv version prepared. Includes main manuscript plus appendix/supplementary-style implementation details and prompt listings. Dated 30 March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28038 2026-03-31 cs.AI cs.LG 79%

Beyond the Answer: Decoding the Behavior of LLMs as Scientific Reasoners

超越答案:解码LLM作为科学推理者的行为

Rohan Pandey, Eric Ye, Michael Li

机构 * University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文通过定制遗传Pareto算法优化提示,研究提示对科学推理行为的影响,揭示模型特定的局部逻辑,并探讨其可迁移性和脆弱性。

Comments Accepted at the Post-AGI Science and Society Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26953 2026-03-31 astro-ph.EP astro-ph.IM cs.AI cs.ET cs.LG 79%

ASTER -- Agentic Science Toolkit for Exoplanet Research

ASTER -- 用于系外行星研究的代理科学工具包

Emilie Panek, Alexander Roman, Gaurav Shukla, Leonardo Pagliaro, Katia Matcheva, Konstantin Matchev

机构 * University of Alabama(阿拉巴马大学) University of Padova(帕多瓦大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 ASTER通过整合AI代理与领域专用工具,为系外行星大气分析提供统一平台,支持多步骤数据处理和检索任务。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23937 2026-03-26 cs.CL cs.LG 79%

Dialogue to Question Generation for Evidence-based Medical Guideline Agent Development

对话到问题生成用于基于证据的医疗指南代理开发

Zongliang Ji, Ziyang Zhang, Xincheng Tan, Matthew Thompson, Anna Goldenberg, Carl Yang, Rahul G. Krishnan, Fan Zhang

机构 * Google Research(谷歌研究) University of Toronto(多伦多大学) Vector Institute Canada(加拿大向量研究所) Emory University(埃默里大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨利用大语言模型生成基于证据的问题,以辅助医生在短时间内进行诊疗决策,通过两种提示策略评估模型效果,结果显示LLM能生成具有临床意义的问题,有助于减轻医生认知负担。

Comments 9 pages. To appear in Proceedings of Machine Learning Research (PMLR), Machine Learning for Health (ML4H) Symposium 2025

Journal ref Proceedings of Machine Learning Research 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23646 2026-03-26 cs.CL cs.AI 79%

Swiss-Bench SBP-002: A Frontier Model Comparison on Swiss Legal and Regulatory Tasks

Swiss-Bench SBP-002:瑞士法律与监管任务上的前沿模型比较

Fatih Uenal

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Swiss-Bench SBP-002,一个包含395个专家定制任务的三语基准,评估十种前沿模型在瑞士监管任务中的表现,揭示了不同任务类型的难度差异及模型性能分布。

Comments 21 pages, 5 figures, 7 tables. Code and data: https://github.com/FUenal/swiss-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23519 2026-03-26 cs.CL cs.AI 79%

MedMT-Bench: Can LLMs Memorize and Understand Long Multi-Turn Conversations in Medical Scenarios?

MedMT-Bench: LLMs能否在医学场景中记忆并理解长多轮对话?

Lin Yang, Yuancheng Yang, Xu Wang, Changkun Liu, Haihua Yang

机构 * ByteDance(字节跳动)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MedMT-Bench通过模拟诊断治疗流程,测试LLM在长上下文记忆、干扰鲁棒性和安全防御方面的表现,发现17种前沿模型均无法达到60%以上的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21728 2026-03-24 cs.AI cs.CL 79%

EvoIdeator: Evolving Scientific Ideas through Checklist-Grounded Reinforcement Learning

EvoIdeator:通过基于检查表的强化学习进化科学思想

Andreas Sauter, Yuyue Zhao, Jacopo Urbani, Wenxiang Hu, Zaiqiao Meng, Lun Zhou, Xiaohui Yan, Yougang Lyu

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) Vrije Universiteit Amsterdam(荷兰瓦赫宁根大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EvoIdeator框架,通过基于检查表的反馈与强化学习结合,提升大语言模型生成高质量科研提案的能力,实验表明其在关键科学指标上优于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21193 2026-03-24 cs.CL cs.AI cs.DL 79%

Context Selection for Hypothesis and Statistical Evidence Extraction from Full-Text Scientific Articles

上下文选择用于从全文科学文章中提取假设和统计证据

Sai Koneru, Jian Wu, Sarah Rajtmajer

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Old Dominion University(旧 Dominion 大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了从全文科学文章中提取假设及其支持统计证据的挑战,通过两阶段检索与提取框架,发现针对性上下文选择能提升假设提取效果,但统计证据提取仍面临较大困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19268 2026-03-23 cs.CL cs.AI 79%

Full-Stack Domain Enhancement for Combustion LLMs: Construction and Optimization

面向燃烧科学的全栈领域增强:构建与优化

Quanjia Xiao, Weimin Ouyang, Zonglin Yang, Tianhao Wu, Qingguo Zhou, Runze Mao, Zhi X. Chen

机构 * Peking University(北京大学) AI for Science Institute, Beijing(AI for Science研究院,北京)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出首个针对燃烧科学的全栈领域增强LLM工作流程,整合自动领域语料构建、增量预训练、指令微调及可验证奖励强化学习,构建标准化评估基准FlameBench,显著提升燃烧科学推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18428 2026-03-20 cs.CL cs.AI 79%

Adaptive Decoding via Test-Time Policy Learning for Self-Improving Generation

通过测试时策略学习实现自适应解码

Asmita Bhardwaj, Yuya Jeremy Ong, Eelaaf Zahid, Basel Shbita

机构 * UC San Diego(加州大学圣地亚哥分校) Plastic Labs IBM Research(IBM研究院)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于强化学习的解码器采样器,通过在测试时调整采样参数提升生成质量,实验表明其在多个数据集上优于传统方法,且能稳定提升生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18008 2026-03-20 cs.CL cs.AI cs.CY 79%

TherapyGym: Evaluating and Aligning Clinical Fidelity and Safety in Therapy Chatbots

TherapyGym: 评估和对齐疗法聊天机器人中的临床忠实性与安全性

Fangrui Huang, Souhad Chbeir, Arpandeep Khatua, Sheng Wang, Sijun Tan, Kenan Ye, Lily Bailey, Merryn Daniel, Ryan Louie, Sanmi Koyejo, Ehsan Adeli

机构 * Department of Computer Science, Stanford University, Stanford, CA, USA(计算机科学系,斯坦福大学,斯坦福,加州,美国) Department of Psychiatry and Behavioral Sciences, Stanford University, Stanford, CA, USA(精神病学与行为科学系,斯坦福大学,斯坦福,加州,美国) Department of Biomedical Data Science, Stanford University, Stanford, CA, USA(生物医学数据科学系,斯坦福大学,斯坦福,加州,美国) University of California, Berkeley, Berkeley, CA, USA(加州大学伯克利分校,伯克利,加州,美国) The University of Hong Kong, Hong Kong(香港大学,香港)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TherapyGym通过评估和提升疗法聊天机器人中的忠实性与安全性,结合CTRS评分和多标签标注方案,利用RL训练框架改进模型性能,提升临床应用的安全性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17191 2026-03-19 cs.CL cs.LG q-bio.QM 79%

Tabular LLMs for Interpretable Few-Shot Alzheimer's Disease Prediction with Multimodal Biomedical Data

用于多模态生物医学数据的可解释少样本阿尔茨海默病预测的表格LLMs

Sophie Kearney, Shu Yang, Zixuan Wen, Weimin Lyu, Bojian Hou, Duy Duong-Tran, Tianlong Chen, Jason H. Moore, Marylyn D. Ritchie, Chao Chen, Li Shen

机构 * University of Pennsylvania(宾夕法尼亚大学) Stony Brook University(石溪大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Medical University of South Carolina(南卡罗来纳医科大学) Cedars-Sinai Medical Center(西格拉姆山医疗中心)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出TAP-GPT框架,利用预训练的大语言模型进行少样本阿尔茨海默病分类,展示了其在多模态生物医学数据中的优越性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00009 2026-03-17 cs.CL cs.AI cs.IR 79%

Unlocking Electronic Health Records: A Hybrid Graph RAG Approach to Safe Clinical AI for Patient QA

解锁电子健康记录:一种混合图RAG方法用于安全临床AI的患者问答

Samuel Thio, Matthew Lewis, Spiros Denaxas, Richard JB Dobson

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MediGRAF,一种结合图检索与向量嵌入的混合RAG系统,通过整合结构化数据与非结构化文本,提升临床AI在患者问答中的安全性和准确性。

Comments 26 pages, 5 figures, 2 tables

Journal ref Frontiers in Digital Health, vol. 8, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04421 2026-03-17 cs.CL cs.AI cs.MA 79%

Do Mixed-Vendor Multi-Agent LLMs Improve Clinical Diagnosis?

多供应商多智能体大语言模型是否能改善临床诊断?

Grace Chang Yuan, Xiaoman Zhang, Sung Eun Kim, Pranav Rajpurkar

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了多供应商多智能体系统在临床诊断中的表现,发现混合供应商配置在召回率和准确性上优于单一供应商配置,揭示了供应商多样性对诊断系统鲁棒性的重要性。

Comments Accepted as Oral at the EACL 2026 Workshop on Healthcare and Language Learning (HeaLing)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12349 2026-03-16 cs.LG cs.AI q-bio.QM stat.ML 79%

Budget-Sensitive Discovery Scoring: A Formally Verified Framework for Evaluating AI-Guided Scientific Selection

预算敏感的发现评分:一种用于评估AI引导的科学选择的正式验证框架

Abhinaba Basu, Pavan Chakraborty

机构 * Indian Institute of Information Technology Allahabad (IIITA)(印度阿瓦德理工学院信息学院(IIITA)) National Institute of Electronics & Information Technology (NIELIT)(国家电子与信息科技研究所(NIELIT))

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出BSDS评分,通过正式验证方法评估AI引导的科学选择策略,证明LLMs在药物发现中无额外价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02123 2026-03-16 cs.CL cs.AI 79%

DeCode: Decoupling Content and Delivery for Medical QA

DeCode:解耦内容与交付以实现医疗问答

Po-Jen Ko, Chen-Han Tsai, Yu-Shao Peng

机构 * National Taiwan University(国立台湾大学) HTC DeepQ

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DeCode框架通过解耦内容与交付,提升医疗问答的临床相关性与准确性,实验表明其在零样本任务中性能显著提升。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09685 2026-03-11 cs.CL cs.AI cs.IR 79%

Automatic Cardiac Risk Management Classification using large-context Electronic Patients Health Records

基于大上下文电子健康记录的自动心脏风险管理分类

Jacopo Vitale, David Della Morte, Luca Bacco, Mario Merone, Mark de Groot, Saskia Haitjema, Leandro Pecchia, Bram van Es

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于大上下文电子健康记录的自动心脏风险管理分类方法,通过定制Transformer架构在纵向临床文本中实现高精度的风险分层。

Comments 17 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00924 2026-03-10 cs.CL cs.AI 79%

Conformal Prediction for Risk-Controlled Medical Entity Extraction Across Clinical Domains

面向多临床领域的风险控制医疗实体提取的符合预测

Manil Shrestha, Edward Kim

机构 * Department of Computer Science, Drexel University(计算机科学系,德雷塞尔大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种符合预测框架,用于多临床领域医疗实体提取,发现模型在不同领域中校准方向不同,需根据文档结构和任务需求调整阈值以确保安全部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07329 2026-03-10 cs.AI cs.CL cs.CY 79%

The Third Ambition: Artificial Intelligence and the Science of Human Behavior

第三项雄心:人工智能与人类行为的科学

W. Russell Neuman, Chad Coleman

专题命中 领域大模型 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用大型语言模型作为研究人类行为、文化及道德推理的科学工具,探讨其在社会科学中的应用与方法论创新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06394 2026-03-09 cs.AI cs.LG cs.MA 79%

Talk Freely, Execute Strictly: Schema-Gated Agentic AI for Flexible and Reproducible Scientific Workflows

自由交谈,严格执行:基于模式的代理AI用于灵活且可重复的科学工作流

Joel Strickland, Arjun Vijeta, Chris Moores, Oliwia Bodek, Bogdan Nenchev, Thomas Whitehead, Charles Phillips, Karl Tassenberg, Gareth Conduit, Ben Pellegrini

机构 * Intellegens, The Studio(Intellegens工作室) Cavendish Laboratory(卡文迪许实验室)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于模式的代理AI,通过分离对话和执行权限,解决科学工作流中灵活性与确定性的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01252 2026-03-03 cs.CL cs.AI 79%

Linking Knowledge to Care: Knowledge Graph-Augmented Medical Follow-Up Question Generation

将知识与关怀联系起来:知识图谱增强的医疗随访问题生成

Liwen Sun, Xiang Yu, Ming Tan, Zhuohao Chen, Anqi Cheng, Ashutosh Joshi, Chenyan Xiong

机构 * Carnegie Mellon university(卡内基梅隆大学) Amazon Health AI(亚马逊健康AI)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出KG-Followup方法,通过知识图谱增强LLM,提升医疗随访问题生成的准确性和效率。

Comments Short paper published in the Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21396 2026-03-03 cs.CL cs.AI cs.CY cs.HC 79%

Augmenting Research Ideation with Data: An Empirical Investigation in Social Science

用数据增强研究构想:社会科学领域的实证研究

Xiao Liu, Xinyi Dong, Xinyang Gao, Yansong Feng, Xun Pang

机构 * Wangxuan Institute of Computer Technology(王轩计算机技术研究所) Yuanpei College(元培学院) School of Government(政府学院) School of International Studies(国际研究学院) Institute for Carbon Neutrality(碳中和研究所) Analytics Lab for Global Risk Politics(全球风险政治分析实验室)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过实证研究探讨了在社会科学领域利用数据增强LLM生成的研究构想,发现元数据和自动化验证显著提升了构想的可行性和质量。

Comments AI4Science Workshop at Neurips 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03255 2026-02-26 cs.LG cs.AI 79%

SciTS: Scientific Time Series Understanding and Generation with LLMs

SciTS: 基于大语言模型的科学时间序列理解与生成

Wen Wu, Ziyang Zhang, Liwei Liu, Xuenan Xu, Jimin Zhuang, Ke Fan, Qitan Lv, Junlin Liu, Chen Zhang, Zheqi Yuan, Siyuan Hou, Tianyi Lin, Kai Chen, Bowen Zhou, Chao Zhang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SciTS提出了一种基于LLM的科学时间序列理解与生成框架,通过基准测试发现通用LLM在泛化能力上优于专门模型,并引入TimeOmni框架提升性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17308 2026-02-20 cs.AI cs.LG 79%

MedClarify: An information-seeking AI agent for medical diagnosis with case-specific follow-up questions

MedClarify:一种用于医学诊断的信息寻求AI代理,具有病例特定的后续问题

Hui Min Wong, Philip Heesen, Pascal Janetzky, Martin Bendszus, Stefan Feuerriegel

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MedClarify通过生成病例特定的后续问题,提升医学诊断的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17288 2026-02-20 cs.AI cs.CL 79%

ArXiv-to-Model: A Practical Study of Scientific LM Training

ArXiv-to-Model:科学语言模型训练的实践研究

Anuj Gupta

机构 * Independent Researcher(独立研究者)

专题命中 领域大模型 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过从arXiv LaTeX源数据直接训练科学语言模型,探讨了预处理、分词和计算资源对模型训练的影响,提供了工程层面的训练实践与透明分析。

Comments 15 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09982 2026-02-17 cs.CL cs.AI 79%

Context Volume Drives Performance: Tackling Domain Shift in Extremely Low-Resource Translation via RAG

上下文体积驱动性能:通过RAG解决极低资源翻译中的领域偏移

David Samuel Setiawan, Raphaël Merx, Jey Han Lau

机构 * The University of Melbourne(墨尔本大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过RAG方法,利用检索增强生成技术,在极低资源翻译中有效缓解领域偏移问题,恢复性能损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14374 2026-02-17 cs.CR cs.AI cs.CL 79%

Differentially Private Retrieval-Augmented Generation

差分隐私增强的检索增强生成

Tingting Tang, James Flemings, Yongqin Wang, Murali Annavaram

机构 * University of Southern California(南加州大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DP-KSA 是一种整合差分隐私的检索增强生成算法,通过关键词增强减少隐私风险并保持实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14233 2026-02-17 cs.LG cs.AI q-fin.CP 79%

Evaluating LLMs in Finance Requires Explicit Bias Consideration

评估金融领域的LLM需要显式考虑偏见

Yaxuan Kong, Hoyoung Lee, Yoontae Hwang, Alejandro Lopez-Lira, Bradford Levy, Dhagash Mehta, Qingsong Wen, Chanyeol Choi, Yongjae Lee, Stefan Zohren

机构 * University of Chicago Booth School of Business(芝加哥大学商学院) Pusan National University(釜山国立大学) Ulsan National Institute of Science(乌山国立科学研究院) University of Oxford(牛津大学) University of Florida(佛罗里达大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种结构性有效性框架,强调在金融领域使用LLM时需显式考虑偏见问题,并提出了评估检查表以确保结果的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14158 2026-02-17 cs.CL cs.AI cs.MA 79%

A Multi-Agent Framework for Medical AI: Leveraging Fine-Tuned GPT, LLaMA, and DeepSeek R1 for Evidence-Based and Bias-Aware Clinical Query Processing

面向医疗AI的多智能体框架:利用微调的GPT、LLaMA和DeepSeek R1进行基于证据和偏见意识的临床查询处理

Naeimeh Nourmohammadi, Md Meem Hossain, The Anh Han, Safina Showkat Ara, Zia Ush Shamszaman

机构 * Department of Computing Games, Teesside University, Middlesbrough, United Kingdom Centre for Digital Innovation, Teesside University, Middlesbrough, United Kingdom Faculty of Business \& Technology, University of Sunderland, Sunderland, United Kingdom

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个多智能体框架,利用微调的GPT、LLaMA和DeepSeek R1,结合证据检索和偏见检查,提升医疗问答的可靠性与准确性。

Comments 27 pages, 14 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13321 2026-02-17 cs.AI cs.LG 79%

Detecting Jailbreak Attempts in Clinical Training LLMs Through Automated Linguistic Feature Extraction

通过自动化语言特征提取检测临床训练LLM中的劫持尝试

Tri Nguyen, Huy Hoang Bao Le, Lohith Srikanth Pentapalli, Laurah Turner, Kelly Cohen

机构 * University of Cincinnati(克利夫兰大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过自动化语言特征提取,利用BERT模型预测四个核心语言特征,以检测临床训练LLM中的劫持尝试,验证了该方法的有效性及可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏