arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-24 至 2026-08-24 共收录 26 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 26 篇

2608.20373 2026-08-24 cs.CL 新提交 92%

An ambiguity taxonomy for evaluating large language model performance on clinical registry abstraction: a multi-site prospective study

用于评估大型语言模型在临床登记处抽象任务中性能的歧义分类:一项多中心前瞻性研究

James Matheson, Betsy Castillo, Andrew Y. Shin, David Scheinker

机构 * Carta Healthcare(卡塔医疗) Stanford University School of Medicine(斯坦福大学医学院)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本多中心前瞻性研究评估LLM在临床登记处抽象任务中的性能,发现其准确率远低于人类抽象人员,且随问题歧义度和临床推理要求升高而降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17474 2026-08-24 eess.AS cs.SD 版本更新 91%

Benchmarking Commercial Speech Recognition and Multimodal Large Language Models on Dysarthric Speech: Severity-Stratified Baselines and Architecture-Specific Prompting Effects

基于商业自动语音识别和多模态大语言模型的口吃语音零样本识别

Ali Alsayegh, Tariq Masood

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);prompting(title,comments)

AI总结 本研究评估了商业ASR和MLLM在口吃语音识别中的性能,发现GPT-4o在重度口吃情况下显著降低WER,而Gemini变体表现下降,为辅助语音接口技术选择提供实证依据。

Comments 32 pages. Revised peer-reviewed version. Updated dataset filtering and transcript normalization, expanded four-condition prompting ablation and error analysis, and revised statistical reporting. Published in International Journal of Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20364 2026-08-24 cs.CL cs.AI 新提交 91%

Hadith computational science in the age of large language models: a critical narrative review

大型语言模型时代的圣训计算科学:批判性叙事综述

Md. Ashraful Haque (1), Riasat Islam (1 and 2) ((1) Greentech Apps Foundation, United Kingdom, (2) Queen Mary University of London, London, United Kingdom)

机构 * Greentech Apps Foundation(绿色科技应用基金会) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文通过批判性叙事综述,梳理大型语言模型等技术对圣训计算科学的重塑进展,指出其在数据、任务等方面的成果,同时分析基准、语料库等局限,提出需将其作为证据基础设施问题研究的议程。

Comments Submitted to Artificial Intelligence Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29668 2026-08-24 cs.AI cs.CL 版本更新 90%

GRASP: Gated Regression-Aware Skill Proposer for Self-Improving LLM Agents

GRASP: 门控回归感知技能提议器用于自我改进的LLM智能体

Johannes Moll, Jean-Philippe Corbeil, Jiazhen Pan, Martin Hadamitzky, Daniel Rueckert, Lisa Adams, Keno Bressem

机构 * Technical University of Munich and TUM University Hospital(慕尼黑技术大学及慕尼黑大学医院) Microsoft Healthcare & Life Sciences(微软医疗与生命科学)

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出GRASP方法,通过门控回归感知技能库编辑,在硬回归预算下确保每次技能更新带来净改进,显著提升LLM智能体在结构化环境中的操作可靠性。

Comments Accepted at EMNLP 2026 (Main Conference). Code and data: this https URL (https://github.com/jomoll/GRASP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21079 2026-08-24 cs.LG 新提交 90%

Causal Modeling of Adverse Pregnancy Outcomes via Adaptive LLM Proposals

基于自适应大语言模型提议的不良妊娠结局因果建模

Kavimayil P. Komarasamy, Saurabh Mathur, Ameet Soni, David M. Haas, Kristian Kersting, Sriraam Natarajan

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Technical University of Darmstadt(达姆施塔特工业大学) Swarthmore College(斯沃斯莫尔学院) Indiana University School of Medicine(印第安纳大学医学院) Hessian Center for Artificial Intelligence(黑森人工智能中心) German Research Center for AI (DFKI)(德国人工智能研究中心(DFKI))

专题命中 领域大模型 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出神经符号框架,将LLM作为自适应提议分布,结合其先验知识与数据经验评分,在真实临床数据集上建模APOs,恢复专家验证边并识别新因果关系,为干预提供新见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20887 2026-08-24 cs.CL cs.AI 新提交 87%

KREL: Automatic Medical Coding via Knowledge-Guided Reasoning over Clinical Evidence with LLMs

KREL:基于大型语言模型对临床证据进行知识引导推理的自动医学编码方法

Xubin Chen, Yipeng Zhou, Wen Sun, Chengkai Huang, Xiaoming Fu, Quan Z. Sheng

机构 * The University of New South Wales(新南威尔士大学) University of Göttingen(哥廷根大学) Macquarie University(麦考瑞大学) Beijing Intelligent Decision Medical Technology Co. Ltd(北京智决医疗科技有限公司)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出KREL框架,将LLM与ICD编码指南知识结合解决自动医学编码问题,在基准数据集上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20369 2026-08-24 cs.CL cs.AI 新提交 87%

ASTAR: Automated induction of STAndardized radiology Reporting templates from large-scale clinical free-text corpora

ASTAR:从大规模临床自由文本语料库自动生成标准化放射学报告模板

Xinfeng Zhang, Mingxuan Liu, Yifei Chen, Juncheng Zhu, Kasidit Anmahapong, Yiming Huang, Yuan Zhang, Hongjia Yang, Yi Liao, Gang Ning, Haibo Qu, Qiyuan Tian

机构 * Tsinghua University(清华大学) Sichuan University(四川大学) University of California San Diego(加利福尼亚大学圣迭戈分校) Southeast University(东南大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对放射学报告模板构建的人工瓶颈,提出基于LLM的ASTAR框架,从大规模临床自由文本语料库自动生成标准化模板,实验显示其性能优于专家构建的模板,大幅缩短模板开发时间。

Comments Accepted by MICCAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20345 2026-08-24 cs.CL cs.AI cs.CY 新提交 87%

When Vocabulary Comprehension Fails Clinical Reasoning: Evaluating Therapy Bots' Safety Risks for Generation Alpha

当词汇理解失效于临床推理:评估面向阿尔法世代(Gen Alpha,2010-2024年出生)的治疗机器人的安全风险

Manisha Mehta, Virendra Mehta

机构 * Lynbrook High School(林布鲁克高中) University of Trento(特伦托大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究构建两个基准评估Claude、GPT-4o等LLM的治疗机器人安全风险,发现其存在10-14个百分点的词汇理解与临床风险校准差距,识别六种失败模式,提出四项监管与技术改进建议。

Comments 42 pages, 6 figures. Accepted at ACM FAccT '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21186 2026-08-24 cs.LG 新提交 86%

A Neurosymbolic Approach for Constructing Planning Domain Models from Clinical Narratives

一种从临床叙事构建规划领域模型的神经符号方法

Ranveer Singh, Saurabh Mathur, Michael Skinner, Prasad Tadepalli, Kristian Kersting, Sriraam Natarajan

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对临床叙事难以构建外科手术概率规划模型的问题,提出神经符号框架NSPIN,结合预训练LLM从2660份阑尾切除术记录生成的模型可泛化且符合临床实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20481 2026-08-24 cs.CR cs.AI 新提交 84%

AEGIS: Preventing Cross-Domain Resource Abuse in MCP

AEGIS:防止MCP中的跨域资源滥用

Shriti Priya, Teryl Taylor, Frederico Araujo

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AEGIS,该组件借助LLM将MCP工具调用归一化为统一表示,结合Open Policy Agent与ContextForge AI Gateway,可防止跨异构MCP工具和模态的资源滥用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20661 2026-08-24 cs.AI cs.CE cs.CL cs.IR 新提交 84%

Auditable by Construction: An Ontology-Driven Framework for Trustworthy LLM Analytics in Enterprise Finance

可审计性原生:面向企业金融领域可信大语言模型分析的本体驱动框架

Sergiy Lunyakin

专题命中 领域大模型 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文针对企业金融大语言模型应用的信任问题,提出知识驱动分析框架KDAF,结合本体与CARP技术,在FinanceBench评估中,其可审计性优于基线方法,表明可审计性是该框架的核心优势。

Comments 20 pages, 1 figure, 4 tables, 1 algorithm. Artifact deposit with configurations, ontology schema, prompts, audit reports and reconstruction scripts: this https URL (https://doi.org/10.5281/zenodo.22022068)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16386 2026-08-24 cs.CL cs.LG 版本更新 84%

Mint-Agent: Introducing Finance-Native Agentic Foundation Models

Mint-Agent:引入金融原生智能体基础模型

Mint-Agent Team, Kun Wang, Gavin Zhang, Yaze Geng, Lei Tang, Yaoyang Yi, Zonghan Wu, Yifan Hu, Qingsong Wen, Yilei Shao

专题命中 领域大模型 :foundation model(title);SFT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本研究提出金融原生智能体模型Mint-Agent,通过三大支柱开发出Mint-Cu(9B)和Mint-Ag(27B),在多个金融基准测试中展现出优异的可靠性与可执行性,为可信金融智能提供了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20348 2026-08-24 cs.CL cs.AI 新提交 82%

Inhibitory Attention for Clinical Long-Context Reasoning: Characterizing and Mitigating Lost-in-the-Middle Effects in EHR Processing

用于临床长上下文推理的抑制注意力:电子病历处理中中间信息丢失效应的表征与缓解

Sanjay Basu

机构 * University of California San Francisco(加利福尼亚大学旧金山分校) Waymark(韦马克公司)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对电子病历处理中的临床中间信息丢失问题,提出查询条件化临床抑制方法,经实验验证其在中间位置指令及整体任务上的表现均优于多种基线检索与重排序方法。

Comments 29 pages, 5 figures. Code: this https URL (https://github.com/sanjaybasu/inhibitory-attention-ehr)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24817 2026-08-24 cs.CR cs.AR cs.CL cs.LG 版本更新 82%

RouteScan: A Non-Intrusive Approach to Auditing MoE LLMs Safety via Expert Routing Telemetry

RouteScan: 通过专家路由遥测对MoE大语言模型安全性进行非侵入式审计

Bo Lv, Zhiheng Xu, KeDong Xiu, Ruyi Ding, Tianhang Zheng, Zhibo Wang, Kui Ren

机构 * Zhejiang University(浙江大学) Donghua University(东华大学) Louisiana State University(路易斯安那州立大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出RouteScan,一种利用MoE模型GPU级专家路由遥测(如预填充阶段活跃线程数)作为微架构指纹,通过轻量级检测流水线识别恶意提示的非侵入式审计框架,在未见过的有害领域AUROC超0.93,新越狱包装下超0.96,且相比基于内容的审计方法具有隐私优势。

Comments 11 pages. Revised manuscript with expanded experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20966 2026-08-24 cs.CR cs.AI 新提交 81%

Structured but Fragile: On the Limits of LLMs in Cybersecurity Decision-Making

结构化但脆弱:大型语言模型(LLMs)在网络安全决策中的局限性

Pasquale Malacaria, Yunxiao Zhang

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究探讨LLMs在网络安全决策中的表现,发现其在明确攻击图结构时能产生接近优化基线的策略,但随复杂度增加而脆弱,对提示敏感,且无法稳健应用结构化推理,为AI辅助安全决策系统设计评估提供参考。

Comments 31 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21220 2026-08-24 cs.HC 新提交 71%

Who Trusts AI with Their Emotions? Trust Formation and Sociodemographic Variation in LLM Use for Emotional Support

谁会信任AI来处理自己的情绪?情感支持大语言模型使用中的信任形成与社会人口统计学差异

Natalia Amat-Lefort, Mert Yazan, Amanda Cercas Curry, Flor Miriam Plaza-del-Arco

专题命中 领域大模型 :LLM(title)

AI总结 本研究针对情感支持大语言模型,开发验证了心理测量量表,通过结构方程模型与多组分析发现不同社会人口群体对AI的信任影响因素及采纳逻辑存在差异,为情感支持AI的公平设计提供了理论支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21089 2026-08-24 cs.AI 新提交 70%

Can Legal AI Know When It Is Wrong? And Do Students Know When It Is?

法律AI能知道自己何时出错吗?学生能知道自己何时出错吗?

Angel Mary John, Vipin Kumar Singh, Jerrin Thomas Panachakel

机构 * Sunrise University(日出大学) Technological University Dublin(都柏林理工大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对法律AI的过度自信问题,测试了ChatGPT等模型的高置信度错误率,调查了印度法律学生的相关认知,提出需调整教学法并构建基于来源的验证架构以防范风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20519 2026-08-24 physics.med-ph cs.AI 新提交 70%

An integrated diffusion-weighted imaging processing and interpretation platform for MR-guided radiotherapy

用于磁共振引导放疗的扩散加权成像处理与解释一体化平台

Yunxiang Li, Yan Dai, Yen-Peng Liao, Jie Deng, Jill B De Vis, You Zhang

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究开发了一体化网络平台,整合MR-Linac的DWI后处理与可追溯的RAG临床解释,经专家评分验证其在胶质母细胞瘤病例中具有高临床实用性。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11354 2026-08-24 cs.AI 版本更新 70%

Inverse Theory of Mind Modeling for Content Recommendation: From Web Browsing to Dynamic Intelligent Interfaces

用于内容推荐的反向心智理论建模:从网页浏览到动态智能界面

Mengyu Chen, Feiyu Lu, Chun-Fu Chen, Lucas Vinh Tran, Jay Katukuri

机构 * JPMorganChase(摩根大通)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出反向心智理论(IToM)流程,从用户交互反向推理推断信念与偏好,在OPeRA数据集上验证其画像推断效果,并通过VisionOS应用展示跨模态迁移能力,提升内容推荐的用户理解精度。

Comments Preprint for conference full paper at 20th ACM Conference on Recommender Systems (RecSys '26), Minneapolis, MN, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29667 2026-08-24 cs.CV cond-mat.mtrl-sci cs.AI 版本更新 70%

MatMMExtract: An Open-Source Pipeline for Panel-Level Extraction of Grounded Image-Text Pairs from Materials Science Literature

解锁材料科学的视觉记录:来自科学文献的大规模多模态数据集

Subham Ghosh, Shubham Tiwari, Mohammad Ibrahim, Abhishek Tewari

机构 * Mehta Family School of Data Science and Artificial Intelligence(梅塔家庭数据科学与人工智能学院) Indian Institute of Technology Roorkee(印度理工学院罗奥克学院) Department of Metallurgical and Materials Engineering(冶金与材料工程系)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对科学文献中复合图像导致图文配对困难的问题,提出MatMMExtract管道,通过分解复合图、利用大语言模型生成结构化标注,构建包含39万对面板级图文对的MatSciFig数据集,并引入MaterialScope检测数据集和微调YOLO12检测器,显著提升视觉语言检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21341 2026-08-24 cs.SE 新提交 67%

Natural-Language Workflows Are Not Software Yet: Artifact-Driven Compilation for Reliable Agent Execution

自然语言工作流尚未成为软件:面向可靠智能体执行的工件驱动编译

Xiangzhe Xu, Hanxi Guo, Guangyu Shen, Siyuan Cheng, Xiangyu Zhang

专题命中 领域大模型 :LLM(abstract,abstract_cn)

AI总结 研究针对自然语言工作流智能体执行不可靠问题,提出Artic编译器将其转换为工件驱动工作流,经评估可提升任务解决率28个百分点,且跨模型、重复执行一致性分别提高32、56个百分点。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11542 2026-08-24 cs.DL 版本更新 67%

The Credibility Revolution in Political Science

政治学中的可信度革命

Carolina Torreblanca, William Dinneen, Guy Grossman, Yiqing Xu

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 该研究通过分析政治学文献发现,基于设计的研究在政治学中逐渐增多,但其增长不均,且与其他增强可信度的方法相比仍较为罕见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11055 2026-08-24 cs.CV 版本更新 67%

Crane: Context-Guided Prompt Learning and Attention Refinement for Zero-Shot Anomaly Detection

Crane:用于零样本异常检测的上下文引导提示学习与注意力优化

Alireza Salehi, Mohammadreza Salehi, Reshad Hosseini, Cees G. M. Snoek, Makoto Yamada, Mohammad Sabokrou

专题命中 领域大模型 :foundation model(abstract);pretraining(abstract)

AI总结 本研究提出基于CLIP的框架Crane,通过相关性注意力模块、上下文引导提示学习等改进零样本异常检测,在7个工业基准上显著提升图像级AP与像素级AUPRO,还衍生出更强变体Crane+。

Comments British Machine Vision Conference (BMVC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20777 2026-08-24 cs.CL 新提交 57%

Tree-of-Concerns: Hierarchical Multi-Agent Debate for Unstated-Limitation Extraction in Scientific Critique

关注点树:面向科学评论中未陈述局限性提取的分层多智能体辩论

Sahil Mishra, Niranjan Rajeev, Tanmoy Chakraborty

机构 * IIT Delhi(印度理工学院德里分校)

专题命中 领域大模型 :LLM(abstract_cn);分类 cs.CL

AI总结 针对科学论文未陈述局限性提取的需求,本文提出Tree-of-Concerns多智能体框架,经ToC-Bench实验验证,其较最强基线提升79%准确率与11%覆盖度,可辅助审稿人开展系统性评估。

Comments Accepted in the Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20768 2026-08-24 cs.AI 新提交 57%

Beyond Endpoint Gains: A Weight-Delta Audit of Medical Specialization

超越端点增益:医学专业化的权重增量审计

Praphul Singh, Shanu Kumar, Akshat Agarwal

机构 * IIT Kanpur(印度理工学院坎普尔分校) Oracle Health AI(甲骨文健康人工智能公司) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 领域大模型 :language model(abstract);分类 cs.AI

AI总结 本研究提出配对权重增量路径审计方法,应用于两组通用模型到医学专业模型的检查点对,发现解码器更新与医学基准变动相关,但组件定位不清晰,明确审计仅针对纯文本多项选择题基准变动。

Comments Preprint: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21355 2026-08-24 cs.RO 新提交 50%

ViTacPhys: Physical Property-Aware Grasping from Human Visual-Tactile Demonstrations

ViTacPhys:基于人类视觉-触觉演示的感知物体物理属性的抓取方法

Yiwen Liu, Yujun Zhu, Kui Jia, Zhao Liao, Yangwei You, Shuaijun Wang

机构 * Xiaomi Robotics(小米机器人)

专题命中 领域大模型 :language model(abstract)

AI总结 该研究提出ViTacPhys视觉-触觉框架,可从人类演示中估计物体物理属性,迁移至机器人后实现高抓取成功率,力曲线更贴合人类遥操作。

Comments 11 pages, 7 figures. Project page: this https URL (https://vitacphys.github.io/ViTacPhys/)

详情

展开后加载摘要…

URL PDF HTML 收藏