arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 461 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 461 篇

2603.22327 2026-06-08 cs.IR cs.AI cs.DL 版本更新 86%

Evaluating AI-based Scientific Knowledge Synthesis with Epidemiological Systematic Reviews

基于流行病学系统评价评估AI科学知识综合

Shreyansh Padarha, Ryan Othniel Kearns, Tristan Naidoo, Lingyi Yang, Łukasz Borchmann, Piotr BŁaszczyk, Christian Morgenstern, Ruth McCabe, Sangeeta Bhatia, Philip H. Torr, Jakob Foerster, Scott A. Hale, Thomas Rawson, Anne Cori, Elizaveta Semenova, Adam Mahdi

机构 * University of Oxford(牛津大学) Imperial College London(伦敦帝国理工学院) University of Nottingham(诺丁汉大学) Snowflake AI Research(Snowflake人工智能研究) Independent(独立)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AgentSLR评估框架,包含自动化工作流和专家标注数据集,测试LLM在流行病学系统评价各阶段能力,发现无模型全面领先,结构化提取是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22513 2026-07-28 cs.CY cs.AI cs.CL 版本更新 86%

Opaque Epistemic Mediation: How LLM Deployment Configurations Shape the Validation of Pseudo-Science

不透明的认知中介:大型语言模型部署配置如何塑造伪科学的验证

Davide Scarso, Hugo Noronha de Almeida, Joaquim Pina

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究商业大语言模型对伪科学主张的验证,通过测试四个模型家族在不同时间点的表现,发现Grok快速版本评分异常高,还发现模型行为受部署配置影响,如无声补丁、输出差异等,强调这一现象需新的认知问责形式。

Comments 16 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06623 2026-07-21 cs.LG cs.AI cs.SY eess.SY 版本更新 86%

LLM-Guided Task-Semantic Field Factorization for Industrial Process Forecasting

用于工业过程预测的大语言模型引导的任务语义场分解

Youcheng Zong, Runda Jia, Mingxuan Ren, Dakuo He

机构 * College of Information Science and Engineering, Northeastern University(东北大学信息科学与工程学院)

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对工业过程预测中标记数据稀缺等问题,提出大语言模型引导的任务语义场分解框架TSF,通过构建任务语义场,结合传统时间序列主干进行训练和推理,在多任务上降低平均绝对误差,增加参数少且推理开销小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08199 2026-08-14 cs.CV 版本更新 86%

Generalizable Operating Room Expert with Multimodal Enhancement

具备多模态增强能力的可泛化手术室专家

Peiqi He, Zhenhao Zhang, Yixiang Zhang, Jiaxin Liu, Xiongjun Zhao, Shaoliang Peng

专题命中 领域大模型 :language model(title,abstract);large language model(title)

AI总结 针对手术室空间建模的局限,提出仅用RGB图像推理的多模态大语言模型OR-Expert,通过内部推导空间线索实现三维推理,在手术室基准上达SOTA且泛化性良好。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06300 2026-07-30 cs.CL cs.AI cs.LG 版本更新 86%

$\texttt{AMEND++}$: Benchmarking Eligibility Criteria Amendments in Clinical Trials

AMEND++:临床试验资格标准修订的基准测试

Trisha Das, Mandis Beigi, Jacob Aptekar, Jimeng Sun

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Medidata Solutions(Medidata解决方案)

专题命中 领域大模型 :LLM(abstract,abstract_cn);language model(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AMEND++通过CAMLM模型提升临床试验资格标准修订预测的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09995 2026-07-28 cs.CE 版本更新 86%

QuantHarness: Price-Driven Multi-Agent LLMs for High-Frequency Trading

QuantHarness:用于高频交易的价格驱动多智能体大语言模型

Fei Xiong, Xiang Zhang, Aosong Feng, Siqi Sun, Chenyu You

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对高频交易需求,引入QuantHarness多智能体LLM框架,将交易分解为四个智能体,利用结构化信号与LLM推理结合,经多金融工具实验验证,该框架在多指标上优于基线方法,为高频金融市场实时决策提供可行路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15932 2026-07-08 cs.CV 版本更新 86%

NAMD: Virtual Follow-up Computed Tomography Synthesis via Nodule-Aligned Multimodal Diffusion Models for Early Lung Cancer Diagnosis

基于LLM驱动多模态扩散的结节对齐潜在空间学习:用于肺结节进展预测

James Song, Yifan Wang, Chuan Zhou, Liyue Shen

机构 * Department of EECS, University of Michigan(电子工程与计算机科学系,密歇根大学) University of Michigan Medical School(密歇根大学医学学院)

专题命中 领域大模型 :LLM(title_cn,summary_cn)

AI总结 本文提出NAMD框架,通过生成1年随访CT图像预测肺结节进展,利用结节对齐潜在空间和LLM驱动控制机制,在NLST数据集上实现优于基线和现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00462 2026-06-09 cs.CY 版本更新 86%

AI Self-preferencing in Algorithmic Hiring: Empirical Evidence and Insights

算法招聘中的AI自我偏好:实证证据与洞见

Jiannan Xu, Gujie Li, Jane Yi Jiang

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 通过大规模简历实验和模拟,发现LLM在招聘中偏好自己生成的简历,导致使用同模型简历的候选人获得23%-60%的短名单优势,且可通过干预减少50%以上偏差。

Comments This paper has been accepted as a non-archival submission at EAAMO 2025 and AIES 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05033 2026-08-14 cs.DC cs.LG 版本更新 85%

SparseDitto: Customizing GPU Kernels for Different Sparsity Patterns with LLM-Based Agentic System

SparseDitto:基于大语言模型的智能体系统,为不同稀疏性模式定制GPU内核

Shiyang Li, Guangyan Sun, Jinwei Tang, Yanzhi Wang, Mingyi Hong, Caiwen Ding

专题命中 领域大模型 :LLM(title,summary_cn);分类 cs.LG

AI总结 SparseDitto是基于LLM的系统,可为不同矩阵、算子和GPU定制稀疏矩阵GPU内核,在多类算子与GPU上较cuSPARSE实现显著加速,还可提升GCN训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21340 2026-07-28 cs.CL 版本更新 85%

Capital Markets LLM Reliability Score (CM-LRS): From Plausible to Bankable

资本市场大语言模型可靠性评分(CM-LRS):从似是而非到可信赖

Prerit Ahuja

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究资本市场大语言模型输出的可信赖问题,提出CM-LRS从七个维度评估工作流程输出,通过五个工作流程对四个模型与四位评判者评分,发现前沿闭源模型聚类近,差距集中在检索合成,决策有用性离散度大且评判者一致性高。

Comments 23 pages. Rubrics, prompts, and demonstration tasks are publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09988 2026-07-23 cs.IR cs.AI 版本更新 85%

An LLM-powered Agentic Recommendation System for Connected TV Content Discovery

一种用于智能电视内容发现的由大语言模型驱动的智能推荐系统

Lei Shi, Di Wang, Harry Tran, Helsing Xu, Yuchen Lu, Dhara Ghodasara, Wilson Chaney, Xueting Liao, Jerry Yu, Huayu Ding, Reza Mirghaderi, David Fan, Qi Guo, Chongguang He, Warren Wang, Warren Deng, Mingze Gao, Shike Mei, Shuo Tang, Zhe Zhang, Jianming He, Abhishek Kumar, Haotian Wu, Hamed Firooz, Li Li

机构 * Meta

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对推荐系统整合上下文信号的挑战,提出用于智能电视内容发现的大语言模型驱动的智能推荐系统,利用其推理能力处理多样信号,采用智能架构协调组件,克服大语言模型用于推荐的实际限制。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22324 2026-07-22 cs.LG cs.MA 版本更新 85%

Automatic Construction of Clinical Scoring Systems with LLM Agents

基于LLM代理的临床评分系统自动构建

Silas Ruhrberg Estévez, Christopher Chiu, Mihaela van der Schaar

机构 * DAMTP, University of Cambridge, Cambridge, UK(剑桥大学 DAMTP 实验室,剑桥,英国)

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.LG

AI总结 提出AgentScore方法,利用大语言模型进行语义引导的规则搜索与验证,自动构建符合临床部署约束的加权评分系统,在多个任务上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01157 2026-06-11 cs.CL cs.CR cs.SD 版本更新 85%

Where Do Backdoors Live? A Component-Level Analysis of Backdoor Propagation in Speech Language Models

后门藏身何处?语音语言模型中后门传播的组件级分析

Alexandrine Fortier, Thomas Thebaud, Jesús Villalba, Najim Dehak, Patrick Cardinal, Peter West

机构 * University of British Columbia(不列颠哥伦比亚大学) École de technologie supérieure(高等技术学院) Johns Hopkins University(约翰霍普金斯大学)

专题命中 领域大模型 :language model(title,abstract);SLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文通过后门攻击视角,对语音语言模型进行组件级分析,揭示后门在不同组件中的传播机制,发现后门持久性高度依赖目标组件,且中毒样本与良性样本在共享嵌入中不可直接分离。

Comments Interspeech 2026 (long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12263 2026-06-09 cs.CL cs.AI cs.LG 版本更新 85%

Multimodal Generative Engine Optimization: Rank Manipulation for Vision-Language Model Rankers

多模态生成式引擎优化:针对视觉-语言模型排序器的排名操纵

Yixuan Du, Chenxiao Yu, Haoyan Xu, Ziyi Wang, Yue Zhao, Xiyang Hu

机构 * Georgetown University(乔治城大学) University of Southern California(南加州大学) University of Maryland, College Park(马里兰大学学院公园分校) Arizona State University(亚利桑那州立大学)

专题命中 领域大模型 :language model(title,abstract);foundation model(abstract,comments);分类 cs.CL、cs.AI、cs.LG

AI总结 提出多模态生成式引擎优化(MGEO)方法,通过联合优化图像扰动和文本后缀,利用视觉-语言模型内部跨模态知识耦合,实现对产品排名的有效操纵,揭示了多模态基础模型知识基础的脆弱性。

Comments Proceedings of the 4th Workshop on Towards Knowledgeable Foundation Models (KnowFM) at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00740 2026-08-04 cs.CL cs.AI 版本更新 85%

MedTextWeaver: Procedural Knowledge Evolution in Agentic Medical Text Editing

ExperienceWeaver: 优化基于 LLM 的临床文本改进的小样本经验学习

Ziyan Xiao, Yinghao Zhu, Liang Peng, Kyongtae T Bae, Lequan Yu

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 领域大模型 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI

AI总结 ExperienceWeaver 通过经验学习优化小样本下 LLM 的临床文本改进,通过提炼反馈知识提升模型修订能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13742 2026-07-07 cs.HC 版本更新 85%

Spatial Balancing: Designing an LLM-Powered Spatial Externalization Interface for Iterative Science Communication Writing

空间平衡:利用空间推理在LLM辅助科学传播写作中平衡科学阐述与叙述吸引力

Kexue Fu, Jiaye Leng, Yawen Zhang, Jingfei Huang, Yihang Zuo, Runze Cai, Zijian Ding, Ray LC, Shengdong Zhao, Qinyuan Lei

专题命中 领域大模型 :LLM(title,title_cn)

AI总结 本文提出SpatialBalancing系统,通过结合人类空间推理与大语言模型的语义能力,提升科学传播写作中科学严谨性与叙述吸引力的平衡。

Comments DIS '26

Journal ref In Designing Interactive Systems Conference (DIS '26), June 13-17, 2026, Singapore, Singapore. ACM, New York, NY, USA, 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08251 2026-08-11 cs.CY cs.AI 版本更新 84%

Contemporary AI lacks the imagination to diverge or negate in science

当代人工智能缺乏在科学中发散或否定的想象力

Honglin Bao, Siyang Wu, Xiao Liu, Sida Li, Shiyun Cao, James A. Evans

机构 * Data Science Institute, University of Chicago(芝加哥大学数据科学研究所) Knowledge Lab, University of Chicago(芝加哥大学知识实验室)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 通过大规模科学家评估,发现当前AI在科学假设生成中缺乏多样性,无法自发提出零假设,且自动评估与专家判断一致性低,但微调奖励模型可缩小差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02288 2026-06-16 cs.CV cs.LG 版本更新 84%

Prompt Disentanglement via Language Guidance and Representation Alignment for Domain Generalization

基于语言引导与表示对齐的提示解缠用于域泛化

De Cheng, Zhipeng Xu, Xinyang Jiang, Dongsheng Li, Nannan Wang, Xinbo Gao

机构 * School of Telecommunications Engineering, the State Key Laboratory of Integrated Services Networks (ISN), Xidian University, Xi’an, China(电信工程学院、集成服务网络国家重点实验室(ISN)、西安电子科技大学) Microsoft Research Asia, Shanghai, China(微软亚洲研究院,上海,中国)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 提出利用大语言模型自动解缠文本提示,并引入最差显式表示对齐,结合抽象提示增强源域多样性,实现域不变视觉表示学习,在多个基准上超越现有方法。

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 48, no. 6, pp. 6799-6816, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01869 2026-06-09 cs.AI 版本更新 84%

WorldCoder-Bench: Benchmarking Physically Grounded 3D World Synthesis

WorldCoder-Bench:物理接地3D世界合成基准

Shuo Lu, Yinuo Xu, Kecheng Yu, Siru Jiang, Yongcan Yu, Yubin Wang, Haitao Yang, Yuxiang Zhang, Bin Wang, Ran He, Jian Liang

机构 * NLPR & MAIS, CASIA(中国科学院自动化研究所与模式识别国家重点实验室) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出WorldCoder-Bench基准,通过StateProbe协议评估LLM生成Three.js 3D世界的物理正确性和交互可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06469 2026-06-09 cs.CL 版本更新 84%

ClinicalBench: Can LLMs Beat Traditional ML Models in Clinical Prediction?

ClinicalBench: 大型语言模型能在临床预测中击败传统机器学习模型吗?

Canyu Chen, Jian Yu, Shan Chen, Che Liu, Zhongwei Wan, Shuang Zhou, Yuan Luo, Rui Zhang, Danielle Bitterman, Fei Wang, Kai Shu

机构 * Department of Computer Science Northwestern University Evanston USA(计算机科学系西北大学艾文斯顿美国) Department of Computer Science University of Texas at Austin Austin USA(计算机科学系德克萨斯大学奥斯汀美国) Boston Children's Hospital, Harvard Medical School Boston USA(波士顿儿童医院哈佛医学院波士顿美国) Department of Computer Science Imperial College London London UK(计算机科学系伦敦帝国学院伦敦英国) Department of Computer Science Ohio State University Columbus USA(计算机科学系俄亥俄州立大学哥伦布美国) Massachusetts General Hospital, Harvard Medical School Boston USA(麻省总医院哈佛医学院波士顿美国) Department of Preventive Medicine, Feinberg School of Medicine Northwestern University Chicago USA(预防医学系费因伯格医学院西北大学芝加哥美国) Division of Computational Health Sciences, Department of Surgery University of Minnesota Minneapolis USA(计算健康科学部外科部明尼苏达大学明尼阿波利斯美国) Department of Population Health Sciences, Weill Cornell Medicine Cornell University New York USA(流行病学与公共卫生系韦尔·科恩医学中心康奈尔大学纽约美国) Department of Computer Science Emory University Atlanta USA(计算机科学系埃默里大学亚特兰大美国) Northwestern University(西北大学) University of Texas at Austin(德克萨斯大学奥斯汀) Boston Children's Hospital, Harvard Medical School(波士顿儿童医院哈佛医学院) Imperial College London(伦敦帝国学院) Ohio State University(俄亥俄州立大学) Massachusetts General Hospital, Harvard Medical School(麻省总医院哈佛医学院) University of Minnesota(明尼苏达大学) Cornell University(康奈尔大学) Emory University(埃默里大学)

专题命中 领域大模型 :LLM(summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 构建ClinicalBench基准,通过三个临床预测任务比较14个通用和8个医学LLM与11个传统ML模型,发现LLM在临床预测上仍无法超越传统ML模型。

Comments Accepted to Proceedings of KDD 2026. The first two authors contributed equally. 12 pages for main paper, 62 pages including appendix. Project website: https://clinicalbench.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25522 2026-06-08 cs.AI 版本更新 84%

Understanding Generative Recommendation with Semantic IDs from a Model-scaling View

从模型扩展视角理解基于语义ID的生成式推荐

Jingzhe Liu, Liam Collins, Jiliang Tang, Tong Zhao, Neil Shah, Clark Mingxuan Ju

机构 * Michigan State University(密歇根州立大学) Snap Inc.(Snap公司)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 揭示基于语义ID的生成式推荐在模型扩展时存在性能瓶颈,发现直接使用大语言模型作为推荐器具有更好的扩展性,性能提升可达20%。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09986 2026-08-05 cs.CL cs.AI 版本更新 84%

Quantifying Hallucinations in Language Language Models on Medical Textbooks

对语言模型在医学教科书中 hallucinations 的量化

Brandon C. Colelough, Davis Bartels, Dina Demner-Fushman

机构 * National Institutes of Health, National Library of Medicine(国家卫生研究院,国家医学图书馆) Department of Computer Science, University of Maryland(大学计算机科学系)

专题命中 领域大模型 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型语言模型在医学教科书基础上的 hallucinations 发生频率及不同模型响应的差异,发现即使在高可信度响应下,LLaMA-70B-Instruct仍存在19.7%的hallucinations,且临床专家对模型响应的评估显示高一致性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24743 2026-07-29 cs.CV cs.AI cs.CL 版本更新 84%

ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding

ClinFusion:用于整体医学理解的以视觉为中心的多模态大语言模型系统

Hangjie Yuan, Yichen Qian, Zhiwei Tang, Xianzhe Xu, Lirong Wu, Sicheng Yang, Jinwang Wang, Pengju Wang, Zhitao Zeng, Yizeng Han, Yan Xing, Shengxuan Luo, Tao Feng, Qing Xie, Weigen Yao, Yi Yang, Zuozhu Liu, Jiasheng Tang, Shaocheng Wang, Jitao Wang, Jiahong Dong, Weihua Chen, Feng Xu, Fan Wang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Laboratory(湖畔实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Department of Radiology, The Affiliated Yangming Hospital of Ningbo University(宁波大学附属阳明医院放射科) Zhejiang University-University of Illinois Urbana-Champaign Institute, Zhejiang University(浙江大学伊利诺伊大学厄巴纳香槟校区联合学院,浙江大学) Hepato-Pancreato-Biliary Center, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua Medicine, Tsinghua University(清华长庚医院肝胆胰中心,清华大学临床医学院,清华医学,清华大学) School of Software, Tsinghua University(清华大学软件学院) Beijing National Research Center for Information Science and Technology, Tsinghua University(清华大学北京信息科学与技术国家研究中心)

专题命中 领域大模型 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对多模态大语言模型在医学领域部署的挑战,提出ClinFusion,采用组合级联视觉编码器架构和视觉基础评估框架,在多模态医学基准测试中表现优异,超越开源和专有模型,经专家盲评验证效果良好。

Comments Code: https://github.com/alibaba-damo-academy/ClinFusion Models: https://huggingface.co/collections/Alibaba-DAMO-Academy/clinfusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14385 2026-07-21 cs.CL cs.LG 版本更新 84%

MamaBench: Benchmarking LLM Robustness in Maternal and Child Health Diagnosis through Counterfactual Clinical Perturbation

MamaBench:通过反事实临床扰动对母婴健康诊断中的大语言模型稳健性进行基准测试

Thanni Adewuyi, Anuoluwa Sotome, Samuel Okoko, Angel Ezendu, Oluwafunke Akinbuwa, Oluwaseun Odunsi, Oluwasegun Oguntuase, Ifeoma Nwabueze, Abiodun Adereni

机构 * Helpmum Africa(非洲帮助妈妈组织) University of Ibadan(伊巴丹大学)

专题命中 领域大模型 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究针对大语言模型在母婴健康诊断中缺乏对临床相似表现区分能力的问题,提出MamaBench基准及EA - RAG方法,通过实验揭示基础准确率高估稳健准确率现象,EA - RAG有效降低BTR,提升稳健准确率,为临床人工智能反事实稳健性研究提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08731 2026-07-21 cs.CL cs.AI cs.CY 版本更新 84%

Trusting sovereign language models as scientific instruments: evidence from Portugal's AMALIA

大语言模型作为数据标注器的有效性:关于权威的AMALIA研究

Manuel Pita

机构 * CICANT, Universidade Lusófona(坎特交互计算与技术研究中心,卢索福纳大学)

专题命中 领域大模型 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究葡萄牙AMALIA大语言模型作为数据标注器标注权威道德基础的有效性,通过恢复差距测试其能否遵循理论,发现校准的英语工具不能转移到该模型,其依赖表面关联,虽能筛选预编码但不能独立衡量,强调基准测试应考察一致性证据路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15684 2026-07-07 cs.LG cs.AI cs.CE 版本更新 84%

Walrus: A Cross-Domain Foundation Model for Continuum Dynamics

海象:用于连续介质动力学的跨域基础模型

Michael McCabe, Payel Mukhopadhyay, Tanya Marwah, Bruno Regaldo-Saint Blancard, Francois Rozet, Cristiana Diaconu, Lucas Meyer, Kaze W. K. Wong, Hadi Sotoudeh, Alberto Bietti, Irina Espejo, Rio Fear, Siavash Golkar, Tom Hehir, Keiya Hirashima, Geraud Krawezik, Francois Lanusse, Rudy Morel, Ruben Ohana, Liam Parker, Mariel Pettee, Jeff Shen, Kyunghyun Cho, Miles Cranmer, Shirley Ho

专题命中 领域大模型 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究针对物理模拟中机器学习的挑战,通过新方法如谐波分析稳定、负载均衡训练策略等,开发基于Transformer的基础模型Walrus,在多场景预训练,实验表明其性能优于现有模型。

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27277 2026-06-12 cs.LG cs.AI cs.CV 版本更新 84%

BrainDINO: A Brain MRI Foundation Model for Generalizable Clinical Representation Learning

BrainDINO:一种用于通用临床表征学习的脑MRI基础模型

Yizhou Wu, Shansong Wang, Yuheng Li, Mojtaba Safari, Mingzhe Hu, Chih-Wei Chang, Harini Veeraraghavan, Xiaofeng Yang

机构 * Department of Radiation Oncology and Winship Cancer Institute, Emory University(放射肿瘤科和Winship癌症研究所,埃默里大学) Department of Radiation and Cellular Oncology, The University of Chicago(放射肿瘤学与细胞肿瘤学部,芝加哥大学) Department of Electrical and Computer Engineering, Georgia Institute of Technology(电气与计算机工程系,佐治亚理工学院) Department of Biomedical Engineering, Georgia Institute of Technology(生物医学工程系,佐治亚理工学院) Department of Biomedical Informatics, Emory University(生物医学信息学系,埃默里大学) Department of Medical Physics, Memorial Sloan Kettering Cancer Center(医学物理系,纪念斯隆凯特琳癌症中心)

专题命中 领域大模型 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出BrainDINO,一种基于自蒸馏的基础模型,在约660万张未标记轴向切片上训练,通过冻结编码器加轻量任务头,在多种脑MRI任务上达到或超越基线,尤其在小样本场景下优势显著。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23292 2026-06-08 cs.AI cs.LG 版本更新 84%

Agentic Physical AI toward a Domain-Specific Foundation Model for Energy Systems: A Case Study on Nuclear Reactor Control

面向能源系统的领域特定基础模型的具身物理人工智能:以核反应堆控制为例

Yoon Pyo Lee, Samrendra Roy, Kazuma Kobayashi, Sajedul Talukder, Diab Abueidda, Seid Koric, Souvik Chakraborty, Syed Bahauddin Alam

机构 * The Grainger College of Engineering, Nuclear, Plasma & Radiological Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校格雷格学院工程学院、核等工程学院) Department of Nuclear Engineering, Hanyang University(汉阳大学核工程系) University of Texas - El Paso(德克萨斯大学埃尔帕索分校) National Center for Supercomputing Applications(国家超级计算应用中心) Department of Applied Mechanics, Indian Institute of Technology Delhi(印度德里理工学院应用力学系) Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(印度德里理工学院亚里人工智能学院)

专题命中 领域大模型 :foundation model(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出通过紧凑语言模型作为具身物理人工智能,利用基于物理模拟器验证的策略优化替代感知推理,在核反应堆控制任务中实现领域特定基础模型,并展示了规模扩展带来的可靠性提升和策略集中化行为。

Comments Accepted for publication in npj Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27856 2026-08-18 cs.CV 版本更新 83%

Benchmarking Foundation and Large Language Models for Few-Shot Medical Image Segmentation

基准测试用于小样本医学图像分割的基础模型与大语言模型

Jinghong Liu, Yuchuan Deng, Fanping Liu, Meng Huang, Xirong Li

专题命中 领域大模型 :large language model(title);language model(title)

AI总结 该研究推出统一基准FAME,涵盖四类模型,含14958个样本,评估得出小样本分割的关键规律,助力开发更有效的小样本医学分割方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23054 2026-08-06 cs.CL cs.AI cs.LG 版本更新 83%

DeepImagine: Clinical Trial Outcome Prediction via Stepwise Local Counterfactual Imaginations

DeepImagine: 通过连续反事实想象学习生物医学推理

Youze Zheng, Jianyou Wang, Yuhan Chen, Matthew Feng, Longtian Bao, Hanyuan Zhang, Maxim Khan, Aditya K. Sehgal, Christopher D. Rosin, Umber Dube, Ramamohan Paturi

机构 * Laboratory for Emerging Intelligence, University of California, San Diego(新兴智能实验室,加州大学圣地亚哥分校) Department of Dermatology, University of California, San Diego(皮肤科系,加州大学圣地亚哥分校) University of Chicago(芝加哥大学) Elsevier(艾尔斯特出版社)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DeepImagine框架,通过连续反事实想象训练语言模型进行生物医学推理,利用反事实对偶和强化学习提升临床试验预测性能,展示模型在生物医学领域的可解释性改进。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏