arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12705 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 12705 篇

2607.23197 2026-07-29 cs.LG cs.AI 交叉投稿 79%

Domain-Prior-Regularized Graph Modeling for Anomaly Detection in Cyber-Physical Systems

用于网络物理系统异常检测的域先验正则化图建模

Youngseok Hwang, Joonsung Kwon, Geonwoo Lee, Hyunwoo Park

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对网络物理系统多变量传感器时间序列异常检测,提出DPR-GM框架,利用大语言模型提取传感器对物理耦合,经皮尔逊相关性调制和传感器级可靠性加权,在SKAB基准测试中优于多种基线。

Comments 12 pages, ICML 2026 AI for Science Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03423 2026-07-28 cs.CL cs.AI 79%

Training-Free Adaptation of New-Generation LLMs using Legacy Clinical Models

无需训练适应新一代语言模型使用遗留临床模型

Sasha Ronaghi, Chloe Stanwyck, Asad Aali, Amir Ronaghi, Miguel Fuentes, Tina Hernandez-Boussard, Emily Alsentzer

机构 * Stanford University(斯坦福大学) MemorialCare(纪念医疗中心)

专题命中 领域大模型 :language model(abstract);instruction tuning(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CAPT方法,通过模型融合实现无需训练的临床模型与通用领域模型适应,提升临床任务性能,适用于计算资源有限的医疗机构。

Journal ref Proceedings of the 7th Conference on Health, Inference, and Learning, PMLR 333:354-388, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11954 2026-07-15 cs.LG cs.AI cs.IR 新提交 79%

Graph-Constrained Policy Learning for Extreme Clinical Code Prediction

用于极端临床代码预测的图约束策略学习

Amritpal Singh, Sebastian Torres, Khawar Shakeel, Syed Ahmad Chan Bukhari

专题命中 领域大模型 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对临床代码预测任务,提出图约束遍历策略,将其转换为有限时域决策过程。单一语言模型逐层选节点得叶代码,实现极端多标签预测到子集决策的转换。实验表明该策略优于平面基线,增加监督数据可提升性能,简单图约束策略学习效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05956 2026-07-08 cs.AI cs.CL 新提交 79%

Integrating knowledge graphs and multilingual scholarly corpora for domain-adaptive LLMs in SSH

将知识图谱和多语言学术语料库集成用于社会科学与人文领域的领域自适应语言模型

Adam Faci, Alessio Miaschi, Anne Combe, Pascal Cuxac, Francesca Frontini, Nicolas Larrousse, Stéphane Pouyllau

机构 * Huma-Num, CNRS(人文数字实验室,法国国家科学研究中心) CNR - Institute for Computational Linguistics “A. Zampolli” (CNR-ILC)(意大利国家研究委员会 - 计算语言学“ A. 赞波利”研究所(CNR-ILC)) Inria(法国国家信息与自动化研究所) Inist, CNRS(法国国家科学研究中心人文社会科学信息研究所)

专题命中 领域大模型 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文针对LLMs集成到SSH科研工作流程的挑战,介绍欧洲项目LLMs4EU和ALT-EDIC基础设施中的用例,通过遵循特定协议的评估框架,将模型适配嵌入相关框架,探索领域敏感且合规的生成式AI对SSH学术研究的支持。

Comments 8 pages, 4 tables, workshop LLMs4SSH of LREC 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01034 2026-07-02 cs.CL cs.AI cs.HC 新提交 79%

Behavior-Adaptive Conversational Agents: Toward a Fluid Personality Framework

行为自适应对话代理:迈向流动人格框架

Hasibur Rahman, Smit Desai

机构 * Northeastern University(东北大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出流动人格框架,根据任务上下文、用户目标和情境紧迫性,动态调整代理的隐喻角色和人格表达强度,以提升用户信任和体验。

Comments Presented at Bridging AI and Behavior Change, a Bridge Program organized at the AAAI Conference on Artificial Intelligence 2026 (AAAI-2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12243 2026-07-02 cs.CL cs.AI 版本更新 79%

Continuous Knowledge Metabolism: Generating Scientific Hypotheses from Evolving Literature

连续知识代谢:从演进文献中生成科学假设

Jinkai Tao, Yubo Wang, Xiaoyu Liu, Menglin Yang

机构 * Tsingyuai(清华院)

专题命中 领域大模型 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CKM框架,通过滑动时间窗口处理文献并动态更新知识库,提出CKM-Lite和CKM-Full两种变体,揭示了增量处理在预测和效率上的优势,以及知识变化对假设生成的影响。

Comments ICML 2026 AI4Research Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02871 2026-06-30 cs.CL cs.AI cs.IR 79%

Synthesized Annotation Guidelines are Knowledge-Lite Boosters for Clinical Information Extraction

合成的标注指南是临床信息提取的低知识提升器

Enshuo Hsu, Martin Ugbala, Krishna Kumar Kookal, Zouaidi Kawtar, Nicholas L. Rider, Muhammad F. Walji, Kirk Roberts

机构 * McWilliams School of Biomedical Informatics, University of Texas Health Science Center at Houston(德克萨斯大学休斯顿健康科学中心麦克威廉姆斯生物医学信息学院) School of Dentistry, University of Texas Health Science Center at Houston(德克萨斯大学休斯顿健康科学中心牙科学院) Enterprise Development and Integration, University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心企业开发与集成部) Virginia Tech Carilion School of Medicine, Department of Health Systems & Implementation Science(弗吉尼亚理工大学卡里利恩医学院卫生系统与实施科学系)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种无需人工输入的自改进方法,利用LLM生成标注指南,提升临床信息提取性能,实验显示在多个基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27023 2026-06-26 cs.LG cs.CL cs.CV 新提交 79%

Just how sure are you? Improving Verbalized Uncertainty Calibration in Medical VQA

你到底有多确定?改进医学视觉问答中的口头不确定性校准

Eren Senoglu, Federico Toschi, Nicolo Brunello, Andrea Sassella, Mark James Carman

机构 * Politecnico di Milano(米兰理工大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 针对多模态大语言模型在医学VQA中过度自信的问题,提出基于复合损失函数的微调框架,通过校准项、锚定正则化、对比对齐和KL稳定项,将校准误差降低60%以上,判别力提升26%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07003 2026-06-24 cs.CL cs.AI 79%

Generative AI for automatic topic labelling

生成式AI用于自动主题标注

Diego Kozlowski, Carolina Pradier, Pierre Benz

机构 * School of Library and Information Science, University of Montreal, Canada(蒙特利尔大学图书馆与信息科学学院)

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文利用生成式AI模型对科学领域主题进行自动标注,评估了三种LLM在标注准确性与复杂性把握上的表现,发现三词标签更适用于捕捉研究主题的复杂性。

Comments 10 pages, 1 figure

Journal ref The Canadian Journal of Information and Library Science, 49, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19627 2026-06-19 cs.IR cs.AI cs.LG 新提交 79%

VCG: A Multimodal Retrieval Framework for E-Commerce Video Feeds under Extreme Cold-Start Conditions

VCG:极端冷启动条件下电商视频流的多模态检索框架

Katya Mirylenka, Egor Malykh, Mahdyar Ravanbakhsh, Michael Gygli, Marco-Andrea Buchmann, Andrew Dzhoha, Svitlana Borzenko, Francesca Catino, Mohamed Gaafar, Maarten Versteegh, Thomas Kober, Dario d'Andrea, Ellie Langhans

机构 * Zalando Switzerland AG(Zalando瑞士有限公司) TU Wien(维也纳技术大学) Zalando SE(Zalando德国分公司)

专题命中 领域大模型 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对电商视频流中的极端冷启动和偏差问题,提出基于领域自适应视觉-语言模型(CLIP)的可扩展多模态检索系统VCG,实现零样本检索,在线测试显示深度视频完成率提升50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07459 2026-06-17 cs.CL cs.AI 版本更新 79%

MedicalAgentsBench for Complex Medical Reasoning: Comparing Internalized Reasoning Models versus Externalized Agent-based Frameworks

MedicalAgentsBench:复杂医学推理基准——比较内化推理模型与外化智能体框架

Yanjun Shao, Xiangru Tang, Jiwoong Sohn, Jiapeng Chen, Yuxuan Liao, Jiayi Zhang, Jinyu Xiang, Fang Wu, Yilun Zhao, Chenglin Wu, Wenqi Shi, Arman Cohan, Mark Gerstein

机构 * Program in Computational Biology & Biomedical Informatics, Yale University(计算生物学与生物医学信息学项目,耶鲁大学) Department of Biomedical Informatics & Data Science, Yale University(生物医学信息学与数据科学系,耶鲁大学) Department of Computer Science, Yale University(计算机科学系,耶鲁大学) Department of Biosystems Science and Engineering, ETH Zurich(生物系统科学与工程系,苏黎世联邦理工学院) Department of Computer Science, Stanford University(计算机科学系,斯坦福大学) Department of Bioinformatics, UT Southwestern Medical Center(生物信息学系,德克萨斯西南医学中心)

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出MedicalAgentsBench基准(862个复杂临床问题),比较内化推理模型与外化智能体框架在医学推理中的表现,发现两者效果可叠加,最优组合为o3-mini+MDAgents(准确率35.1%)。

Comments https://github.com/gersteinlab/MedicalAgentsBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12413 2026-06-12 cs.CY cs.AI cs.CE cs.CL cs.SE 新提交 79%

AI SciBrief as a Gateway to Research: A Framework for Onboarding Students into New Research Areas

AI SciBrief 作为研究入门:一种引导学生进入新研究领域的框架

Andrei Lazarev, Dmitrii Sedov

机构 * Russian Federation(俄罗斯联邦)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出利用大语言模型平台 AI SciBrief 自动生成科学趋势摘要的框架,帮助学生克服信息过载,加速从信息搜索到知识创造的转变。

Comments This is the version of the article accepted for publication in TELE 2025 after peer review. The final, published version is available at IEEE Xplore: https://doi.org/10.1109/TELE66816.2025.11211989

Journal ref 2025 5th International Conference on Technology Enhanced Learning in Higher Education (TELE), Lipetsk, Russian Federation, 2025, pp. 365-369

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05232 2026-06-10 cs.CL cs.CY cs.LG 版本更新 79%

AI Application Gives Users Real-Time Feedback on the Level of Peace in the Social Media Videos They Watch

AI应用为用户观看的社交媒体视频提供实时和平水平反馈

P. Gilda, P. Dungarwal, A. Thongkham, E. T. Ajayi, S. Choudhary, T. M. Terol, C. Lam, J. P. Araujo, M. McFadyen-Mungalln, L. S. Liebovitch, P. T. Coleman, H. West, K. Sieck, S. Carter

机构 * Data Science Institute, Columbia University(哥伦比亚大学数据科学研究所) Advanced Consortium on Cooperation, Conflict, and Complexity, Columbia University(哥伦比亚大学合作、冲突与复杂性高级联合体) Computer Science, Columbia University(哥伦比亚大学计算机科学) Data Science, St John’s University(圣约翰大学数据科学) Quantitative Methods in the Social Sciences, Columbia University(哥伦比亚大学社会科学定量方法) Barnard College, Columbia University(哥伦比亚大学巴纳德学院) Teachers College, Columbia University(哥伦比亚大学教师学院) Department of Industrial Engineering and Operations Research, Columbia University(哥伦比亚大学工业工程与运筹学系) Harmonious Communities, Toyota Research Institute(丰田研究院和谐社区)

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 开发了一个实时分析YouTube视频中语言和平程度的AI应用,使用监督学习和大语言模型,大语言模型在测量和平相关社会维度上更接近人类编码者。

Comments 6 pages, 4 figures, corrected typos, minor edits; v3: 16 pages, improved title, abstract, introduction, discussion, conclusions, added more references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29475 2026-06-09 cs.CL cs.AI cs.CE cs.HC 版本更新 79%

MOOSE-Copilot: A Web-Based Interactive Assistant for Unified Exploratory and Fine-Grained Scientific Hypothesis Discovery

MOOSE-Copilot:一个基于网络的交互式助手,用于统一探索性和细粒度科学假设发现

Hongran An, Zonglin Yang

机构 * Central Conservatory of Music(中央音乐学院) Nanyang Technological University(南洋理工大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出MOOSE-Copilot,通过形式化的人机交互协议,将发散性探索和收敛性细化统一,利用蓝图、路由和反馈三种信号引导生成,显著优于纯自主基线。

Comments Accepted to ACL 2026 (System Demonstrations)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19005 2026-06-04 cs.LG cs.AI stat.ME 79%

AgentDS Technical Report: Benchmarking the Future of Human-AI Collaboration in Domain-Specific Data Science

AgentDS技术报告:领域特定数据科学中人机协作的未来基准测试

An Luo, Jin Du, Xun Xian, Robert Specht, Fangqiao Tian, Ganghua Wang, Xuan Bi, Charles Fleming, Ashish Kundu, Jayanth Srinivasa, Mingyi Hong, Rui Zhang, Tianxi Li, Galin Jones, Jie Ding

机构 * School of Statistics, University of Minnesota(明尼苏达大学统计学系) AIScientists, Inc.(AIScientists公司) Data Science Institute, University of Chicago(芝加哥大学数据科学研究所) Carlson School of Management, University of Minnesota(明尼苏达大学卡尔森管理学院) Cisco Research(思科研究) Department of Electrical and Computer Engineering, University of Minnesota(明尼苏达大学电气与计算机工程系) Division of Computational Health Sciences, University of Minnesota(明尼苏达大学计算健康科学 division)

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出AgentDS基准测试和竞赛,通过17个跨行业挑战评估AI代理及人机协作在领域特定数据科学中的表现,发现AI代理在领域推理上存在不足,人机协作优于纯AI方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02398 2026-06-02 cs.LG cs.CL 79%

A Local Perturbation Theory for Cross-Domain Interference and Recovery in Multi-Domain RL

跨域干扰与恢复的局部微扰理论:多领域强化学习

Lei Yang, Siyu Ding, Deyi Xiong

机构 * TJUNLP Lab, College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院TJUNLP实验室) Baidu Inc.(百度公司)

专题命中 领域大模型 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 针对多领域RL训练中一个领域性能下降的问题,提出局部微扰理论,证明后期领域训练主要通过二阶损伤项在低维共享冲突子空间中损害早期领域,并通过短时领域刷新实现选择性恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02983 2026-06-02 cs.CL cs.AI 79%

Truth, Trust, and Trouble: Medical AI on the Edge

真相、信任与麻烦:边缘上的医疗AI

Mohammad Anas Azeez, Rafiq Ali, Ebad Shabbir, Zohaib Hasan Siddiqui, Gautam Siddharth Kashyap, Jiechao Gao, Usman Naseem

机构 * Jamia Hamdard(贾迈亚哈姆达德大学) DSEU-Okhla Macquarie University(麦考瑞大学) Center for SDGC, Stanford University(SDGC中心,斯坦福大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 通过一个包含1000多个健康问题的基准测试框架,评估Mistral-7B、BioMistral-7B-DARE和AlpaCare-13B三个模型在诚实、有用性和无害性方面的表现,发现AlpaCare-13B准确率最高(91.7%)且无害性最佳(0.92),而领域微调可提升安全性,少样本提示能提高准确率,但复杂查询下有用性下降。

Comments Accepted at EMNLP 2025 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14113 2026-05-29 cs.CV cs.AI cs.LG cs.MA 79%

ProtoMedAgent: Multimodal Clinical Interpretability via Privacy-Aware Agentic Workflows

ProtoMedAgent: 通过隐私感知的智能体工作流实现多模态临床可解释性

Alvaro Lopez Pellicer, Plamen Angelov, Marwan Bukhari, Yi Li, Eduardo Soares, Jemma Kerns

机构 * School of Computing and Communications(计算与通信学校) Lancaster University(兰卡斯特大学) Lancaster Medical School(兰卡斯特医学院) PUC-Rio(里约热内卢联邦大学) Puc-Behring Institute for AI(人工智能皮克林研究所)

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出ProtoMedAgent框架,通过神经符号瓶颈和反射性Scribe-Critic循环约束生成过程,解决原型网络在临床报告中的语义结构缺失和检索谄媚问题,并引入k-匿名和ℓ-多样性隐私门控。

Comments CVR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21963 2026-05-22 cs.LG cs.AI 79%

ChronoMedicalWorld: A Medical World Model for Learning Patient Trajectories from Longitudinal Care Data

ChronoMedicalWorld:一个用于从纵向护理数据中学习患者轨迹的医学世界模型

Jiangyuan Wang, Xuyong Chen, Junwei He, Xu Xu, Shasha Xie, Fuman Han

机构 * Beijing KidneyTec Medical Technology Co., Ltd.(北京肾科医疗技术有限公司)

专题命中 领域大模型 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种名为ChronoMedicalWorld的模型,旨在通过纵向护理数据学习患者轨迹,该模型结合了联合嵌入状态编码器和宽动作编码器,并在六个术语目标下训练了循环潜在转移模块,以提高慢性病护理中长期预测的准确性。

Comments 14 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09722 2026-05-19 cs.CL cs.AI 79%

ADMEDTAGGER: an annotation framework for distillation of expert knowledge for the Polish medical language

ADMEDTAGGER: 一个用于波兰医疗语言知识蒸馏的标注框架

Franciszek Górski, Andrzej Czyżewski

机构 * Gdansk University of Technology(格但斯克技术大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种标注框架,展示如何利用一个多语言预训练大语言模型作为教师模型,蒸馏出用于标注波兰医疗文本所需的专业知识,通过开发多类分类器,解决了标注资源不足的问题,最终得到了高效的分类器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10468 2026-05-05 cs.IR cs.AI cs.CL 79%

Learning Decomposed Contextual Token Representations from Pretrained and Collaborative Signals for Generative Recommendation

从预训练和协作信号中学习分解的上下文令牌表示以生成推荐

Yifan Liu, Yaokun Liu, Zelin Li, Zhenrui Yue, Gyuseok Lee, Ruichen Yao, Yang Zhang, Dong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Miami University(迈阿密大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DECOR框架,通过上下文化令牌组成和分解嵌入融合,提升推荐性能,实验证明其优于现有方法。

Comments Accepted to SIGIR 2026. Full author version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26597 2026-04-30 cs.CL cs.AI 79%

Translating Under Pressure: Domain-Aware LLMs for Crisis Communication

在压力下翻译:面向危机通信的领域感知语言模型

Antonio Castaldo, Maria Carmen Staiano, Johanna Monti, Sheila Castilho, Francesca Chiusaroli

机构 * University of Pisa(帕尔米斯大学) University of Macerata(马切拉塔大学) Dublin City University(都柏林城市大学)

专题命中 领域大模型 :language model(abstract);small language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种领域自适应流程,通过检索和过滤通用语料库扩展小语料库,用于危机领域翻译,并通过偏好优化提升翻译质量,验证了简化英语结合领域适应在应急通信中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03266 2026-04-29 cs.CL cs.AI 79%

Benchmarking and Adapting On-Device LLMs for Clinical Decision Support

对设备大语言模型在临床决策支持中的基准测试与适应性研究

Alif Munim, Jun Ma, Omar Ibrahim, Alhusain Abdalla, Shuolin Yin, Leo Chen, Bo Wang

机构 * AI Collaborative Centre, University Health Network(人工智能协同中心,健康大学网络) Princess Margaret Cancer Centre, University Health Network(彭菲癌症中心,健康大学网络) Department of Electrical and Computer Engineering, University of Toronto(电气与计算机工程系,多伦多大学) Division of Urology, Department of Surgery, St. Michael’s Hospital, Unity Health Toronto and University of Toronto(泌尿科,外科部,圣米歇尔医院,统一健康多伦多及多伦多大学) Peter Munk Cardiac Centre, University Health Network(彼得·默克心脏中心,健康大学网络) Department of Laboratory Medicine and Pathobiology and Department of Computer Science, University of Toronto(实验室医学与病理学系及计算机科学系,多伦多大学) Vector Institute, Toronto(向量研究所,多伦多)

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过基准测试和微调,评估了多种设备端大语言模型在临床任务中的性能,发现其在诊断准确率上可与开源模型和专有模型相媲美,并展示了微调对提升诊断准确性的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12290 2026-04-28 cs.AI cs.CL 79%

Frontier-Eng: Benchmarking Self-Evolving Agents on Real-World Engineering Tasks with Generative Optimization

Frontier-Eng:基于生成优化的现实工程任务中自演化代理的基准测试

Yizhe Chi, Deyao Hong, Dapeng Jiang, Tianwei Luo, Kaisen Yang, Boshi Zhang, Zhe Cao, Xiaoyan Fan, Bingxiang He, Han Hao, Weiyang Jin, Dianqiao Lei, Qingle Liu, Houde Qian, Bowen Wang, Situ Wang, Youjie Zheng, Yifan Zhou, Calvin Xiao, Eren Cai, Qinhuai Na

机构 * Navers Lab(Navers实验室)

专题命中 领域大模型 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 Frontier-Eng通过工业级模拟器和验证器,评估生成优化中代理在现实工程任务中的表现,发现GPT 5.4表现最稳健,但所有模型仍面临挑战,分析显示改进频率和幅度呈双幂律衰减。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12910 2026-04-23 cs.CL cs.AI 79%

SciCoQA: Quality Assurance for Scientific Paper--Code Alignment

SciCoQA:科学论文与代码对齐的质量保障

Tim Baumgärtner, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(普遍知识处理实验室(UKP实验室)、计算机科学系、德累斯顿技术大学和应用网络安全国家研究中心ATHENE)

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出SciCoQA数据集,用于评估LLM在科学论文与代码对齐任务中的表现,揭示自动化科学质量保障的关键差距。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11217 2026-04-14 cs.CL cs.AI 79%

Domain-Specific Data Generation Framework for RAG Adaptation

面向RAG适应的领域特定数据生成框架

Chris Xing Tian, Weihao Xie, Zhen Chen, Zhengyuan Yi, Hui Liu, Haoliang Li, Shiqi Wang, Siwei Ma

机构 * Peng Cheng Laboratory(鹏城实验室) City University of Hong Kong(香港城市大学) Peking University(北京大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RAGen框架,通过识别文档中的关键概念生成领域相关的问答对,支持多种RAG适应策略,提升领域适应效果。

Comments To appear in ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09645 2026-04-14 cs.CL cs.AI 79%

Generating High Quality Synthetic Data for Dutch Medical Conversations

生成高质量的荷兰医疗对话合成数据

Cecilia Kuan, Aditya Kamlesh Parikh, Henk van den Heuvel

专题命中 领域大模型 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出生成荷兰医疗对话合成数据的流程,利用微调后的大型语言模型,通过定量和定性评估发现生成对话在自然度和结构上存在不足,强调需结合领域知识和精心设计提示以提升质量。

Comments Accepted to LREC 2026. This publication was supported by the MediSpeech project funded by ITEA4 under contract number 22032

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21605 2026-04-07 cs.LG cs.AI cs.CR 79%

SoSBench: Benchmarking Safety Alignment on Six Scientific Domains

SoSBench:在六个科学领域中对安全对齐进行基准测试

Fengqing Jiang, Fengbo Ma, Zhangchen Xu, Yuetai Li, Zixin Rao, Bhaskar Ramasubramanian, Luyao Niu, Bo Li, Xianyan Chen, Zhen Xiang, Radha Poovendran

机构 * University of Washington(华盛顿大学) University of Georgia(佐治亚大学) WWU(西华盛顿大学) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SoSBench针对高风险科学领域设计,通过3000个基于真实法规的提示评估大模型的安全性,揭示了先进模型在处理危险场景时存在严重的安全对齐缺陷。

Comments Project Page: https://sosbench.github.io/; ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01481 2026-04-03 cs.LG cs.AI 79%

DISCO-TAB: A Hierarchical Reinforcement Learning Framework for Privacy-Preserving Synthesis of Complex Clinical Data

DISCO-TAB:一种用于隐私保护合成复杂临床数据的分层强化学习框架

Arshia Ilaty, Hossein Shirazi, Amir Rahmani, Hajar Homayouni

机构 * Computational Science Research Center, San Diego State University(圣地亚哥州立大学计算科学研究中心) School of Nursing and Department of Computer Science, University of California, Irvine(加州大学尔湾分校护理学院与计算机科学系) Fowler College of Business, San Diego State University(圣地亚哥州立大学福勒商学院) Department of Computer Science, San Diego State University(圣地亚哥州立大学计算机科学系)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DISCO-TAB框架,结合微调LLM与多目标判别器,通过强化学习优化,解决临床数据生成中的复杂依赖和类别不平衡问题,提升合成数据的临床有效性与统计真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00085 2026-04-02 cs.AI cs.CL cs.MA 79%

One Panel Does Not Fit All: Case-Adaptive Multi-Agent Deliberation for Clinical Prediction

一个面板并不适用于所有情况:面向临床预测的案例自适应多智能体协商

Yuxing Lu, Yushuhong Lin, Jason Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院) Peking University(北京大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CAMP框架,通过动态组建专家团队应对临床预测中的案例异质性,采用三值投票机制和混合路由策略,实现更精确的诊断预测和住院疗程生成,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏