arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12705 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 12705 篇

2602.09306 2026-02-11 cs.LG cs.AI cs.DB 79%

Empowering Contrastive Federated Sequential Recommendation with LLMs

通过大型语言模型增强对比联邦序列推荐

Thi Minh Chau Nguyen, Minh Hieu Nguyen, Duc Anh Nguyen, Xuan Huong Tran, Thanh Trung Huynh, Quoc Viet Hung Nguyen

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 通过整合大型语言模型作为本地语义生成器,LUMOS在联邦序列推荐中提升模型性能,增强隐私保护下的推荐系统鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07520 2026-02-11 cs.IR cs.AI cs.LG 79%

MDL: A Unified Multi-Distribution Learner in Large-scale Industrial Recommendation through Tokenization

MDL:通过分词实现大规模工业推荐系统的统一多分布学习

Shanlei Mu, Yuchen Jiang, Shikang Wu, Shiyong Hong, Tianmu Sha, Junjie Zhang, Jie Zhu, Zhe Chen, Zhe Wang, Jingjian Lin

机构 * ByteDance Search(字节跳动搜索) ByteDance AML(字节跳动人工智能实验室)

专题命中 领域大模型 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 MDL通过统一的多分布学习框架,利用分词技术提升大规模工业推荐系统中多场景和多任务学习的性能。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08019 2026-02-10 cs.LG cs.AI 79%

The Rise of Sparse Mixture-of-Experts: A Survey from Algorithmic Foundations to Decentralized Architectures and Vertical Domain Applications

稀疏专家混合模型的兴起:从算法基础到去中心化架构和垂直领域应用的综述

Dong Pan, Bingtao Li, Yongsheng Zheng, Jiren Ma, Victor Fei

机构 * FEDIMOSS TECH HK LIMITED(FEDIMOSS科技(香港)有限公司) Ormi Labs, Inc.(Ormi实验室有限公司)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了稀疏混合专家模型从算法基础到去中心化架构及垂直领域应用的发展,系统探讨了其核心原理、去中心化范式和关键挑战,为研究者和实践者提供全面的参考。

Journal ref Journal of Computer Science and Artificial Intelligence 5 (2025) 25-41

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15047 2026-02-10 cs.LG cs.AI 79%

PiFlow: Principle-Aware Scientific Discovery with Multi-Agent Collaboration

PiFlow:基于多智能体协作的原则感知科学发现

Yingming Pu, Tao Lin, Hongyu Chen

机构 * Westlake University(西湖大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 PiFlow通过多智能体协作和原则引导,提升科学发现效率和质量,实现高效且稳健的AI驱动研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07491 2026-02-10 cs.AI cond-mat.mes-hall cond-mat.mtrl-sci cond-mat.soft cs.LG 79%

GraphAgents: Knowledge Graph-Guided Agentic AI for Cross-Domain Materials Design

GraphAgents: 基于知识图谱的多智能体AI用于跨领域材料设计

Isabella A. Stewart, Tarjei Paule Hage, Yu-Chuan Hsu, Markus J. Buehler

机构 * Department of Civil and Environmental Engineering Massachusetts Institute of Technology(土木与环境工程系 马萨诸塞理工学院) Department of Mechanical Engineering Massachusetts Institute of Technology(机械工程系 马萨诸塞理工学院) Department of Civil and Environmental Engineering Department of Mechanical Engineering Schwarzman College of Computing Massachusetts Institute of Technology(土木与环境工程系 机械工程系 斯沃茨曼计算学院 马萨诸塞理工学院)

专题命中 领域大模型 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 GraphAgents通过多智能体与知识图谱结合,实现跨领域材料设计,生成可持续替代品并平衡性能与生物相容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04210 2026-02-09 cs.AI cs.LG 79%

Steering LLMs via Scalable Interactive Oversight

通过可扩展的交互监督引导大语言模型

Enyu Zhou, Zhiheng Xi, Long Ma, Zhihao Zhang, Shihan Dou, Zhikai Lei, Guoteng Wang, Rui Zheng, Hang Yan, Tao Gui, Qi Zhang, Xuanjing Huang

专题命中 领域大模型 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文提出可扩展的交互监督框架,通过递归决策树提升人类对AI任务的引导能力,实现非专家生成高质量产品需求文档,并通过强化学习优化

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15610 2026-02-05 cs.AI cs.LG 79%

Transduction is All You Need for Structured Data Workflows

传递是构建结构化数据工作流的全部需求

Alfio Gliozzo, Naweed Khan, Christodoulos Constantinides, Nandana Mihindukulasooriya, Nahuel Defosse, Gaetano Rossiello, Junkyu Lee

机构 * IBM

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Agentics通过智能体嵌入数据类型,实现结构化数据工作流的逻辑传递,提升数据建模和处理效率。

Comments 38 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03569 2026-02-04 cs.AI cs.LG 79%

EHRWorld: A Patient-Centric Medical World Model for Long-Horizon Clinical Trajectories

EHRWorld: 一个以患者为中心的医疗世界模型用于长周期临床轨迹

Linjie Mu, Zhongzhen Huang, Yannian Gu, Shengqian Qin, Shaoting Zhang, Xiaofan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 EHRWorld通过因果序列范式训练,有效解决长周期临床模拟中的误差累积问题,提升医疗世界模型的稳定性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10692 2026-01-30 cs.LG cs.AI 79%

ACES: Generating Diverse Programming Puzzles with with Autotelic Generative Models

ACES: 用自激励生成模型生成多样化的编程谜题

Julien Pourcel, Cédric Colas, Gaia Molinaro, Pierre-Yves Oudeyer, Laetitia Teodorescu

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 ACES通过自激励生成模型生成多样且更具挑战性的Python编程谜题,提升谜题的多样性和难度。

Journal ref NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13481 2026-01-27 cs.AI cs.CL cs.CY 79%

neuralFOMO: Can LLMs Handle Being Second Best? Measuring Envy-Like Preferences in Multi-Agent Settings

neuralFOMO: LLMs能否处理第二好?在多智能体设置中测量类似嫉妒的偏好

Arnav Ramamoorthy, Shrey Dhorajiya, Ojas Pungalia, Rashi Upadhyay, Abhishek Mishra, Abhiram H, Tejasvi Alladi, Sujan Yenuganti, Dhruv Kumar

机构 * BITS Pilani, Pilani Campus(比斯学院,帕利尼校区)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 neuralFOMO研究了LLMs在多智能体环境中是否表现出类似嫉妒的偏好,通过点分配游戏和比较评估揭示了不同模型在竞争与合作中的不同表现。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12648 2026-01-21 cs.CL cs.AI 79%

Intelligent Documentation in Medical Education: Can AI Replace Manual Case Logging?

医学教育中的智能文档:AI能否取代手动病例记录?

Nafiz Imtiaz Khan, Kylie Cleland, Vladimir Filkov, Roger Eric Goldman

机构 * Department of Computer Science, University of California, Davis, CA, USA(计算机科学系,加州大学戴维斯分校) Department of Radiology, University of California, Davis, CA, USA(放射学系,加州大学戴维斯分校)

专题命中 领域大模型 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了大型语言模型在自动完成放射学程序性病例记录中的可行性,结果显示LLMs在提取结构化信息方面表现优异,能有效减轻学员文书负担并提高记录一致性。

Comments 51 pages, 12 figures, 8 tables. Feasibility study using retrospective radiology reports. Submitted to JAMIA Open (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12607 2026-01-21 cs.CL cs.AI 79%

A Cloud-based Multi-Agentic Workflow for Science

基于云的多智能体工作流用于科学

Anurag Acharya, Timothy Vega, Rizwan A. Ashraf, Anshu Sharma, Derek Parker, Robert Rallo

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室) Florida International University(佛罗里达国际大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于云的多智能体工作流框架,用于科学领域,能够协调多个智能体完成科学任务,通过实验验证其在催化剂研究中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10951 2026-01-19 cs.CL cs.AI 79%

Multi-Stage Patient Role-Playing Framework for Realistic Clinical Interactions

多阶段患者角色扮演框架用于真实临床互动

Shijie Jiang, Zefan Zhang, Kehua Zhu, Tian Bai, Ruihong Zhao

机构 * College of Computer Science and Technology, Key Laboratory of Symbolic Computation and Knowledge Engineering, Ministry of Education, Jilin University(计算机科学与技术学院、符号计算与知识工程重点实验室、教育部、吉林大学) College of Software, Jilin University(软件学院、吉林大学) Gastrointestinal Endoscopy Center, The First Hospital of Jilin University(吉林大学第一医院消化内窥镜中心)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出无需训练的多阶段患者角色扮演框架,通过分解互动为三个阶段,提升模型在模拟患者行为时的个性化和真实性。

Comments 22 pages, 5figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09749 2026-01-16 cs.SE cs.AI cs.LG 79%

R-LAM: Reproducibility-Constrained Large Action Models for Scientific Workflow Automation

R-LAM:具有可重复性约束的大型动作模型用于科学工作流自动化

Suriya Sureshkumar

机构 * 1, Department of AI \& Data Science, RMK Engineering College, Chennai, India

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 R-LAM通过引入结构化动作模式、确定性执行策略和显式溯源跟踪,提升科学工作流自动化的可重复性和可靠性。

Comments 9 pages, 3 figures, 1 Table, 2 Artifacts

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20993 2026-01-14 cs.CL cs.AI cs.HC 79%

SAC: A Framework for Measuring and Inducing Personality Traits in LLMs with Dynamic Intensity Control

SAC:一种用于衡量和诱导LLM人格特质的框架,具有动态强度控制

Adithya Chittem, Aishna Shrivastava, Sai Tarun Pendela, Jagat Sesh Challa, Dhruv Kumar

机构 * BITS Pilani, India(印度比特斯理工学院)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SAC框架,通过动态强度控制实现LLM人格特质的衡量与诱导,提升人机交互的可控性和细腻度。

Comments Accepted into 18th Edition of International Conference on Agents and Artificial Intelligence (ICAART)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06181 2026-01-13 cs.AI cs.FL cs.LG cs.LO 79%

Neuro-Symbolic Compliance: Integrating LLMs and SMT Solvers for Automated Financial Legal Analysis

神经符号合规:整合大语言模型与SMT求解器用于自动化金融法律分析

Yung-Shen Hsia, Fang Yu, Jie-Hong Roland Jiang

机构 * Department of Management Information Systems, National ChengChi University, Taipei, Taiwan(管理信息系,中华大学,台北,台湾) Department of Electrical Engineering, National Taiwan University, Taipei, Taiwan(电子工程系,台湾大学,台北,台湾)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究整合大语言模型与SMT求解器,提出神经符号合规框架,用于自动化金融法律分析,实现形式可验证性和基于优化的合规修正。

Comments 10 pages, 6 tables, 3 figures, accepted by the 2nd ACM AIware Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06472 2026-01-13 cs.CL cs.AI cs.CE cs.DL 79%

KARMA: Leveraging Multi-Agent LLMs for Automated Knowledge Graph Enrichment

KARMA:利用多智能体大语言模型实现知识图谱的自动化丰富

Yuxing Lu, Wei Wu, Xukai Zhao, Rui Peng, Jinzhuo Wang

机构 * Department of Big Data and Biomedical AI, Peking University(北京大学大数据与生物医学人工智能系) Wallace H. Coulter Department of Biomedical Engineering, Georgia Institute of Technology(佐治亚理工学院生物医学工程系) School of Architecture, Tsinghua University(清华大学建筑学院)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 KARMA通过多智能体大语言模型自动丰富知识图谱,有效识别新实体并提高正确性与一致性

Comments 24 pages, 3 figures, 2 tables

Journal ref Spotlight paper of NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05567 2026-01-12 cs.AI cs.CL 79%

WildSci: Advancing Scientific Reasoning from In-the-Wild Literature

WildSci: 从真实文献中推进科学推理

Tengxiao Liu, Deepak Nathani, Zekun Li, Kevin Yang, William Yang Wang

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 WildSci通过自动合成领域特定科学问题数据集,提升科学推理的可扩展性和可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04195 2026-01-09 cs.CL cs.AI 79%

MedPI: Evaluating AI Systems in Medical Patient-facing Interactions

MedPI:评估医疗患者交互中的人工智能系统

Diego Fajardo V., Oleksii Proniakin, Victoria-Elisabeth Gruber, Razvan Marinescu

机构 * Lumos

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MedPI是一个评估医疗患者交互中AI系统表现的高维基准,通过105个维度评估医疗对话质量,发现主流LLM在鉴别诊断上表现不佳。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11184 2026-01-08 cs.LG cs.CL 79%

Reinforcement Learning for Tool-Integrated Interleaved Thinking towards Cross-Domain Generalization

强化学习用于工具集成的交叉领域泛化思考

Zhengyu Chen, Jinluan Yang, Teng Xiao, Ruochen Zhou, Luan Zhang, Xiangyu Xi, Xiaowei Shi, Wei Wang, Jinggang Wang

机构 * Meituan(美团) Zhejiang University(浙江大学) Allen Institute for Artificial Intelligence(人工智能算法研究所) City University of Hong Kong(香港城市大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出RITE方法,通过强化学习和交叉领域工具执行,提升LLM在跨领域推理中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23090 2026-01-05 cs.AI cs.LG 79%

Benchmark Success, Clinical Failure: When Reinforcement Learning Optimizes for Benchmarks, Not Patients

基准成功,临床失败:当强化学习优化于基准,而非患者

Armin Berger, Manuela Bergau, Helen Schneider, Saad Ahmad, Tom Anglim Lagones, Gianluca Brugnara, Martha Foltyn-Dumitru, Kai Schlamp, Philipp Vollmuth, Rafet Sifa

机构 * Fraunhofer IAIS(弗劳恩霍夫人工智能研究所) University of Bonn(波恩大学) Lamarr Institute(拉马尔研究所) Department of Health Queensland(昆士兰健康部) Griffith University(格里菲斯大学) University Hospital Bonn(波恩大学医院)

专题命中 领域大模型 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI、cs.LG

AI总结 ChexReason通过低资源强化学习在医学影像基准上表现优异,但其跨数据集迁移性下降,揭示了RL范式在临床应用中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24830 2026-01-01 cs.CL cs.AI 79%

Improving Reliability and Explainability of Medical Question Answering through Atomic Fact Checking in Retrieval-Augmented LLMs

通过检索增强的大语言模型中的原子事实核查来提高医疗问答的可靠性与可解释性

Juraj Vladika, Annika Domres, Mai Nguyen, Rebecca Moser, Jana Nano, Felix Busch, Lisa C. Adams, Keno K. Bressem, Denise Bernhardt, Stephanie E. Combs, Kai J. Borm, Florian Matthes, Jan C. Peeken

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过原子事实核查提升医疗问答的可靠性与可解释性,减少幻觉并提高事实准确性。

Comments 18 pages, 7 figures and tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23848 2026-01-01 cs.CL cs.CE cs.LG 79%

Integrating Domain Knowledge for Financial QA: A Multi-Retriever RAG Approach with LLMs

在金融问答中整合领域知识:一种基于多检索器RAG方法与LLM的多检索器RAG方法

Yukun Zhang, Stefan Elbl Droguett, Samyak Jain

机构 * Department of Computer Science Stanford University(计算机科学系 斯坦福大学) Graduate School of Business Stanford University(商学院 斯坦福大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出一种基于多检索器RAG方法与LLM的金融问答系统,通过领域知识训练提升数值推理能力,验证了领域特定训练在不同模型规模下的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10340 2025-12-30 cs.CL cs.AI 79%

Forecasting Clinical Risk from Textual Time Series: Structuring Narratives for Temporal AI in Healthcare

从文本时间序列预测临床风险:为医疗健康领域的时序AI构建叙述

Shahriar Noroozizadeh, Sayantan Kumar, Jeremy C. Weiss

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出从文本时间序列预测临床风险的方法,通过构建时间有序的临床数据,提升时序AI在医疗健康领域的应用效果。

Comments AAAI AI for Social Impact 2026. Shahriar Noroozizadeh, Sayantan Kumar (authors contributed equally)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18999 2025-12-23 cs.CL cs.AI 79%

Evaluating the Challenges of LLMs in Real-world Medical Follow-up: A Comparative Study and An Optimized Framework

评估LLMs在真实医疗随访中的挑战:一项比较研究及优化框架

Jinyan Liu, Zikang Chen, Qinchuan Wang, Tan Xie, Heming Zheng, Xudong Lv

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种模块化框架,通过任务分解、语义聚类和流程管理提升医疗随访中LLM的对话稳定性和准确性,同时减少对话轮次和token消耗。

Comments 10 pages,3 figures,conference ICCBB2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00931 2025-12-19 cs.CL cs.AI 79%

Mitigating Hallucinations in Zero-Shot Scientific Summarisation: A Pilot Study

缓解零样本科学摘要中的幻觉:一项初步研究

Imane Jaaouine, Ross D. King

机构 * Department of Chemical Engineering and Biotechnology(化学工程与生物技术系) University of Cambridge(剑桥大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨提示工程方法对缓解零样本科学摘要中的幻觉效果,发现上下文重复和随机添加能显著提升摘要与原文的对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18054 2025-12-17 cs.IR cs.AI cs.LG 79%

A Knowledge Graph-based Retrieval-Augmented Generation Framework for Algorithm Selection in the Facility Layout Problem

基于知识图谱的检索增强生成框架用于设施布局问题中的算法选择

Nikhil N S, Bilal Muhammed, Soban Babu Beemaraj, Amol Dilip Joshi

机构 * Indian Institute of Science(印度科学学院) TCS Research and Innovation(塔塔咨询公司研究与创新)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于知识图谱的检索增强生成框架,用于自动推荐设施布局问题中的算法选择,通过多维检索机制和大语言模型实现数据驱动的算法推荐。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13654 2025-12-16 cs.CL cs.AI cs.ET cs.IR 79%

Large-Language Memorization During the Classification of United States Supreme Court Cases

大语言模型在美最高法院案件分类中的记忆能力

John E. Ortega, Dhruv D. Joshi, Matt P. Borkowski

机构 * Pace University(帕克大学)

专题命中 领域大模型 :LLM(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大语言模型在美最高法院案件分类中的记忆能力,发现基于提示的模型在分类任务中表现更优。

Comments 7 pages, 1 figure, Appendix of Prompts

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11202 2025-12-15 astro-ph.IM cs.AI cs.DL cs.LG 79%

amc: The Automated Mission Classifier for Telescope Bibliographies

amc:望远镜文献的自动任务分类器

John F. Wu, Joshua E. G. Peek, Sophie J. Miller, Jenny Novacescu, Achu J. Usha, Christopher A. Wilkinson

机构 * Space Telescope Science Institute(空间望远镜科学研究所)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 amc利用大型语言模型自动分类望远镜文献,有效提升天文文献处理效率,适用于历史数据检查与标签错误识别。

Comments Accepted to IJCNLP-AACL WASP 2025 workshop. Code available at: https://github.com/jwuphysics/automated-mission-classifier

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10195 2025-12-12 cs.CL cs.LG cs.MA 79%

AutoMedic: An Automated Evaluation Framework for Clinical Conversational Agents with Medical Dataset Grounding

AutoMedic: 一种用于具有医学数据集支撑的临床对话代理的自动化评估框架

Gyutaek Oh, Sangjoon Park, Byung-Hoon Kim

机构 * Yonsei University College of Medicine(延世大学医学院) Yonsei Institute for Digital Health(延世大学数字健康研究所) Yonsei University(延世大学) Institute of Behavioral Sciences in Medicine(医学行为科学研究所)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 AutoMedic是一种基于医学数据集的自动化评估框架,用于评估临床对话代理的多方面性能,包括准确性、效率、同理心和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏