arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 925 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 925 篇

2608.00285 2026-08-04 cs.CL cs.AI 新提交 62%

Sixteen models, fewer than two voices: measuring ensemble dispersion where no answer is uniquely correct

十六种模型,不足两种声音:在无唯一正确答案的场景中测量集成模型的离散度

Mario Vega-Barbas, Lidia Mora-Valenciano, Iván Pau, Fernando Seoane, Farhad Abtahi

专题命中 领域大模型 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对无唯一正确答案的心理治疗案例,以十六种语言模型为对象,定义模型异议贡献,发现集成模型离散度由临床内容组织,模型身份为异议的可检测结构因素。

Comments 34 pages (25 article + 9 supplementary), 3 figures. Supplementary material (S1-S11) included. Preregistered at OSF (osf.io/c5qk7), sealed 21 July 2026. Analysis code and data: https://doi.org/10.5281/zenodo.21718657

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27210 2026-07-31 cs.CL cs.AI cs.CE cs.DL cs.SE 新提交 62%

Prompt Chaining in Practice: A Case Study in Automated Scholarly Report Generation

实践中的提示词链:学术报告自动生成的案例研究

Andrei Lazarev

专题命中 领域大模型 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文针对学术报告自动生成任务,提出多阶段提示词链方法,在教育领域实验中,该方法成功率100%、ROUGE-L F1达0.507,优于单次提示基线,可降低生成失败与不一致风险。

Comments This is the version of the article accepted for publication in SUMMA 2025 after peer review. The final, published version is available at IEEE Xplore: https://doi.org/10.1109/SUMMA68668.2025.11302303

Journal ref 2025 7th International Conference on Control Systems, Mathematical Modeling, Automation and Energy Efficiency (SUMMA), Lipetsk, Russian Federation, 2025, pp. 704-710

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25948 2026-07-29 cs.CV cs.AI cs.LG 新提交 62%

MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities

MODUS:仅解码器的多模态任意到任意建模

Mingqiao Ye, Zhaochong An, Zhitong Gao, Xian Liu, François Fleuret, Chuan Li, Amir Zadeh, Serge Belongie, Afshin Dehghan, Jesse Allardice, David Mizrahi, Oğuzhan Fatih Kar, Roman Bachmann, Amir Zamir

专题命中 领域大模型 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究任意到任意多模态建模,提出仅解码器的对称多模态建模方法Modus,无需特定模态组件,支持多种应用,在各基准测试中用单模型展现强大性能且与基线竞争,材料开源。

Comments Accepted at ICML 2026. Project page: https://modus-multimodal.epfl.ch

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24784 2026-07-29 cs.AI cs.CL 新提交 62%

On the Use of LLMs for Specialised Terminology: A Good Alternative to Corpora?

关于大语言模型在专业术语方面的应用:语料库的良好替代品?

Joachim Minder, Guillaume Wisniewski, Natalie Kübler

专题命中 领域大模型 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨大语言模型在专业翻译中找英语到法语对应词的作用,评估四个模型在两个领域的表现,比较两种提示策略,发现模型等存在差异,大语言模型对专业译者有用但不能取代语料库,为后续研究铺了路。

Journal ref 26th Annual Conference of the European Association for Machine Translation, Jun 2026, Tilburg, Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23368 2026-07-28 cs.CV cs.AI cs.CL 新提交 62%

Explaining BiomedCLIP with Weighted Banzhaf Interactions Supported by Tree-Gram Parsing

用基于树图解析支持的加权班扎夫交互解释生物医学CLIP

Jakub Rymarski, Adam Rempała, Bartłomiej Sobieski, Przemysław Biecek

机构 * University of Warsaw(华沙大学) Centre for Credible AI, Warsaw University of Technology(华沙理工大学可信人工智能中心)

专题命中 领域大模型 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对视觉语言模型在医学任务中解释难的问题,引入ParseFIxLIP方法,将树图解析融入班扎夫交互博弈,通过smart_depth分组策略减轻概念碎片化,提升跨模态交互可解释性,为VLM决策提供医学领域相关见解。

Comments 12 pages, 13 figures. Accepted at EXPLIMED 2026 (Third Workshop on Explainable Artificial Intelligence for the medical domain), IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22592 2026-07-28 cs.AI cs.CL cs.IR 新提交 62%

Structure Over Scale: Schema-Constrained Causal Graphs for RAG

结构跨越尺度:用于检索增强生成的模式约束因果图

Marc Saouda, Rajprakash Bale, Eren Aldis, Cloves Almeida

机构 * Boston Consulting Group(波士顿咨询集团)

专题命中 领域大模型 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究针对GraphRAG问题,提出HCG-RAG,用模式约束因果图取代开放式提取,构建紧凑两层图。该方法成本低,答案质量优,在医学等基准测试中表现出色,对比实验显示因果图作为检索过滤器有优势,表明图内容比节点数量更重要。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20426 2026-07-24 cs.CL cs.AI 新提交 62%

Knowledge Injection Exists in MoE? Exploring Expert-Aware Contrast Decoding in MoE for Mitigating LLMs'Hallucinations

知识注入存在于混合专家模型中吗?探索混合专家模型中基于专家感知的对比解码以减轻大语言模型的幻觉

Xinyue Fang, Zhiliang Tian, Zhen Huang, Ziyi Pan, Zhihua Wen, Xi Wang, Quntian Fang, Dongsheng Li

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院)

专题命中 领域大模型 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究探索混合专家模型中基于专家感知的对比解码以减轻大语言模型幻觉问题。提出EAACD方法,利用MoE高层专家差异,将专家分组对比校准预测,放大低可靠性专家幻觉提供负面参考,在四个数据集上优于所有基线。

Comments Accepted by ACL2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16131 2026-07-20 cs.CL cs.AI 新提交 62%

ToolSciVer: Multimodal Scientific Claim Verification with Visual Tool Augmented Reinforcement Learning

ToolSciVer:基于视觉工具增强强化学习的多模态科学声明验证

Binglin Zhou, Peng Shi, Ryo Kamoi, Nan Zhang, Rui Zhang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Waterloo(滑铁卢大学)

专题命中 领域大模型 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究多模态科学声明验证问题,提出ToolSciVer框架,为视觉语言模型配备三种类型感知视觉工具,用组相对策略优化训练策略,实验证明该方法在多模型上性能优于竞争基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15545 2026-07-20 cs.MA cs.AI cs.CL 新提交 62%

CoWeaver: A Bi-directional, Learnable and Explainable Matching Engine for Mixed Human-Agent Science Collaboration

CoWeaver:用于混合人机科学协作的双向、可学习且可解释的匹配引擎

Jiayao Gu, Kexin Chu, Peidong Liu, Yue Yang, Lynn Ai, Qi Zhang, Ling Yang, Tianyu Shi

专题命中 领域大模型 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究针对基于大语言模型的智能体在科学协作中存在的问题,提出CoWeaver算法,通过填补能力差距匹配人员,经两阶段排名筛选,结合探索与贪婪策略,在匹配质量和效率上优于基线,能促进人机科学协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14157 2026-07-17 cs.LG cs.AI cs.IR cs.SY eess.SY 新提交 62%

Certified Domain Consistency for Multi-Domain Retrieval: Label-Free Per-Domain Contamination Control with Conformal Risk Guarantees

多域检索的认证域一致性:具有共形风险保证的无标签逐域污染控制

Jayakumar Manoharan

机构 * Electric Power Research Institute (EPRI)(电力研究协会)

专题命中 领域大模型 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 针对多域检索中错误域证据及污染控制问题,提出C3R控制层。基于风险控制预测集构建双分割方案,认证污染预算。通过实验验证其稳定性及有效性,能减少错误权威基础,且与冻结堆栈和重排器无关。

Comments Submitted to ACM TOI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14937 2026-07-17 cs.LG cs.AI math.DS nlin.CD 新提交 62%

A Minimal Interpretable Architecture for Zero-Shot Reconstruction of Dynamical Systems

用于动态系统零样本重建的最小可解释架构

Christoph Jürgen Hemmer, Florian Plaswig, Daniel Durstewitz

机构 * Central Institute of Mental Health, Mannheim, Germany(德国曼海姆中央精神卫生研究所) Interdisciplinary Center for Scientific Computing (IWR), Heidelberg, Germany(德国海德堡跨学科科学计算中心 (IWR)) Faculty of Physics and Astronomy, Heidelberg University, Heidelberg, Germany(德国海德堡大学物理与天文学系)

专题命中 领域大模型 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对动态系统零样本重建基础模型缺乏预测机制洞察的问题,将DynaMix简化为DynaBase,其通过简单线性混合预测,参数负载低,表现出色,还得出映射族及不同训练策略效果,揭示最小机制并协调文献观察。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12048 2026-07-15 cs.CV cs.AI cs.CL 新提交 62%

An Empirical Analysis of Continual Learning for Heterogeneous Medical Visual Question Answering

异构医学视觉问答持续学习的实证分析

Mai A. Shaaban, Tausifa Jan Saleem, Alaa Mohamed, Dilnaz Utemissova, Ufaq Khan, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Alexandria University(亚历山大大学)

专题命中 领域大模型 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究异构医学视觉问答持续学习,通过系统评估多种临床目标任务,探究现有CL方法减轻灾难性遗忘能力、对任务排序敏感性及低秩适应参数演变,发现交错不同任务时现有方法难维持稳定性 - 可塑性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07401 2026-07-09 cs.CV cs.AI cs.LG 新提交 62%

Heterogeneity-Adaptive Diffusion Schrodinger Bridge for PET-Guided Whole-Body MRI Translation

用于PET引导的全身MRI转换的异质性自适应扩散薛定谔桥

Chengbo Wang, Jiacheng Yu, Linjie Bian, Ming Qi, Xiaosheng Liu, Tongtong Che, Jichang Zhang, Shuyu Li, Shaoli Song, Xiuying Wang

机构 * The University of Sydney(悉尼大学) Fudan University Shanghai Cancer Center(复旦大学附属上海肿瘤医院) Beijing Normal University(北京师范大学)

专题命中 领域大模型 :language model(abstract);分类 cs.AI、cs.LG

AI总结 针对PET-MR扫描时间长的问题,提出异质性自适应扩散薛定谔桥(HA-DSB)框架,通过整合视觉语言模型嵌入及PET先验,利用双阶段引导机制,实现全身MRI转换,提升不同区域尤其是病变区域的转换质量。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05937 2026-07-08 cs.CL cs.LG 新提交 62%

Is Domain Adaptation Always Helpful? A Frozen-Backbone Study of Cross-Domain Sentiment Transfer

域适应总是有帮助吗?跨域情感转移的冻结主干研究

Phat Tran, Artin Lahni, Pranav Kulkarni, Yaolun Zhang

机构 * Oregon State University(俄勒冈州立大学)

专题命中 领域大模型 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨使用冻结预训练语言模型主干时显式域适应的效果,通过训练轻量级MLP适配器并评估向不同领域转移,发现域适应效果因主干对目标域覆盖情况而异,对抗对齐对域专用主干有负面影响,监督对比损失有积极作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25147 2026-06-25 cs.IR cs.AI cs.LG 新提交 62%

TokenMinds: Pretrained User Tokens and Embeddings for User Understanding in Large Recommender Systems

TokenMinds: 用于大型推荐系统中用户理解的预训练用户令牌和嵌入

Qingyun Liu, Bo Yan, Yang Liu, Yuji Roh, Ekansh Sharma, Likang Yin, Emma Olowo, Min-hsuan Tsai, Yuxuan Li, Diego Uribe, Saksham Aggarwal, Siqi Wu, Yuan Hao, Vikas Kedigehalli, Lukasz Heldt, Lichan Hong, Li Wei, Xinyang Yi

机构 * Google DeepMind(谷歌DeepMind)

专题命中 领域大模型 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 提出TokenMinds系统,通过编码器-解码器架构生成基于语义ID的离散用户令牌和稠密嵌入,实现互补优势,并在YouTube全流量部署验证其工业可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24014 2026-06-24 cs.AI cs.CL 新提交 62%

Reinforcement Learning Towards Broadly and Persistently Beneficial Models

强化学习迈向广泛且持久有益的模型

Akshay V. Jagadeesh, Rahul K. Arora, Khaled Saab, Ali Malik, Mikhail Trofimov, Foivos Tsimpourlas, Johannes Heidecke, Karan Singhal

机构 * OpenAI

专题命中 领域大模型 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 通过真实领域中的有益行为强化学习,模型在超过80%的分布外基准上表现提升,并展现出跨领域对齐泛化与对抗攻击的持久性。

Comments Blog: https://alignment.openai.com/beneficial-rl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20913 2026-06-23 cs.CV cs.AI cs.LG 新提交 62%

PROTON: Prototype-Based Test-Time Online OOD Detection for Medical VLMs

PROTON: 基于原型的测试时在线OOD检测方法用于医学视觉语言模型

Abhijit Das, Nichula Wasalathilaka, Yifan Lu, Adinath Dukre, Dwarikanath Mahapatra, Shadab Khan, Imran Razzak

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) University of Peradeniya(佩拉德尼亚大学) Khalifa University(哈利法大学) ADIA Lab(阿布扎比投资局实验室) MedOS

专题命中 领域大模型 :language model(abstract);分类 cs.AI、cs.LG

AI总结 针对医学视觉语言模型在部署时难以检测分布外输入的问题,提出PROTON方法,通过在线原型库和自适应融合原型距离与最大概念匹配得分,无需修改模型或训练数据,在多个OOD场景下提升检测性能。

Journal ref 29th International Conference on Medical Image Computing and Computer Assisted Intervention 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10216 2026-06-10 cs.LG cs.AI 新提交 62%

A Source Domain is All You Need: Source-Only Cross-OS Transfer Learning for APT Anomaly Detection via Semantic Alignment and Optimal Transport

一个源域足矣:基于语义对齐和最优传输的仅源域跨操作系统APT异常检测迁移学习

Sidahmed Benabderrahmanea, Petko Valtchev, James Cheney, Talal Rahwan

机构 * New York University, NYUAD, Division of Science, Computer Science Department(纽约大学,NYUAD,科学学院,计算机科学系) University of Quebec in Montreal, Computer Science Department, Montreal(魁北克大学蒙特利尔分校,计算机科学系,蒙特利尔) University of Edinburgh, School of Informatics, Edinburgh(爱丁堡大学,信息学院,爱丁堡)

专题命中 领域大模型 :language model(abstract);分类 cs.AI、cs.LG

AI总结 针对跨操作系统APT检测中目标域无标签的挑战,提出基于最优传输的仅源域异常评分框架,通过语义抽象和三种偏差通道实现零目标监督下的异常排序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10194 2026-06-10 cs.LG cs.AI 新提交 62%

MMClima: A Framework for Multimodal Climate Science Data and Evaluation

MMClima:多模态气候科学数据与评估框架

Muhammad Umer Sheikh, Hassan Abid, Khawar Shehzad, Ufaq Khan, Muhammad Haris Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Missouri(密苏里大学)

专题命中 领域大模型 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出MMClima,一个包含10万+专家验证问答对的多模态气候问答框架,覆盖文本、视频和图表,用于评估多模态语言模型在气候科学中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07865 2026-06-09 cs.LG cs.AI physics.comp-ph stat.ML 新提交 62%

Instrumented data for causal scientific machine learning

因果科学机器学习的仪器化数据

Daniel N. Wilke

机构 * University of the Witwatersrand(威特沃特斯兰德大学)

专题命中 领域大模型 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出仪器化数据作为观测数据和模板合成数据之外的第三种选择,每个数据点携带产生它的机制模型、显式不确定性及可执行的反事实族,通过V&V仪器化图像到模拟管道实现,支持因果干预。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07568 2026-06-09 cs.HC cs.AI cs.CV cs.LG physics.data-an 新提交 62%

A Systematic Study of Behavioral Cloning for Scientific Data Annotation

行为克隆在科学数据标注中的系统研究

Ishaan Singh Chandok, Core Francisco Park

专题命中 领域大模型 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 针对科学数据标注中人工验证校正耗时问题,提出行为克隆框架,通过9个合成任务模拟专家策略,发现模型层次化技能习得、多任务预训练高效微调、内部表示共享错误模式等关键结论。

Comments ICML 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24838 2026-07-29 cs.IR cs.AI 新提交 61%

MedJudgeRAG: Option-Wise Evidence Judgment with Dynamic Knowledge Graphs for Medical MCQA

MedJudgeRAG:用于医学多项选择题问答的基于动态知识图谱的选项级证据判断

Seongwon Seo, Seung Hwan Cho, Young-Min Kim

专题命中 领域大模型 :language model(abstract);分类 cs.AI;foundation model(comments)

AI总结 针对医学MCQA中普通RAG降低LM性能的问题,提出MedJudgeRAG框架,将检索文档表示为动态知识图谱,为选项判断证据裁决并确定知识利用策略,经监督微调训练,实验证明其性能优于基线,且动态知识图谱在训练时作用更有效。

Comments 16 pages, 2 figures, Accepted at The Workshop on Graph Foundation Models at the 43 rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20777 2026-08-24 cs.CL 新提交 57%

Tree-of-Concerns: Hierarchical Multi-Agent Debate for Unstated-Limitation Extraction in Scientific Critique

关注点树:面向科学评论中未陈述局限性提取的分层多智能体辩论

Sahil Mishra, Niranjan Rajeev, Tanmoy Chakraborty

机构 * IIT Delhi(印度理工学院德里分校)

专题命中 领域大模型 :LLM(abstract_cn);分类 cs.CL

AI总结 针对科学论文未陈述局限性提取的需求,本文提出Tree-of-Concerns多智能体框架,经ToC-Bench实验验证,其较最强基线提升79%准确率与11%覆盖度,可辅助审稿人开展系统性评估。

Comments Accepted in the Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20768 2026-08-24 cs.AI 新提交 57%

Beyond Endpoint Gains: A Weight-Delta Audit of Medical Specialization

超越端点增益:医学专业化的权重增量审计

Praphul Singh, Shanu Kumar, Akshat Agarwal

机构 * IIT Kanpur(印度理工学院坎普尔分校) Oracle Health AI(甲骨文健康人工智能公司) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 领域大模型 :language model(abstract);分类 cs.AI

AI总结 本研究提出配对权重增量路径审计方法,应用于两组通用模型到医学专业模型的检查点对,发现解码器更新与医学基准变动相关,但组件定位不清晰,明确审计仅针对纯文本多项选择题基准变动。

Comments Preprint: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20315 2026-08-21 cs.LG 新提交 57%

Explainable Transformer Models for Clinical Prediction Tasks on Structured Electronic Health Records

用于结构化电子健康记录临床预测任务的可解释Transformer模型

Jun Ni Du, Lukas Adamek, Maxim Kryukov, Flavio Dormont, Ziv Bar-Joseph, Sven Jager, Brandon Rufino

机构 * Sanofi(赛诺菲) Carnegie Mellon University(卡内基梅隆大学)

专题命中 领域大模型 :language model(abstract);分类 cs.LG

AI总结 研究针对结构化EHR预测模型的可解释性缺口,提出BERT-LER模型,在EHRShot等任务中性能优于多数基准模型,归因符合临床风险因素,可推广至多领域。

Comments Accepted at MLHC 2026; to appear in Proceedings of Machine Learning Research (PMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19825 2026-08-21 cs.CV cs.CL 新提交 57%

Towards Clinically Faithful Medical Image Captioning via Enhanced Vision-Language Alignment

基于增强型视觉-语言对齐的临床可信医学图像描述生成研究

Yunseo Lee, Hyun Jun Kim, Heeseung Shin, Changwon Lim

机构 * Chung-Ang University(中央大学)

专题命中 领域大模型 :language model(abstract);分类 cs.CL

AI总结 本研究针对医学图像描述生成的临床可信性问题,提出分离训练与推理对齐的框架,结合多编码器、辅助学习及MedPAIR-SCST方法,通过选择与强化学习对齐提升临床一致性,在数据受限场景下改善医学图像描述的可信度。

Comments 10 pages, 2 figures, 7 tables. Preprint submitted to IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18099 2026-08-20 cs.AI q-fin.PM 新提交 57%

FinSkillBench: Evaluating AI Agents and Domain Skills for Investment Management

FinSkillBench:评估用于投资管理的智能体AI与领域技能

Jermyn Zhen Yong Bek, Zhuang Qiang Bok, Zhongtian Sun

机构 * Deep Insight Labs(深洞察实验室) University of Kent(肯特大学) University of Cambridge(剑桥大学)

专题命中 领域大模型 :language model(abstract);分类 cs.AI

AI总结 FinSkillBench是评估投资管理领域AI智能体金融技能的基准,经9个模型的大规模评估发现,精选技能可显著提升性能,而自生成技能益处有限,其成果为该领域研究提供了支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16211 2026-08-18 cs.AI 新提交 57%

BaT: Towards Self-Evolving Medical Research Agent with Stage Rubrics

BaT:构建具备阶段式评分标准的自演化医学研究智能体

Junqi Liu, Yufan He, Yexiao He, Pengfei Guo, Dong Yang, Andriy Myronenko, Can Zhao, Hanrong Ye, Tianhao Qi, Yuyin Zhou, Daguang Xu, Yucheng Tang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) NVIDIA(英伟达)

专题命中 领域大模型 :post-training(abstract);分类 cs.AI

AI总结 本文提出BaT系统,结合Stage Bank与BiCuRL方法,使医学研究智能体在AutoMedBench-Lite上得分大幅提升,BaT-9B性能优于Claude Opus 4.6。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15270 2026-08-18 cs.CL 新提交 57%

Time as Structure: Temporal Dependency Graphs for Verifiable Deadline Computation over Legal Documents

作为结构的时间:用于法律文件上可验证截止日期计算的时间依赖图

Maryia Zhyrko, Lifeng Han, Suzan Verberne

机构 * Leiden Institute of Advanced Computer Science (LIACS)(莱顿高级计算机科学研究所(LIACS)) Leiden University(莱顿大学)

专题命中 领域大模型 :language model(abstract);分类 cs.CL

AI总结 该研究针对法律文件截止日期计算问题,提出时间依赖图结合日历引擎的方法,在英国就业上诉法庭案件中表现优于语言模型,正确率达90.2%,可用于可验证的法律截止日期计算。

Comments 13 pages, 2 figures, 5 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14407 2026-08-17 cs.AI 新提交 57%

The Past and Future of AI Scientists

AI科学家的过去与未来

Ross D. King

专题命中 领域大模型 :foundation model(abstract);分类 cs.AI

AI总结 本文综述AI科学家的过去与未来,指出其核心挑战是多技术集成,现有技术已支持构建更通用系统,其有望变革科学,诺贝尔图灵挑战目标进展超前。

详情

展开后加载摘要…

URL PDF HTML 收藏