arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 925 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 925 篇

2607.07915 2026-07-10 cs.CY cs.CL 新提交 77%

Validating LLMs in social science: Epistemic threats and emerging norms

在社会科学中验证大语言模型:认知威胁与新兴规范

Meera Desai, Dallas Card, Abigail Z. Jacobs

机构 * School of Information, University of Michigan(信息学院,密歇根大学) Center for the Study of Complex Systems, University of Michigan(复杂系统研究中心,密歇根大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨大语言模型对社会科学方法论的重塑,通过分析八本旗舰期刊论文语料库,发现其生成测量在实证分析中核心作用凸显,但验证实践存问题,进而概述补充策略以完善大语言模型在社会科学应用的规范标准。

Comments 28 pages, 2 figures. Main text: 11 pages, Appendix: 11 pages, References: 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04907 2026-07-07 cs.AI 新提交 77%

Medi-Gemma: A Hybrid Clinical Decision Support System Integrating Deterministic EMR Analytics and Retrieval-Augmented Generation

Medi-Gemma:一种集成确定性电子病历分析与检索增强生成的混合临床决策支持系统

Mohammed Saim Ahmed Quadri, Yunzhe Xue, Justin W. Ady, Usman Roshan

机构 * New Jersey Institute of Technology(新泽西理工学院) Robert Wood Johnson Hospital(罗伯特·伍德·约翰逊医院)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 介绍用于伤口病理分类和工作流程自动化的临床决策支持系统Medi-Gemma,其采用解耦框架,经多阶段管道处理数据请求,关键贡献是地面真值注入模块,验证表明该架构有诸多优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01960 2026-07-03 cs.CL 新提交 77%

NAVER LABS Europe Submission to the Instruction-following 2026 Short Track

NAVER LABS Europe 对指令遵循 2026 短轨道的提交

Marcely Zanon Boito, Hemant Yadav, Jean-Luc Meunier, Ioan Calapodescu

机构 * NAVER LABS Europe IIIT Delhi(印度德里国际信息技术学院)

专题命中 领域大模型 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL

AI总结 提出SpeechMapper语音投影器和合成SQA数据集fakACL,在更紧凑模型上实现ASR、ST和SQA联合处理,获得IWSLT 2026短轨道并列第一。

Comments IWSLT 2026 system paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01440 2026-07-03 cs.CL 新提交 77%

FaithMed: Training LLMs For Faithful Evidence-Based Medical Reasoning

FaithMed: 训练大语言模型进行忠实于证据的医学推理

Zhiyun Zhang, Liwen Sun, Xiang Qian, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University School of Medicine(斯坦福大学医学院) Xlue

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 提出FaithMed框架,通过过程级奖励和优势分组强化学习,监督LLM在医学推理中忠实评估和应用检索证据,在7个基准上平均提升9%。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25651 2026-06-29 cs.CL 新提交 77%

MedGuards: Multi-Agent System for Reliable Medical Error Detection and Correction

MedGuards: 用于可靠医疗错误检测与纠正的多智能体系统

Congbo Ma, Hu Wang, Yichun Zhang, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) Khalifa University(哈利法大学) New York University(纽约大学)

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出MedGuards框架,通过多智能体上下文学习与置信度引导仲裁机制,无需额外训练即可检测、定位和纠正医疗文本错误,并引入关键词优先纠正评分(KPCS)评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23165 2026-06-23 cs.IR cs.CL 新提交 77%

The Language Blind Spot: How Query Language and Brand Recognition Tier Shape AI-Constructed Brand Reputation Across Twelve European Languages

语言盲点:查询语言与品牌识别层级如何塑造跨十二种欧洲语言的AI构建品牌声誉

Dmitrij Żatuchin

机构 * Estonian Entrepreneurship University of Applied Sciences (EUAS)(爱沙尼亚应用科学创业大学)

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过查询三种大语言模型对66个品牌在12种语言中的表现,发现AI构建的品牌声誉存在语言依赖性,且查询语言对本地品牌的推荐影响远大于对全球品牌的影响,表明仅用英语监测存在语言盲点。

Comments 17 pages, 3 figures. Data and analysis code on Zenodo, https://doi.org/10.5281/zenodo.20794390

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19950 2026-06-19 cs.CV cs.AI 新提交 77%

Confidence Calibration for Multimodal LLMs: An Empirical Study through Medical VQA

多模态大语言模型的置信度校准:基于医学视觉问答的实证研究

Yuetian Du, Yucheng Wang, Ming Kong, Tian Liang, Qiang Long, Bingdi Chen, Qiang Zhu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Zhihui Medical Technology (Shanghai) Co., Ltd.(智汇医疗科技(上海)有限公司)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多模态大语言模型在医学任务中置信度与准确性不匹配的问题,提出结合多策略融合询问与专家大语言模型评估的方法,在三个医学VQA数据集上将期望校准误差平均降低40%,提升了模型可靠性。

Comments Accepted by MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18897 2026-06-18 cs.IR cs.AI 新提交 77%

SAERec: Constructing Fine-grained Interpretable Intents Priors via Sparse Autoencoders for Recommendation

SAERec:通过稀疏自编码器为推荐构建细粒度可解释意图先验

Jiangnan Xia, Xuansheng Wu, Yu Yang, Xin Wang, Ninghao Liu

机构 * University of Georgia(佐治亚大学) Shanghai AI Laboratory(上海人工智能实验室) The Education University of Hong Kong(香港教育大学) Jilin University(吉林大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SAERec模型,利用稀疏自编码器从大型语言模型文本嵌入中解耦出细粒度可解释意图,作为先验指导推荐,并通过多分支注意力机制融合个人与公共意图,提升推荐性能与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16710 2026-06-16 cs.MA cs.CL 新提交 77%

Misinformation Propagation in Benign Multi-Agent Systems

良性多智能体系统中的错误信息传播

Jonas Becker, Jan Philip Wahle, Terry Ruas, Bela Gipp

机构 * University of Göttingen, Germany(德国哥廷根大学) LKA NRW, Germany(德国北莱茵-威斯特法伦州警署) Shared last authorship(共同通讯作者)

专题命中 领域大模型 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 研究在良性多智能体系统中,基于意图的错误信息如何通过智能体交互传播,并发现多智能体辩论相比单智能体提示能减少性能下降,鲁棒性取决于群体组成和决策协议。

Comments 20 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10125 2026-06-10 stat.ML cs.DB cs.LG 新提交 77%

Robust Active Learning for Few-Shot Example Selection in Text-to-SQL

鲁棒主动学习用于文本到SQL中的少样本示例选择

Arash Pourhabib

机构 * NVIDIA

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对文本到SQL中少样本示例选择,提出一种鲁棒主动学习方法,通过分层贪婪算法最大化异方差互信息目标,在嵌入流形上实现常数因子近似保证,显著减少标注成本。

Comments 31 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20557 2026-07-24 cs.LG cs.AI 新提交 76%

Monkey King Bang: A Unified Scientific Multimodal Foundation Model

孙悟空爆炸:一个统一的科学多模态基础模型

Hesen Chen, Xinyu Su, Xiaomeng Yang, Yuetan Lin, Zixiong Yang, Junyi An, Fenglei Cao, Yifeng Jiao, Yunqi Zhang, Yuan Cheng, Zhiyu Tan, Hao Li, Libo Wu, Yuan Qi

机构 * Shanghai Academy of AI for Science(上海人工智能研究院)

专题命中 领域大模型 :foundation model(title);分类 cs.AI、cs.LG

AI总结 研究针对科学多领域推理需求,引入统一科学多模态模型MKB,围绕共享Transformer主干及定制组件构建,涵盖多科学分支。通过两阶段训练,在多方面实验表现出色,证明该范式可行,为跨领域科学多模态探索提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03882 2026-07-13 cs.CL cs.AI 新提交 76%

Consistent but Miscalibrated: Evaluating LLM Limitations for Risk Communication in Natural Language

一致但校准错误:评估大语言模型在自然语言风险沟通中的局限性

Diego Cerda-Mardini, Sarath Chandar, Sreenath Madathil

机构 * Faculty of Dental Medicine and Oral Health Sciences, McGill University(麦吉尔大学牙医学与口腔健康科学学院) Chandar Research Lab, Polytechnique Montréal(蒙特利尔理工大学钱达尔研究实验室) Mila – Québec Artificial Intelligence Institute(魁北克人工智能研究所米拉) Département de Génie Informatique et Génie Logiciel (GIGL), Polytechnique Montréal(蒙特利尔理工大学计算机科学与软件工程系)

专题命中 领域大模型 :LLM(title);分类 cs.CL、cs.AI

AI总结 研究大语言模型在自然语言中传达概率信息的可靠性,在两阶段预测管道中评估九个模型,发现其一致但校准错误,提供预计算统计量未解决问题,表明当前模型非可靠零样本风险沟通工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17987 2026-08-19 cs.SI cs.AI cs.CL cs.LG 新提交 75%

Against Political Polarization: A Unified Framework for Tracing Evolving Political Ideologies on Social Media

对抗政治极化:一种用于追踪社交媒体上不断演变的政治意识形态的统一框架

Yijie Xu, Chao Wang, Hui Xiong

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对社交媒体政治意识形态追踪的挑战,提出TSN4PI框架,含PIDN和PIPN模块,发布两个大规模数据集,经多平台案例研究验证其有效性,助力政治极化研究

Comments Accepted by ACM Transactions on Intelligent Systems and Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14128 2026-08-17 cs.SE 新提交 75%

DepWareTrans: Dependency-Aware Incremental Repository Migration across Co-executable Languages

DepWareTrans:跨可共执行语言的依赖感知增量仓库迁移

Sivajeet Chand, Alexander Pretschner, Steve Haupt, Derui Zhu, Sushant Kumar Pandey

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出依赖感知增量迁移框架,构建依赖图分组文件进行批量翻译,在 STAR 仓库等上实现 100% 编译和测试成功率,提升仓库级代码翻译的可扩展性与可靠性。

Comments Accepted for publication in the Industry Showcase Track of the 41st IEEE/ACM International Conference on Automated Software Engineering, which will take place in Munich, Germany during October 12-16, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09080 2026-08-11 cs.CL cs.AI cs.HC cs.LG 新提交 75%

When Confidence Fails: Overconfidence in LLMs under Uncertainty and Missing Clinical Information

当置信度失效:不确定性与临床信息缺失下大语言模型的过度自信

Maryam Tahermazandarani, Adnan Mahmood, Fahmida Islam, Quan Z. Sheng

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文针对临床信息不确定性下的LLMs开展行为分析,提出基于MedMCQA的评估框架,发现模型置信度与准确率不匹配、弃权能力差异大等关键局限,凸显需采用不确定性感知评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25489 2026-07-29 cs.CV 新提交 75%

Agentic AI in medicine: architectures, applications, evaluation, and challenges for clinical translation

医学中的智能体人工智能:临床转化的架构、应用、评估及挑战

Zheng Tong, Yang Liu, Wanshu Fan, Jing Qin, Zhongbin Han, Haifan Gong, Congyu Liao, Xiaofeng Liu, Cong Wang

机构 * School of Software Engineering, Dalian University(大连大学软件工程学院) Affiliated Zhongshan Hospital of Dalian University(大连大学附属中山医院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of California, San Francisco(加州大学旧金山分校) Yale University(耶鲁大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 研究探讨医学中智能体人工智能的架构、应用等,通过范围审查筛选相关研究,指出其范围未定论且评估与临床需求不符,证据基础有限,临床转化需更清晰定义、可重复评估等。

Comments Review article, 6 figures, 2 tables. 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23313 2026-07-28 econ.GN q-fin.EC 新提交 75%

Agentic AI Orchestration of Heterogeneous Economic Models for Rapid, Multi-scenario Analysis of Energy Crises

用于能源危机快速多场景分析的异构经济模型的智能人工智能编排

Dana Golden, Brett Indelicato, Lav R. Varshney, Carlos D. Messina, Suzanne Thornsbury

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对能源危机下政策制定者需快速决策但经济模型整合困难的问题,利用大语言模型开发框架,协调多个异构经济模型,通过构建场景、转化输入、执行模型和合成输出,快速评估霍尔木兹海峡关闭等情况,避免单一模型假设主导结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20453 2026-07-24 cs.CL cs.AI cs.LG 新提交 75%

A Knowledge-Injection Framework for Zero-Shot Adaptation of LLMs to Delirium Prediction

一种用于将大语言模型零样本适应谵妄预测的知识注入框架

Jessica Sena, Shesadree Priyadarshani, Miguel Contreras, Bharat Gandhi, Scott Siegel, Subhash Nerella, Parisa Rashidi

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大语言模型零样本适应谵妄预测中领域知识不足问题,提出轻量级知识注入框架。在推理时用外部临床知识报告增强数据摘要,无需微调或检索。实验表明该方法能提升模型性能,缩小与前沿模型差距,且收益依赖临床意义内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19822 2026-07-23 eess.SP 新提交 75%

WARA: A Closed-Loop Multi-Agent Framework for Wireless Optimization Autoresearch

WARA:用于无线优化自动研究的闭环多智能体框架

Yuan Guo, Yilong Chen, Chao Hu, Xianghao Yu, Liang Hong, Jie Xu

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文针对无线领域提出端到端自动研究框架WARA,通过闭环多智能体系统将研究工作流程分三个阶段,经工件介导过程和控制器管理验证工件,设计评分智能体评估有效性,其性能优于一次性大语言模型生成,接近同行评审论文质量。

Comments 2026 IEEE/CIC International Conference on Communications in China (ICCC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17839 2026-07-21 cs.RO 新提交 75%

Receiver-Centered Robot-to-Human Handover with Grasp-Aware Object Orientation

基于抓握感知物体方向的以接收者为中心的机器人到人类工具交接

Federico Biagi, Dario Onfiani, Simone Silenzi, Luigi Biagiotti

机构 * University of Modena and Reggio Emilia(摩德纳大学和雷焦艾米利亚大学)

专题命中 领域大模型 :LLM(summary_cn,abstract)

AI总结 研究针对协作机器人与人类操作员工具交接问题,提出以接收者为中心、语音驱动的自适应交接系统,基于Franka cobot,用LLM识别意图、MediaPipe跟踪手部,动态调整末端执行器方向,经实验验证该系统能减少抓握延迟,提升交互流畅性与信任感知。

Comments Accepted for presentation at the 19th International Workshop on Human-Friendly Robotics (HFR 2026), Trento, Italy. The paper will appear in Springer's Proceedings in Advanced Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16569 2026-07-21 cs.SE 新提交 75%

From Discussion to Execution: Replicating Buggy and Correct Data Science Code

从讨论到执行:复制有缺陷和正确的数据科学代码

Ragib Shahariar Ayon, Mohammad Wardat, Shibbir Ahmed

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究旨在解决从问答论坛复制数据科学代码的难题,提出基于大语言模型的Reprodgen框架,能根据问题与答案生成可执行代码对,经多库评估及构建基准验证,实现可靠复制且模型性能有差异。

Comments accepted at the 37th IEEE International Symposium on Software Reliability Engineering (ISSRE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15608 2026-07-20 cs.HC 新提交 75%

Visualization Autocomplete: Visualization Authoring via Stepwise Design Recommendations

可视化自动完成:通过逐步设计建议进行可视化创作

Hyeon Jeon, Sungbok Shin, Niklas Elmqvist

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对领域专家创建图表时确定设计下一步的难题,提出VISAUTOCOMPLETE系统,受文本自动完成启发,按顺序过程推荐步骤,用户可干预。提炼大语言模型逻辑,经评估在复杂图表创作清晰度上超基线,可接近性与大语言模型相当。

Comments IEEE VIS 2026 & IEEE Transactions on Visualization and Computer Graphics (TVCG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15246 2026-07-17 cs.CV 新提交 75%

ARMOR++: Agentic Orchestration of a Multi-Domain Primitive Set for Transferable Attacks on Deepfake Detectors

ARMOR++:用于对深度伪造检测器进行可转移攻击的多域原语集的智能编排

Christos Korgialas, Gabriel Lee Jun Rong, Dion Jia Xu Ho, Pai Chet Ng, Xiaoxiao Miao, Konstantinos N. Plataniotis

机构 * Department of Informatics, Aristotle University of Thessaloniki(塞萨洛尼基亚里士多德大学信息学系) Infocomm Technology Cluster, Singapore Institute of Technology(新加坡科技学院信息通信技术集群) Department of Applied Physics and Applied Mathematics, Columbia University(哥伦比亚大学应用物理与应用数学系) Division of Natural and Applied Sciences, Duke Kunshan University(昆山杜克大学自然科学与应用科学部) Department of Electrical and Computer Engineering, University of Toronto(多伦多大学电气与计算机工程系)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对深度伪造检测器在黑盒对抗转移下可靠性下降问题,提出ARMOR++多智能体框架,利用视觉与语言模型提供语义先验并编排原语选择等,整合多种原语有效针对异构偏差,实验表明其性能优于现有基线,凸显当前检测器可靠性差距及智能编排的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14888 2026-07-17 cs.LG cs.AI cs.CL cs.CY 新提交 75%

Innocuous-Seeming Data, Latent Ideology: Ideological Generalisation in Finetuned LLMs

看似无害的数据,潜在的意识形态:微调语言模型中的意识形态泛化

Robert Graham, Edward Stevinson, Yariv Barsheshat

专题命中 领域大模型 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现微调语言模型会引发意识形态泛化,提出衡量广度和放大率的方法,指出少样本提示表明泛化方向,微调会使模型走向极端,该效果能复现且对模型准确率影响小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10711 2026-07-14 cs.HC 新提交 75%

Lottery and Sprint Arcade: Enabling Player-Driven Game Editing with Generative AI

彩票与冲刺街机:通过生成式人工智能实现玩家驱动的游戏编辑

Maya Grace Torii, Takahito Murakami, Yoichi Ochiai

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究通过语音驱动编辑系统让玩家修改复古太空侵略者风格游戏,结合用户研究探讨玩家体验及编辑模式与体验变化的关系,发现语音驱动编辑可支持人机共创,玩家体验积极,编辑有多种策略。

Comments 14 pages, 5 figures, 1 table. Published in The Journal of the Society for Art and Science, Vol. 25, No. 2, 2026

Journal ref The Journal of the Society for Art and Science 25(2) (2026) 12:1-12:14

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08093 2026-07-10 cs.AI cs.CL cs.LG 新提交 75%

CausalDS: Benchmarking Causal Reasoning in Data-Science Agents

因果DS:数据科学智能体中的因果推理基准测试

Andrej Leban, Yuekai Sun

机构 * Department of Statistics University of Michigan(统计学系密歇根大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 介绍用于评估数据科学智能体因果推理的CausalDS基准,由含观测数据的结构因果模型和合成自然语言故事构成场景,导出跨越Pearl三个层级的任务,联合评估符号因果推理、数据科学等多方面能力。

Comments 55 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00924 2026-07-02 cs.AI cond-mat.mtrl-sci cs.CL cs.LG 新提交 75%

Graph-Native Reinforcement Learning Enables Traceable Scientific Hypothesis Generation through Conceptual Recombination

图原生强化学习通过概念重组实现可追溯的科学假设生成

Subhadeep Pal, Shashwat Sourav, Tirthankar Ghosal, Markus J. Buehler

机构 * Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出图原生推理模型Graph-PRefLexOR,结合GRPO强化学习将推理组织为显式阶段,在材料科学100个开放问题上推理可追溯性提升40-65%,语义多样性增加2-3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20663 2026-06-23 cs.AI cs.CL cs.LG 新提交 75%

DrugBench: Evaluating AI Control Protocols for Medication Harm Mitigation

DrugBench:评估用于减轻药物危害的AI控制协议

Guido Freire, Agustín Martínez-Suñé, Viviana Cotik

机构 * Universidad de Buenos Aires, Facultad de Ciencias Exactas y Naturales, Departamento de Computación(布宜诺斯艾利斯大学,精确与自然科学学院,计算机系) AI Safety Argentina (AISAR)(阿根廷人工智能安全组织 (AISAR)) Department of Computer Science, University of Oxford(牛津大学计算机科学系) CONICET-Universidad de Buenos Aires, Instituto de Ciencias de la Computación (ICC)(阿根廷国家科学与技术研究理事会-布宜诺斯艾利斯大学,计算机科学研究所 (ICC))

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出DrugBench基准,结合医疗对话与FDA标签,评估AI控制协议在减轻药物交互、禁忌症等四类危害中的有效性,并引入基于严重性的监控方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20573 2026-06-23 cs.NI cs.MA 新提交 75%

AONA: A Comprehensive Architecture and Workflow Design for Global Agentic Collaboration

AONA:全球智能体协作的综合架构与工作流设计

Jinliang Xu, Runkai Zhu, Bingqi Li, Fanjie Nie, Jin Li, Jiagui Xie

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对现有互联网缺乏语义感知和去中心化信任机制的问题,提出AONA覆盖网络架构,通过四层逻辑蓝图和分布式节点基础设施,实现跨协议、跨平台的智能体互操作。

Comments 28 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16907 2026-08-19 cs.CY cs.AI 新提交 74%

Effective Personalized AI Tutors via LLM-Guided Reinforcement Learning

基于大语言模型引导强化学习的高效个性化AI辅导系统

Angel Tsai-Hsuan Chung, Botong Zhang, Ling-Chieh Kung, Hamsa Bastani, Osbert Bastani

专题命中 领域大模型 :LLM(title);分类 cs.AI

AI总结 本研究设计了集成大语言模型聊天机器人与强化学习算法的个性化AI辅导平台,经十所高中的五个月课程验证,其自适应编排练习题可提升学生Python成绩0.15个标准差,且成绩提升源于参与度提高。

详情

展开后加载摘要…

URL PDF HTML 收藏