arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12705 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 12705 篇

2606.25651 2026-06-29 cs.CL 新提交 77%

MedGuards: Multi-Agent System for Reliable Medical Error Detection and Correction

MedGuards: 用于可靠医疗错误检测与纠正的多智能体系统

Congbo Ma, Hu Wang, Yichun Zhang, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) Khalifa University(哈利法大学) New York University(纽约大学)

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出MedGuards框架,通过多智能体上下文学习与置信度引导仲裁机制,无需额外训练即可检测、定位和纠正医疗文本错误,并引入关键词优先纠正评分(KPCS)评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03247 2026-06-26 cs.CL cs.CY 版本更新 77%

Somatic in the East, Psychological in the West?: Investigating Clinically-Grounded Cross-Cultural Depression Symptom Expression in LLMs

东方躯体化,西方心理化?:探究临床基础下跨文化抑郁症状在LLMs中的表达

Shintaro Sakai, Jisun An, Migyeong Kang, Haewoon Kwak

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校) Sungkyunkwan University(成均馆大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本研究测试大语言模型(LLMs)是否复现西方抑郁患者报告心理症状、东方患者报告躯体症状的文化模式,发现英语提示下模型未能复现,但东方语言提示改善部分对齐,原因在于模型对文化人物敏感性低及症状层级压倒文化线索。

Comments C3NLP workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23165 2026-06-23 cs.IR cs.CL 新提交 77%

The Language Blind Spot: How Query Language and Brand Recognition Tier Shape AI-Constructed Brand Reputation Across Twelve European Languages

语言盲点:查询语言与品牌识别层级如何塑造跨十二种欧洲语言的AI构建品牌声誉

Dmitrij Żatuchin

机构 * Estonian Entrepreneurship University of Applied Sciences (EUAS)(爱沙尼亚应用科学创业大学)

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过查询三种大语言模型对66个品牌在12种语言中的表现,发现AI构建的品牌声誉存在语言依赖性,且查询语言对本地品牌的推荐影响远大于对全球品牌的影响,表明仅用英语监测存在语言盲点。

Comments 17 pages, 3 figures. Data and analysis code on Zenodo, https://doi.org/10.5281/zenodo.20794390

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19950 2026-06-19 cs.CV cs.AI 新提交 77%

Confidence Calibration for Multimodal LLMs: An Empirical Study through Medical VQA

多模态大语言模型的置信度校准:基于医学视觉问答的实证研究

Yuetian Du, Yucheng Wang, Ming Kong, Tian Liang, Qiang Long, Bingdi Chen, Qiang Zhu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Zhihui Medical Technology (Shanghai) Co., Ltd.(智汇医疗科技(上海)有限公司)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多模态大语言模型在医学任务中置信度与准确性不匹配的问题,提出结合多策略融合询问与专家大语言模型评估的方法,在三个医学VQA数据集上将期望校准误差平均降低40%,提升了模型可靠性。

Comments Accepted by MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18897 2026-06-18 cs.IR cs.AI 新提交 77%

SAERec: Constructing Fine-grained Interpretable Intents Priors via Sparse Autoencoders for Recommendation

SAERec:通过稀疏自编码器为推荐构建细粒度可解释意图先验

Jiangnan Xia, Xuansheng Wu, Yu Yang, Xin Wang, Ninghao Liu

机构 * University of Georgia(佐治亚大学) Shanghai AI Laboratory(上海人工智能实验室) The Education University of Hong Kong(香港教育大学) Jilin University(吉林大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SAERec模型,利用稀疏自编码器从大型语言模型文本嵌入中解耦出细粒度可解释意图,作为先验指导推荐,并通过多分支注意力机制融合个人与公共意图,提升推荐性能与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16710 2026-06-16 cs.MA cs.CL 新提交 77%

Misinformation Propagation in Benign Multi-Agent Systems

良性多智能体系统中的错误信息传播

Jonas Becker, Jan Philip Wahle, Terry Ruas, Bela Gipp

机构 * University of Göttingen, Germany(德国哥廷根大学) LKA NRW, Germany(德国北莱茵-威斯特法伦州警署) Shared last authorship(共同通讯作者)

专题命中 领域大模型 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 研究在良性多智能体系统中,基于意图的错误信息如何通过智能体交互传播,并发现多智能体辩论相比单智能体提示能减少性能下降,鲁棒性取决于群体组成和决策协议。

Comments 20 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01131 2026-06-16 cs.MA cs.AI 版本更新 77%

MedCollab: IBIS-Guided Multi-Agent Collaboration with Hierarchical Disease Relation Chains for Clinical Diagnosis

MedCollab:基于IBIS引导的多智能体协作与分层疾病关系链的临床诊断

Yuqi Zhan, Xinyue Wu, Tianyu Lin, Yutong Bao, Xiaoyu Wang, Weihao Cheng, Huangwei Chen, Feiwei Qin, Zhu Zhu

机构 * Princeton University(普林斯顿大学) Springer Heidelberg(斯普林格海德堡) ABC Institute(ABC研究所) Rupert-Karls-University Heidelberg(海德堡鲁珀特-卡尔大学) Hangzhou Dianzi University(杭州电子科技大学) Zhejiang University(浙江大学) Children’s Hospital, Zhejiang University School of Medicine, National Clinical Research Center for Children and Adolescents’ Health and Diseases(浙江大学医学院儿童医院,国家儿童青少年健康与疾病临床研究中心)

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MedCollab框架,通过IBIS结构化论证和分层疾病关系链(HDRC)增强多智能体协作,提升临床诊断的准确性、可追溯性和报告质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10125 2026-06-10 stat.ML cs.DB cs.LG 新提交 77%

Robust Active Learning for Few-Shot Example Selection in Text-to-SQL

鲁棒主动学习用于文本到SQL中的少样本示例选择

Arash Pourhabib

机构 * NVIDIA

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对文本到SQL中少样本示例选择,提出一种鲁棒主动学习方法,通过分层贪婪算法最大化异方差互信息目标,在嵌入流形上实现常数因子近似保证,显著减少标注成本。

Comments 31 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04550 2026-06-08 cs.IR cs.AI cs.SI 交叉投稿 77%

Trading Engagement for Sustainability: Carbon-Aware Re-ranking for E-commerce Recommendations

用参与度换取可持续性:面向电子商务推荐中碳感知的重排序

Noah Lund Syrdal, Anders Vestrum, Jorgen Bergh

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 领域大模型 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 本文提出一种碳感知重排序策略,通过检索增强的碳足迹估计管道推断缺失的产品碳足迹标签,并在三个推荐模型上权衡用户参与度与碳排放,实现可持续推荐。

Comments 23 pages, 30 figures. Code available at https://github.com/andersvestrum/carbon-aware-recsys

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17004 2026-06-08 cs.MA cs.AI 版本更新 77%

ReclAIm: A Multi-Agent Framework for Monitoring and Correcting Performance Decline in Medical Imaging AI

ReclAIm:用于监测和纠正医学影像AI性能下降的多智能体框架

Eleftherios Tzanis, Michail E. Klontzas

机构 * Artificial Intelligence and Translational Imaging (ATI) Lab, Department of Radiology, School of Medicine, University of Crete(人工智能与转化成像实验室,放射科,医学院,希腊克里特大学) Computational Biomedicine Laboratory, Institute of Computer Science Foundation for Research and Technology Hellas (ICS - FORTH), Heraklion, Crete, Greece(计算生物医学实验室,希腊基础研究与技术院计算机科学研究所(ICS - FORTH),克里特,希腊) Division of Radiology, Department of Clinical Science, Intervention and Technology (CLINTEC), Karolinska Institute, Huddinge, Sweden(放射科,临床科学、干预与技术部(CLINTEC),卡罗林斯卡研究所,瑞典Huddinge)

专题命中 领域大模型 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 提出基于大语言模型的多智能体框架ReclAIm,通过自然语言交互自动监测医学图像分类模型性能下降并触发微调,采用数据增强、类别不平衡处理和参数锚定正则化策略,在多个数据集上验证了有效性。

Comments Published in Radiology: Artificial Intelligence (https://doi.org/10.1148/ryai.250923)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00282 2026-06-02 cs.IR cs.AI 77%

Synthetic Data from Cross-Domain Events for Large-Scale Recommendation Systems

跨域事件的合成数据用于大规模推荐系统

Xiangyu Wang, Yawen He, Shivendra Pratap Singh, Han Huang, Mengtong Hu, Sharath Ciddu, Yi-Hsuan Hsieh, Erik Groving, Yi Ding, Jieming Di, Tony Wang, Min Yun, Xiaoyu Chen, Ling Leng, Rob Malkin

机构 * Meta

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SCALR框架,通过源域事件生成目标域的合成用户-物品交互事件,以缓解数据稀疏和噪声反馈问题,并在工业推荐平台的在线A/B测试中取得显著改进。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00005 2026-06-02 cs.AI 77%

Emergent Collaborative Deliberation in Multi-Model AI Systems: A BFT-Derived Protocol for Epistemic Synthesis

多模型AI系统中的涌现协作审议:一种源自BFT的认知综合协议

VD Doske

机构 * Independent Researcher(独立研究者) Consilia

专题命中 领域大模型 :RLHF(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出Consilium协议,一种基于拜占庭容错的多模型AI审议架构,将模型间分歧视为认知信号而非错误,通过认知角色分配和样本内外验证框架,实现低成本下与前沿模型相当的认知综合能力。

Comments 32 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05671 2026-06-02 cs.CL 77%

ClinTutor-R1: Advancing Scalable and Robust One-to-Many Alignment in Clinical Socratic Education

ClinTutor-R1:在临床苏格拉底式教育中推进可扩展且稳健的一对多对齐

Zhitao He, Haolin Yang, Zeyu Qin, Yi R Fung

机构 * Hong Kong University of Science and Technology(香港理工大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);language agent(abstract);分类 cs.CL

AI总结 针对临床查房等一对多教学场景中上下文稀释与目标错位问题,提出基于多智能体模拟器ClinEdu构建的苏格拉底式教学数据集ClinTeach,并开发首个显式内部思维机制的一对多对齐视觉语言智能体ClinTutor-R1,通过建模个体信念状态与群体共识,在静态基准、交互评估、专家评审及200人真实用户研究中超越基线模型20%以上,达到与专有模型相当的性能,并展现出随学生规模扩展的教学质量可扩展性。

Comments Accepted by ICML 2026 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30284 2026-05-29 cs.AI 77%

ProjectionBench: Evaluating Scientific Hypothesis Generation in LLMs Under Progressive Information Disclosure

ProjectionBench: 在渐进信息揭示下评估大语言模型的科学假设生成

A. J. Lew, Y. Cao, M. J. Buehler

机构 * Unreasonable Labs

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ProjectionBench框架,通过渐进式信息揭示评估大语言模型在科学发现中的创新性和推理能力,实验表明GPT-5.4在最小上下文下仍保持0.7 F1分数与真实结论对齐。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27115 2026-05-27 cs.AI 77%

Counteraction-Aware Multi-Teacher On-Policy Distillation for General Capability Recovery with Domain Preservation

基于对抗感知的多教师同策略蒸馏以实现领域保留下的通用能力恢复

Tianlei Chen, Jiao Ou, Ziyuan Liu, Ruiming Tang, Jian Liang, Han Li

机构 * Kuaishou Technology, Beijing, China(快手科技,北京,中国)

专题命中 领域大模型 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 针对多教师同策略蒸馏在提示覆盖不完全时出现的恢复-保留对抗和弱信号平坦化问题,提出CaMOPD方法,通过解耦交替训练和基于差距的样本选择,在保持领域性能的同时有效恢复通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24219 2026-05-27 cs.AI 77%

Beyond Final Answers: Auditing Trajectory-Level Hallucinations in Multi-Agent Industrial Workflows

超越最终答案:多智能体工业工作流中的轨迹级幻觉审计

Harshada Badave, Santosh Borse, Andrea Gomez, Harshitha Narahari, Sara Carter, Vishwa Bhatt, Aishani Rachakonda, Shuxin Lin, Dhaval Patel

机构 * IBM Columbia University(哥伦比亚大学)

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Trajel数据集和评估框架,通过五类幻觉分类法审计多智能体工业工作流中的轨迹级幻觉,发现现有基准忽略的常见失败模式,并证明轨迹感知检测优于标准事后验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20761 2026-05-26 cs.CL 77%

Findings of the Counter Turing Test: AI-Generated Text Detection

反图灵测试的发现:AI生成文本检测

Rajarshi Roy, Gurpreet Singh, Ashhar Aziz, Shashwat Bajpai, Nasrin Imanpour, Shwetangshu Biswas, Kapil Wanaskar, Parth Patwa, Subhankar Ghosh, Shreyas Dixit, Nilesh Ranjan Pal, Vipula Rawte, Ritvik Garimella, Amitava Das, Amit Sheth, Vasu Sharma, Aishwarya Naresh Reganti, Vinija Jain, Aman Chadha

机构 * Kalyani Government Engineering College(卡利尼政府工程学院) IIIT Delhi(德里IIIT) BITS Pilani Hyderabad Campus(比斯汉学院海得拉巴校区) AI Institute, University of South Carolina(南卡罗来纳大学人工智能研究所) IIIT Guwahati(古瓦哈提IIIT) NIT Silchar(西里char理工学院) San José State University(圣何塞州立大学) UCLA(加州大学洛杉矶分校) Washington State University(华盛顿州立大学) Vishwakarma Institute of Information Technology(维斯瓦卡马信息科技学院) Meta AI Amazon AI(亚马逊人工智能) BITS Pilani Goa(比斯汉学院果阿)

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过反图灵测试(CT2)共享任务,评估了AI生成文本检测技术的有效性,发现二分类任务表现优异(F1=1.0000),但模型归因任务更具挑战性(最佳F1=0.9531),并分析了微调Transformer、集成学习等方法的优劣。

Comments Defactify4 @AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29897 2026-05-26 cs.IR cs.AI 77%

UniRank: End-to-End Domain-Specific Reranking of Hybrid Text-Image Candidates

UniRank: 混合文本-图像候选的端到端领域特定重排序

Yupei Yang, Lin Yang, Wanxi Deng, Lin Qu, Shikui Tu, Lei Xu

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 领域大模型 :RLHF(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出UniRank,一种基于视觉语言模型的重排序框架,通过无需模态转换的统一评分和端到端领域适应(包括指令微调和基于强化学习的偏好对齐),在科学文献检索和设计专利搜索中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21180 2026-05-21 cs.LG cs.SE 77%

Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards

用于密集奖励的领域可适应强化学习代码生成

Erfan Aghadavoodi Jolfaei, Daniel Maninger, Abhinav Anand, Mert Tiftikci, Mira Mezini

机构 * Hessian Center for Artificial Intelligence (hessian.AI)(海斯曼人工智能中心) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出了一种领域可适应的强化学习框架,用于改进代码生成的正确性、质量和安全性,通过定制化的执行感知奖励公式和令牌级奖励映射机制,提高了代码生成在不同领域中的适应性和执行效率。

Comments 10 pages, 2 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16280 2026-05-19 cs.CY cs.AI 77%

Beyond Imperfect Alternatives with Rulemapping: A Neuro-Symbolic Case Study on Online Hate Speech

超越不完美替代:基于规则映射的神经符号案例研究:在线仇恨言论

Oskar von Cossel

机构 * Max Planck Institute for Comparative and International Private Law(比较与国际私法Max Planck研究所)

专题命中 领域大模型 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文探讨神经符号方法在在线仇恨言论分类中的应用,通过约束大语言模型以提高法律判断的准确性与可验证性。

Comments Extended version of a paper accepted at ICAIL 2026. 10 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14301 2026-05-15 cs.LG stat.ML 77%

Language-Induced Priors for Domain Adaptation

领域适应中的语言诱导先验

Qiyuan Chen, Jiayu Zhou, Raed Al Kontar

机构 * University of Michigan(密歇根大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出语言诱导先验(LIP)用于领域适应,通过利用目标领域的专家描述,结合预训练大语言模型学习偏好,改进源域选择并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14089 2026-05-15 cs.AI 77%

SkillFlow: Flow-Driven Recursive Skill Evolution for Agentic Orchestration

SkillFlow: 以流程驱动的递归技能进化用于代理编排

Mingda Zhang, Tiesunlong Shen, Haoran Luo, Wenjin Liu, Zikai Xiao, Erik Cambria, Xiaoying Tang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 SkillFlow通过流程驱动的递归技能进化解决代理编排中的策略崩溃、梯度方差高和无指导技能进化问题,实现高效任务编排。

Comments 49 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12016 2026-05-13 cs.AI 77%

LLMs and the ZPD

语言模型与最近发展区

Peter Wallis

机构 * Centre for Policy Modelling(政策建模中心)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨语言模型是否通过分布式表示进行思考,提出应从实践角度理解其'原始思考',并强调互动在人类交流中的核心地位,而非仅是真实理解的补充。

Comments Short paper submitted to Interspeech 2026 (Desk Reject) 4 pages, plus references. 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16814 2026-05-13 cs.AI cs.HC 77%

Stable diffusion models reveal a persisting human and AI gap in visual creativity

稳定扩散模型揭示了人类与AI在视觉创造力中的持续性差距

Silvia Rondini, Claudia Alvarez-Martin, Paula Angermair-Barkai, Olivier Penacchio, M. Paz, Matthew Pelowski, Dan Dediu, Antoni Rodriguez-Fornells, Xim Cerda-Company

机构 * Cognition and Brain Plasticity Unit, Bellvitge Biomedical Research Institute(认知与脑可塑性单位,贝尔维希生物医学研究所) Bridging AI and Neuroscience, Computer Vision Center(弥合人工智能与神经科学,计算机视觉中心) Department of Cognition, Development and Educational Psychology, University of Barcelona(认知、发展与教育心理学系,巴塞罗那大学) Vienna Cognitive Science Hub(维也纳认知科学中心) Faculty of Psychology, University of Vienna(心理学系,维也纳大学) Computer Science Department, Universitat Autonoma de Barcelona(计算机科学系,巴塞罗那自治大学) University of Barcelona Institute for Complex Systems (UBICS)(巴塞罗那大学复杂系统研究所) Department of Catalan Philology and General Linguistics, University of Barcelona(加泰罗尼亚语言学与一般语言学系,巴塞罗那大学) Catalan Institution for Research and Advanced Studies (ICREA)(加泰罗尼亚研究与高级科学研究机构(ICREA)) Aix-Marseille University(艾克斯-马赛大学) Institute of Neurosciences (UBNeuro), University of Barcelona(神经科学研究所(UBNeuro),巴塞罗那大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 研究比较了人类参与者与AI图像生成模型在视觉创造力上的表现,发现视觉艺术家最具有创造力,随后是非艺术家,再是受人类启发的生成AI,最后是自我引导的生成AI。人类指导显著提升了生成AI的创造力,但人类与AI评估者在创造力判断上存在显著差异。

Journal ref Advanced Science, 2026, e24142

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08956 2026-05-12 cs.AI 77%

Agentic AI Scientists Are Not Built For Autonomous Scientific Discovery

代理式AI科学家并非为自主科学发现而建

Harshit Bisht, Vinay Kumar, Kevin Maik Jablonka, Mausam, N. M. Anoop Krishnan

机构 * Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(印度理工学院德里人工智能学院) Department of Computer Science and Engineering, Indian Institute of Technology Delhi(印度理工学院德里计算机科学与工程系) Department of Civil and Environmental Engineering, Indian Institute of Technology Delhi(印度理工学院德里土木与环境工程系) Laboratory of Organic and Macromolecular Chemistry (IOMC), Friedrich Schiller University Jena(耶拿弗里德里希·席勒大学有机与大分子化学实验室) Center for Energy and Environmental Chemistry Jena, Friedrich Schiller University Jena(耶拿弗里德里希·席勒大学能源与环境化学中心) Helmholtz Institute for Polymers in Energy Applications Jena (HIPOLE Jena)(耶拿海德堡聚合物能源应用研究所(HIPOLE耶拿))

专题命中 领域大模型 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文指出,尽管代理式AI科学家能作为合作者,但其设计并非为自主科学发现。挑战包括问题选择偏差、实验室知识缺失、输出多样性压缩及缺乏实验反馈,需重新审视基础设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03080 2026-05-08 cs.AI 77%

Beyond Factual Correctness: Mitigating Preference-Inconsistent Explanations in Explainable Recommendation

超越事实正确性:缓解可解释推荐中的偏好不一致解释

Chengkai Wang, Baisong Liu

专题命中 领域大模型 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 本文提出PURE框架,通过选择-生成范式缓解推荐中因偏好不一致导致的解释问题,提升解释可信度与推荐准确性。

Comments The authors have identified an issue in the evaluation protocol in Section 5.1.3. Feature extraction and semantic matching used to compute P-EHR require correction and re-validation, as they may not have been applied consistently across all generated explanations and baselines. This may affect part of the reported quantitative results and analysis, so the authors withdraw this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22382 2026-05-08 cs.LG 77%

Purely Agent-Driven Black-Box Optimization for Biological Design

纯粹的基于代理的黑盒优化用于生物设计

Natalie Maus, Yimeng Zeng, Haydn Thomas Jones, Yining Huang, Gaurav Ng Goel, Alden Rose, Kyurae Kim, Hyun-Su Lee, Marcelo Der Torossian Torres, Fangping Wan, Cesar de la Fuente-Nunez, Mark Yatskar, Osbert Bastani, Jacob R. Gardner

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出PABLO框架,通过基于语言的代理方法在生物设计中实现高效黑盒优化,提升样本效率和目标值,展示其在抗微生物肽优化中的卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27724 2026-05-01 cs.AI 77%

Iterative Multimodal Retrieval-Augmented Generation for Medical Question Answering

迭代多模态检索增强生成用于医疗问答

Xupeng Chen, Binbin Shi, Chenqian Le, Jiaqi Zhang, Kewen Wang, Ran Gong, Jinhan Zhang, Chihang Wang

机构 * New York University, New York, USA(纽约大学) Tsinghua University, Beijing, China(清华大学) Independent Researcher(独立研究者) Chinese Academy of Sciences, Beijing, China(中国科学院)

专题命中 领域大模型 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 MED-VRAG通过多模态检索增强生成框架,利用文档页面图像而非OCR文本进行医疗问答,提升准确率至78.6%,并验证检索和迭代对问答性能的积极影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24262 2026-05-01 cs.LG 77%

Coverage-Aware Web Crawling for Domain-Specific Supplier Discovery via a Web--Knowledge--Web Pipeline

面向领域供应商发现的覆盖感知网络爬虫:通过网络-知识-网络流水线

Yijiashun Qi, Yijiazhen Qi, Tanmay Wagh

机构 * University of Michigan(密歇根大学) The University of Hong Kong(香港大学) Santa Clara University(圣克拉拉大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.LG

AI总结 本文提出网络-知识-网络流水线,通过迭代爬取领域网页、提取知识并引导爬虫,提高中小企业发现的覆盖率和精度,实验显示其在半导体设备制造领域表现优异。

Comments Accepted by 2026 7th International Conference on Computer Information and Big Data Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26394 2026-04-30 cs.CR cs.AI 77%

SecMate: Multi-Agent Adaptive Cybersecurity Troubleshooting with Tri-Context Personalization

SecMate:基于三重上下文个性化多智能体网络安全故障排查

Yair Meidan, Omri Haller, Yulia Moshan, Shahaf David, Dudu Mimran, Yuval Elovici, Asaf Shabtai

机构 * Ben-Gurion University of the Negev(贝加尔-戈里昂大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SecMate通过整合设备、用户和服务特定性,利用轻量级本地诊断工具和隐式技能推断,提升网络安全故障排查的准确性和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏