arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 1216 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 1216 篇

2607.26160 2026-07-30 cs.AI 新提交 70%

GuideSkill: Evolving Executable LLM Agent Skills for Guideline-Grounded Clinical Reasoning

GuideSkill:面向基于指南的临床推理的可执行大语言模型智能体技能演化框架

Lang Cao, Yuhao Shen, Tianyang Luo, Simo Du, Hao Peng, Yue Guo

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出与模型无关的GuideSkill框架,通过可执行技能结合指南流程与病例诊断模式,在多基准和骨干模型上显著提升临床推理性能,技能可靠且实用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01348 2026-07-28 cs.CL cs.LG 版本更新 70%

Does Faithfulness-Guided Alignment Hurt Accuracy? Unlocking Accurate and Faithful Post-Retrieval Reasoning

CRAFT: 通过强化学习进行多跳问答的校准推理与答案忠实轨迹

Yu Liu, Wenxiao Zhang, Diandian Guo, Cong Cao, Fangfang Yuan, Qiang Sun, Yanbing Liu, Jin B. Hong, Zhiyuan Ma

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 CRAFT通过强化学习框架提升多跳问答的推理准确性和答案忠实度,结合确定性奖励和判官奖励,增强推理轨迹的可审计性与语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20478 2026-07-24 cs.SE cs.AI 新提交 70%

Verifier-First Evaluation of Agentic LLMs for Infrastructure-as-Code Generation

用于基础设施即代码生成的智能语言模型的验证优先评估

Mohamed Jouini

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 研究针对自然语言生成基础设施即代码的问题,对七种智能策略在特定基准测试上进行验证优先评估,通过多种方法得出如主动检索提升性能、迭代优化有收敛效果等五个主要发现,为相关研究提供了重要参考。

Comments 26 pages, 3 figures, 17 tables. Benchmark dataset available at https://huggingface.co/datasets/iac-eval-v2/iac-eval-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17963 2026-07-21 cs.AI 新提交 70%

OntoExtend: A Framework for Requirement-driven and Scalable Ontology Extension with LLMs

OntoExtend:一个用于基于需求驱动和可扩展的大语言模型本体扩展框架

Anna Sofia Lippolis, Mohammad Javad Saeedizade, Stefan Schmid, Simon Blattner, Robin Keskisärkkä, Aldo Gangemi, Eva Blomqvist, Andrea Giovanni Nuzzolese

机构 * Linköping University(林雪平大学) University of Bologna(博洛尼亚大学) Bosch(博世公司) ISTC-CNR(意大利国家研究委员会信息科学与技术研究所)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 研究基于需求驱动的本体扩展问题,提出用检索增强生成的OntoExtend框架,通过在相关输入本体和需求上应用该框架,在两个用例的能力问题上评估,结果显示其可作为现实场景中本体扩展起草助手,对问题特异性和建模概要敏感。

Comments Accepted in research track of Semantics 2026: https://2026-eu.semantics.cc/page/accepted_research

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14035 2026-07-16 cs.IR cs.DL 新提交 70%

Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023-2026)

优化生成引擎中的可见性:生成引擎优化的批判性综述(2023 - 2026)

Olivier Martinez

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.IR

AI总结 该研究对2023年11月至2026年有关生成引擎优化的45项研究进行批判性综述,指出其术语等存在异质性。贡献多阶段形式模型等,表明虽有成果但证据有限,未显示技术对有机可发现性等有稳定因果效应。

Comments 18 pages, 8 tables, 1 figure; critical survey of 45 studies; ancillary literature matrix and search protocol included

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01241 2026-07-15 cs.CY cs.AI 版本更新 70%

First, do NOHARM: a medical safety benchmark and randomized study of physician and AI teaming on clinical consultations

首先,不伤害:迈向临床安全的大语言模型

David Wu, Fateme Nateghi Haredasht, Saloni Kumar Maharaj, Priyank Jain, Jessica Tran, Matthew Gwiazdon, Arjun Rustagi, Jenelle Jindal, Jacob M. Koshy, Vinay Kadiyala, Anup Agarwal, Bassman Tappuni, Brianna French, Sirus Jesudasen, Christopher V. Cosgriff, Rebanta Chakraborty, Jillian Caldwell, Susan Ziolkowski, David J. Iberri, Robert Diep, Rahul S. Dalal, Kira L. Newman, Kristin Galetta, J. Carl Pallais, Nancy Wei, Kathleen M. Buchheit, David I. Hong, Vartan Pahalyants, Ernest Y. Lee, Allen Shih, Tamara B. Kaplan, Vishnu Ravi, Sarita Khemani, Thomas A. Buckley, April S. Liang, Daniel Shirvani, Advait Patil, Nicholas Marshall, Kanav Chopra, Joel Koh, Adi Badhwar, Anastasia Perez, Austin J. Schoeffler, Mahbuba Tusty, Chase M. Walton, Liam G. McCoy, David J. H. Wu, Yingjie Weng, Sumant Ranji, Kevin Schulman, Nigam H. Shah, Jason Hom, Arnold Milstein, Arjun K. Manrai, Adam Rodman, Jonathan H. Chen, Ethan Goh

机构 * Harvard Combined Dermatology Program(哈佛联合皮肤科项目) Department of Dermatology, Mass General Brigham(麻省总医院皮肤科) Harvard Medical School(哈佛医学院) Stanford Center for Biomedical Informatics Research(斯坦福生物医学信息学研究中心) Stanford University(斯坦福大学) Division of Hospital Medicine, Department of Medicine, Stanford University School of Medicine(斯坦福大学医学院医院医学科) Department of Medicine, Cambridge Health Alliance(剑桥健康联盟医学科) Beth Israel Deaconess Hospital–Plymouth(贝塞斯达德acons医院-普利茅斯) Department of Medicine, University of California, San Francisco(加州大学旧金山分校医学科) Department of Neurology, Stanford University School of Medicine(斯坦福大学医学院神经科) Department of Medicine, Beth Israel Deaconess Medical Center(贝塞斯达德acons医学中心医学科) Division of Cardiology, Department of Medicine, Cambridge Health Alliance(剑桥健康联盟心脏病科) Department of Cardiovascular Medicine, Summa Health System(Summa健康系统心血管医学科) Division of Allergy, Pulmonary, and Critical Care Medicine, Department of Medicine, University of Wisconsin-Madison(威斯康星大学麦迪逊分校医学科过敏、呼吸科和危重医学科) Division of Pulmonary and Critical Care Medicine, Department of Medicine, Massachusetts General Hospital(麻省总医院呼吸科和危重医学科) Center for Immunology and Inflammatory Diseases, Department of Medicine, Massachusetts General Hospital(麻省总医院免疫和炎症疾病中心) Broad Institute of MIT and Harvard(MIT和哈佛Broad研究所) Division of Pulmonary, Critical Care, and Sleep Medicine, Cambridge Health Alliance(剑桥健康联盟呼吸科、危重医学科和睡眠医学科)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 提出NOHARM基准,包含1100个初级到专科咨询案例,评估28个LLM的医疗建议安全性,发现高达22.6%的案例存在严重危害风险,其中遗漏错误占80%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05055 2026-07-07 cs.AI 新提交 70%

Toward Trustworthy Large Language Model Agents in Healthcare

迈向医疗保健领域值得信赖的大语言模型智能体

Hadi Hasan, Safaa Salman, Adam Tai Abou Dargham, Ammar Mohanna, Ali Chehab

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 针对医疗预约调度瓶颈,提出CareConnect智能体,利用大语言模型函数调用等技术,协调工具支持预约操作,设安全护栏。经评估有高任务完成率、安全合规性及成本效益,能自动化复杂医疗工作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01846 2026-07-03 cs.AI 新提交 70%

CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training

CLAP:领域智能体后训练的闭环训练、评估与发布控制

Fangfei Li, Chenyang Zhao, Long Wang, Feng Tian, Zhiyue Zheng, Lv Guo

机构 * MatrixOrigin(矩阵起源)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 提出CLAP闭环方法,通过数据验证、奖励/KL诊断、离线门控和应用链回放,在制造场景中评估后训练效果,发现仅部分批次提升且存在KL风险,支持集成循环管理。

Comments 6 pages, 1 figure. Accepted to CRAE 2026; to appear in SPIE Proceedings. Best Poster Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30139 2026-07-02 cs.AI 版本更新 70%

Relevance Is Not Permission: Warranted Attention for Value Contributions

相关性并非许可:价值贡献的应有注意

Minwoo Yu, Young-guk Ha

机构 * Smart Computing Laboratory, Department of Computer Science & Engineering, Konkuk University(智能计算实验室,计算机科学与工程系,康肯大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 针对注意力机制中相关项的价值贡献未必成为预测证据的问题,提出Warrant接口,通过学习查询-项许可来调节价值路径,在多个任务上提升主指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14463 2026-06-10 cs.CL 版本更新 70%

An Industrial-Scale Insurance LLM Achieving Verifiable Domain Mastery and Hallucination Control without Competence Trade-offs

一个工业级保险大语言模型,实现可验证的领域掌握与幻觉控制,无能力权衡

Qian Zhu, Xinnan Guo, Jingjing Huo, Jun Li, Pan Liu, Wenyan Yang, Wanqing Xu, Xuan Lin

机构 * Ant Group(蚂蚁集团)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL

AI总结 提出INS-S1保险专用大语言模型,通过可验证数据合成系统和渐进式SFT-RL课程框架,在领域任务上达到SOTA,同时保持通用能力并实现0.6%的低幻觉率。

Comments 21 pages, 12 figures, 17 tables

Journal ref ICLR 2026 Workshop Advances in Financial AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17561 2026-06-08 cs.SE cs.AI cs.MA 版本更新 70%

Automated Root-Cause Subclassification and No-Code Fix Generation for Invalid Bug Reports

自动化无效bug报告的根因子类划分及无代码修复生成

Mahmut Furkan Gon, Emre Dinc, Tevfik Emre Sungur, Eray Tuzun

机构 * Department of Computer Engineering, Bilkent University(计算机工程系,比尔肯特大学)

专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本研究旨在引入一个标准化的根因导向的无效bug报告子类划分体系,并通过实验测试不同方法在无效子类划分和无代码修复生成中的准确性。研究还分析了不同配置在我们创建的黄金标准基准上的表现。

Comments Submitted to IEEE Transactions on Software Engineering (TSE) and currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00644 2026-06-05 cs.AI 70%

ForeSci: Evaluating LLM Agents for Forward-Looking AI Research Judgment

ForeSci: 评估LLM智能体在前瞻性AI研究判断中的能力

Qiuyu Tian, Haojie Yin, Yingce Xia, Youyong Kong, Zequn Liu

机构 * Southeast University(东南大学) Beijing Zhongguancun Academy(北京中关村学院) Duke Kunshan University(杜克昆山大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 提出ForeSci基准,通过时间控制的500个任务评估LLM智能体基于历史证据做出前瞻性研究判断的能力,发现证据与决策脱节问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30947 2026-06-04 cs.CL 70%

Extending AI for Research to the Humanities: A Multi-Agent Framework for Evidence-Grounded Scholarship

将人工智能研究扩展到人文学科:一个用于证据基础学术的多智能体框架

Yating Pan, Jiajun Zhang, Jun Wang, Qi Su

机构 * Department of Information Management(信息管理系) Research Center for Digital Humanities(数字人文研究中心) School of Foreign Languages(外国语言学院) Institute for Artificial Intelligence(人工智能研究院)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL

AI总结 提出SPIRE多智能体框架,通过将人文学科操作建模为协作智能体角色,结合多尺度细读检索,实现基于证据的论证,在古典文献基准上优于现有方法。

Comments 28 pages, 3 figures. Code, data catalogues, and reproduction scripts: https://github.com/YatingPan/SPIRE. Lead corresponding author: Jun Wang; corresponding author: Qi Su

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20884 2026-06-04 cs.CL 70%

MemoNoveltyAgent: A Historical Research Memory-Aware Agent Workflow for Paper Novelty Assessment

MemoNoveltyAgent:一种用于论文新颖性评估的历史研究记忆感知智能体工作流

Jiajun Hou, Hexuan Deng, Wenxiang Jiao, Xuebo Liu, Xiaopeng Ke, Derek F. Wong, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(计算与智能研究院,哈尔滨工业大学深圳校区,中国) Xiaohongshu Inc.(小红书公司) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) NLP 2 CT Lab, Department of Computer and Information Science, University of Macau, China(自然语言处理2实验室,计算机与信息科学系,澳门大学,中国)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL

AI总结 提出MemoNoveltyAgent多智能体系统,通过分层抽象记忆、细粒度新颖点分解和自验证机制,生成忠实的新颖性报告,在评估中比GPT-5 DeepResearch提升13.69%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00015 2026-06-02 cs.HC cs.AI cs.CY cs.ET 70%

SortingHat: Redefining Operating Systems Education with a Tailored Digital Teaching Assistant

SortingHat: 用定制的数字教学助手重新定义操作系统教育

Yifan Zhang, Xinkui Zhao, Zuxin Wang, Zhengyi Zhou, Guanjie Chen, Shuiguang Deng, Jianwei Yin

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院)

专题命中 RAG评测 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 针对操作系统课程教学挑战,提出结合检索增强生成和多智能体强化学习的3D数字人教学助手SortingHat,提供个性化指导、自适应内容生成和自动评估。

Journal ref WWW '25: Companion Proceedings of the ACM on Web Conference 2025,Pages 2951 - 2954

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31167 2026-06-01 cs.AI 70%

LLM-FACETS: A Privacy-Preserving Framework for Evaluating LLM Transparency and Accountability

LLM-FACETS:一个保护隐私的评估LLM透明度和问责制的框架

Tom Lucas, Alessio Buscemi, Alfredo Capozucca, German Castignani, Barbara Delacroix

机构 * Luxembourg Institute of Science and Technology (LIST)(卢森堡科学与技术研究所) University of Luxembourg(卢森堡大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 提出一个开源框架LLM-FACETS,通过浏览器界面和插件架构,为技术专家、领域专家和合规官员提供隐私保护的LLM评估,实现透明度与问责制。

Comments Submitted to ACM Journal on Responsible Computing, Special Section: Collaborative Methods and Tools for Engineering and Evaluating Transparency in AI. 28 pages 9 figures, 7 tables, 1 algorithm. Source code: https://github.com/Scriptor-Group/AIMVi

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29742 2026-05-29 cs.AI 70%

Citation-Closure Retrieval and Per-Rule Attribution for Real-World Regulatory Compliance Question Answering

引用闭包检索与逐规则归因:面向真实世界法规合规问答

Yeong-Joon Ju, Seong-Whan Lee

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 针对法规合规问答中多层级权威结构的引用追踪难题,提出基于操作知识图谱的基准RegOps-Bench和统一框架RefWalk,通过共享主题锚点遍历跨文档引用、多视角候选融合及逐规则归因,显著提升检索召回率和引用准确性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22734 2026-05-22 cs.CL 70%

ChronoMedKG: A Temporally-Grounded Biomedical Knowledge Graph and Benchmark for Clinical Reasoning

ChronoMedKG:一个具有时间基础的生物医学知识图谱和用于临床推理的基准

Md Shamim Ahmed, Farzaneh Firoozbakht, Lukas Galke Poech, Jan Baumbach, Richard Röttger

机构 * University of Southern Denmark(丹麦南部大学) University of Hamburg(汉堡大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出ChronoMedKG,一个包含460,497个证据链接三元组的生物医学知识图谱,覆盖13,431种疾病,通过时间组件如发病窗口或进展阶段,为临床推理提供时间基础,并引入ChronoTQA基准测试,验证了其在时间推理任务中的有效性。

Comments 9 pages main text plus appendices, 8 figures. Dataset and benchmark paper. ChronoMedKG released under CC BY 4.0 and ChronoTQA/code under MIT (Zenodo: 10.5281/zenodo.19697542). Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10787 2026-05-21 cs.AI cs.SE 70%

ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox

ComplexMCP: 评估LLM代理在动态、相互依赖和大规模工具沙箱中的表现

Yuanyang Li, Xue Yang, Longyue Wang, Weihua Luo, Hongyang Chen

机构 * Zhejiang University(浙江大学) Zhejiang Lab(浙江实验室) Alibaba Group(阿里巴巴集团)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出ComplexMCP基准,用于评估LLM代理在动态、相互依赖和大规模工具环境中的性能,揭示了现有模型在复杂任务中的不足,指出三个关键瓶颈:工具检索饱和、过度自信和战略投降倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23355 2026-05-19 cs.AI 70%

LEGO: An LLM Skill-Based Front-End Design Generation Platform

LEGO: 一个基于LLM技能的前端设计生成平台

Jincheng Lou, Ruohan Xu, Jiecheng Ma, Runzhe Tao, Xinyu Qu, Yibo Lin

机构 * School of IC, Peking University(北京大学集成电路学院) School of EECS, Peking University(北京大学电子信息技术学院) School of Microelectronics, Xidian University(西安电子科技大学微电子学院) Institute of EDA, Peking University(北京大学EDA研究院) Beijing Advanced Innovation Center for IC(北京集成电路先进创新中心)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出LEGO平台,通过将数字前端流程分解为六个独立步骤,并将每个代理能力表示为标准化的可组合电路技能,实现了高效的前端设计生成,显著提升了RTL设计自动化的效果。

Comments Accepted to ISEDA 2026. Best Paper Nomination. 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01970 2026-05-18 cs.CR cs.AI 70%

Trojan Hippo: Weaponizing Agent Memory for Data Exfiltration

Trojan Hippo:利用代理记忆进行数据外泄

Debeshee Das, Julien Piet, Darya Kaviani, Luca Beurer-Kellner, Florian Tramèr, David Wagner

机构 * ETH Z\"urich

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 研究提出Trojan Hippo攻击,通过单次不可信工具调用在代理长期记忆中植入潜伏载荷,当用户讨论敏感话题时激活并外泄数据。通过动态评估框架评估不同内存架构和防御措施,发现现有防御措施在安全性和实用性之间存在显著权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12493 2026-05-13 cs.CL 70%

LongMemEval-V2: Evaluating Long-Term Agent Memory Toward Experienced Colleagues

LongMemEval-V2:评估长期代理记忆以成为经验丰富的同事

Di Wu, Zixiang Ji, Asmi Kawatkar, Bryan Kwan, Jia-Chen Gu, Nanyun Peng, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL

AI总结 LongMemEval-V2通过451个手动整理的问题评估代理记忆系统是否能帮助代理在定制环境中获取经验,采用上下文收集方法并提出两种记忆方法,实验显示AgentRunbook-C在准确率上表现最佳。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02372 2026-05-12 cs.CR cs.AI cs.SE 70%

Scam2Prompt: A Scalable Framework for Auditing Malicious Scam Endpoints in Production LLMs

Scam2Prompt: 一种可扩展的框架,用于审计生产LLM中的恶意诈骗端点

Zhiyang Chen, Tara Saba, Xun Deng, Xujie Si, Fan Long

机构 * OpenAI

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 Scam2Prompt通过生成开发者风格提示来测试LLM生成恶意代码的能力,发现4.24%的LLM会生成恶意URL,且在2025年发布的七种LLM中,恶意代码生成率高达12.9%-47.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07613 2026-05-11 cs.CL 70%

Intent-Driven Semantic ID Generation for Grounded Conversational News Recommendation

基于意图的语义ID生成用于 grounded 对话新闻推荐

Hongyang Su, Beibei Kong, Lei Cheng, Chengxiang Zhuo, Zang Li, Chenyun Yu

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Platform and Content Group, Tencent(腾讯平台与内容部)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出意图驱动的语义ID生成方法,通过多任务对齐和GPT-4链式推理蒸馏,实现意图到层级SID前缀的映射,提升新闻推荐的 grounded 性和冷启动用户推荐效果。

Comments Accepted at ACL 2026 Industry Track (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07325 2026-05-11 cs.RO cs.AI 70%

CSR: Infinite-Horizon Real-Time Policies with Massive Cached State Representations

CSR:具有大规模缓存状态表示的无限时间 horizon 实时策略

Robin Karlsson, Go Suzui

机构 * GODOT Inc(GODOT公司) Graduate School of Informatics, Nagoya University(名古屋大学信息研究生院)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出CSR框架,通过优化KV缓存重用和异步状态协调算法,实现大规模LLM在机器人中的实时应用,显著降低延迟并提升性能。

Comments Extended Technical Report for Paper Accepted to IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09775 2026-04-22 cs.AR cs.AI cs.DC cs.LG 70%

MIST: A Co-Design Framework for Heterogeneous, Multi-Stage LLM Inference

MIST:一种用于异构、多阶段LLM推理的联合设计框架

Abhimanyu Rajeshkumar Bambhaniya, Hanjiang Wu, Suvinay Subramanian, Sudarshan Srinivasan, Souvik Kundu, Amir Yazdanbakhsh, Midhilesh Elavazhagan, Madhu Kumar, Minlan Yu, Arijit Raychowdhury, Tushar Krishna

机构 * Georgia Institute of Technology(佐治亚理工学院) Google(谷歌) Intel(英特尔) Intel Labs(英特尔实验室) Google DeepMind(谷歌DeepMind) Harvard University(哈佛大学) Infravana

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 MIST是一种用于异构、多阶段LLM推理的联合设计框架,通过模拟不同请求阶段和复杂硬件层次,优化硬件-软件协同设计,解决LLM推理中的配置空间导航和跨厂商PD配置问题。

Comments Inference System Design for Multi-Stage AI Inference Pipelines. 11 Pages, 10 Figues, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17966 2026-04-21 cs.AI 70%

TPS-CalcBench: A Benchmark and Diagnostic Evaluation Framework for LLM Analytical Calculation Competence in Hypersonic Thermal Protection System Engineering

TPS-CalcBench: 一种用于高超音速热防护系统工程中LLM分析计算能力的基准和诊断评估框架

Jinglai Zheng, Chuhan Qiao, Haiming Huang

机构 * School of Civil Engineering, Beijing Jiaotong University, Beijing 100044, China(北京交通大学土木工程学院)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出TPS-CalcBench,首个针对高超音速气动学和高温气体动力学中闭式解析计算的诊断基准,通过领域导向任务分类、双轨评估和人类-AI数据管道,建立安全关键工程LLM部署评估的完整诊断-评估-干预框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06633 2026-04-09 cs.CR cs.CL cs.SE 70%

Argus: Reorchestrating Static Analysis via a Multi-Agent Ensemble for Full-Chain Security Vulnerability Detection

Argus:通过多智能体集合重新编排静态分析以实现全链路安全漏洞检测

Zi Liang, Qipeng Xie, Jun He, Bohuan Xue, Weizheng Wang, Yuandao Cai, Fei Luo, Boxian Zhang, Haibo Hu, Kaishun Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) HKUST(香港科技大学) SF Express(顺丰速运) Great Bay University(大湾区大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 Argus通过多智能体框架提升静态分析效率,结合RAG和ReAct技术减少漏洞误报,发现更多真实漏洞并降低运营成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05587 2026-04-08 cs.AI math.OC 70%

ResearchEVO: An End-to-End Framework for Automated Scientific Discovery and Documentation

ResearchEVO:一个端到端的自动化科学发现与文档框架

Zhe Zhao, Haibin Wen, Jiaming Ma, Jiachang Zhan, Tianyi Xu, Ye Wei, Qingfu Zhang

机构 * City University of Hong Kong(香港城市大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 ResearchEVO通过端到端框架实现科学发现与解释的自动化,利用算法进化和文献基础的文档生成,首次完整覆盖该流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04020 2026-04-07 cs.CL cs.LG 70%

Unmasking Hallucinations: A Causal Graph-Attention Perspective on Factual Reliability in Large Language Models

揭示幻觉:从因果图注意力视角探讨大语言模型中的事实可靠性

Sailesh kiran kurra, Shiek Ruksana, Vishal Borusu

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 本文提出因果图注意力网络框架,通过构建token级图来减少大语言模型中的幻觉问题,提升事实可靠性。

Comments Paper accepted for publication at IEEE International Conference on Emerging Computing and Intelligent Technologies 2026 (ICoECIT),5 Pages,5 figures,1 table

详情

展开后加载摘要…

URL PDF HTML 收藏