arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 93793 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5118 篇

2605.26542 2026-07-02 cs.CR cs.AI 版本更新 57%

ChainCaps: Composition-Safe Tool-Using Agents via Monotonic Capability Attenuation

ChainCaps: 通过单调能力衰减实现组合安全的工具使用智能体

Xiaochong Jiang, Shiqi Yang, Ziwei Li, Lifei Liu, Haoran Yu, Yichen Liu

机构 * Independent Researcher, Seattle, WA, USA(华盛顿州塞勒姆独立研究员) Independent Researcher, New York City, NY, USA(纽约市纽约独立研究员) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹科学技术大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 针对工具组合中的权限洗钱漏洞,提出ChainCaps机制,通过运行时能力预算交集传播规则,在不修改智能体或工具服务器的情况下,将攻击成功率从25-68%降至0-4.8%,同时保持96-100%的良性任务完成率。

Comments Published at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07397 2026-07-02 cs.CL 版本更新 57%

Thinking While Speaking: Inference-Time Knowledge Transfer for Responsive and Intelligent Conversational Voice Agents

边说话边思考:面向响应式与智能对话语音代理的推理时知识迁移

Vidya Srinivas, Zachary Englhardt, Vikram Iyer, Shwetak Patel

机构 * Paul G. Allen School of Computer Science & Engineering(保罗·G·阿伦计算机科学与工程学院)

专题命中 工具调用 :tool use(abstract);分类 cs.CL

AI总结 提出对话填充方法,通过小型说话者模型即时生成上下文响应以隐藏推理模型延迟,并在推理中无缝整合流式知识,在保持毫秒级响应速度的同时将准确度差距缩小至前沿推理模型的6.3%以内。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31372 2026-07-01 cs.SE 新提交 57%

Failure-Based Testing for Deep Reinforcement Learning Agents

基于失败的深度强化学习智能体测试方法

Weibin Lin, Jiangtao Meng, Zheng Zheng

专题命中 工具调用 :agent(abstract);分类 cs.SE

AI总结 针对深度强化学习智能体测试中奖励信号失效的问题,提出一种基于任务失败洞察的黑盒测试方法PRT,通过优先测试高难度任务来提升故障检测效率,在四个基准上测试成本降低超50%。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16250 2026-07-01 cs.CV cs.AI 版本更新 57%

Visual Prompt Discovery via Semantic Exploration

通过语义探索发现视觉提示

Jaechang Kim, Yotaro Shimose, Zhao Wang, Kuang-Da Wang, Jungseul Ok, Shingo Takamatsu

机构 * Sony Group Corporation(索尼集团公司) Pohang University of Science and Technology(浦项科技大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出SEVEX算法,通过抽象思想空间和语义反馈自动探索任务级视觉提示,提升LVLM图像感知能力。

Comments Accepted to ECCV 2026, project page: https://jaechang.dev/projects/SEVEX/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29544 2026-06-30 cs.SD cs.AI 57%

Proteus: Automated Adversarial Robustness Testing for Audio Deepfake Detectors

Proteus: 音频深度伪造检测器的自动化对抗鲁棒性测试

Nicolas M. Müller, Aditya Tirumala Bukkapatnam, Zohaib Ahmed

机构 * Resemble AI

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出Proteus框架,通过搜索日常音频变换组合(如编解码、噪声等)自动发现欺骗深度伪造检测器的对抗样本,并利用BFS和Q-learning两种策略优化攻击链,以提升检测器鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09038 2026-06-30 cs.AI 57%

SearchSkill: Teaching LLMs to Use Search Tools with Evolving Skill Banks

SearchSkill: 教授大语言模型使用搜索工具与演进技能库

Jinchao Hu, Meizhi Zhong, Kehai Chen, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区计算机科学与技术学院) TikTok Inc, Beijing(字节跳动北京公司)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 SearchSkill通过可重用的搜索技能显式规划查询,提升开放域问答中的检索效率和推理质量,改进了知识密集型问答基准的精确匹配表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28070 2026-06-29 cs.AI 新提交 57%

JD Oxygen AI Item Center (Oxygen AIIC) V1: An Industrial-Scale LLM/VLM-Centric Solution for Item Understanding, Management, and Applications

JD Oxygen AI 商品中心 (Oxygen AIIC) V1:面向商品理解、管理和应用的工业级 LLM/VLM 解决方案

Oxygen AIIC, Chan Long, Chao Liu, Chaofan Chen, Chaohui Dong, Chunyuan Guo, Danping Liu, Debin Liu, Deping Xiang, Fulai Xu, Guangyue Liu, Hao Li, Huichun Hu, Jian Yang, Jianan Wang, Jianbo Zhao, Jiaoyang Li, Jiaxing Wang, Jinglong Li, Jinjin Guo, Jun Fang, Jun Liu, Kai Zhou, Li Wang, Lili Gao, Liying Chen, Luning Yang, Mengdi Zhou, Pengzhang Liu, Qi Lv, Qianyun Wang, Qixia Jiang, Ruyue Li, Shimu Liang, Shuxing Wang, Sijie Zhang, Siqi Li, Tianhao Gao, Wang Ke, Weihu Huang, Wencan Lai, Wenjie Zhang, Xiaohui Zhang, Xiaojing Dong, Ya Liu, Yifeng Zhang, Yixiang Wang, Yongtai Zhang, Yongyi Liao, Zhaoru Chen, Zhen Chen, Zhiyong Ma, Zhiyuan Liu, Zhongwei Liu, Ziyan Xing

机构 * Oxygen AIIC(氧气AIIC)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 针对电商平台海量SKU的知识生产与服务挑战,提出基于LLM/VLM的工业级平台Oxygen AIIC,通过本体工程、S2D知识识别架构、自进化模型和统一商品通道,实现高精度、高吞吐的知识生产,并在搜索、推荐等场景取得显著收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26964 2026-06-29 cs.AI cs.CV 新提交 57%

Look-Before-Move: Narrative-Grounded World Visual Attention in Dynamic 3D Story Worlds

Look-Before-Move:动态3D故事世界中的叙事驱动世界视觉注意力

Jiaming Bian, Bingliang Li, Yuehao Wu, Pichao Wang, Zhi Wang, Hailan Ma, Huadong Mo, Zhenhong Sun

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 提出Look-Before-Move框架,通过语义观察合约、蒙特卡洛视点搜索和语义轨迹接地,在动态3D故事世界中实现叙事驱动的视觉注意力规划,提升主体感知、意图一致性和轨迹质量。

Comments 25 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26627 2026-06-26 cs.CR cs.AI 新提交 57%

Agents That Know Too Much: A Data-Centric Survey of Privacy in LLM Agents

知道太多的智能体:LLM智能体中隐私的数据中心调查

Nada Lahjouji, Ashwin Gerard Colaco

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 从数据中心视角调查LLM智能体隐私风险,分类数据源、隐私风险及治理机制,发现信息流控制可覆盖组合和跨会话推理泄露,但缺乏统一隐私策略的基准。

Comments 17 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26442 2026-06-26 cs.LO cs.AI 新提交 57%

AXLE: A Cloud Infrastructure for Lean 4 Theorem Proving Utilities

AXLE:面向 Lean 4 定理证明工具的云基础设施

Jimmy Xin, Alex Schneidman, Chris Cummins, Karun Ram, Srihari Ganesh, Jannis Limperg

机构 * Axiom Math Recursive Superintelligence, Inc.

专题命中 工具调用 :agentic(abstract);分类 cs.AI

AI总结 提出 AXLE 云服务,提供可扩展的 Lean 4 证明操作、提取与验证工具,支持多版本、多租户隔离,已处理超5亿请求并助力 Putnam 竞赛满分。

Comments Accepted at the 3rd AI for Math Workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26180 2026-06-26 cs.SE 新提交 57%

Orchestrating Black-Box Schema Converters: An Empirical Study of Automated, Quality-Ranked Conversion Across Heterogeneous Schema Languages

编排黑盒模式转换器:跨异构模式语言的自动化、质量排序转换的实证研究

Felix Neubauer, Giridhar Chinnikkaramadom Govindan, Jürgen Pleiss, Benjamin Uekermann

专题命中 工具调用 :agent(abstract);分类 cs.SE

AI总结 通过将模式语言视为节点、转换器视为有向边,编排黑盒转换器实现自动化、可重复且质量排序的转换,在60个真实任务中43个成功,揭示了当前转换器生态的局限。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16821 2026-06-24 cs.CL cs.CR cs.CY cs.IR 新提交 57%

How Much Can We Trust LLM Search Agents? Measuring Endorsement Vulnerability to Web Content Manipulation

我们能在多大程度上信任LLM搜索智能体?衡量对网络内容操纵的认可脆弱性

Yimeng Chen, Zhe Ren, Firas Laakom, Yu Li, Dandan Guo, Jürgen Schmidhuber

机构 * Center of Excellence for Generative AI, KAUST(KAUST生成式人工智能卓越中心) Jilin University(吉林大学) Zhejiang University(浙江大学) The Swiss AI Lab, IDSIA-USI/SUPSI(瑞士人工智能实验室 IDSIA-USI/SUPSI) NNAISENSE

专题命中 工具调用 :agent(abstract);分类 cs.CL

AI总结 提出SearchGEO框架,通过五类攻击模式和输出级指标评估13种LLM后端对网络内容操纵的认可脆弱性,发现攻击成功率从0%到31.4%不等,且不同后端对攻击模式的敏感性和部署框架的影响存在显著差异。

Comments 23 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22909 2026-06-23 cs.DB cs.AI cs.IR 新提交 57%

Graph-Enhanced Large Language Models for Spatial Search

用于空间搜索的图增强大型语言模型

Nicole R. Schneider, Kent O'Sullivan, Hanan Samet

机构 * University of Maryland(马里兰大学) University of Sydney(悉尼大学)

专题命中 工具调用 :planning(abstract);分类 cs.AI

AI总结 针对大语言模型空间推理能力不足的问题,提出图增强方法,将空间数据以图形式存储并与检索增强生成结合,提升复杂空间问题回答能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22840 2026-06-23 cs.LG 新提交 57%

RLM-Cascade: Response-Level Speculative Decoding for Cost-Efficient LLM API Serving

RLM-Cascade:用于成本高效LLM API服务的响应级推测解码

Haifeng Wu, Srinivasan Manoharan, Fangbo Tu, Junhua Zhao, Jian Wan

机构 * PayPal

专题命中 工具调用 :agentic(abstract);分类 cs.LG

AI总结 提出RLM-Cascade代理层系统,通过响应级推测解码降低LLM API成本,在真实编码工作负载上实现45.8%成本降低和1.83倍延迟加速,同时保持或超越基线质量。

Comments 9 pages, 1 figure, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22698 2026-06-23 cs.CR cs.CL 新提交 57%

Black-Box Forensics for Conversational LLM Agents

对话式LLM代理的黑盒取证

Isadora White, Yasaman Jafari, Taylor Berg-Kirkpatrick

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 工具调用 :agent(abstract);分类 cs.CL

AI总结 研究通过非对抗对话识别对话代理的基座模型(归因)和系统提示(指纹识别),归因准确率达98%,指纹识别对未见提示的AUC达0.943。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22385 2026-06-23 cs.AI cs.CE 新提交 57%

MetaPS: Adaptive Programmatic Strategy Selection for Market Agents

MetaPS:面向市场智能体的自适应程序化策略选择

Jiaxiang Chen, Aotian Luo, Zhouyi Zheng, Weiyi Huang, Chi Zhang, Zenglin Xu

机构 * Fudan University(复旦大学) TensorPacific

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出MetaPS框架,通过模拟市场回滚候选策略并生成监督微调数据,使智能体自适应选择程序化策略,在股票交易和商品交换实验中优于固定策略和直接决策方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22013 2026-06-23 cs.LG cs.PF 新提交 57%

Load Testing for Machine Learning Model Serving Systems at Scale

大规模机器学习模型服务系统的负载测试

Amr S. Abdelfattah, Nakul Tirumalai, Indu Mohanan, Xiao Li, Pengchao Wang, Dinakar Dhurjati, Eric Sung

机构 * Meta Inc.(Meta公司)

专题命中 工具调用 :planning(abstract);分类 cs.LG

AI总结 提出自适应反馈驱动的负载测试框架Sys,通过实时性能信号和收敛检测,在SLO约束下高效识别最大可持续吞吐量,显著提升GPU资源效率并减少服务事故。

Comments The paper is accepted at ECSA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21416 2026-06-23 cs.DC cs.SE 新提交 57%

Bridging Design and Execution: A Visual Graph Editor for Edge and Cloud Workflows

桥接设计与执行:面向边缘和云工作流的可视化图形编辑器

Katarina-Glorija Grujić, Nikola Stanković, Maja Vukasović, Miloš Simić

专题命中 工具调用 :workflow(abstract);分类 cs.SE

AI总结 提出一种领域特定可视化图形编辑器,通过内核、共享内存节点和事件触发器三种抽象,支持边缘和云应用的模块化设计,自动序列化为可执行表示,弥合设计与部署的鸿沟。

Comments 12 pages, published at the 16th International Conference on Information Society and Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23166 2026-06-23 cs.LG cond-mat.mtrl-sci 新提交 57%

Substitution-Based Analysis of Structural Novelty for Generative Models of Materials

基于替换分析的材料生成模型结构新颖性评估

Masahiro Negishi, Aron Walsh

机构 * Imperial College London(伦敦帝国学院)

专题命中 工具调用 :workflow(abstract);分类 cs.LG

AI总结 针对无机晶体生成AI模型,提出工作流区分生成晶体是否为训练重复、元素替换产物或全新结构,发现81-92%的生成晶体为重复或替换结构,高对称性系统尤其明显,低对称性新结构可解释为数据丰富区域的插值。

Comments 27 pages (20 pages of main text). See https://github.com/WMD-group/xtaledit for the code

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22425 2026-06-23 cs.AI cond-mat.mtrl-sci 新提交 57%

SVGym (SciVerseGym): An Environment for Reinforcement Learning and Bayesian Optimization in Crystal Discovery

SVGym (SciVerseGym): 晶体发现中强化学习与贝叶斯优化的环境

Bin Cao

机构 * Bin Cao(包超)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出一个兼容Gymnasium的晶体发现环境SciVerseGym,将晶体设计建模为马尔可夫决策过程,支持局部和全局编辑操作,为强化学习、贝叶斯优化等提供可复现的测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18860 2026-06-18 cs.CV cs.LG 新提交 57%

Quantification of Uncertainty with Adversarial Models in Medical Image Segmentation

医学图像分割中对抗模型的不确定性量化

Hana Jebril, Thomas Pinetz, Günter Klambauer, Hrvoje Bogunović

机构 * Institute of Artificial Intelligence, Center for Medical Data Science, Medical University of Vienna, Austria(人工智能研究所、医学数据科学中心、维也纳医学大学,奥地利) Comprehensive Center for AI in Medicine, Medical University of Vienna, Austria(医学人工智能综合中心、维也纳医学大学,奥地利) ELLIS Unit Linz, LIT AI Lab and Institute for Machine Learning, Johannes Kepler University Linz, Austria(林茨ELLIS单位、LIT人工智能实验室和机器学习研究所、林茨约瑟夫·冯·克拉夫特大学,奥地利) Institute for Machine Learning, Johannes Kepler University Linz, Austria(机器学习研究所、林茨约瑟夫·冯·克拉夫特大学,奥地利) Clinical Research Center for Medical AI, Johannes Kepler University Linz, Austria(医学人工智能临床研究中心、林茨约瑟夫·冯·克拉夫特大学,奥地利)

专题命中 工具调用 :planning(abstract);分类 cs.LG

AI总结 提出QUAM-SM后处理框架,通过针对性对抗搜索识别脆弱像素,量化不确定性并分离认知与偶然不确定性,在公开数据集上优于现有方法。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18730 2026-06-18 cs.RO cs.AI math.CO math.OC 新提交 57%

Two-Phase Bilevel Search for the Moving-Target Traveling Salesman Problem with Moving Obstacles

带移动障碍物的移动目标旅行商问题的两阶段双层搜索

Allen George Philip, Anoop Bhat, Sivakumar Rathinam, Howie Choset

机构 * Texas A&M University(德克萨斯A&M大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 针对带移动障碍物的移动目标旅行商问题,提出混合整数锥规划公式和两阶段双层搜索算法,显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26195 2026-06-17 cs.CR cs.AI 版本更新 57%

CyberEvolver: Structured Self-Evolution for Cybersecurity Agents On the Fly

CyberEvolver:面向网络安全代理的即时结构化自我进化

Yihe Fan, Changyi Li, Lichen Xu, Xudong Pan, Jiarun Dai, Hong Geng, Min Yang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Pudong Research Institute of Cryptology(上海浦东密码研究院)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出CyberEvolver框架,通过四层可进化架构、痕迹诊断机制和种群波束搜索,实现网络安全代理基于失败经验的支架自我进化,平均成功率提升13.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16978 2026-06-16 cs.RO cs.LG cs.SY eess.SY 新提交 57%

Task-Error Residual Learning for Real-Robot Five-Ball Juggling

任务误差残差学习用于真实机器人五球杂耍

Kai Ploeger, Jan Peters

机构 * Technical University of Darmstadt(达姆施塔特工业大学) German Research Center for AI (DFKI)(德国人工智能研究中心) Hessian Center for Artificial Intelligence (hessian.AI)(黑森州人工智能中心)

专题命中 工具调用 :planning(abstract);分类 cs.LG

AI总结 提出基于任务误差方向监督和误差模型驱动样本选择的残差学习方法,在Barrett WAM机械臂上实现稳定三、四、五球杂耍,首次尝试失败后任务误差单调递减,无需进一步失败。

Comments Submitted to the 2026 International Symposium on Robotics Research (ISRR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16652 2026-06-16 cs.CY cs.AI cs.SI 新提交 57%

Optimising Temporary Accommodation Placement Across London with AI-Powered SaaS in E-Governance Systems

利用AI驱动的SaaS优化伦敦临时住所安置:电子政务系统中的应用

Hankun He, Jordan Richards, Gopalakrishnan Netuveli, Kumar Aniket, Ramya Pachatcharam, Binta Ade-olusile, Nathan Nagaiah, Matthew I Bellgard

机构 * UK Centre for AI in the Public Sector(英国公共部门人工智能中心) Institute for Connected Communities(连接社区研究所) University of East London(东伦敦大学) London Borough of Newham(伦敦新ham区)

专题命中 工具调用 :workflow(abstract);分类 cs.AI

AI总结 本文介绍DOMUS系统,一个基于云的AI决策支持系统,通过规则过滤与大语言模型搜索结合,优化伦敦纽汉姆区的临时住所安置,显著减少搜索时间并提高合规性。

Comments 13 pages, 4 figures, to be published in International Conference on AI and Sustainability Advances 2026 Companion Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16358 2026-06-16 cs.CR cs.AI cs.ET cs.MA 新提交 57%

The Proxy Knows Too Much: Sealing LLM API Routers with Attested TEEs

代理知道太多:用认证TEE密封LLM API路由器

Sipeng Xie, Qianhong Wu, Hengrun Lu, Ziliang Sun, Qi Wu, Bo Qin, Qin Wang

机构 * Beihang University(北京航空航天大学) Renmin University of China(中国人民大学) Independent(独立)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 针对API路由器作为应用层中间人可窃取明文交互的问题,提出AEGIS,一种提供者透明的认证API路由器,通过硬件飞地保护数据路径,客户端验证飞地后释放明文,阻止所有恶意路由器攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14777 2026-06-16 cs.CV cs.AI 新提交 57%

JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence

JoyAI-VL-Interaction: 实时视觉-语言交互智能

Dingyu Yao, Junhao Zhou, Chenxu Yang, Chuanyu Qin, Haowen Hou, Zheming Liang, Congcong Wang, Yuhang Cao, Shenglong Ye, Shuai Xie, Shuhuan Gu, Haoyang Huang, Qingyi Si, Nan Duan, Jiaqi Wang

机构 * JD.com(京东)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出一种持续观察、自主决定是否回应的视觉-语言交互模型,并开源8B规模模型及完整部署系统,在六个真实场景中优于现有方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14718 2026-06-16 cs.CY cs.AI 新提交 57%

Gender Differences in AI Literacy Workshop Outcomes and Deepfake Engagement

AI素养工作坊成果与深度伪造参与中的性别差异

Jake Renzella, Christian Bergh, Natasha Banks, Alexandra Vassar

机构 * University of New South Wales(新南威尔士大学)

专题命中 工具调用 :tool-use(abstract);分类 cs.AI

AI总结 本研究通过统计回归分析澳大利亚中学生AI素养工作坊前后数据,发现男性在STEM职业兴趣上显著更高,女性更常使用AI工具,且工作坊后女性在AI知识和职业兴趣上提升更大,部分缩小了性别差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22376 2026-06-16 cs.IR cs.AI 版本更新 57%

Closing the Auto-Research Loop: An AI Co-Scientist for Production Search Ranking

关闭自动研究循环:面向生产搜索排名的AI合作科学家

Liwei Wu, Cho-Jui Hsieh

机构 * Trip.com Group(Trip.com集团) UCLA(加州大学洛杉矶分校)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出AI合作科学家框架,通过LLM代理与云计算集成,自动迭代生成想法、实现代码、进行GPU实验并分析结果,在搜索排名任务中带来额外+0.083%离线增益。

Comments Submitted to EMNLP for review on June 14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14239 2026-06-15 cs.AI 新提交 57%

SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing

SkillAudit: 通过配对轨迹审计实现无真实反馈的技能进化

Haowen Gao, Haoran Chen, Can Wang, Shasha Guo, Liang Pang, Zhaoyang Liu, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

专题命中 工具调用 :agent(abstract);分类 cs.AI

AI总结 提出SkillAudit框架,通过配对轨迹审计和过程对齐对比评估,无需真实反馈即可进化智能体技能,在89个任务中平均奖励达73.9%。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏