arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6842 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 427 篇

2606.17939 2026-06-17 stat.AP stat.ML 新提交 50%

Understanding Long-Term Dynamics of Individual Metro Usage: A Hidden Semi-Markov State Framework with Survival Analysis

理解个体地铁使用的长期动态:基于生存分析的隐半马尔可夫状态框架

Bingxun Wang, Valeria Maria Urbano, Shan He, Yang Chen, Wei Liu, Zhibin Jiang, Piercesare Secchi

专题命中 记忆与上下文管理 :planning(abstract)

AI总结 提出融合隐半马尔可夫模型与离散时间生存分析的框架,利用上海地铁四年刷卡数据识别五种可解释的出行状态及其转移层次,揭示退出风险与状态相关但独立于时长,而重返风险随不活跃时长急剧衰减。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18180 2026-06-17 cs.CV 新提交 50%

EgoCS-400K: An Egocentric Gameplay Dataset for World Models

EgoCS-400K:面向世界模型的自我中心游戏数据集

Rongjin Guo, Dong Liang, Yuhao Liu, Fang Liu, Tianyu Huang, Gerhard P. Hancke, Rynson W. H. Lau

机构 * City University of Hong Kong(香港城市大学)

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 为支持世界模型研究,构建大规模自我中心游戏数据集EgoCS-400K,包含40万第一人称视频和1万小时游戏轨迹,支持动作条件未来预测、状态事件场景展开等交互式视觉建模任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12556 2026-06-17 cs.DC 新提交 50%

ITME: Inference Tiered Memory Expansion with Disaggregated CXL-Hybrid Memories

ITME:基于解耦CXL混合内存的分层推理内存扩展

Hakbeom Jang, Younghoon Min, Sunwoong Kim, Taeyoung Ahn, Hanyee Kim, Youngpyo Joo, Hoshik Kim, Jongryool Kim

专题命中 记忆与上下文管理 :agentic(abstract)

AI总结 针对大语言模型推理中TB级上下文状态的内存瓶颈,提出ITME架构,利用CXL混合内存实现字节可寻址的远程内存扩展,通过确定性访问模式优化数据移动,提升吞吐量达35.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16342 2026-06-16 cs.CV 新提交 50%

When the Past Matters: FlashBack Memory for Precipitation Nowcasting

当过去重要时:用于降水临近预报的FlashBack记忆

Yuhao Du, Boxiao Huang, Chengrong Wu, Jiankai Zhang

机构 * College of Atmospheric Sciences, Lanzhou University(兰州大学大气科学学院) Fuqua School of Business, Duke University(杜克大学福库商学院) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Supercomputing Center of Lanzhou University(兰州大学超级计算中心)

专题命中 记忆与上下文管理 :planning(abstract)

AI总结 提出FlashBack Memory模块,通过动态检索关键历史状态并自适应融合,增强循环模型时空表征能力,显著提升高分辨率降水预测的准确性和时序一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16184 2026-06-16 cs.CV cs.MM 新提交 50%

Closed-Loop Triplet Synergistic Generation for Long-Form Video

闭环三元组协同生成用于长视频

Xinlei Yin, Xiulian Peng, Xiao Li, Zhiwei Xiong, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 记忆与上下文管理 :agentic(abstract)

AI总结 提出CoTriSyGen框架,通过闭环视觉-文本-记忆协同过程,结合分析器进行镜头内和镜头间修正,解决长视频生成中的身份漂移和不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16135 2026-06-16 cs.DC 新提交 50%

SwiftCache: Efficient LLM Serving for Multi-turn Conversations with Heterogeneous KV Cache Sharing

SwiftCache: 面向多轮对话的高效LLM服务与异构KV缓存共享

Jianmin Hu, Minxian Xu, Sa Wang, Chong Ma, Min Shen, Kejiang Ye, Lin Qu, Chengzhong Xu

专题命中 记忆与上下文管理 :AI agent(abstract)

AI总结 针对多轮对话中KV缓存占用显存导致推理延迟高、上下文受限的问题,提出SwiftCache系统,通过异构模型间共享空闲GPU内存和NVLink带宽,仅保留当前层KV缓存,降低延迟并扩展上下文长度。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15071 2026-06-16 quant-ph 新提交 50%

Quantum learning with a single-atom sensor

单原子传感器的量子学习

Yin Mo, Emilio Bagan, Giulio Chiribella

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 研究单原子传感器在量子学习中的性能极限,发现传感阶段的纠缠与行动阶段的相干性之间存在根本权衡,并揭示了量子传感器特性对最优行动策略的影响。

Comments 5+12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14818 2026-06-16 physics.soc-ph cond-mat.stat-mech cs.MA 新提交 50%

Physics of anticipatory active matter, with application to crowd dynamics

预期性活性物质的物理及其在人群动力学中的应用

Alexis Raulin-Foissac, Alexandre Nicolas

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 提出预期性主体的统计物理框架,通过将d维预期动力学映射到d+1维非预期链,利用聚合物物理刻画不确定性,成功应用于行人动力学,复现复杂场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09022 2026-06-16 math.PR 新提交 50%

Steady-State Approximation Error of Heterogeneous Mean-Field Models

异质平均场模型的稳态近似误差

Lei Ying

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 研究异质平均场模型中M个智能体系统的占据测度与退火平均场平衡之间的稳态均方误差,建立了O(1/M)的界,揭示了异质系统需要初始条件扰动的均匀鲁棒性。

Comments Corrected a few minor typos and added a link to ref [6]

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14065 2026-06-15 physics.optics 新提交 50%

Probing the Broken Spatial Symmetry of a Stratified Medium with Structured Light

利用结构光探测分层介质的空间对称性破缺

Arani Maiti, Sauvik Roy, Nirmalya Ghosh, Ayan Banerjee, Subhasish Dutta Gupta

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 研究近对称共振分层介质,通过反射光中放大的古斯-汉欣和伊姆伯特-费多罗夫位移,利用结构光探测微小空间对称性破缺,并展示非互易性导致的位移差异,为高灵敏度传感器提供新思路。

Comments 8 pages, 6 figures, Comments are appreciated

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12293 2026-06-11 eess.SP 新提交 50%

LLM-Based Digital Twin Intelligence for Application-Aware Network Selection in 6G Heterogeneous Wireless Networks

基于大语言模型的数字孪生智能:面向6G异构无线网络中应用感知的网络选择

Brahim Mefgouda, Anis Bara, Lina Bariah, Hang Zou, Yuzhi Yang, Merouane Debbah

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 提出一种基于大语言模型的数字孪生框架,通过融合物理传播、分组级QoS仿真和决策记忆,实现候选集演化下的稳定应用感知RAT选择,显著降低秩反转和切换次数。

Comments Submitted to an IEEE venue

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12290 2026-06-11 cs.CR 新提交 50%

Selection Integrity for LLM Graph Memory: An Accumulability Criterion for Information-Flow-Blind Retrieval

LLM图记忆的选择完整性:面向信息流盲检索的可累积性准则

Zeming Fei, Hongming Fei, Xiaoyang Wang, Yang yang, Prosanta Gope, Biplab Sikdar, Ying Zhang

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 针对图记忆检索中信息流控制盲区,提出可累积性准则,证明无源结构写入可导致不可逆转账被误导,并通过重分配性而非依赖性预测漏洞,提出认证子图重计算防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09784 2026-06-09 math.OC math.PR 新提交 50%

Mean field games with option to buy information

具有购买信息选项的平均场博弈

Bernardo D'Auria, Markus Fischer

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 研究连续时间有限时域平均场博弈,其中代表性玩家的目标函数依赖于隐藏状态,玩家可选择付费观察该状态,通过连接最优控制与自由停止模型给出解的表征和显式示例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07326 2026-06-08 cs.CV 新提交 50%

AnchorWorld: Embodied Egocentric World Simulation with View-based Evolution Customization

AnchorWorld: 基于视图演化定制的具身自我中心世界模拟

Yu Li, Menghan Xia, Gongye Liu, Xintao Wang, Conglang Zhang, Lei Ke, Yuxuan Lin, Ruihang Chu, Pengfei Wan, Kun Gai, Yujiu Yang

机构 * Tsinghua University(清华大学) HUST(华中科技大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) HKUST(香港科技大学) WHU(武汉大学)

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 提出AnchorWorld框架,利用3D人体运动和外源视角辅助训练增强交互完整性,并通过锚点视图和文本描述实现自我演化世界的灵活定制,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07158 2026-06-08 cs.CR 新提交 50%

Synthetic APTs: the Collapse of TTP-Based Attribution

合成APT:基于TTP的归因的崩溃

Francesco Balassone, Víctor Mayoral-Vilches, María Sanz-Gómez, Paul Zabalegui-Landa, Stefan Rass, Davide Quarta, Daniel Sanchez-Prieto, Marina Oteiza-Álvarez, Almerindo Graziano, Lauren Min Kim, MinSeok Choi

专题命中 记忆与上下文管理 :agentic(abstract)

AI总结 研究AI驱动的对手模拟是否挑战基于TTP的归因,通过CSI框架配置五个APT组进行实验,发现企业网络均被攻陷且攻击者独立武器化防御工具,表明AI时代TTP归因基础被削弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07195 2026-06-08 math.NA cs.NA 新提交 50%

Adjoint-based Perfusion Estimation from Dynamic Contrast-Enhanced Ultrasound: Advection-Diffusion and Two-Compartment Models

基于伴随的动态对比增强超声灌注估计:对流扩散与两室模型

Sophie Externbrink, Ahmed El Kaffas, Dimitre Hristov, Sebastian Götschel

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文通过伴随方法估计肿瘤血流速度和灌注参数,比较了对流扩散模型与生理上更合理的两室模型,并利用Tikhonov正则化和连续伴随方程进行高效梯度优化。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 1187 篇

2608.05668 2026-08-07 cs.MA cs.AI cs.MM 新提交 92%

F$^2$Agent: Financial Fusion of Agentic Intelligence for Multimodal Trading

F²Agent:面向多模态交易的智能体智能金融融合框架

Changshuo Liu, Yanzheng Jin, Shangfeng Cai, Peng Fang, Xiaokui Xiao, Beng Chin Ooi

专题命中 Agent评测 :agent(title,title_cn);agentic(title,abstract);分类 cs.AI

AI总结 该研究针对现有多模态金融交易模型的跨模态依赖捕捉不足、抗噪性差的问题,提出F²Agent框架,通过专业化智能体提取模态信号、模态感知自适应融合机制及抗噪正则化,在6种资产上较16个基线实现超20%年化回报率提升,表现出优异性能。

Comments 32 pages, 12 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22902 2026-06-29 cs.AI 新提交 92%

Agent-as-a-Router: Agentic Model Routing for Coding Tasks

Agent-as-a-Router: 面向编码任务的智能体模型路由

Pengfei Zhou, Zhiwei Tang, Yixing Ma, Jiasheng Tang, Yizeng Han, Zhenglin Wan, Fanqing Meng, Wei Wang, Bohan Zhuang, Wangbo Zhao, Yang You

机构 * National University of Singapore(新加坡国立大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) University of California, Berkeley(加州大学伯克利分校) The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(title,title_cn);agentic(title,abstract);分类 cs.AI

AI总结 提出Agent-as-a-Router框架,通过C-A-F循环积累执行经验,实现编码任务的动态模型路由,ACRouter在分布内任务上取得最低累积遗憾并泛化到分布外任务。

Comments 39 pages, 21 figures, a living technical report with a living benchmark that continuously updates

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24855 2026-06-24 cs.AI 新提交 91%

OpenThoughts-Agent: Data Recipes for Agentic Models

OpenThoughts-Agent: 智能体模型的数据配方

Negin Raoof, Richard Zhuang, Marianna Nezhurina, Etash Guha, Atula Tejaswi, Ryan Marten, Charlie F. Ruan, Tyler Griggs, Alexander Glenn Shaw, Hritik Bansal, E. Kelly Buchanan, Artem Gazizov, Reinhard Heckel, Chinmay Hegde, Sankalp Jajee, Daanish Khazi, Emmanouil Koukoumidis, Xiangyi Li, Hange Liu, Shlok Natarajan, Harsh Raj, Nicholas Roberts, Ethan Shen, Nishad Singhi, Michael Siu, Ashima Suvarna, Hanwen Xing, Patrick Yubeaton, Robert Zhang, Leon Liangyu Chen, Xiaokun Chen, Steven Dillmann, Saadia Gabriel, Xunyi Jiang, Anurag Kashyap, Boxuan Li, Yein Park, Minh Pham, Sujay Sanghavi, Lin Shi, Ke Sun, Yixin Wang, Zhiwei Xu, Erica Zhang, Siyan Zhao, Wanjia Zhao, Jenia Jitsev, Alex Dimakis, Benjamin Feuer, Ludwig Schmidt

机构 * UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) JSC(于利希超级计算中心) LAION University of Texas at Austin(德克萨斯大学奥斯汀分校) Bespoke Labs Laude Institute UCLA(加州大学洛杉矶分校) Harvard University & Harvard Medical School(哈佛大学与哈佛医学院) TU Munich & Munich Center for Machine Learning(慕尼黑工业大学与慕尼黑机器学习中心) New York University(纽约大学) Medical University of South Carolina(南卡罗来纳医科大学) The LLM Data Company BenchFlow Independent Researcher(独立研究员) Northeastern University(东北大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Washington(华盛顿大学) TU Darmstadt(达姆施塔特工业大学) University of Southern California(南加州大学) UC San Diego(加州大学圣地亚哥分校) Amazon(亚马逊) Microsoft(微软) Korea University(高丽大学) Cornell Tech(康奈尔科技) University of Michigan(密歇根大学)

专题命中 Agent评测 :agent(title,title_cn);agentic(title,abstract);分类 cs.AI

AI总结 提出全开放数据筛选流水线,通过100多次消融实验研究任务来源与多样性,构建10万样本训练集,在7个智能体基准上平均44.8%准确率,较最强开源模型提升3.9个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15591 2026-08-18 cs.AI 新提交 91%

Agent Gym: A Framework for Continuous Evaluation and Evolution of LLM Agents Through Human-in-the-Loop Feedback

Agent Gym:通过人在回路反馈实现LLM智能体持续评估与演化的框架

Pouya Ghiasnezhad Omran, Michael Zimmermann, Duncan Cambridge, Ashmita Kapoor, Tanya Dixit

机构 * Google Cloud(谷歌云)

专题命中 Agent评测 :agent(title,title_cn);agentic(abstract);分类 cs.AI

AI总结 Agent Gym是支持LLM智能体持续评估演化的模块化框架,通过人在回路反馈实现行为修正,其发票处理参考验证表明框架实用可用。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23032 2026-07-01 cs.AI q-fin.GN 新提交 91%

IPO Finance Agent: Benchmark of LLM Financial Analysts Beyond Finance Agent v2, with Automated Rubric Generation, on the SpaceX (SPCX) IPO

IPO金融分析师:超越Finance Agent v2的LLM金融分析师评估,带自动评分标准生成——以SpaceX (SPCX) IPO为例

Mostapha Benhenda

机构 * Vals AI

专题命中 Agent评测 :agent(title,title_cn);agentic(abstract);分类 cs.AI

AI总结 针对IPO尽职调查中长文档检索的挑战,提出IPO Finance Agent框架,通过上下文检索和自动评分标准生成,在SpaceX S-1文件上评估多个LLM,最佳模型Qwen 3.7 Max准确率79.4%,成本$0.30/查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11218 2026-06-11 cs.CY cs.AI 新提交 91%

An Ethical eValuation Agent (EeVA): Results of a Proof-of-Concept Test on a Prototype Agentic-like Workflow to Assist Ethical Deliberations

伦理评估代理(EeVA):在原型类代理工作流中辅助伦理审议的概念验证测试结果

Stephen Milford, B. Zara Malgir, Miguel Vazquez

机构 * Institute for Biomedical Ethics, Basel University(伦理研究所,巴塞尔大学) North-West University(北开普大学) Barcelona Supercomputing Center(巴塞罗那超级计算中心)

专题命中 Agent评测 :workflow(title,abstract);agentic(title,abstract);agent(title);分类 cs.AI

AI总结 提出基于LLM的类代理工作流EeVA,通过10种伦理框架评估用例,生成结构化评估与综合,促进伦理反思而非给出绝对答案,在三个案例中验证了可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31179 2026-07-01 cs.AI cs.CL cs.CV 新提交 91%

HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents

HealthAgentBench:面向挑战性前沿AI代理的统一真实医疗环境基准套件

Qianchu Liu, Sheng Zhang, Guanghui Qin, Jeya Maria Jose Valanarasu, Maximilian Rokuss, Mingyu Lu, Timothy Ossowski, Juan Manuel Zambrano Chaves, Cliff Wong, Peniel Argaw, Yashna Hasija, Mu Wei, Wen-wai Yim, Qin Liu, Zilin Jing, Jason Entenmann, Naoto Usuyama, Tristan Naumann, Hoifung Poon

机构 * Microsoft(微软)

专题命中 Agent评测 :AI agent(title,abstract);agentic(title,abstract);agent(abstract);workflow(abstract)

AI总结 提出包含54个医疗任务的基准套件HealthAgentBench,评估AI代理在真实临床工作流中的端到端多步推理能力,最强代理Codex GPT-5.5仅达42%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19263 2026-08-21 cs.SE cs.MA 新提交 90%

The Evaluation Context Protocol (ECP): A Portable Contract for AI Agent Evaluation

评估上下文协议(ECP):一种用于AI智能体评估的便携式契约

Aniket Wattamwar, Manav Anandani, Mrunal Kakirwar

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);autonomous agent(abstract);agentic(abstract)

AI总结 针对当前AI智能体评估范式的局限性,提出厂商中立的ECP协议,实现跨框架的统一评估,已开发适配主流智能体框架的开源参考实现,相关验证为未来工作。

Comments 14 pages, 4 tables, 4 figures, Code available at https://github.com/evaluation-context-protocol

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25656 2026-06-25 cs.CL cs.AI cs.IR 新提交 90%

Is GraphRAG Needed? From Basic RAG to Graph-/Agentic Solutions with Context Optimization

是否需要GraphRAG?从基础RAG到基于图/智能体的上下文优化解决方案

Long Chen, Ryan Razkenari, Yuxuan Zhou, Yuan Tian, Rahul Ghosh, Venkatesh Pappakrishnan, Disha Ahuja, Vidya Sagar Ravipati

机构 * Generative AI Innovation Center, Amazon Web Services (AWS)(亚马逊云科技(AWS)生成式AI创新中心) Cisco Systems, Inc.(思科系统公司)

专题命中 Agent评测 :agentic(title,summary_cn);agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一个框架,比较常规RAG、GraphRAG、Modular RAG和Agentic RAG在9种标准化场景下的性能,并引入上下文工程方法减少19%-53%的token使用,同时发现检索-生成差距,表明扩展检索未成比例提升生成质量。

Comments Accepted to ACL 2026 GEM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15579 2026-06-16 cs.AI cs.LG cs.MA cs.SE 新提交 90%

Your Agent Has a Genome: Sequence-Level Behavioral Analysis and Runtime Governance of LLM-Powered Autonomous Agents

你的智能体有基因组:基于序列的LLM驱动自主智能体行为分析与运行时治理

Sidi Deng

机构 * Independent Researcher(独立研究员)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 提出XEPV序列编码框架,将LLM智能体行为建模为基因组序列,通过n-gram挖掘发现P-X-P高风险模式,设计Governor三层干预系统,使成功率提升6.2%并减少44% token消耗。

Comments 16 pages, 15 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17933 2026-08-19 cs.AI cs.CE 新提交 90%

EvoTS-Agent: A Self-Evolving LLM Agent for Financial Time Series Change Point Detection

EvoTS-Agent:一种用于金融时间序列变点检测的自进化大语言模型智能体

Lei Jiang, Ye Wei, Xinyu Xi, Jordan Langham-Lopez, Yifan Bao, Raad Khraishi, Yihao Ang, Anthony K. H. Tung, Lukasz Szpruch, Hao Ni

机构 * Alan Turing Institute(阿兰·图灵研究所) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) NatWest AI Research(国民西敏寺银行人工智能研究部) University of Edinburgh(爱丁堡大学) University College London(伦敦大学学院)

专题命中 Agent评测 :agent(title,title_cn);分类 cs.AI

AI总结 该研究针对金融时间序列变点检测难题,提出自进化 LLM 智能体 EvoTS-Agent,经验证引导进化检测流程,在四个基准数据集上表现优于现有同类智能体且执行成功率达100%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10768 2026-07-14 cs.AI 新提交 90%

Opti-Agent-Bench: Benchmarking End-to-End Optimization R&D Agents on Real-World Business Problems

Opti-Agent-Bench:在实际业务问题上对端到端优化研发智能体进行基准测试

Yongchang Fu, Xinjie Huang, Chengjun Dai, Chengzhe Feng, Junshao Zhang, Hong Zhu

机构 * Ding Talk, Alibaba Group(钉钉,阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(title,title_cn);分类 cs.AI

AI总结 研究针对大语言模型解决优化问题的现有不足,引入Opti-Agent-Bench基准测试,通过业务语义真实性、模块化评估、ORAC双层有效性框架,在多工业规模任务中揭示当前模型关键失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18142 2026-07-08 cs.AI cs.CL cs.CY 新提交 90%

Your AI Travel Agent Would Book You a Bullfight: An Agentic Benchmark for Implicit Animal Welfare in Frontier AI Models

你的AI旅行代理会为你预订斗牛:前沿AI模型中隐含动物福利的代理基准

Jasmine Brazilek, Joel Christoph, Maheep Chaudhary, Oliver Tullio, Carol Kline, Miles Tidmarsh, Arturs Kanepajs

机构 * Compassion Aligned Machine Learning(同情对齐机器学习) Sentient Futures(感知未来) Harvard Kennedy School(哈佛肯尼迪学院) Appalachian State University Department of Management(阿巴拉契亚州立大学管理系)

专题命中 Agent评测 :agent(title,abstract);agentic(title,abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 提出首个代理基准TAC,测试AI代理在为用户执行旅行预订等操作时是否避免涉及动物剥削的选项。评估七个前沿模型,所有模型得分低于随机水平64%,最佳模型仅53%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12721 2026-08-14 cs.CV 新提交 89%

VOS-Agent: The 1st Place Solution for the 8th LSVOS Challenge (MOSEv2 Track)

VOS-Agent:第8届LSVOS挑战赛(MOSEv2赛道)的第一名解决方案

Canyang Wu, Jinrong Zhang, Xusheng He, Ce Bian, Xianjing Han, Jianlong Wu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Nanyang Technological University(南洋理工大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 Agent评测 :agent(title,title_cn)

AI总结 针对复杂视频目标分割中微小目标、语义主导目标的稳健传播难题,本文提出VOS-Agent协作框架,以SAM3为共享密集分割模块,根据目标特征激活专用智能体,在ECCV 2026第8届LSVOS挑战赛MOSEv2赛道获第一名,J&JF指标达69.82%。

Comments 1st Place Solution for the 8th LSVOS MOSEv2 Challenge (ECCV 2026 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏