arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1207 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1207 篇

2608.06020 2026-08-07 cs.AI cs.LG 新提交 86%

From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models

从经济智能体到智能体经济:经济世界模型的系统蓝图

Jiale Han, Xiang Li, Jing Qian, Wenyuan Gu, Pin Gao, Ye Luo, Hongyuan Zha, Dacheng Tao, Benyou Wang, Lin William Cong

机构 * Shenzhen Loop Area Institute(深圳河套学院) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract);planning(abstract)

AI总结 本文提出经济世界模型(EWM)的六级能力阶梯实施蓝图,旨在加速可作为人类决策沙箱与AI智能体基础的下一代高保真经济模拟环境开发。

Comments Project page: https://github.com/FreedomIntelligence/Awesome-Economic-World-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02712 2026-08-05 cs.SE cs.AI 新提交 86%

Don't Regenerate, Debug: A Domain-Specific Agent for Repairing Near-Miss Hardware Operators

不要重新生成,要调试:一种用于修复近失配硬件算子的领域特定智能体

Yansong Sun, Shenxiu Wu, Siyuan Chen, Runlin Hou, Junhao Qiu, Junming Cao, Shudi Shao, Zhichao Lu, Qingfu Zhang

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出领域特定调试智能体,通过调试而非重新生成修复硬件近失配算子,其调试Pass@1准确率更高、token消耗更少,可拓展能力边界并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25485 2026-07-29 cs.AI cs.CL 新提交 86%

PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents

PatientAgentBench:一个用于评估面向患者的健康人工智能代理的基准框架

Korosh Vatanparvar, Ashutosh Joshi, Maria Xenochristou, Mohammad Abuzar Hashemi, Prasad Kasu, Deepak Bansal, Daniel Lopez-Martinez, Anchal Nema, Ramya Ganesan, Will Kimbrough, Alex Woody, Yadunandana Rao, Dilek Hakkani-Tur, Wilko Schulz-Mahlendorf

机构 * Amazon Health AI(亚马逊健康人工智能)

专题命中 Agent评测 :AI agent(title);agent(abstract);workflow(abstract);agentic(abstract)

AI总结 研究面向患者的健康人工智能代理评估问题,核心方法是用PatientAgentBench框架,通过语言模型评审团在多维度评估,主要贡献是发现模型临床差距,发布可重复、经临床医生验证的评估标准助领域弥补差距。

Comments Code: https://github.com/amazon-science/PatientAgentBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18366 2026-07-22 cs.AI cs.CL cs.CY 新提交 86%

Operational Hallucination and Safety Drift in AI Agents

人工智能代理中的操作幻觉与安全漂移

Shasha Yu, Fiona Carroll, Barry L. Bentley

专题命中 Agent评测 :AI agent(title);agent(abstract);autonomous agent(abstract);agentic(abstract)

AI总结 研究大型语言模型在多轮执行中引发的可靠性风险,通过多轮评估量化安全漂移和操作幻觉现象,分析其根源,提出行动感知监督层,该层能拦截违规行为且无良性误报,提升了代理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11399 2026-07-14 cs.CL cs.AI 新提交 86%

Agentic Routing: The Harness-Native Data Flywheel

智能体路由:原生执行框架的数据飞轮

Xinchen Liu, Hang Zhou, Yingjie Zong, Yuchuan Tian, Liuyang Song, Shuo Zhang, Yulong Li, Wei He, Mengyu Zheng, Runke Liu, Siyang Cheng, Xiang Kuang, Hailin Hu, Kai Han, Yunhe Wang

机构 * TokenRhythm Technologies(TokenRhythm科技公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI、cs.CL

AI总结 研究大型语言模型智能体中模型选择问题,提出原生执行框架智能体路由范式,依执行框架状态选模型,其决策产生的数据记录形成数据飞轮,经实例化验证,表明该路由不仅控成本,更是智能体训练的数据引擎。

Comments Code: https://github.com/opensquilla/opensquilla

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16000 2026-06-18 cs.CL cs.LG 新提交 86%

GRACE-DS: a Guarded Reward-guided Agent Correction Environment in Data Science

GRACE-DS:数据科学中的受保护奖励引导智能体修正环境

Aleksandr Tsymbalov, Danis Zaripov, Artem Epifanov, Anastasiya Palienko

机构 * ITMO University(ITMO大学) HSE University(高等经济学院)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);workflow(abstract);分类 cs.CL、cs.LG

AI总结 提出GRACE-DS,一个用于评估LLM驱动的AutoML智能体在部署前性能的隔离环境,通过隐藏的可执行验证器衡量预测性能、泄漏避免、可重复性等指标,实验证明其灵活迭代交互模式优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15899 2026-06-16 cs.CR cs.AI cs.HC cs.LG cs.MA 新提交 86%

SkillVetBench: LLM-as-Judge for Multi-Dimensional Security Risk Evaluation in Open-Source LLM Agent Skills

SkillVetBench: 基于LLM评判的多维安全风险评估开源LLM智能体技能

Ismail Hossain, Sai Puppala, Md Jahangir Alam, Tanzim Ahad, Sajedul Talukder

机构 * SUPREME Lab, University of Texas at El Paso, Texas, USA(SUPREME实验室,德克萨斯理工大学埃尔帕索分校,德克萨斯州,美国)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 提出SkillVetBench,利用LLM作为评判器对开源LLM智能体技能进行多维安全风险评估,引入五维技能智能体风险评分(SARS)和CVSS v4.0向量分解,在78个恶意技能上实现零假阴性,22个良性技能上零假阳性。

Comments The main research paper is submitted to NeurIPS 2027, it is in under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13994 2026-06-15 cs.CR cs.AI cs.LG 新提交 86%

Hidden in Plain Sight: Benchmarking Agent Safety Against Decomposition Attacks with DECOMPBENCH

隐于无形:使用DECOMPBENCH基准测试代理安全对抗分解攻击

Vikhyath Kothamasu, Virginia Smith, Chhavi Yadav

机构 * Carnegie Mellon University(卡内基梅隆大学) Simons Institute, UC Berkeley(Simons研究所,伯克利大学)

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出DeCompBench基准,通过分解攻击将有害任务拆分为良性子任务,揭示现有代理安全机制在对抗分解攻击时的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11166 2026-08-12 cs.SE 新提交 86%

Agentic Configuration Management (ACM): A Reference Configuration Model for Governed Agentic Systems

智能体配置管理(ACM):受管控智能体系统的参考配置模型

Audrey Quessada-Vial

专题命中 Agent评测 :agentic(title,abstract);AI agent(abstract,abstract_cn);分类 cs.SE

AI总结 本文提出与框架无关的智能体配置管理(ACM)模型,经实验验证可实现异构智能体系统的管控等价表示,支持可复现性、可审计性等,适配LangGraph等主流框架。

Comments 77 pages, 12 figures, 17 tables. Includes formal appendices and experimental evaluation across LangGraph, CrewAI, and the OpenAI Agents SDK. Reference implementation and evaluation artifacts: https://github.com/audreyqvial/ACM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20394 2026-06-19 cs.RO math.OC 新提交 86%

Agentic AutoResearch forSpace Autonomy: An Auditable, LLM-Driven Research Agent for Aerospace Control Problems

面向空间自主性的智能体自动研究:用于航空航天控制问题的可审计、LLM驱动的研究代理

Amit Jain, Richard Linares

机构 * Department of Aeronautics and Astronautics(航空航天学系)

专题命中 Agent评测 :agent(title,abstract);agentic(title)

AI总结 提出AutoResearch框架,利用大语言模型作为离线研究代理,自动迭代开发航天控制策略,并通过内置可信层审计结果,消除种子噪声影响,在交会和对接问题上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18099 2026-08-20 cs.AI q-fin.PM 新提交 85%

FinSkillBench: Evaluating AI Agents and Domain Skills for Investment Management

FinSkillBench:评估用于投资管理的智能体AI与领域技能

Jermyn Zhen Yong Bek, Zhuang Qiang Bok, Zhongtian Sun

机构 * Deep Insight Labs(深洞察实验室) University of Kent(肯特大学) University of Cambridge(剑桥大学)

专题命中 Agent评测 :AI agent(title);agent(abstract,abstract_cn);agentic(abstract);分类 cs.AI

AI总结 FinSkillBench是评估投资管理领域AI智能体金融技能的基准,经9个模型的大规模评估发现,精选技能可显著提升性能,而自生成技能益处有限,其成果为该领域研究提供了支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17597 2026-08-19 cs.CR cs.AI 新提交 85%

HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety

HarnessRisk:面向生命周期的智能体管控安全基准

Yajing Bai, Jinhao Duan, Jie Peng, Xianfeng Wu, Sijia Liu, Song Wang, Tianlong Chen

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 研究提出面向生命周期的智能体管控安全基准HarnessRisk,含128个沙箱案例,评估多模型与管控配置的安全表现,发现管控配置阶段最易受攻击,明确风险识别未必带来安全行动,凸显多维度评估智能体安全的必要性。

Comments Project Page: https://baiyajing.github.io/harness-risk/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07965 2026-08-11 cs.AI 新提交 85%

CyberAGENTS: Structured Autonomy for Agentic Gamified Learning in Cybersecurity

CyberAGENTS:面向网络安全领域智能体游戏化学习的结构化自主机制

Ivan Hornung, Deepthi Marasinghe Arachchige, Tharindu Kumarage, Garima Agrawal, Yuli Deng, Ying-Chih Chen, Huan Liu

机构 * Arizona State University(亚利桑那州立大学) Amazon AGI(亚马逊AGI)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本研究提出CyberAGENTS框架,通过结构化自主机制实现游戏化网络安全学习,经课堂评估验证其可提升学习者参与度与对AI响应的信任度,为相关系统设计提供蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05573 2026-08-07 cs.AI 新提交 85%

SkillTV-Bench: Benchmarking How Well Judges Perform on Skill-Augmented Agentic Execution

SkillTV-Bench:评估评判者在技能增强型智能体执行任务中的表现

Zhi Han, Chenxi Zeng, Liuhaichen Yang, Zihan Guo, Ming Zhou, Yang Li

专题命中 Agent评测 :agentic(title);agent(abstract,abstract_cn);tool use(abstract);分类 cs.AI

AI总结 SkillTV-Bench是含681个案例的智能体轨迹基准,用于评估技能感知轨迹验证;提出SkillTV-Evolve优化JudgeSkill,使智能体评判者准确率提升14.8个百分点,选定轨迹成功率大幅提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02657 2026-08-05 cs.CR cs.AI 新提交 85%

Your Agentic LLMs Secretly Encode Latent Signals of Indirect Prompt-Injection Exposure

你的智能体大模型会秘密编码间接提示注入暴露的潜在信号

Jianshuo Dong, Yiming Liu, Maosen Zhang, Nan Deng, Xu Peng, Xiaoping Zhang, Tianwei Zhang, Jie Zhang, Han Qiu

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文研究智能体大模型的间接提示注入暴露问题,通过探测、防御、解释三方面分析,提出AGRI防御方法,可大幅降低攻击成功率且保持任务效用

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02470 2026-08-04 cs.CV cs.AI 新提交 85%

Grounding Agentic VLMs with Dedicated Segmentation for Fine-Grained Vehicle Damage Assessment

基于专用分割模型实现具身智能视觉语言模型(Agentic VLMs)的细粒度车辆损伤评估

Vishwajeet Shivaji Hogale, Anjali Pai, Nitya Ravi

机构 * Northeastern University(东北大学)

专题命中 Agent评测 :agentic(title,title_cn);agent(abstract);分类 cs.AI

AI总结 针对VLMs空间定位不可靠问题,本文提出TinyDamage架构,将空间定位委托给专用多任务分割模型,集成至7节点LangGraph智能体流程,在车辆损伤评估中大幅降低报告虚构率。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26064 2026-07-30 cs.CY cs.AI 新提交 85%

The Age of AI Agents Demands A New Scientific Paradigm To Sustain Trustworthy Science

AI智能体时代需要新的科学范式以维持可信科学

Belinda Mo

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 针对AI自主研究智能体带来的科学产出验证缺口扩大问题,该文提出需进化科学验证基础设施的标准,以应对无人能核查结果等风险,维持科学信任。

Comments Accepted at ICML 2026, Position Paper Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25891 2026-07-29 cs.AI cs.DB 新提交 85%

Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation

梅西耶:用于跨基准智能体评估的高分辨率语料库

Stefan Krsteski, Charlotte Meyer, Guillaume Allegre, Tony O'Halloran, Alexandre Sallinen

机构 * Andromede AI(仙女座人工智能公司)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);function calling(abstract);分类 cs.AI

AI总结 研究针对智能体评估中任务等碎片化问题,引入梅西耶语料库,整合多基准、智能体、任务和验证器等信息,标准化记录并分类。通过该语料库发现基准进展不均衡,指出多验证器任务评分问题,得出能力量表,为智能体评估提供基础可复用设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23147 2026-07-28 cs.CR cs.AI 新提交 85%

False Prophets: On the Security of World Models in Agentic Systems

虚假预言:论智能体系统中世界模型的安全性

Erik Imgrund, Anna Wimbauer, Klim Kireev, Konrad Rieck

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 研究智能体系统中世界模型的安全性,发现其存在特定漏洞,引入安全基准数据集,指出攻击者能诱导错误预测,成功率达95%,并为从业者提供减轻危害、强化系统的实用建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24663 2026-07-28 physics.acc-ph cs.AI cs.IR 新提交 85%

A corrective agentic hybrid RAG and an operations-grounded evaluation for a scientific facility

一种用于科学设施的校正智能混合RAG及基于操作的评估

Rajat Sainju, Dariusz Jarosz, Hairong Shang, Michael Prince, Ryan M. Aydelott, Mathew J. Cherukara, Yine Sun, Michael D. Borland

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI

AI总结 研究针对科学设施操作知识难覆盖问题,提出APS - RAG平台,融合多种检索通道并添加校正智能循环,构建APS - Bench数据集评估。结果显示该平台提升关键信息召回率,交叉编码器重排器作用显著,还发布相关资源,为设施操作提供可信AI辅助工作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19038 2026-07-22 cs.CV cs.AI 新提交 85%

FilmWorld: Agentic Novel-to-Film Generation through Dynamic Cinematic World Modeling

FilmWorld:通过动态电影世界建模实现从小说到电影的智能生成

Jialong Zuo, Haotong Zuo, Shiwei Zhang, Xiang Wang, Chen Li, Nong Sang, Changxin Gao, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI

AI总结 研究如何将小说转化为电影,提出将其形式化为动态电影世界建模,构建FilmWorld系统,两组智能体协作实现各阶段,引入FilmEval评估框架,实验证明该系统性能优于现有技术。

Comments Project Page: https://filmworld-ai.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16845 2026-07-21 cs.AI 新提交 85%

From Overload to Insights: How AI Agents Can Support Scientists in Analyzing Complex Data

从过载到洞察:人工智能代理如何支持科学家分析复杂数据

Tim Fuchs, Luca Gelisio, Steffen Hauf, Walid Maalej

机构 * European XFEL(欧洲X射线自由电子激光设施)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 针对欧洲XFEL科学家分析复杂数据面临的挑战,设计并评估智能AI系统。采用设计科学研究方法,经多项研究开发并评估两原型,确定关键挑战,得出对AI代理的要求及设计建议,为开发可维护的AI支持提供指导。

Comments Accepted for publication at the 42nd IEEE International Conference on Software Maintenance and Evolution

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14275 2026-07-17 cs.AI cs.MA 新提交 85%

AI Agents Do Not Fail Alone:The Context Fails First

人工智能智能体并非独自失败:上下文首先失败

Fouad Bousetouane

机构 * The University of Chicago(芝加哥大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI

AI总结 研究人工智能智能体可靠性,通过ProofAgent-Harness评估上下文七个标准,验证上下文工程质量是智能体可靠性的领先指标,经受控研究表明上下文质量标准可预测行为结果,确立其为预检信号及可审计层。

Comments 24 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15001 2026-07-17 hep-lat cs.AI hep-ph 新提交 85%

LQCDMaster: Agentic Scientific Computing for Lattice Quantum Chromodynamics Research

LQCDMaster:用于格点量子色动力学研究的智能科学计算

Haofei Gao, Tingjia Miao, Wenkai Jin, Muhua Zhang, Hanzhang Wang, Jie Ran, Jinxin Tan, Zhentao Zhang, Bo Tang, Leiyi Li, Jun Hua, Xiangyu Jiang, Qi-An Zhang, Siheng Chen, Wei Wang

机构 * School of Physics and Astronomy(物理与天文学院) Tsung-Dao Lee Institute(李政道研究所) State Key Laboratory of Dark Matter Physics(暗物质物理国家重点实验室) School of Artificial Intelligence(人工智能学院) Zhiyuan College(智远学院) School of Physics(物理学院) SciLand Institute of Quantum Matter(量子物质研究所) Department of Physics(物理系)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI

AI总结 研究针对格点量子色动力学研究实际应用受限问题,提出LQCDMaster智能体,结合智能规划等技术将自然语言任务转化为计算工作流程。经实验评估,其能精确再现多数任务,大幅缩短实现时间,开创智能科学计算范式,促进相关研究。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11503 2026-07-14 cs.CL 新提交 85%

GEIS: A Generation-Evaluation-Improvement Loop of Agent Skills for Long-Form Article Generation

GEIS:用于长篇文章生成的智能体技能生成-评估-改进循环

Jiale Zhang, Juntao Hu, Zhijian Ou

机构 * Speech Processing and Machine Intelligence (SPMI) Lab, Tsinghua University, China(清华大学语音处理与机器智能实验室) TasiTech Co., Ltd., China(泰赛科技有限公司)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);multi-agent(abstract);分类 cs.CL

AI总结 针对长篇文章生成难题,提出GEIS循环,通过在Tasi Harness中实现文章写作、证据图像收集等技能,经核心写作、成对评估及改进技能,在20个主题实验中提升了PDF质量得分,证明可将其转变为可改进循环。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11423 2026-07-14 cs.CL 新提交 85%

ToFu: A White-Box, Token-Efficient Agent Harness for Researchers

ToFu:面向研究人员的白盒、令牌高效代理工具包

Junhao Ruan, Yuan Ge, Bei Li, Yongjing Yin, Yuchun Fan, Xin Chen, Jingang Wang, Chenglong Wang, Jingbo Zhu, Tong Xiao

机构 * Northeastern University(东北大学) LongCat RSI, Meituan(美团龙猫RSI) NiuTrans Research(小牛翻译研究院)

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);agentic(abstract);分类 cs.CL

AI总结 研究提出ToFu这一代理工具包,作为研究助手,以高令牌效率等支持实际研究流程,且能本地部署;作为研究对象,提供白盒工具包供研究人员检查、修改和评估,兼具强大性能与用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10286 2026-07-14 cs.AI cs.MA 新提交 85%

Can Agentic Trading Systems Pay for Their Own Intelligence?

智能交易系统能否为自身智能付费?

Qiqi Duan, Changlun Li, Chen Wang, Fan Zhang, Mengxiang Wang, Dayi Miao, Peixian Ma, Jiangpeng Yan, Liyuan Chen, Shuoling Liu, Preslav Nakov, Yuyu Luo, Nan Tang

机构 * HKUST(GZ)(香港科技大学(广州)) Paradoox AI(悖论人工智能公司) E Fund Management Co., Ltd(易方达基金管理有限公司) MBZUAI(Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)) The University of Tokyo(东京大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI

AI总结 研究基于LLM的交易系统中智能体能否为自身智能付费的问题,引入TradeLens工具包进行评估,通过多方面分析发现可行性取决于智能到利润的转化,不同模型有不同失败模式,重构了此类交易智能体的评估方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08495 2026-07-10 cs.CY cs.AI 新提交 85%

The Context Access Divide: Interaction-Level Architecture as a Complementary Dimension of Agentic Inequality

上下文访问鸿沟:交互级架构作为智能不平等的补充维度

Masahiro Fujita

机构 * Faculty of Sociology, Kansai University(京都产业大学社会科学学部)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究智能不平等中未被关注的个体交互层面的上下文访问鸿沟,提出上下文性作为补充维度,用概率模型形式化CAD,分析其在相关架构中的技术基础及对知识工作分层和平台治理的影响。

Comments 19 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04433 2026-07-07 cs.IR cs.CL 新提交 85%

Autonomous Information Seeking: A Roadmap for Agentic Recommender Systems

自主信息寻求:智能推荐系统路线图

Xinyu Lin, Yashar Deldjoo, Sunhao Dai, Honghui Bao, Xiaopeng Ye, Fatemeh Nazary, Wenjie Wang, Tommaso Di Noia, Jun Xu, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Polytechnic University of Bari(巴里理工大学) Renmin University of China(中国人民大学) University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.CL

AI总结 综述基于大语言模型的智能体融入推荐系统带来的转变,介绍基于自主性水平的分类法及三种核心范式,分析各范式采用的架构和智能体对关键组件的增强,探讨评估方法及未解决问题,指出开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00939 2026-07-02 cs.SE quant-ph 新提交 85%

Leveraging LLM-Based Agentic Systems to Generate Quantum Applications for Test Optimization

利用基于LLM的代理系统生成量子应用以优化测试

Ming Tao, Yuechen Li, Tao Yue, Man Zhang, Aitor Arrieta Marcos

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 提出QPipe,一种基于大语言模型的多代理架构,自动将自然语言需求转化为可执行的量子应用工作流,在测试优化问题上实现高编译率和执行率。

详情

展开后加载摘要…

URL PDF HTML 收藏