SciTextures: Collecting and Connecting Visual Patterns, Models, and Code Across Science and Art
SciTextures: 收集和连接科学与艺术中的视觉模式、模型和代码
专题命中 软件智能体 :agentic(abstract)
AI总结 SciTextures通过连接视觉模式与生成机制,提供大规模数据集评估VLMs对物理系统多层抽象的理解与模拟能力。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
SciTextures: 收集和连接科学与艺术中的视觉模式、模型和代码
专题命中 软件智能体 :agentic(abstract)
AI总结 SciTextures通过连接视觉模式与生成机制,提供大规模数据集评估VLMs对物理系统多层抽象的理解与模拟能力。
机制设计中的合同签订
专题命中 软件智能体 :agent(abstract)
AI总结 本文研究了众包市场中主体通过中介与工人互动的机制设计问题,提出了虚拟价值定价模型,并分析了双边际化价格和纳什均衡价格在不同分布下的界限。
Avenir-Web: 人类经验模拟的多模态网络代理与接地专家混合
机构 * University College London(伦敦大学学院) ; The University of Edinburgh(爱丁堡大学) ; Princeton University(普林斯顿大学)
专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL
AI总结 Avenir-Web通过融合接地专家与经验模仿规划,实现了在复杂网络界面中可靠执行长周期任务的开源网络代理新纪录。
Mobile-Bench-v2: 一种更现实和全面的基于VLM的移动代理基准测试
机构 * Nanyang Technological University(南洋理工大学) ; Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 Gallagher人工智能学院) ; MiLM Plus, Xiaomi Inc.(小米公司 MiLM Plus) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究所)
专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 Mobile-Bench-v2通过引入基于槽位的指令生成方法,构建了一个更现实和全面的基准测试,以评估基于VLM的移动代理在处理噪声、多路径任务和主动交互方面的性能。
道路网络中的交通感知导航
机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) ; Queen’s University(女王大学)
专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI
AI总结 本研究比较了三种图搜索方法在Kingston道路网络中交通感知导航中的性能,发现Dijkstra和A*在交通感知最优解方面表现最佳,而Yen's算法在预处理和运行效率上取得平衡。
MAGNET:迈向基于记忆驱动的知识演化的自适应GUI代理
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; University of Southern California(南加州大学)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI
AI总结 MAGNET通过双层记忆机制和动态演化机制,提升GUI代理在界面变化中的适应性和任务执行性能。
AOASS:自适应障碍感知正方形螺旋框架用于单移动锚点基于WSN定位
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 AOASS通过自适应障碍检测和优化运动模式,提升WSN中单移动锚点的定位精度与能耗效率,适用于现实物联网应用。
Comments 19 pages, 4 figures
自主导航中的主动感知强化学习
机构 * Department of Engineering Cybernetics, Norwegian University of Science and Technology (NTNU)(工程 cybernetics 系,挪威科学技术大学)
专题命中 GUI与网页智能体 :planning(abstract)
AI总结 本文提出一种端到端强化学习框架,使无人机在复杂环境中通过主动控制相机实现安全导航与探索。
Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2026
针对现实动态环境中的GUI代理的环境注入攻击
机构 * College of AI, Tsinghua University(清华大学人工智能学院) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; School of Computer Science, Peking University(北京大学计算机学院)
专题命中 GUI与网页智能体 :agent(abstract)
AI总结 本文提出Chameleon框架,通过LLM驱动的环境模拟和注意力黑洞机制,有效暴露GUI代理在动态环境中的隐藏漏洞。
通过保守代理进行具有随机延迟的环境强化学习
机构 * Department of Convergence IT Engineering, Pohang University of Science and Technology(融合信息技术工程系,POSTECH) ; Department of Electrical Engineering, Pohang University of Science and Technology(电气工程系,POSTECH)
专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究提出保守代理,通过将随机延迟环境转换为等效恒定延迟环境,提升连续控制任务中的渐近性能和样本效率。
StoryState: 基于代理的状态控制用于一致且可编辑的故事书
机构 * Birbhum Institute of Engineering and Technology(比尔布尔工程科技学院) ; Universiti Malaya(马来亚大学) ; City University of Hong Kong(香港城市大学) ; Wake Forest University(威克森林大学)
专题命中 记忆与上下文管理 :agent(title,abstract)
AI总结 StoryState通过基于代理的状态控制实现多页故事书的一致性与编辑优化
Live-Evo: 从连续反馈中在线进化智能记忆
机构 * Oregon State University(俄勒冈州立大学) ; AG2 AI(AG2人工智能) ; Penn State University(宾夕法尼亚州立大学)
专题命中 记忆与上下文管理 :agentic(title);分类 cs.AI、cs.LG
AI总结 Live-Evo通过在线进化记忆系统,在连续反馈中提升任务性能和市场收益。
Comments 13 pages
SPARC-RAG:基于上下文管理的自适应顺序-并行扩展用于检索增强生成
机构 * University of Southern California(南加州大学) ; Capital One
专题命中 记忆与上下文管理 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 SPARC-RAG通过多代理框架实现顺序与并行扩展的协调,提升检索增强生成在多跳问答中的性能和效率。
过去折扣是学习具有长时间范围的马尔可夫公平性的关键
机构 * Washington University in St Louis(华盛顿大学圣路易斯分校)
专题命中 记忆与上下文管理 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 本文提出了一种结合过去折扣的公平性框架,解决了长期时间范围内学习马尔可夫公平性的关键挑战,通过理论分析证明其在状态空间的有界性,为可扩展的公平资源分配提供了新方法。
在完全老虎机反馈下学习马尔可夫决策过程
机构 * Department of Industrial and Operations Engineering, University of Michigan(工业与运作工程系,密歇根大学) ; Computer Science Department, New York University(计算机科学系,纽约大学)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG
AI总结 本文提出了在完全老虎机反馈下学习回合制MDP的高效算法,实现了O(√T)的后悔界,并展示了其在k-项预言不等式中的性能与有详细反馈的算法相当。
自组织式自进化代理
机构 * UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学Terminus AI实验室,中国科学院大学) ; Centre for Artificial Intelligence and Robotics, HKISI-CAS(人工智能与机器人中心,中国科学院香港研究院) ; School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG
AI总结 本文提出了一种自组织式自进化框架,通过对比反思和自组织机制,使LLM代理能有效利用历史经验实现长期进化。
隐性偏见如何在LLM长期记忆中积累和传播
机构 * International Research Center for Artificial Intelligence, Harbin Institute of Technology (Shenzhen), Shenzhen, China ; Chongqing Research Institute of Harbin Institute of Technology, Chongqing, China ; College of Computing ; Data Science, Nanyang Technological University, Singapore ; Department of Management ; Marketing, The Hong Kong Polytechnic University, Hong Kong ; Haide College, Ocean University of China, Qingdao, China ; School of Computer Science, The University of Sheffield, Sheffield, UK ; Department of Automation, Tsinghua University, Beijing, China
专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.LG
AI总结 本文研究了LLM长期记忆中隐性偏见的积累与传播,提出动态内存标记方法以缓解偏见问题。
Comments Under review, and the first two authors contribute equally
Transformer记忆能否被破坏?调查大型语言模型中的缓存侧漏洞
机构 * College of Engineering and Computer Science, University of Central Florida(中央佛罗里达大学工程与计算机科学学院) ; Department of Computer Science and Engineering, Mississippi State University(密苏里州立大学计算机科学与工程系) ; Department of Electrical and Computer Engineering, North Carolina State University(北卡罗来纳州立大学电子与计算机工程系)
专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI
AI总结 本文提出恶意令牌注入框架,揭示了大型语言模型缓存中的安全漏洞,通过扰动缓存关键向量影响模型输出和任务性能。
混合人工-生物细胞集体用于湿ware计算
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 本文提出一种混合人工-生物细胞网络,通过人工细胞调控生化环境并利用细菌集体实现非线性时空动态,用于时间序列预测任务,展示了其在生物医学应用中的潜力。
APEX:一种解耦的记忆型探索者用于异步空中目标导航
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; National University of Singapore(新加坡国立大学) ; Central South University(中南大学) ; Meituan Academy of Robotics(美团机器人研究院)
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 APEX通过分层异步架构实现高效空中目标导航,提升探索效率与目标识别精度。
Comments 15 pages, 8 figures
利用可接受控制集实现到达-回避-稳定
机构 * Mechanical and Aerospace Engineering at UC San Diego(机械与航空航天工程系,UC圣地亚哥大学)
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 本文提出利用可接受控制集的方法,解决可达-回避-稳定问题,确保系统在连续目标和障碍物回避下安全稳定到达感兴趣点。
Comments 7 pages, 5 figures, submitted to 64th IEEE Conference on Decision and Control
Journal ref 2025 IEEE 64th Conference on Decision and Control (CDC)
AgentRx: 从执行轨迹诊断AI代理故障
机构 * Microsoft Research(微软研究院) ; Microsoft(微软)
专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);multi-agent(abstract);分类 cs.AI
AI总结 AgentRx通过自动化诊断框架,从执行轨迹中定位AI代理的关键故障步骤,并提升跨领域的故障归因能力。
HumanStudy-Bench: 向参与者模拟的AI代理设计迈进
机构 * University of California San Diego(加州大学圣地亚哥分校) ; Tsinghua University(清华大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Independent Researcher(独立研究者)
专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI
AI总结 HUMANSTUDY-BENCH通过代理设计问题重建人类受试者实验,评估代理行为与人类行为的一致性,涵盖个体认知、战略互动和社会心理学领域。
大卫与歌利亚:通过强化学习实现可验证的代理到代理劫持
机构 * Department of Artificial Intelligence, Radboud University, Nijmegen, The Netherlands(人工智能系,拉德堡德大学,尼姆韦根,荷兰)
专题命中 Agent评测 :agent(title);autonomous agent(abstract);tool use(abstract);agentic(abstract)
AI总结 通过强化学习框架Slingshot,验证了Tag-Along攻击作为可验证的威胁模型,并展示了如何通过环境交互从现成模型中引发有效代理攻击。
Comments Under review. 8 main pages, 2 figures, 2 tables. Appendix included
不要破坏缓存:对长周期智能体任务中提示缓存的评估
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);function calling(abstract);分类 cs.CL
AI总结 本文评估了提示缓存对长周期智能体任务的影响,发现通过策略性缓存控制可显著降低API成本并提升响应速度。
Comments 16 pages, 9 figures
TessPay:可信代理商业的验证后支付基础设施
机构 * University of Oxford(牛津大学) ; Indian Institute of Technology, Delhi(德里印度理工学院)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 TessPay通过'验证后支付'架构解决代理商业中的信任缺口,提供统一的交易生命周期基础设施。
A2Eval: 基于代理的自动评估用于具身脑
机构 * Zhejiang University, China(浙江大学) ; Westlake University, China(西湖大学) ; Beijing Innovation Center of Humanoid Robotics, China(北京人形机器人创新中心) ; University of Manchester, UK(曼彻斯特大学) ; Southern University of Science(南方科技大学) ; Xiamen University Malaysia, Malaysia(厦门大学马来西亚分校)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.CL
AI总结 A2Eval提出首个基于代理的自动评估框架,通过两个协作代理自动化基准编纂和评估,显著提升评估效率并减少成本,同时保持高保真度。
从意图到动作:自主网络中的代理AI
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.LG
AI总结 本文提出一种代理AI系统,用于自主网络中将高层意图转化为具体控制动作,通过三个专门代理实现意图解析、优化和控制,以满足多样化的网络需求。
多功能行为扩散用于通用交通代理模拟
机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) ; Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系) ; NVIDIA Research(NVIDIA研究)
专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract)
AI总结 多功能行为扩散通过生成多代理互动场景,提升交通模拟的灵活性和实用性,为自动驾驶系统测试提供基础工具。
LinearizeLLM: 一个基于代理的框架,用于由LLM驱动的非线性优化问题的精确线性重 formulations
机构 * Institute for Operations Research, Karlsruhe Institute of Technology, Karlsruhe, Germany(运营研究学院,卡尔斯鲁厄技术大学) ; Institute for Information Systems, Reutlingen University, Reutlingen, Germany(信息系统研究所,鲁特lingen大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG;workflow(comments)
AI总结 LinearizeLLM通过基于代理的LLM框架实现非线性优化问题的自动精确线性化,显著提升线性化效率和准确性。
Comments This version is a major revision with a new abstract, updated workflow logic and description, an expanded instance set, additional numerical experiments, and corrected bibliography entries