arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-28 至 2026-08-28 共收录 223 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 65 篇

2608.26685 2026-08-28 cs.IR cs.CL cs.DL 新提交 57%

BLANC: Discovering Patent White Space via Changes in Normalized Pointwise Mutual Information Between Multi-View Clusters

BLANC:通过多视图簇间归一化点间互信息变化发现专利空白区域

Shuichi Miyazawa, Kensuke Fujii

专题命中 规划决策 :planning(abstract);分类 cs.CL

AI总结 本研究提出BLANC三阶段流程,通过多视图神经主题建模、NPMI及ΔNPMI检测,在USPTO等语料库中成功恢复专利空白区域,其特异性优于单视图聚类与现有共现度量。

Comments 15 pages, 4 figures, 10 tables. A preliminary Japanese-language report covering the methodology and the industrial case study is scheduled to appear as AGC Research Report 76 (2026), ISSN 2434-0774. The present article is the full version, containing the entire quantitative evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26596 2026-08-28 cs.CL 新提交 57%

Not Just Reason, Not Just Scan: Reinforcement Learning for Proactive Scientific Error Verification over Academic Paper

不仅是推理,不仅是扫描:面向学术论文的主动科学错误验证强化学习

Rongjin Li, Yuanxin Liu, Hao Zhou, Fandong Meng, Jie Zhou, Xu Sun

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) WeChat AI, Tencent Inc.(腾讯微信人工智能部门)

专题命中 规划决策 :workflow(abstract);分类 cs.CL

AI总结 针对现有无预设问题/证据的学术论文科学错误验证研究不足的问题,提出VERA-RL强化学习框架,构建VERA-13K数据集,训练Qwen3-VL-8B后其可验证推理能力接近旗舰级多模态大语言模型。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26530 2026-08-28 cs.AI 新提交 57%

PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents

循环中的PILOT:长智能体的实时自我改进

Yang Xiao, Yusong Sun, Haoyi Wu, Wenyang Hui, Wen Da, Zhaokai Luo, Mu Chuan, Yao Hu, Wenjie Li, Chengyue Jiang

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 该研究针对长智能体自我改进方法无法实时利用经验的问题,提出PILOT框架,通过实时引导与实时自我进化机制,在多基准测试中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26355 2026-08-28 cs.CV cs.LG 新提交 57%

Finding the Right Evidence: Factor-Guided Coarse-to-Fine Reasoning for Long Videos

寻找合适的证据:因子引导的长视频由粗到细推理

Baixuan Xu, Yinyui Xu, Tianshi Zheng, Zhaowei Wang, Weiqi Wang, Haochen Shi, Jiayu Liu, Qing Zong, Xiyu Ren, Xinyu Geng, Zhitao He, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程学系)

专题命中 规划决策 :agentic(abstract);分类 cs.LG

AI总结 针对长视频问答的证据稀疏、选项区分困难问题,提出因子引导的PACE框架,经实验在多基准数据集上优于现有方法,实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26332 2026-08-28 cs.LG 新提交 57%

Beyond Capability Benchmarks: Learning Operational Fingerprints of LLM Cloud Services from Production Incident Metadata

超越能力基准:从生产事件元数据学习LLM云服务的操作指纹

Meiwei Zhang, Eduardo Miranda, Bruce Baynes, Suvigya Jain, Wanlong Chen, Tao He, Sergey Borodavkin

机构 * Google Cloud Platform, Google LLC(谷歌云平台,谷歌有限责任公司)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 该研究提出OpEmbed框架,利用生产支持案例元数据学习LLM云服务的操作指纹,在Google Cloud的大规模生产案例评估中表现优异,可用于模型上线、支持评估等场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23390 2026-08-28 cs.SI cs.LG 版本更新 57%

PACIFIER: Pacing Opinion Depolarization via a Unified Graph Learning Framework

PACIFIER:通过统一图学习框架进行意见极化控制

Mingkai Liao, Zijun Zhang, Mingyang Zhou

机构 * CSSE, Shenzhen University(深圳大学计算机科学与技术系)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 本文提出PACIFIER框架,通过图学习和强化学习解决基于Friedkin-Johnsen模型的意见极化问题,实现大规模网络的高效极化控制。

Comments 11 pages. Accepted at the 35th ACM International Conference on Information and Knowledge Management (CIKM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06474 2026-08-28 cs.CL 版本更新 57%

DataSTORM: Deep Research on Large-Scale Databases using Exploratory Data Analysis and Data Storytelling

DataSTORM:利用探索性数据分析和数据叙事进行大规模数据库的深度研究

Shicheng Liu, Yucheng Jiang, Sajid Farook, Camila Nicollier Sanchez, David Fernando Castro Pena, Monica S. Lam

机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系)

专题命中 规划决策 :agentic(abstract);分类 cs.CL

AI总结 DataSTORM通过探索性数据分析和数据叙事,实现对大规模结构化数据库的深度研究,提出基于论点的分析流程,并在InsightBench上取得新的最佳成绩。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26475 2026-08-28 stat.ME 新提交 50%

Power and Sample Size Calculations for Hybrid Controlled Trials

混合对照试验的功效与样本量计算

Ke Zhu, Shu Yang, Xiaofei Wang

专题命中 规划决策 :planning(abstract)

AI总结 本文针对混合对照试验样本量确定的难题,提出含5个常规RCT参数与3个EC可比性参数的5+3设计,推导估计量渐近分布并实现连续/二分类结局的样本量计算,相关方法已封装为hctdesign R包。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27456 2026-08-28 cs.CV 新提交 50%

UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City

UrbanGround:从局部感知到真实城市中的空间能动性

Tianjie Ju, Zheng Wu, Yueqing Sun, Yuhan Cui, Bobo Li, Shengqiong Wu, Pengzhou Cheng, Haodong Zhao, Zongru Wu, Xinbei Ma, Doris Zhang, Kunling Li, Mong-Li Lee, Wynne Hsu, Hao Fei, Qi Gu, Gongshen Liu, Zhuosheng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学) Meituan(美团) The Chinese University of Hong Kong(香港中文大学) Shanghai University(上海大学) University of Oxford(牛津大学)

专题命中 规划决策 :agent(abstract)

AI总结 本文提出首个基于香港3D地理空间数据构建的UrbanGround沙盒,探究MLLM智能体在真实城市中从局部感知转化为可靠行动的程度,发现其长时间探索时错误累积的缺陷,为相关研究提供支撑。

Comments 35 pages, 11 figures, 7 tables. Project Page: this https URL (https://urbanground.github.io), Code Repository: this https URL (https://github.com/UrbanGround/UrbanGround)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27092 2026-08-28 cs.CR 新提交 50%

The Framing Gap: Indirect Prompt-Injection Exfiltration Defeats Surface-Level Defenses in Tool-Using Agents

框架缺口:间接提示注入数据泄露可突破使用工具智能体的表层防御

Md Habibur Rahman, Jaeho Kim

专题命中 规划决策 :agent(abstract)

AI总结 该研究发现使用工具的智能体存在框架缺口,间接提示注入攻击可通过重新表述泄露内容突破表层防御,需通过目标约束或能力隔离等手段提升鲁棒性。

Comments 20 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26947 2026-08-28 cs.RO cs.CV 新提交 50%

4DSynth: Controllable Procedural World Synthesis for Dynamic Embodied Simulation

4DSynth:面向动态具身模拟的可控程序式世界合成

Zehao Qi, Haochen Luo, Jia-Wang Bian, Zeyu Ma, Shuyang Sun

机构 * Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学) Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

专题命中 规划决策 :planning(abstract)

AI总结 本文提出可控程序式4D环境生成系统4DSynth,可将自然语言等输入转化为可编辑4D环境,并构建交互式导航基准4DSynth-Nav,为具身智能体开发评估提供实用基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26830 2026-08-28 eess.SY 新提交 50%

Joint Spectrum and Airspace Resource Optimization for Low-altitude Wireless Network

面向低空无线网络的频谱与空域资源联合优化

Yafei Guo, Ziye Jia, Lei Zhang, Jingxian Liu, Qiuming Zhu, Qihui Wu

专题命中 规划决策 :planning(abstract)

AI总结 针对无人机低空网络的频谱与空域资源耦合优化难题,提出含约束VCG拍卖机制的序列框架,经仿真验证其成本低于基线算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26607 2026-08-28 cs.CV 新提交 50%

FU-Mamba: A Frequency-Enhanced Dynamic Scanning Framework for Oralscan Image Segmentation

FU-Mamba:用于口腔扫描图像分割的频率增强型动态扫描框架

Xinxin Zhao, Jinpeng Ye, Bo Wei, Liqin Wu, Mahmoud Hassaballah, Karen Egiazarian, Aura Conci, Victor Hugo C. de Albuquerque, Abdulkadir Sengur, Leszek Rutkowski, Yan Tian

机构 * School of Computer Science and Technology, Zhejiang Gongshang University(浙江工商大学计算机科学与技术学院) Tongxiang Hospital of Traditional Chinese Medicine(桐乡市中医院) Prince Sattam Bin Abdulaziz University(萨塔姆·本·阿卜杜勒阿齐兹王子大学) Qena University(奎纳大学) Tampere University(坦佩雷大学) Universidade Federal Fluminense(弗卢米嫩塞联邦大学) Federal University of Ceara(塞阿拉联邦大学) Firat University(菲拉特大学) Systems Research Institute, Polish Academy of Sciences(波兰科学院系统研究所) AGH University of Krakow(克拉科夫AGH大学)

专题命中 规划决策 :planning(abstract)

AI总结 针对口腔扫描图像分割中现有视觉SSMs破坏空间连续性、成像干扰影响边界定位的问题,提出融合动态扫描与频域增强的FU-Mamba,在牙科数据集上使mIoU提升1.1%。

Comments Accepted by Neurocomputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26239 2026-08-28 cs.RO 新提交 50%

WALL-SS: Scaling Long-horizon World Models via Next-Scale Autoregression

WALL-SS:通过下一尺度自回归扩展来缩放长视界世界模型

Maeve Zhang, Rain Sun, Xiang Wang, Cyril Zhang, Shalfun Li, Meng Cao, Howard Lu, Ethan Chen, Harry Jhou, KZ Zheng, Lights Shi, Regis Cheng, Lorenzin, Robert Wang, Victor Yao, Gody Li, Elise Mon, Yohann Tang, Ryan Yu, PS Zhang, Vincent Chen, Hang Su, Roy Gan, Hao Wang, Qian Wang

机构 * X Square Robot(X Square机器人)

专题命中 规划决策 :planning(abstract)

AI总结 本研究提出WALL-SS世界模型,通过尺度自回归扩展实现动作可控的长视界机器人仿真,经实验验证其可提升动作跟随与轨迹精度,减少动作漂移和长视界不一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27271 2026-08-28 math.OC cs.RO 新提交 50%

Marine Autonomous Vehicle Fleet Scheduling to Maximise Scientific Impact

最大化科学影响力的海洋自主航行器集群调度

Mehdi El Krari, Jonathan Smith, Maria Fox

专题命中 规划决策 :planning(abstract)

AI总结 该研究针对海洋自主航行器集群调度难题,提出混合整数线性规划模型,整合船舶航线实现高效调度,可快速求解大规模集群问题,兼具调度与仿真功能,支持战略决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27222 2026-08-28 math.OC eess.SY 新提交 50%

Co-Optimized Generation, Transmission, and Storage Expansion: System Value and Optimal Duration of Pumped-Storage Hydropower

协同优化发电、输电与储能扩建:系统价值及抽水蓄能的最优时长

Rafael Benchimol Klausner, Rafael Kelman

专题命中 规划决策 :planning(abstract)

AI总结 本文提出发电-输电-储能扩建框架,将抽水蓄能(PSH)与电池储能系统(BESS)对比,发现PSH可显著降低巴西互联系统的成本、弃电率及燃气装机需求,核心机制具普适性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26444 2026-08-28 math.OC 新提交 50%

Integrated Multi-Modal Transit Network Design via Dynamic Line Generation

基于动态线路生成的综合多模式交通网络设计

Ning Duan, Oktay Günlük, Samitha Samaranayake

专题命中 规划决策 :planning(abstract)

AI总结 该研究提出统一优化框架,通过列生成启发式方案联合设计多模式交通的线路、频率与按需出行段,在波士顿、芝加哥数据集上较基准方案显著提升乘客量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26886 2026-08-28 quant-ph 新提交 50%

Quantum Interconnects Part I: Strategic Quantum Network Formation

量子互连 第一部分:战略性量子网络构建

Gustavo Castro do Amaral

专题命中 规划决策 :agent(abstract)

AI总结 本研究提出分层架构,论证量子互连可解耦量子平台物理实现与网络功能,为战略性量子网络构建提供基础,解决当前量子网络缺乏效用驱动的问题。

Comments 6 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26330 2026-08-28 physics.med-ph 新提交 50%

Adapting the TG-43 formalism for use in Diffusing alpha-emitters Radiation Therapy

将TG-43形式化方法适配用于扩散α粒子发射体放射治疗

Guy Heger, Lior Epstein, Lior Arazi

专题命中 规划决策 :planning(abstract)

AI总结 本研究将TG-43形式化方法适配Alpha DaRT模型,定义有效剂量率与活度转换因子,通过数值计算生成相关表格,使商用软件可用于Alpha DaRT治疗计划制定,但表格需按病例生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26207 2026-08-28 nucl-th nucl-ex 新提交 50%

Frontier Questions and Emerging Directions in Nuclear Science and Technology

核科学与技术的前沿问题及新兴方向

Yu-Gang Ma

专题命中 规划决策 :planning(abstract)

AI总结 本综述梳理核科学与技术的十大前沿问题,涵盖基础前沿、支撑方法论及转化战略方向,构建连接科学问题与基础设施、应用及战略的整合研究框架。

Comments 32 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23863 2026-08-28 cs.RO 版本更新 50%

DreamLedger: Where to Refuse World-Model Imagination Using Execution-Settled Credit

DreamLedger:机器人决策回路中用于世界模型想象的执行结算信用文件

Xianyao Li, Ruitong Tian, Rui Min, Fang Xu, Jing Du

机构 * University of Florida(佛罗里达大学)

专题命中 规划决策 :planning(abstract)

AI总结 该研究提出DreamLedger执行结算信用文件,管控机器人世界模型预测的消耗,在多模拟域和真实机械臂上验证,可减少无效想象、降低验证探测次数,适用于多模型与硬件场景。

Comments 12 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21686 2026-08-28 cs.HC 版本更新 50%

UrbanGazeVis: A Visualization System for Analyzing Eye-Tracking Data on Urban Safety Perception

UrbanGazeVis:用于分析城市安全感知眼动数据的可视化系统

Andres De La Puente, Luis Sante, Felipe Moreno-Vera, Mauro Diaz, Jorge Poco

专题命中 规划决策 :planning(abstract)

AI总结 本研究开发UrbanGazeVis可视化系统,通过30名参与者使用HoloLens 2分析150张里约街景的眼动数据,揭示注视与城市安全感知的关联,为城市设计提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20318 2026-08-28 cs.DB 版本更新 50%

AgenticDB: Self-Evolving Reconfiguration Framework for Database Workloads

AgenticDB: 面向数据库工作负载的代理式性能重配置

Xinyue Yang, Chaozheng Wang, Chen Zheng, Heng Zhang, Yanjun Wu

专题命中 规划决策 :agentic(abstract)

AI总结 提出AgenticDB框架,通过运行时交互实现数据库系统级和操作系统级重配置,诊断瓶颈并积累经验,在MySQL和PostgreSQL上平均性能提升118.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24441 2026-08-28 physics.data-an hep-ex hep-ph 版本更新 50%

On the Statistical Interpretation of Discoveries in LHC Data

关于LHC数据中发现的统计解释

S. V. Chekanov, E. J. Weik

专题命中 规划决策 :planning(abstract)

AI总结 本研究在模型无关框架下探讨大型强子对撞机(LHC)的发现标准,重点关注新物理的统计特征,并提出考虑多重分布中“look-elsewhere效应”的局部与全局显著性之间的保守关系。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多智能体 35 篇

2608.26626 2026-08-28 cs.MA cs.AI 新提交 91%

Risks and Controls for Multi-Agent Systems: an analytical framework for deployment of AI agents across organisational boundaries

多智能体系统的风险与管控:跨组织边界部署AI智能体的分析框架

Alistair Reid, Simon O'Callaghan, Dustin Venini, Liam Carroll, Tiberio Caetano

专题命中 多智能体 :agent(title,abstract);AI agent(title,abstract);multi-agent(title,comments);分类 cs.AI

AI总结 本研究提出跨组织边界部署AI智能体的分析框架,定义三类部署层级并分析各层级的风险、管控缺口与所需集体行动,为相关方应对多智能体交互风险提供支撑。

Comments This paper has been published by the Australian AI Safety Institute within the Department of Industry, Science and Resources under a CC BY 4.0 licence: this https URL (https://www.industry.gov.au/publications/risks-and-controls-multi-agent-systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17173 2026-08-28 cs.CL cs.AI 版本更新 91%

Beyond Factual QA: Mentorship-Oriented Question Answering over Long-Form Multilingual Content

超越事实问答:面向长形式多语言内容的指导型问答

Parth Bhalerao, Diola Dsouza, Ruiwen Guan, Oana Ignat

专题命中 多智能体 :agent(summary_cn,abstract);multi-agent(summary_cn,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出MentorQA,首个多语言长形式视频指导型问答数据集和评估框架,通过对比不同架构发现Multi-Agent在复杂和低资源语言中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25457 2026-08-28 cs.CR cs.AI cs.MA 版本更新 90%

MACGen: Toward Functionally Correct and Secure Code Generation via Multi-Agent Collaboration

MACGen:通过多智能体协作实现功能正确且安全的代码生成

Miseon Yu, Jaehoon Choi, Younghan Lee, Yunheung Paek

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);planning(abstract);agentic(abstract)

AI总结 MACGen是整合规划等多环节的多智能体代码生成框架,在CWEval、BaxBench基准上,较直接提示显著提升安全代码生成的功能与安全性指标。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26108 2026-08-28 cs.SE 新提交 90%

Agentic AI Containment Architecture for Security Hardening

用于安全加固的智能体AI containment架构

Mohamed ElBendary

专题命中 多智能体 :agent(summary_cn,abstract);agentic(title);tool use(abstract);multi-agent(abstract)

AI总结 针对多智能体AI系统的安全风险,本文提出Agent Containment架构,通过六项约束实施「提议-验证-行动-验证」模型,可防御多种威胁,案例验证其能产生合规可审计结果。

Comments Accepted to IntelliSys'2026. To Appear in Springer series "Lecture Notes in Networks and Systems" in 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26114 2026-08-28 cs.AI cs.CL q-fin.CP 新提交 90%

CIFQA: A Deterministic Tool-Grounded Multi-Agent LLM Framework for Financial Query Answering

CIFQA:一种用于金融查询问答的确定性工具基多智能体大语言模型框架

Kunjesh Parekh, Anil Kumar Tiwari, Divya Saxena

机构 * School of Artificial Intelligence and Data Science, Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校人工智能与数据科学学院)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 本研究针对LLM多步骤金融计算易出错的问题,提出CIFQA多智能体框架,在定期存款查询基准上准确率达95.54%,且17B开源模型在该框架内表现优于更大前沿模型,证明架构设计对数值可靠性更关键。

Comments 16 pages, 5 figures, submitted for academic dissemination

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10002 2026-08-28 cs.AI 版本更新 89%

Interaction Protocol Shapes Moral Judgment in Multi-Agent Debate

辩论动态与价值对齐在大语言模型辩论中

Pratik S. Sachdeva, Tom van Nuenen

机构 * D-Lab University of California, Berkeley(D-Lab 加州大学伯克利分校)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 研究通过LLM辩论探讨多轮设置中模型的辩论动态与价值对齐,发现不同模型在同步和轮转结构下的行为差异及价值倾向。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏