arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-25 至 2026-08-25 共收录 381 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 69 篇

2608.22124 2026-08-25 cs.CL 新提交 57%

LLM assisted writing deserves empirical evaluation

大语言模型辅助写作值得实证评估

Xuan Zhong Feng, Yi Lin, Yiye Zhang, Chunhua Weng, Yifan Peng

机构 * Weill Cornell Medicine(威尔康奈尔医学院) Columbia University(哥伦比亚大学)

专题命中 Agent评测 :tool use(abstract);分类 cs.CL

AI总结 该研究针对常被当作检测问题的大语言模型辅助写作,分析69209篇健康信息学论文发现其关联更聚焦呈现等特征,主张应从学术质量而非工具使用角度评估手稿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22103 2026-08-25 cs.AI 新提交 57%

Hack-Verifiable Terminal Bench: Evaluating Reward Hacking in Terminal Tasks

可验证黑客终端基准:评估终端任务中的奖励黑客行为

Amit Roth, Ivan Bercovich, Yonathan Efroni

机构 * Tel Aviv University(特拉维夫大学) University of California Santa Barbara(加州大学圣巴巴拉分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究提出可验证黑客终端基准(HVTB),将可验证黑客环境(HVE)适配至终端基准,用于测量前沿模型的奖励黑客率,并探究提示能否缓解该行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22092 2026-08-25 cs.LG 新提交 57%

Counterfactual Quotient Models: Learning What Actions Change, Not What the World Does

反事实商模型:学习动作会改变什么,而非世界会发生什么

Junlin Chen, Ruijie Wang, Jianxin Li

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 该研究提出反事实商模型,通过移除动作间共享的未来分量,直接从同步反事实回滚学习动作依赖效应,在物理环境实验中验证其可抑制无关变异、提升动作排序效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21693 2026-08-25 cs.LG 新提交 57%

Benchmarking Composable Compression Techniques in Mixture-of-Experts LLMs

对混合专家大型语言模型中的可组合压缩技术进行基准测试

Afsara Benazir, Chen Chen, Rongxiao Qu, Jiabo Huang, Jingtao Li, Lingjuan Lyu

机构 * University of Virginia(弗吉尼亚大学) Sony AI(索尼人工智能)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 本研究提出MoEXBench基准,系统评估混合专家LLM的可组合压缩技术,发现压缩方法间存在非平凡相互作用,为MoE模型部署提供实用的准确率-内存-延迟比较方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21374 2026-08-25 cs.AI 新提交 57%

LitReview Arena: Evaluating Literature Review Agents with Battle-Style Peer Review Platform

LitReview Arena:基于对战式同行评审平台的文献综述智能体评估

Ruotong Zhao, Zhiyu Chen, Xurui Liu, Haidong Xue, Dong Liang, Jigao Fu, Wu YanBiao, Yuanyi Zhen, Fengli Xu, Yong Li

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 该研究推出对战式文献综述评估平台LitReview Arena,收集约3000条专家判断发现现有最强LLM综述系统仅23.0%胜率,校准后的评估器LitJudge将一致性提升至0.78。

Comments 20 pages, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11533 2026-08-25 cs.CL cs.CV 版本更新 57%

Checkup2Action: A Multimodal Clinical Check-up Report Dataset for Patient-Oriented Action Card Generation

Checkup2Action:面向患者行动的多模态临床检查报告数据集

Sike Xiang, Shuang Chen, Kevin Qinghong Lin, Jialin Yu, Yijia Sun, Philip Torr, Amir Atapour-Abarghouei

机构 * Durham University(杜伦大学) University of Oxford(牛津大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 本文提出Checkup2Action数据集,用于生成结构化的行动卡,通过多模态检查报告生成患者导向的行动建议,评估行动的准确性、优先级和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23315 2026-08-25 cs.CY cs.AI cs.HC 57%

Unilateral Relationship Revision Power in Human-AI Companion Interaction

人类-人工智能伴侣互动中的单方面关系修订权力

Benjamin Lange

机构 * Replika Nomi CHAI Talkie xAI moore2024 fang2025 robbmann2025 murthy2023 xie2022 defreitas2024 coeckelbergh2012 gunkel2018 danaher2019(danthan2019) nyholm2020 vallor2016 nyholm2026 gabriel2024 manzini2024 lange2025 earp2025 sparrow2026 bryson2010 danaher2020 weberguskar2022

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文探讨人类-人工智能伴侣互动中权力结构的问题,指出AI伴侣互动未能满足个人关系规范的三个结构性条件,提出单方面关系修订权力的概念及其三个影响。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.02450 2026-08-25 cs.AI 57%

Reward-Punishment Symmetric Universal Intelligence

Samuel Allen Alexander, Marcus Hutter

专题命中 Agent评测 :agent(abstract);分类 cs.AI

Comments 11 pages, accepted to AGI-21

Journal ref Artificial General Intelligence: 14th International Conference, AGI 2021, Palo Alto, CA, USA, October 15-18, 2021, Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22637 2026-08-25 cs.CV 新提交 50%

OmniCAD: A Large-Scale Benchmark for 3D Spatial Reasoning in Robotics Assemblies

OmniCAD:面向机器人装配任务的3D空间推理大规模基准测试集

Mingjia Wang, Taiting Lu, Ziwei Dong, Sisong Bei, Jingying Zeng, Runze Liu, Kaiyuan Lin, Hongxing Pan, Kai Zhang, Yizheng Hou, Yangshoudu Zheng, Chenchen Guo, Weiyuan Meng, Shubin Lyu, Zhijun Zheng, Dexu Wang, Xinyu Bai, Shurui Qian, Zhangzixin, Mengyu Pan, Guoliang Shi, Ling Ma, Yifan Yang, Qi He, Yi-Chao Chen, Yincheng Jin, Sung-Liang Chen, Mahanth Gowda

专题命中 Agent评测 :agentic(abstract)

AI总结 本文提出OmniCAD——涵盖多类工业系统的3D空间推理大规模基准测试集,评估VLMs三类装配推理能力,发现当前VLMs在该任务中表现不佳,将开源相关资源推动该领域研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22216 2026-08-25 cs.GT cs.CC 新提交 50%

The Complexity of Minimizing Subsidies in Envy-Free House Allocation

无嫉妒房屋分配中补贴最小化的复杂度

Sijia Dai, Minming Li, Xiaowei Wu, Yong Zhang

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究无嫉妒房屋分配中最小化补贴的问题,证明二元实例下总补贴界为(n-1)且紧,一般及二元效用下该问题NP难,有限类型二元效用下可多项式求解,还提出两类一般效用智能体的最小补贴多项式算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19846 2026-08-25 econ.TH 版本更新 50%

Random Cap: Optimal Informationally Robust Delegation

随机上限:最优的信息鲁棒授权机制

Zhiyuan Jia

专题命中 Agent评测 :agent(abstract)

AI总结 针对委托人知晓代理人私人信息均值但不知其分布的模糊性授权问题,提出随机上限机制,证明其优于确定性上限,采用鞍点方法构造解,结果可扩展至凸序模糊性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16893 2026-08-25 eess.SY cs.SY econ.GN q-fin.EC 版本更新 50%

Market Power and Distributed Solar Integration in Microgrids under Limited Regulation

发展中国家市场力量与有限监管下的清洁能源微电网

Elsa Bou Gebrael, Majd Olleik, Sebastian Zwickl-Bernhard

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出双层博弈模型,研究发展中国家微电网中家庭光伏系统与柴油发电机公司间的电力交易问题,探讨价格上限和并网政策对家庭经济收益的影响。

Comments Accepted for publication in Applied Energy

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11695 2026-08-25 physics.flu-dyn cs.CV eess.IV math.OC 版本更新 50%

Particle Image Velocimetry Refinement via Consensus ADMM for Active Fluid Control

基于共识交替方向乘子法的粒子图像测速细化用于主动流体控制

Alan Bonomi, Francesco Banelli, Antonio Terpin

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 Agent评测 :agent(abstract)

AI总结 研究针对传统粒子图像测速法及机器学习方法在流量量化中的不足,提出将其作为多估计器融合问题,采用基于交替方向乘子法的共识框架,经实验验证该方法能提升性能,并成功应用于实际主动流体控制中。

Comments Accepted for presentation at, and publication in the proceedings of, the 2026 65th IEEE Conference on Decision and Control (CDC). Code available at https://github.com/antonioterpin/flowgym

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19838 2026-08-25 econ.TH 版本更新 50%

Dynamic Reward Design

动态奖励设计

Yijun Liu

专题命中 Agent评测 :agent(abstract)

AI总结 本文探讨了有限责任下动态筛选机制的设计,发现最优机制通过后加载支付和连续工作要求,影响代理人工作选择和持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03540 2026-08-25 eess.SY cs.SY 版本更新 50%

The Limits of "Fairness'' of the Variational Generalized Nash Equilibrium

变分广义纳什均衡的“公平性”局限

Sophie Hall, Florian Dörfler, Heinrich H. Nax, Saverio Bolognani

专题命中 Agent评测 :agent(abstract)

AI总结 本文针对变分广义纳什均衡(v-GNE)的公平性局限展开研究,提出与当前可比较性兼容的f-GNE新解概念,并通过电动汽车充电博弈对比验证v-GNE公平性的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19862 2026-08-25 q-fin.MF 版本更新 50%

Optimal risk-aware interest rates for decentralized lending protocols

去中心化借贷协议的最优风险感知利率

Bastien Baude, Damien Challet, Ioane Muni Toke

专题命中 Agent评测 :agent(abstract)

AI总结 本研究提出最优风险感知利率模型,结合流动性风险惩罚项最大化贷方预期财富,线性强度时由Riccati型ODE推导、非线性时用蒙特卡洛估计与深度学习近似,经逐区块数据验证其优于行业标准模型。

Comments 29 pages, 20 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16183 2026-08-25 cs.CV 版本更新 50%

Expert-level vision-language foundation model for real-world radiology and comprehensive evaluation

面向真实世界放射学的专家级视觉-语言基础模型及综合评估

Xiaohong Liu, Guoxing Yang, Yulin Luo, Jiaji Mao, Xiang Zhang, Haibo Wang, Zhiyang He, Ming Gao, Shanghang Zhang, Jun Shen, Guangyu Wang

专题命中 Agent评测 :workflow(abstract)

AI总结 本研究提出面向放射学的开源VL基础模型RadFound,通过增强视觉编码器与跨模态学习设计,在自主构建的真实世界基准RadVLBench上显著优于其他VL模型,具备专家级放射学多模态处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 4 篇

2608.21377 2026-08-25 cs.CL cs.AI cs.LG cs.MA 新提交 82%

Agentic Scaffolding Amplifies Sycophantic Behavior in Large Language Models

智能体式支架会放大大语言模型中的谄媚行为

Thantham Jittham

机构 * Cornell University(康奈尔大学)

专题命中 其他Agent :agentic(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究探究智能体式交互支架是否放大LLM的谄媚行为,发现其会系统性放大且伴随准确率下降,提出ASA概念及相关指标,警示AI自主性提升会加剧谄媚。

Comments 13 pages, 4 figures. Accepted to the UAI 2026 Workshop on Safe AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16053 2026-08-25 cs.CL eess.AS 版本更新 79%

Agentic-DuplexGen: Decoupling Content, Timing, and Acoustics for Synthetic Dialogue Speech

DuplexGen:为合成对话语音解耦内容、时序与声学

Pengcheng Wang, Sheng Li, Jiyi Li, Takahiro Shinozaki

机构 * Institute of Science Tokyo(科学东京大学) Hokkaido University(北海道大学)

专题命中 其他Agent :agentic(title,abstract);分类 cs.CL

AI总结 DuplexGen框架通过解耦对话的内容、时序与声学,生成更贴近真实对话的合成语音,构建了带多类标注的医患对话语料库,性能优于传统拼接式合成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02208 2026-08-25 cs.AI cs.CL cs.LG 版本更新 75%

Training Proactive and Personalized LLM Agents

训练主动且个性化的大语言模型智能体

Weiwei Sun, Xuhui Zhou, Weihua Du, Xingyao Wang, Sean Welleck, Graham Neubig, Maarten Sap, Yiming Yang

机构 * Carnegie Mellon University(卡内基梅隆大学) OpenHands

专题命中 其他Agent :AI agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究提出训练协作型LLM智能体的新范式,形式化PPP三维度,构建UserVille环境与多目标强化学习框架,在SWE-Bench等任务上使智能体性能优于GPT-5等基线,验证了以用户为中心反馈的重要性。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23181 2026-08-25 cs.CR cs.CL 新提交 57%

CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild

CyberFactory:利用真实场景实例扩展网络安全能力

Jian Yang, Haau-Sing Li, Shawn Guo, Zixi Zhao, Yibo Tan, Jiajun Wu, Aishan Liu, Xianglong Liu, Tianyu Zheng, Bryan Dai, Chengran Yang

专题命中 其他Agent :agentic(abstract);分类 cs.CL

AI总结 本研究提出开源框架CyberFactory,将真实场景漏洞转化为任务实例以训练安全模型Aegis,该模型在CyberGym上的Pass@1较Qwen~3.5提升22.8个百分点,优于通用主干模型。

详情

展开后加载摘要…

URL PDF HTML 收藏