arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-11-26 至 2025-11-26 共收录 16 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 16 篇

2511.19930 2025-11-26 cs.GT cs.CY cs.LG 88%

Designing Reputation Systems for Manufacturing Data Trading Markets: A Multi-Agent Evaluation with Q-Learning and IRL-Estimated Utilities

为制造数据交易市场设计声誉系统:基于Q学习和IRL估计效用的多智能体评估

Kenta Yamamoto, Teruaki Hayashi

机构 * Department of Systems Innovation, Graduate School of Engineering, The University of Tokyo Tokyo, Japan(系统创新部门,工学研究生院,东京大学东京,日本)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG

AI总结 本研究通过多智能体模拟器评估了五种声誉系统,发现PeerTrust在数据价格与质量一致性及防止垄断方面表现最佳,并提出混合声誉机制提升市场稳定性。

Comments 10 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19874 2025-11-26 cs.CR cs.AI cs.LG 87%

Cross-LLM Generalization of Behavioral Backdoor Detection in AI Agent Supply Chains

人工智能代理供应链中行为后门检测的跨LLM泛化

Arun Chowdary Sanna

机构 * Arun Chowdary Sanna(独立研究者)

专题命中 Agent评测 :AI agent(title,abstract);agent(title);分类 cs.AI、cs.LG

AI总结 本研究首次系统探讨了跨LLM行为后门检测的泛化问题,发现模型特定特征导致泛化差距,并提出模型感知检测方法提升检测准确率。

Comments 10 pages, 2 figures, 8 tables. Evaluation across 6 production LLMs with 1,198 traces

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15097 2025-11-26 cs.CR cs.AI 83%

MAIF: Enforcing AI Trust and Provenance with an Artifact-Centric Agentic Paradigm

MAIF:基于 artifacts 的代理范式强化 AI 可信度与溯源

Vineeth Sai Narajala, Manish Bhatt, Idan Habler, Ronald F. Del Rosario, Ads Dawson

机构 * Security Researcher Cisco(安全研究员 希思科) Researcher OWASP/Project Kuiper Security(研究员 OWASP/项目 Kuiper 安全) Adversarial AI Security Research Cisco(对抗性AI安全研究 希思科)

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 MAIF 通过以 artifacts 为中心的代理范式,解决 AI 的可信度、安全性和问责问题,实现数据的主动信任执行和高效处理。

Comments 7 Pages, 2 Figures, 6 Tables, Repo: https://github.com/vineethsai/maifscratch-1, Added additional Author and fixed Citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20490 2025-11-26 cs.LG cs.AI 82%

MTBBench: A Multimodal Sequential Clinical Decision-Making Benchmark in Oncology

MTBBench: 一个用于肿瘤学的多模态序列临床决策制定基准

Kiril Vasilev, Alexandre Misrahi, Eeshaan Jain, Phil F Cheng, Petros Liakopoulos, Olivier Michielin, Michael Moor, Charlotte Bunne

机构 * ETH Zürich(苏黎世联邦理工学院) EPFL(洛桑联邦理工学院) HUG

专题命中 Agent评测 :agent(abstract);tool-use(abstract);agentic(abstract);multi-agent(abstract)

AI总结 MTBBench通过模拟分子肿瘤委员会的决策流程,提出一个多模态、纵向的肿瘤学基准测试,评估LLMs在复杂临床任务中的表现并提升其推理与可靠性。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11979 2025-11-26 cs.CL cs.MA 79%

Value-Based Large Language Model Agent Simulation for Mutual Evaluation of Trust and Interpersonal Closeness

基于价值的大型语言模型代理模拟用于信任和人际亲密的相互评估

Yuki Sakamoto, Takahisa Uchida, Hiroshi Ishiguro

机构 * The University of Osaka, Graduate School of Engineering Science(大阪大学工学科学研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本研究通过模拟LLM代理,探讨价值相似性对信任和人际亲密的影响,验证了人工社会中价值观对关系建立的作用。

Journal ref Scientific Reports volume 15, Article number: 41653 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19536 2025-11-26 cs.CR cs.AI 77%

AttackPilot: Autonomous Inference Attacks Against ML Services With LLM-Based Agents

AttackPilot: 基于大语言模型的自主推断攻击对抗ML服务

Yixin Wu, Rui Wen, Chi Cui, Michael Backes, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全中心) Institute of Science Tokyo(东京科学研究所)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 AttackPilot利用大语言模型开发自主代理,实现无需人工干预的推断攻击,展现高任务完成率和低成本,有效提升非专家对ML服务风险评估的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26536 2025-11-26 cs.CL cs.AI cs.CV cs.LG cs.RO 75%

OceanGym: A Benchmark Environment for Underwater Embodied Agents

OceanGym: 一个用于水下具身智能体的基准环境

Yida Xue, Mingjun Mao, Xiangyuan Ru, Yuqi Zhu, Baochang Ren, Shuofei Qiao, Mengru Wang, Shumin Deng, Xinyu An, Ningyu Zhang, Ying Chen, Huajun Chen

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 OceanGym通过多模态大语言模型构建首个水下具身智能体基准,揭示水下环境感知与规划的挑战,推动水下自主系统发展。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19489 2025-11-26 cs.SE cs.AI 73%

Evolution without an Oracle: Driving Effective Evolution with LLM Judges

无Oracle的进化:通过LLM裁判驱动有效进化

Zhe Zhao, Yuheng Yang, Haibin Wen, Xiaojie Qiu, Zaixi Zhang, Qingfu Zhang

机构 * Stanford University(斯坦福大学) City University of Hong Kong(香港城市大学) Princeton University(普林斯顿大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出MADE框架,通过问题规范减少LLM反馈噪声,实现无Oracle的进化优化,在软件需求满足和复杂指令跟随任务中取得显著成效。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19492 2025-11-26 cs.CY cs.AI 70%

Forecasting AI Time Horizon Under Compute Slowdowns

在计算放缓下预测AI时间跨度

Parker Whitfill, Ben Snodin, Joel Becker

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出一个模型,预测在计算放缓情况下AI时间跨度的增长,发现时间跨度与计算能力成正比,并通过实验验证了这一理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18958 2025-11-26 cs.LG cs.AI 62%

Learning to Compress Graphs via Dual Agents for Consistent Topological Robustness Evaluation

通过双智能体学习压缩图以实现一致的拓扑鲁棒性评估

Qisen Chai, Yansong Wang, Junjie Huang, Tao Jia

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 Cutter通过双智能体强化学习框架,实现图压缩以保持拓扑结构和鲁棒性,提升评估效率和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20614 2025-11-26 cs.CV 50%

The Consistency Critic: Correcting Inconsistencies in Generated Images via Reference-Guided Attentive Alignment

一致性批评者:通过参考引导的注意对齐纠正生成图像中的不一致

Ziheng Ouyang, Yiren Song, Yaoli Liu, Shihao Zhu, Qibin Hou, Ming-Ming Cheng, Mike Zheng Shou

机构 * VCIP, Nankai University Show Lab, National University of Singapore State Key Laboratory of CAD\&CG, Zhejiang University

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出ImageCritic,通过参考引导的注意力对齐方法纠正生成图像中的不一致问题,提升细粒度细节的一致性。

Comments Project page: https://ouyangziheng.github.io/ImageCritic-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20573 2025-11-26 cs.CV 50%

VQ-VA World: Towards High-Quality Visual Question-Visual Answering

VQ-VA世界:迈向高质量的视觉问题-视觉回答

Chenhui Gou, Zilong Chen, Zeyu Wang, Feng Li, Deyao Zhu, Zicheng Duan, Kunchang Li, Chaorui Deng, Hongyi Yuan, Haoqi Fan, Cihang Xie, Jianfei Cai, Hamid Rezatofighi

专题命中 Agent评测 :agentic(abstract)

AI总结 VQ-VA World通过大规模数据构建框架提升开源模型的视觉问题-视觉回答能力,实现性能超越现有开源基线并接近专有系统水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20248 2025-11-26 cs.MA cs.CY cs.SI econ.TH physics.soc-ph 50%

Realistic gossip in Trust Game on networks: the GODS model

信任游戏中的现实 gossip 模型:GODS 模型

Jan Majewski, Francesca Giardini

专题命中 Agent评测 :agent(abstract)

AI总结 GODS 模型通过结合现实 gossip 过程与信任游戏变体,展示了 gossip 如何通过提升合作效率来解决声誉系统中的合作问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20130 2025-11-26 cs.CY 50%

Dual Stressors in Engineering Education: Lagged Causal Effects of Academic Staff Strikes and Inflation on Dropout within the CAPIRE Framework

工程教育中的双重压力源:学术员工罢工和通货膨胀对退学的滞后因果影响(CAPIRE框架)

H. R. Paz

专题命中 Agent评测 :agent(abstract)

AI总结 本研究通过双重机器学习验证了学术罢工与通货膨胀对退学的交互影响,发现二者在特定滞后期内显著提升退学风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07944 2025-11-26 physics.soc-ph 50%

When heterogeneity drives hysteresis: Anticonformity in the multistate $q$-voter model on networks

当异质性驱动滞后效应:在网络上的多态q-投票者模型中的反从众性

Arkadiusz Lipiecki, Katarzyna Sznajd-Weron

专题命中 Agent评测 :agent(abstract)

AI总结 该研究发现,在网络上的多态q-投票者模型中,异质性可导致相变类型从连续变为不连续,并提供了新的对偶近似结果。

Journal ref Physical Review. E, 112(5) (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.08343 2025-11-26 econ.TH 50%

Optimism, overconfidence, and moral hazard

乐观、过度自信与道德风险

Ludvig Sinander

专题命中 Agent评测 :agent(abstract)

AI总结 本文重新审视道德风险模型,提出相对自信和乐观的定义,并展示其与变分模型的关系。

Journal ref Journal of Political Economy Microeconomics (2025), 3(4), 741-762

详情

展开后加载摘要…

URL PDF HTML 收藏