arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 573 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 573 篇

2607.18785 2026-08-17 cs.AI 版本更新 57%

SkillSight: Calibrating Generic Content Bias for Skill Retrieval

SkillSight:通过共享描述实现准确技能检索

Jinying Xiao, Bin Li, Xiaopeng Li, Jianling Li, Jiacheng Jie, Xiaodong Liu, Ma Jun, Chao Wang, Nyima Tashi, Jie Yu

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对大语言模型智能体技能检索问题,提出SkillSight框架,通过语义和词汇空间校准共享背景,减少偏差,实验证明该方法能提升检索指标,在端到端评估中表现出色且速度快,实现准确高效的技能选择。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11941 2026-08-14 cs.AI 版本更新 57%

OEIS Open: How many conjectures can language models turn into theorems?

OEIS Open:语言模型能将多少个猜想转化为定理?

Tom Adamczewski

机构 * Epoch AI

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究构建OEIS Open基准,发现配备最少工具的语言模型在适中预算下可自主解决部分OEIS未解决数学猜想,访问大量数学文献或复杂智能体循环未提升其性能。

Comments 26 pages, 6 figures. Code: https://github.com/epoch-research/LeanOpenProblems, results: https://github.com/epoch-research/LeanOpenProblems-results

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05485 2026-08-14 cs.AI 版本更新 57%

Auditable Agents

可审计代理

Yi Nian, Aojie Yuan, Haiyue Zhang, Jiate Li, Li Li, Xiyang Hu, Hua Wei, Xiongye Xiao, Chaowei Xiao, Yue Zhao

机构 * FORTIS Lab, University of Southern California(南加州大学FORTIS实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文探讨了可审计代理系统的核心问题,提出五个可审计性维度和三种机制类别,通过实证证据证明代理系统需具备审计能力才能实现问责。

Comments 24 pages, 1 figure. Extended version. A condensed 4-page version appears in the Proceedings of the ACM AI Leadership Summit 2026 (Visionary Papers track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18455 2026-08-14 stat.ML cs.IT cs.LG math.IT 版本更新 57%

Multiview Representation Learning via Distributed Joint Latent Space Structuring

基于分布式联合隐空间构建的多视图表示学习

Milad Sefidgaran, Piotr Krasnowski, Abdellatif Zaidi

机构 * Huawei Paris Research Center, France(华为巴黎研究中心,法国)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 该研究针对分布式多视图表示学习的客户端协调问题,推导了基于MDL的泛化界,提出分布式高斯乘积混合先验方法,经多组实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06960 2026-08-13 cs.CL 版本更新 57%

FinEvolveBench: A Benchmark for Self-Evolving Agents on Low-Repetition Tasks with Implicit Rewards

经验之树:低重复与隐式奖励环境下自演化智能体的结构化经验管理方案

Zihao Deng, Yining Zhu, Leiming Wang, Jingfei Lu, Junbo Wang, Chuncheng Ran, Yu Yang, Dixuan Yang, Jikun Shen

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 针对低重复任务与隐式奖励环境,提出结构化经验管理方法ToE,通过组织、检索、验证和更新经验,在金融情绪预测基准上优于无经验基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05353 2026-08-12 cs.CL 版本更新 57%

Evidence Lock Before Commitment: A Frozen Interface Degrades LLM-as-Judge Evaluation

提交前的证据锁定:冻结界面会降低“大模型作为评判者”的评估效果

Divyansh Singh

机构 * University of Florida(佛罗里达大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 该研究测试了证据锁定等不同LLM-as-Judge评估方案,发现证据锁定会降低与人类偏好的一致性、增加答案顺序不一致性,而结构化证据引出效果接近标准评判,持久化证据可支持审计但不应替代源答案。

Comments Withdrawn due to an error identified in the code during debugging. The error affects the reported results

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10309 2026-08-12 cs.AI 版本更新 57%

Measure the Sim-to-Real Gap: Designing an Affordable Real-World Benchmark Platform for Reinforcement Learning in AIoT Systems

测量模拟到现实的差距:为物联网系统中的强化学习设计一个经济实惠的真实世界基准平台

Rongping Zhou, Omid Tavallaie, Shuaijun Chen, Albert Y. Zomaya

机构 * The University of Sydney(悉尼大学) University of Oxford(牛津大学) The University of Western Australia(西澳大利亚大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对AIoT系统中强化学习模拟到现实的差距问题,开发了成本低于400美元的真实世界平台,通过硬件模拟键盘让边缘设备智能体玩游戏训练,实验显示模拟训练智能体部署后性能大幅下降,直接现实训练有可行性,为强化学习评估提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15850 2026-08-12 cs.CY cs.AI cs.HC 版本更新 57%

Access Timing as Scaffolding: A Reinforcement Learning Approach to GenAI in Education

访问时机作为脚手架:一种强化学习方法在生成式AI教育中的应用

Janne Rotter, Pau Benazet i Montobbio, Davinia Hernández-Leo

机构 * Universitat Pompeu Fabra(庞培法华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究通过强化学习智能体控制生成式AI的访问时机,基于元认知理论、认知负荷理论和生产性失败设计奖励函数,实验证明策略性定时访问相比无限制和完全限制使用能提高学习效果和元认知准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11533 2026-08-12 cs.CL cs.CV 版本更新 57%

Checkup2Action: A Multimodal Clinical Check-up Report Dataset for Patient-Oriented Action Card Generation

Checkup2Action:面向患者行动的多模态临床检查报告数据集

Sike Xiang, Shuang Chen, Kevin Qinghong Lin, Jialin Yu, Yijia Sun, Philip Torr, Amir Atapour-Abarghouei

机构 * Durham University(杜伦大学) University of Oxford(牛津大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 本文提出Checkup2Action数据集,用于生成结构化的行动卡,通过多模态检查报告生成患者导向的行动建议,评估行动的准确性、优先级和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05624 2026-08-12 cs.MA cs.LG 版本更新 57%

Behavioral Inference at Scale: The Fundamental Asymmetry Between Motivations and Belief Systems

大规模行为推断:动机与信念系统之间的根本不对称性

Jason Starace, Terence Soule

机构 * Department of Computer Science University of Idaho(计算机科学系 俄克拉荷马州立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究通过大规模实验揭示动机与信念系统在行为推断中的根本不对称性,发现动机推断效率远超信念系统,且信念系统推断的瓶颈在于信息理论限制。

Comments Published in Transactions on Machine Learning Research (2026). OpenReview: https://openreview.net/forum?id=aDMDqtw63H

Journal ref Transactions on Machine Learning Research, ISSN 2835-8856 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09898 2026-08-11 cs.LG cs.MA q-bio.QM 版本更新 57%

TRAPS: Treatment-Assignment Prediction via Pathway-informed Stratification

TRAPS: 基于通路信息分层的治疗反应分析

Sujoy Banik, Sayantan Chakraborty, Boishakhi Das Toma, Zainab Ghafoor, Ushashi Bhattacharjee, Koushik Howlader, Tirtho Roy

机构 * Rajshahi University of Engineering \& Technology Bangladesh University of Dhaka Bangladesh American International University of Bangladesh Bangladesh Sonoma State University United States Iowa State University United States Rajshahi University of Engineering \& Technology University of Dhaka American International University of Bangladesh Sonoma State University Iowa State University

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 提出首个统一基准,评估三种通路引导的深度学习模型在联合预测癌症治疗反应和生存率上的表现,发现不同模型在不同任务上各有优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08251 2026-08-11 cs.CY cs.AI 版本更新 57%

Contemporary AI lacks the imagination to diverge or negate in science

当代人工智能缺乏在科学中发散或否定的想象力

Honglin Bao, Siyang Wu, Xiao Liu, Sida Li, Shiyun Cao, James A. Evans

机构 * Data Science Institute, University of Chicago(芝加哥大学数据科学研究所) Knowledge Lab, University of Chicago(芝加哥大学知识实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 通过大规模科学家评估,发现当前AI在科学假设生成中缺乏多样性,无法自发提出零假设,且自动评估与专家判断一致性低,但微调奖励模型可缩小差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15645 2026-08-11 cs.LG physics.comp-ph quant-ph 版本更新 57%

Hybrid Quantum-Classical PINNs for Scientific Computing: A Multi-GPU Open-Source Framework

PINNACLE:一种用于经典和量子PINN的开源计算框架

Ziv Chen, Hemanth Chandravamsi, Shimon Pisnoy, Aaron Goldgewert, Gal Shaviner, Boris Shragner, Steven H. Frankel

机构 * Faculty of Mechanical Engineering, Technion Israel Institute of Technology, Haifa, Israel(技术学院机械工程系,以色列技术学院,海法,以色列) Andrew and Erna Viterbi Faculty of Electrical & Computer Engineering, Technion Israel Institute of Technology, Haifa, Israel(安德鲁和伊尔纳·维特比电气与计算机工程学院,技术学院,海法,以色列) Helen Diller Quantum Center, Technion Israel Institute of Technology, Haifa, Israel(海伦·迪尔量子中心,技术学院,海法,以色列) Faculty of Electrical and Computer Engineering, Cornell University, Ithaca, NY, USA(电气与计算机工程学院,康奈尔大学,纽约州伊萨克,美国)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 PINNACLE框架整合了现代训练策略和混合量子经典架构,通过统一模块化工作流系统评估PINN在不同基准问题中的性能,支持多种增强方法并提供全面的基准研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04465 2026-08-11 cs.HC cs.AI cs.CR 版本更新 57%

Autonomy Reshapes How Personalization Affects Privacy Concerns and Trust in LLM Agents

自主性重塑个性化对隐私担忧和对LLM代理信任的影响

Zhiping Zhang, Yi Evie Zhang, Freda Shi, Tianshi Li

机构 * Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Waterloo(滑铁卢大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨了LLM代理自主性如何影响个性化对用户隐私担忧和信任的影响,发现风险驱动的自主性可缓解个性化带来的负面影响。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03159 2026-08-11 cs.DL cs.CL 版本更新 57%

BibTeX Citation Errors in Scientific Publishing Agents: Evaluation and Mitigation

科学出版代理中的BibTeX引用幻觉:评估与缓解

Delip Rao, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文评估并缓解了科学出版代理中BibTeX引用的字段级错误,通过构建包含931篇论文的基准测试,发现模型依赖参数记忆,提出clibib工具提升准确性。

Comments 35 pages; COLM 2026 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29139 2026-08-11 cs.AI cs.GR cs.HC 版本更新 57%

SciVisAgentBench: A Benchmark for Evaluating Scientific Data Analysis and Visualization Agents

SciVisAgentBench:用于评估科学数据分析和可视化代理的基准测试

Kuangshi Ai, Haichao Miao, Kaiyuan Tang, Nathaniel Gorski, Jianxin Sun, Guoxi Liu, Helgi I. Ingolfsson, David Lenz, Hanqi Guo, Hongfeng Yu, Teja Leburu, Michael Molash, Bei Wang, Tom Peterka, Chaoli Wang, Shusen Liu

机构 * University of Notre Dame(圣母大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) University of Utah(犹他大学) University of Nebraska–Lincoln(内布拉斯加大学林肯分校) The Ohio State University(俄亥俄州立大学) Argonne National Laboratory(阿贡国家实验室) Anthropic PBC

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文提出SciVisAgentBench,一个用于评估科学数据可视化代理的基准测试,涵盖四个维度,包含108个案例,结合LLM和确定性评估器进行多模态评估,揭示代理能力差距。

Comments IEEE Transactions on Visualization and Computer Graphics (IEEE VIS '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24084 2026-08-11 cs.AI 版本更新 57%

Bridging the Evaluation Gap: Standardized Benchmarks for Multi-Objective Search

弥合评估差距:多目标搜索的标准化基准

Hadar Peer, Carlos Hernandez, Sven Koenig, Ariel Felner, Oren Salzman

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文提出首个标准化多目标搜索基准,涵盖四个结构各异的领域,通过固定实例和标准查询确保评估的鲁棒性和全面性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22130 2026-08-11 cs.LG 版本更新 57%

Benchmarking In-context Experiential Learning Through Repeated Product Recommendations

通过重复产品推荐评估上下文经验学习

Gilbert Yang, Yaqin Chen, Thomson Yen, Hongseok Namkoong

专题命中 Agent评测 :agentic(abstract);分类 cs.LG

AI总结 本文提出BELA基准,通过重复产品推荐场景评估智能体在动态环境中的经验学习与主动探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08531 2026-08-10 cs.AI 版本更新 57%

ForesightSafety-SAGE:A Fully Automated Scenario Generation and Safety Evaluation Framework for LLM Agents

VESTA: 一种全自动的LLM智能体场景生成与安全评估框架

Lu Jia, Haibo Tong, Feifei Zhao, Jindong Li, Dongqi Liang, Ping Wu, Qian Zhang, Yi Zeng

机构 * BrainCog AI Lab, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所类脑人工智能实验室) Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院) Beijing Key Laboratory of Safe AI and Superalignment(北京市安全人工智能与超级对齐重点实验室) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Long-term AI(长期人工智能)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出VESTA框架,基于五个风险维度自动生成1072个可执行场景,评估12个LLM智能体在任务执行中的行为安全风险,平均攻击成功率达47.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06108 2026-08-10 cs.CG cs.LG 版本更新 57%

Using Reinforcement Learning to Optimize the Global and Local Crossing Number

使用强化学习优化全局和局部交叉数

Timo Brand, Henry Förster, Stephen Kobourov, Daniel Kohrt, Robin Schukrafft, Markus Wallinger, Johannes Zink

机构 * Technical University of Munich, Heilbronn, Germany(慕尼黑技术大学(海因斯贝格)) John Cabot University, Rome, Italy(约翰·卡博特大学) Technical University of Munich, Garching, Germany(慕尼黑技术大学(戈林根))

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 将图绘制视为单玩家优化游戏,利用强化学习通过移动顶点减少边交叉,提出一种优化全局或局部交叉数的策略,在局部交叉数最小化上具有竞争力。

Comments Appears in the Proceedings of the 34th International Symposium on Graph Drawing and Network Visualization (GD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12369 2026-08-07 cs.CL 版本更新 57%

Can Deep Research Agents Retrieve and Organize? Evaluating the Synthesis Gap with Expert Taxonomies

深度研究代理能否检索和组织?通过专家分类法评估合成差距

Ming Zhang, Jiabao Zhuang, Wenqing Jing, Kexin Tan, Ziyu Kong, Jingyi Deng, Yujiong Shen, Yuhui Wang, Zhenghao Xiang, Qiyuan Peng, Yuhang Zhao, Ning Luo, Renzhe Zheng, Jiahui Lin, Mingqi Wu, Long Ma, Shihan Dou, Maxm Pan, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Hunyuan Team, Tencent(腾讯 Hunyuan 团队)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出TaxoBench基准,评估深度研究代理在检索和组织论文方面的能力,发现两者在能力与对齐方面均存在瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25186 2026-08-06 cs.CL 版本更新 57%

CardioBench: A Real-World Data Benchmark for Evaluating Large Language Models in Clinically Authentic Cardiovascular Care Scenarios

MyoCardBench:用于评估临床真实心血管护理场景中大型语言模型的真实世界数据基准

Xiao Li, Mouxiao Bian, Zhaodi Wu, Sijie Ren, Juechen Chen, Lu Lu, Jingru Ding, Yun Zhong, Jie Xu, Yixiu Liang, Junbo Ge

机构 * Shanghai Institute of Cardiovascular Diseases(上海市心血管病研究所) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Minhang Hospital, Fudan University(复旦大学附属闵行医院)

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 该研究开发MyoCardBench真实世界基准评估大语言模型在心血管护理场景的性能,涵盖多任务数据集,经专家注释审核。7个模型在零样本设置下输出,GPT-5.4表现最佳。此基准为评估模型提供框架,助于发现优势与不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11745 2026-08-06 cs.AI 版本更新 57%

Text2GraphQuery-Bench: A Text to Graph Query Benchmark

Text2GQL-Bench: 一个文本到图查询语言基准 [实验、分析与基准]

Songlin Lyu, Lujie Ban, Zihang Wu, Tianqi Luo, Jirong Liu, Ayoub Moussaid, Oskar van Rest, Heng Lin, Chenhao Ma, Nan Tang, Shipeng Qi, Yongchao Liu, Zhan Qiu, Juelu Zhang, Jiajun Zheng

机构 * Ant Group(蚂蚁集团) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Xi'an Polytechnic University(西安理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 Text2GQL-Bench是一个统一的文本到图查询语言基准,通过多领域数据集和评估方法,揭示了ISO-GQL生成中的方言差距,并展示了通过充足示例提升模型性能的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28048 2026-08-05 cs.AI 版本更新 57%

SKILL-KD: Contrastive Skill Distillation for LLM Agents

SKILL-KD:面向大语言模型智能体的对比式技能蒸馏

Qiming Shi, Yibo Dou, Jiawen Zhu, Yulong Tao, Linbo Jin, Zhaolu Kang, Yunfan Zhou, Di Weng

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 SKILL-KD是面向LLM智能体的对比式技能蒸馏框架,通过将师生智能体的可操作差异蒸馏为技能补丁并迭代优化,结合感知漂移的技能整合,在五个智能体基准上提升了冻结学生智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23690 2026-08-05 cs.CV cs.CL 版本更新 57%

HomeSafeBench: Benchmarking Embodied Vision-Language Models in Free-Exploration Home Safety Inspection

HomeSafeBench:面向自由探索式家庭安全检查的具身视觉-语言模型基准

Jiashu Yao, Haoyu Wen, Siyuan Gao, Yuhang Guo, Zeming Liu, Heyan Huang

机构 * Beijing Institute of Technology(北京理工大学) Beihang University(北京航空航天大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究针对家庭安全隐患检查需求构建HomeSafeBench基准,提出CueBack数据构建方法,微调4B规模VLM使分布外测试集F1值显著提升,缩小了与人类检查员的性能差距。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28894 2026-08-04 cs.AI stat.ML 版本更新 57%

Identifying Informative Environments for Cognition Parameter Inference via Bayesian Experimental Design

基于贝叶斯实验设计识别认知参数推断的有效环境

Manisha Dubey, Rimvydas Rubavicius, N. Siddharth, Subramanian Ramamoorthy

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 该研究针对认知参数推断的环境选择问题,将认知规划实验建模为贝叶斯实验设计问题,提出摊销贝叶斯实验设计框架,经Mouselab-MDP实验验证其高效性,揭示了环境选择的权衡关系。

Comments 14 pages, 16 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11439 2026-08-04 cs.LG 版本更新 57%

Multi-Level Strategic Classification: Incentivizing Improvement through Promotion and Relegation Dynamics

多层级策略分类:通过晋升与降级动态激励改进

Ziyuan Huang, Lina Alkarmi, Mingyan Liu

机构 * Electrical and Computer Engineering Department, University of Michigan, Ann Arbor, MI 48109, USA(密歇根大学电气与计算机工程系,安阿伯,MI 48109,美国)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出一种多层级晋升-降级框架,通过设计分类器阈值和难度递进来激励代理人诚实努力,并证明在温和条件下代理人可通过真实改进达到任意高水平。

Comments 9 pages, 4 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23590 2026-08-04 cs.AI 版本更新 57%

Co-ReAct: Rubrics as Step-Level Collaborators for ReAct Agents

Co-ReAct:作为ReAct智能体逐步协作者的评分准则

Jiazheng Kang, Bowen Zhang, Zixin Song, Jiangwang Chen, Xiao Yang, Da Zhu, Guanjun Jiang

机构 * Qwen Applications Business Group of Alibaba(阿里巴巴文勤应用业务组) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出Co-ReAct框架,通过训练专用评分准则生成器,在推理时逐步指导ReAct智能体的行动选择,显著提升搜索密集型多步推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14322 2026-08-04 cs.AI 版本更新 57%

TeachArena: Are Language Agents Ready for Realistic Teaching Work?

代理是否准备好教学?一个多阶段基准用于现实世界教学工作流程

Zixin Chen, Peng Liu, Rui Sheng, Haobo Li, Jianhong Tu, Xiaodong Deng, Kashun Shum, Dayiheng Liu, Huamin Qu

机构 * Hong Kong University of Science and Technology(香港科技大学) Qwen Team, Alibaba Group(阿里集团通义实验室)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本文提出EduAgentBench基准,用于评估教学代理的全面能力,发现当前模型在教学任务中的表现有限,但仍为开发未来教学代理提供了测量基础。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27269 2026-08-04 cs.AI 版本更新 57%

Unifying biomedical knowledge in a modern multimodal graph

OptimusKG:统一生物医学知识的现代多模态图

Lucas Vittor, Ayush Noori, Iñaki Arango, Joaquín Polonuer, Sam Rodriques, Andrew White, David A. Clifton, Marinka Zitnik

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Edison Scientific Inc.(Edison科学公司) Oxford Suzhou Centre for Advanced Research, University of Oxford(牛津大学苏格兰研究中心) Broad Institute of MIT and Harvard(MIT与哈佛大学Broad研究所) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究所) Harvard Data Science Initiative(哈佛大学数据科学计划)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 OptimusKG通过整合结构化和半结构化资源,构建了多模态生物医学标记属性图,统一了分子、解剖、临床和环境领域的知识,验证了其在生物医学领域的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏