arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15756 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15756 篇

2602.13275 2026-02-17 cs.AI cs.CL 73%

Artificial Organisations

人工组织

William Waites

机构 * University of Southampton(南安普顿大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出通过机构设计实现多智能体AI系统可靠性的方法,通过信息隔离和对抗性审查,使不可靠个体组件产生可靠集体行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12517 2026-02-16 cs.LG cs.AI cs.MA math.OC 73%

Bench-MFG: A Benchmark Suite for Learning in Stationary Mean Field Games

Bench-MFG:用于在平稳均场博弈中学习的基准测试套件

Lorenzo Magnino, Jiacheng Shen, Matthieu Geist, Olivier Pietquin, Mathieu Laurière

机构 * University of Cambridge(剑桥大学) NYU Shanghai(纽约大学上海分校) NYU Center for Data Science(纽约大学数据科学中心) Earth Species Project(地球物种计划) NYU-ECNU Institute of Mathematical Sciences at NYU Shanghai(纽约大学上海分校数学科学研究所)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 Bench-MFG提出了一套用于评估MFG学习方法的基准测试套件,通过分类问题类型和生成随机实例,提供标准化的实验框架和评估指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10081 2026-02-13 cs.CL cs.AI 73%

Anagent For Enhancing Scientific Table & Figure Analysis

一个增强科学表格及图表分析的代理

Xuehang Guo, Zhiyong Lu, Tom Hope, Qingyun Wang

机构 * College of William \& Mary The Allen Institute for AI (AI2)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 Anagent通过多代理框架提升科学表格及图表分析的准确性和效率,实现显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22130 2026-02-12 cs.AI cs.SE 73%

World of Workflows: A Benchmark for Bringing World Models to Enterprise Systems

世界工作流:一个将世界模型引入企业系统的基准

Lakshya Gupta, Litao Li, Yizhe Liu, Sriram Ganapathi Subramanian, Kaheer Suleman, Zichen Zhang, Haoye Lu, Sumit Pasupalak

专题命中 Agent评测 :autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 World of Workflows提出一个基于ServiceNow的企业系统基准,揭示前沿LLMs在动态建模中的盲区,并强调基于现实世界建模的可靠性需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05636 2026-02-10 cs.AI cs.CL 73%

Generative Ontology: When Structured Knowledge Learns to Create

生成本体:当结构化知识学会创造

Benny Cheung

机构 * Dynamind Research(Dynamind研究)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 生成本体通过融合本体结构与LLM创造力,实现结构化知识生成,展示了在桌游设计中的有效性及跨领域应用潜力。

Comments 19 pages, 12 figures, 8 tables. v2: added empirical evaluation (3 studies: ablation, benchmark, reliability), expanded related work, discussion section, appendices. Code available at https://github.com/bennycheung/GameGrammarCLI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01392 2026-02-10 cs.CL cs.AI cs.CV 73%

ComfyBench: Benchmarking LLM-based Agents in ComfyUI for Autonomously Designing Collaborative AI Systems

ComfyBench:在ComfyUI中基于LLM的代理自主设计协作AI系统的基准测试

Xiangyuan Xue, Zeyu Lu, Di Huang, Zidong Wang, Wanli Ouyang, Lei Bai

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 ComfyBench通过评估基于LLM的代理在ComfyUI中自主设计协作AI系统的能力,提出ComfyAgent框架,展示其在任务解决中的性能与潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03468 2026-02-04 cs.AI cs.LG 73%

IntentRL: Training Proactive User-intent Agents for Open-ended Deep Research via Reinforcement Learning

IntentRL: 通过强化学习训练主动的用户意图代理以进行开放性深度研究

Haohao Luo, Zexi Li, Yuexiang Xie, Wenhao Zhang, Yaliang Li, Ying Shen

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 IntentRL通过强化学习训练主动用户意图代理,提升开放性深度研究的意图识别与任务性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02760 2026-02-04 cs.CL cs.LG 73%

From Task Solving to Robust Real-World Adaptation in LLM Agents

从任务解决到在LLM代理中的鲁棒现实适应

Pouya Pezeshkpour, Estevam Hruschka

机构 * Megagon Labs(梅加戈恩实验室)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了LLM代理在现实环境中的鲁棒适应能力,发现任务解决与实际部署鲁棒性存在显著差距,揭示了在部分可观测性和噪声环境下代理的决策挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02589 2026-02-04 cs.AI cs.LG 73%

PeerRank: Autonomous LLM Evaluation Through Web-Grounded, Bias-Controlled Peer Review

PeerRank: 通过基于网络的、受偏见控制的同行评审实现自主LLM评估

Yanki Margalit, Erni Avram, Ran Taig, Oded Margalit, Nurit Cohen-Inger

机构 * Computer Science and Information, Ben-Gurion University of the Negev(本·加里翁大学(内盖夫)计算机科学与信息学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 PeerRank通过基于网络的、受偏见控制的同行评审实现自主LLM评估,产生稳定且具有区分性的排名,并揭示可测量的身份和呈现偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01171 2026-02-03 cs.AI cs.CL cs.LO 73%

ASP-Bench: From Natural Language to Logic Programs

ASP-Bench: 从自然语言到逻辑程序

Stefan Szeider

机构 * Algorithms and Complexity Group TU Wien(算法与复杂性组维也纳技术大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 ASP-Bench通过自然语言到逻辑程序的转换基准,评估了基于ReAct框架的代理方法,揭示了建模难度的多维因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13448 2026-02-03 cs.MA cs.AI cs.ET cs.LG 73%

BMG-Q: Localized Bipartite Match Graph Attention Q-Learning for Ride-Pooling Order Dispatch

BMG-Q:局部双图匹配图注意力Q学习用于拼车订单调度

Yulong Hu, Siyuan Feng, Sen Li

机构 * Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学土木与环境工程系) Intelligent Transportation Thrust, Systems Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)智能交通 thrust,系统中心) Department of Aeronautical and Aviation Engineering, The Hong Kong Polytechnic University(香港理工大学航空与航空工程系)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 BMG-Q通过局部双图匹配图注意力Q学习提升拼车订单调度的决策效率与鲁棒性。

Journal ref IEEE Transactions on Intelligent Transportation Systems ( Volume: 26, Issue: 10, October 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21903 2026-02-02 cs.SE cs.AI 73%

TOM-SWE: User Mental Modeling For Software Engineering Agents

TOM-SWE:软件工程代理的用户心理建模

Xuhui Zhou, Valerie Chen, Zora Zhiruo Wang, Graham Neubig, Maarten Sap, Xingyao Wang

机构 * Language Technology Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.SE

AI总结 TOM-SWE通过双代理架构实现用户心理建模,提升软件工程代理的任务成功率和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21096 2026-01-30 cs.AI cs.LG cs.PL 73%

Magellan: Autonomous Discovery of Novel Compiler Optimization Heuristics with AlphaEvolve

Magellan:利用AlphaEvolve自主发现新型编译器优化启发式方法

Hongzheng Chen, Alexander Novikov, Ngân Vũ, Hanna Alam, Zhiru Zhang, Aiden Grossman, Mircea Trofin, Amir Yazdanbakhsh

机构 * Google(谷歌) Google DeepMind(谷歌DeepMind) Cornell University(康奈尔大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 Magellan通过AlphaEvolve自主发现新型编译器优化启发式方法,提升编译器优化效率与性能。

Comments Accepted to C4ML@CGO'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13561 2026-01-30 cs.SE cs.AI 73%

OpenDerisk: An Industrial Framework for AI-Driven SRE, with Design, Implementation, and Case Studies

OpenDerisk: 一个面向AI驱动SRE的工业框架,包含设计、实现与案例研究

Peng Di, Faqiang Chen, Xiao Bai, Hongjun Yang, Qingfeng Li, Ganglin Wei, Jian Mou, Feng Shi, Keting Chen, Peng Tang, Zhitao Shen, Zheng Li, Wenhui Shi, Junwei Guo, Hang Yu

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 OpenDerisk是一个专为SRE设计的开源多智能体框架,通过整合诊断协作模型、推理引擎和知识引擎,实现复杂问题的自动化解决,已在蚂蚁集团大规模部署并验证其高效性和可扩展性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08235 2026-01-27 cs.AI cs.CL 73%

MPCI-Bench: A Benchmark for Multimodal Pairwise Contextual Integrity Evaluation of Language Model Agents

MPCI-Bench: 一种用于语言模型代理多模态成对情境完整性评估的基准

Shouju Wang, Haopeng Zhang

机构 * University of Hawaii at Manoa(夏威夷大学曼瑙分校)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 MPCI-Bench是首个用于评估语言模型代理多模态情境完整性隐私行为的基准,揭示了现有模型在隐私与效用平衡及模态泄漏方面的系统性失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04663 2026-01-27 cs.CL cs.LG cs.MA 73%

Debate, Deliberate, Decide (D3): A Cost-Aware Adversarial Framework for Reliable and Interpretable LLM Evaluation

辩论、 deliberative、决定(D3):一种成本意识的对抗框架,用于可靠且可解释的LLM评估

Abir Harrasse, Chaithanya Bandi, Hari Bandi

机构 * Martian NUS(新加坡国立大学) MIT(麻省理工学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL、cs.LG

AI总结 D3是一种通过结构化辩论和聚合机制提升LLM评估可靠性和可解释性的对抗框架,通过预算停止机制优化成本效率。

Journal ref EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11868 2026-01-21 cs.SE cs.AI 73%

Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces

终端基准:在命令行界面中对硬、现实任务的智能体基准测试

Mike A. Merrill, Alexander G. Shaw, Nicholas Carlini, Boxuan Li, Harsh Raj, Ivan Bercovich, Lin Shi, Jeong Yeon Shin, Thomas Walshe, E. Kelly Buchanan, Junhong Shen, Guanghao Ye, Haowei Lin, Jason Poulos, Maoyu Wang, Marianna Nezhurina, Jenia Jitsev, Di Lu, Orfeas Menis Mastromichalakis, Zhiwei Xu, Zizhao Chen, Yue Liu, Robert Zhang, Leon Liangyu Chen, Anurag Kashyap, Jan-Lucas Uslu, Jeffrey Li, Jianbo Wu, Minghao Yan, Song Bian, Vedang Sharma, Ke Sun, Steven Dillmann, Akshay Anand, Andrew Lanpouthakoun, Bardia Koopah, Changran Hu, Etash Guha, Gabriel H. S. Dreiman, Jiacheng Zhu, Karl Krauth, Li Zhong, Niklas Muennighoff, Robert Amanfu, Shangyin Tan, Shreyas Pimpalgaonkar, Tushar Aggarwal, Xiangning Lin, Xin Lan, Xuandong Zhao, Yiqing Liang, Yuanli Wang, Zilong Wang, Changzhi Zhou, David Heineman, Hange Liu, Harsh Trivedi, John Yang, Junhong Lin, Manish Shetty, Michael Yang, Nabil Omi, Negin Raoof, Shanda Li, Terry Yue Zhuo, Wuwei Lin, Yiwei Dai, Yuxin Wang, Wenhao Chai, Shang Zhou, Dariush Wahdany, Ziyu She, Jiaming Hu, Zhikang Dong, Yuxuan Zhu, Sasha Cui, Ahson Saiyed, Arinbjörn Kolbeinsson, Jesse Hu, Christopher Michael Rytting, Ryan Marten, Yixin Wang, Alex Dimakis, Andy Konwinski, Ludwig Schmidt

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 终端基准2.0通过89个计算机终端环境中的硬任务,评估智能体在现实任务中的表现,并揭示模型改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10122 2026-01-16 cs.CL cs.AI cs.HC 73%

Role-Playing Agents Driven by Large Language Models: Current Status, Challenges, and Future Trends

由大型语言模型驱动的角色扮演代理:现状、挑战与未来趋势

Ye Wang, Jiaxing Chen, Hongjiang Xiao

机构 * Communication University of China(中国传媒大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文系统回顾了由大型语言模型驱动的角色扮演代理的现状、挑战及未来趋势,探讨了关键技术路径与评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08835 2026-01-15 cs.CL cs.AI 73%

DeliberationBench: When Do More Voices Hurt? A Controlled Study of Multi-LLM Deliberation Protocols

DeliberationBench: 当更多声音有害时?多LLM协商协议的受控研究

Vaarunay Kaushal, Taranveer Singh

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 DeliberationBench研究发现,多LLM协商协议在性能上远低于简单基线,挑战了复杂性提升质量的假设。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13291 2026-01-15 cs.CL cs.AI 73%

Higher Satisfaction, Lower Cost: A Technical Report on How LLMs Revolutionize Meituan's Intelligent Interaction Systems

更高满意度,更低成本:关于LLMs如何革新美团智能交互系统的技术报告

Xuxin Cheng, Ke Zeng, Zhiquan Cao, Linyi Dai, Wenxuan Gao, Fei Han, Ai Jian, Feng Hong, Wenxing Hu, Zihe Huang, Dejian Kong, Jia Leng, Zhuoyuan Liao, Pei Liu, Jiaye Lin, Xing Ma, Jingqing Ruan, Jiaxing Song, Xiaoyu Tan, Ruixuan Xiao, Wenhui Yu, Wenyu Zhan, Haoxing Zhang, Chao Zhou, Hao Zhou, Shaodong Zheng, Ruinian Chen, Siyuan Chen, Ziyang Chen, Yiwen Dong, Yaoyou Fan, Yangyi Fang, Yang Gan, Shiguang Guo, Qi He, Chaowen Hu, Binghui Li, Dailin Li, Xiangyu Li, Yan Li, Chengjian Liu, Xiangfeng Liu, Jiahui Lv, Qiao Ma, Jiang Pan, Cong Qin, Chenxing Sun, Wen Sun, Zhonghui Wang, Abudukelimu Wuerkaixi, Xin Yang, Fangyi Yuan, Yawen Zhu, Tianyi Zhai, Jie Zhang, Runlai Zhang, Yao Xu, Yiran Zhao, Yifan Wang, Xunliang Cai, Yangen Hu, Cao Liu, Lu Pan, Xiaoli Wang, Bo Xiao, Wenyuan Yao, Qianlin Zhou, Benchang Zhu

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 美团通过WOWService技术报告,利用LLMs和多智能体架构提升智能交互系统,实现用户满意度提升和成本降低。

Comments 36 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08003 2026-01-14 cs.CL cs.AI cs.MA 73%

LLM Review: Enhancing Creative Writing via Blind Peer Review Feedback

LLM Review: 通过盲审同行反馈增强创造性写作

Weiyue Li, Mingxiao Song, Zhenda Shen, Dachuan Zhao, Yunfan Long, Yi Li, Yongce Li, Ruyi Yang, Mengyu Wang

机构 * Harvard University(哈佛大学) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 LLM Review通过盲审同行反馈机制提升创造性写作,实验显示其优于多智能体基线,并使小模型超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02369 2026-01-14 cs.CL cs.AI 73%

AutoContext: Instance-Level Context Learning for LLM Agents

AutoContext:LLM代理的实例级上下文学习

Kuntai Cai, Juncheng Liu, Xianglin Yang, Zhaojie Niu, Xiaokui Xiao, Xing Chen

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 AutoContext通过解耦探索与任务解决,为LLM代理构建结构化的实例上下文,显著提升了任务执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07606 2026-01-13 cs.CL cs.AI 73%

Proof of Time: A Benchmark for Evaluating Scientific Idea Judgments

证明时间:评估科学思想判断的基准

Bingyang Ye, Shan Chen, Jingxuan Tu, Chen Liu, Zidi Xiong, Samuel Schmidgall, Danielle S. Bitterman

机构 * Harvard University(哈佛大学) Mass General Brigham(麻省总医院) Boston Children’s Hospital(波士顿儿童医院) Brandeis University(布兰迪大学) Yale University(耶鲁大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.AI、cs.CL

AI总结 PoT通过半可验证的基准框架评估科学思想判断,利用时间分区和未来可验证的目标,结合离线沙盒实现可扩展的评估。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03144 2026-01-07 cs.CL cs.AI 73%

Self-Verification is All You Need To Pass The Japanese Bar Examination

自我验证就是通过日本司法考试所需

Andrew Shin

机构 * Keio University(.keio大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出了一种自我验证模型,通过忠实复制考试格式和评分尺度,首次实现了LLM通过日本司法考试,无需修改原始问题结构或评分规则。

Comments https://github.com/shinandrew/self_verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24959 2026-01-01 cs.LG cs.AI 73%

Semi-overlapping Multi-bandit Best Arm Identification for Sequential Support Network Learning

半重叠多臂老虎机最佳臂识别用于序列支持网络学习

András Antos, András Millinghoffer, Péter Antal

机构 * Department of Artificial Intelligence and Systems Engineering(人工智能与系统工程系) Budapest University of Technology and Economics(布达佩斯技术与经济大学) E-Group ICT Software Zrt.(E-Group ICT软件公司)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出半重叠多臂老虎机模型,用于高效学习支持网络,改进多老虎机最佳臂识别的误差界并提升性能保证。

Comments 29 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09602 2025-12-30 physics.flu-dyn cs.AI cs.CL 73%

Fine-tuning a Large Language Model for Automating Computational Fluid Dynamics Simulations

针对计算流体力学模拟的大型语言模型微调

Zhehao Dong, Zhen Lu, Yue Yang

机构 * State Key Laboratory for Turbulence and Complex Systems, College of Engineering, Peking University, Beijing 100871, China(湍流与复杂系统国家重点实验室,工程学院,北京大学,北京100871,中国) HEDPS-CAPT, Peking University, Beijing 100871, China(HEDPS-CAPT,北京大学,北京100871,中国)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 通过微调领域特定LLM,实现从自然语言到CFD模拟配置的自动化,提升复杂工程流程的效率和准确性。

Journal ref Theor. Appl. Mech. Lett. 15, 100594 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16530 2025-12-19 cs.CL cs.AI 73%

Plain language adaptations of biomedical text using LLMs: Comparision of evaluation metrics

利用大语言模型对生物医学文本进行plain language改编:评估指标的比较

Primoz Kocbek, Leon Kopitar, Gregor Stiglic

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究比较了利用大语言模型对生物医学文本进行plain language改编的不同方法,发现gpt-4o-mini在评估指标上表现优异,而微调方法效果欠佳。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14720 2025-12-18 cs.SI cs.AI cs.CL 73%

SoMe: A Realistic Benchmark for LLM-based Social Media Agents

SoMe:一种用于基于大语言模型的社会媒体代理的现实基准

Dizhan Xue, Jing Cui, Shengsheng Qian, Chuanrui Hu, Changsheng Xu

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 SoMe是一个用于评估基于大语言模型的社会媒体代理能力的现实基准,通过多样化任务和大量数据揭示了现有LLM在处理社交媒体任务中的局限性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13764 2025-12-17 cs.AI cs.LG 73%

Mathematics and Coding are Universal AI Benchmarks

数学与编码是通用AI的通用基准

Przemyslaw Chojecki

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了数学和编码在AI评估中的通用性,证明了编码任务在电池空间中的稠密性,而纯数学并非如此,揭示了形式数学作为递归自我改进的自然起点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12443 2025-12-16 cs.AI cs.SE 73%

AI Transparency Atlas: Framework, Scoring, and Real-Time Model Card Evaluation Pipeline

AI透明度地图:框架、评分与实时模型卡片评估流程

Akhmadillo Mamirov, Faiaz Azmain, Hanyu Wang

机构 * Department of Computer Science, The College of Wooster, Wooster, OH, USA(计算机科学系,沃斯特学院,沃斯特,OH,USA) Robert F. Wagner Graduate School of Public Service, New York University, New York, NY, USA(罗伯特·F·瓦格纳公共事务研究生学院,纽约大学,纽约,NY,USA)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出AI透明度框架和实时评估流程,评估50个模型发现前沿实验室合规率约80%,而多数供应商低于60%,安全关键领域存在显著缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏