arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15841 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15841 篇

2605.14779 2026-05-15 cs.LG 57%

Peng's Q($λ$) for Conservative Value Estimation in Offline Reinforcement Learning

彭的Q(λ)在离线强化学习中的保守价值估计

Byeongchan Kim, Min-hwan Oh

机构 * Seoul National University(首尔国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种基于离线多步强化学习的算法CPQL,通过保守价值估计替代贝尔曼算子,实现了更优的性能保证和鲁棒性改进。

Comments Accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14542 2026-05-15 cs.AI 57%

VerbalValue: A Socially Intelligent Virtual Host for Sales-Driven Live Commerce

VerbalValue:面向销售驱动直播电商的社会智能虚拟主持人

Yuyan Chen

机构 * Cornell University(康奈尔大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出VerbalValue,一种以销售转化为导向的虚拟主持人,通过构建产品知识库和销售术语词典,结合大语言模型微调,提升直播电商中的信息传达和说服力。

Comments Accepted to the CVPR 2026 HiGen Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14350 2026-05-15 cs.LG 57%

Distributionally Robust Multi-Task Reinforcement Learning via Adaptive Task Sampling

通过自适应任务采样实现分布鲁棒多任务强化学习

Nicholas E. Corrado, Wenyuan Huang, Josiah P. Hanna

机构 * Computer Sciences Department(计算机科学系) University of Wisconsin – Madison(威斯康星大学麦迪逊分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出DRATS算法,通过自适应优先采样未被解决的任务,提升多任务强化学习的数据效率和最差任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14261 2026-05-15 cs.AI cs.GT 57%

Heuristic Pathologies and Further Variance Reduction via Uncertainty Propagation in the AIVAT Family of Techniques

启发式病态及通过不确定性传播进一步方差缩减在AIVAT技术家族中

Juho Kim, Tuomas Sandholm

机构 * CMU Strategic Machine, Inc.(CMU战略机器公司) Strategy Robot, Inc.(策略机器人公司) Optimized Markets, Inc.(优化市场公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文探讨了AIVAT技术中启发式价值函数的潜在漏洞,并通过不确定性传播进一步减少方差,实验显示可减少43%的样本需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15620 2026-05-15 cs.LG 57%

Closing the Gap on the Sample Complexity of 1-Identification

缩小1-识别问题样本复杂度的差距

Zitian Li, Wang Chi Cheung

机构 * Department of Industrial Systems Engineering & Management(工业系统工程与管理系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文研究了多臂老虎机中的1-识别问题,提出新的下界和算法,统一界内匹配至多项式对数因子,补充了多合格臂情况下的样本复杂度分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14067 2026-05-15 cs.LG 57%

Comparative Evaluation of Machine Learning Approaches for Minority-Class Financial Distress Prediction Under Class Imbalance Constraints

机器学习方法在类不平衡约束下对少数类财务困境预测的比较评估

Karan Sehgal, Khawar Naveed Bhatti

机构 * Kent Business School(肯特商学院) University of Kent(肯特大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 本文比较了统计方法、集成学习和神经网络模型在类不平衡数据下的少数类财务困境预测效果,验证了梯度提升方法在严重不平衡情况下的优越性。

Comments 16 pages, 4 figures, preprint under review. Applied machine learning evaluation involving imbalance-aware financial distress prediction, ensemble learning, SMOTE, and SHAP explainability analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13849 2026-05-15 cs.AI 57%

Mixed Integer Goal Programming for Personalized Meal Optimization with User-Defined Serving Granularity

带有用户定义服务粒度的混合整数目标规划用于个性化餐优化

Francisco Aguilera Moreno

机构 * March 2026(2026年3月)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文提出混合整数目标规划(MIGP)解决个性化餐优化中的服务粒度和营养约束问题,通过整数变量和目标规划偏差实现更灵活的营养目标,且在多数情况下优于传统方法。

Comments 34 pages, 6 figures, open-source implementation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13706 2026-05-14 cs.CR cs.AI cs.CY cs.NI 57%

Identifying AI Web Scrapers Using Canary Tokens

通过信标令牌识别人工智能网络爬虫

Steven Seiden, Triss Ren, Caroline Zhang, Taein Kim, Enze Liu, Emily Wenger

机构 * Duke University(杜克大学) University of Pittsburgh(匹兹堡大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出一种自动识别与大型语言模型相关的网络爬虫的方法,通过动态网站和信标令牌验证爬虫身份,实验表明能可靠识别多个未公开的爬虫。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10888 2026-05-14 cs.LO cs.AI 57%

Shields to Guarantee Probabilistic Safety in MDPs

护盾以保证马尔可夫决策过程中的概率安全

Linus Heck, Filip Macák, Roman Andriushchenko, Milan Češka, Sebastian Junges

机构 * Radboud University(拉德堡德大学) Brno University of Technology(布拉格技术大学)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI

AI总结 本文提出一种框架,扩展传统护盾以保证概率安全,证明强安全保证不可行,提供弱保证护盾,并引入离线和在线护盾构造以确保强安全保证。

Comments Accepted to CAV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13167 2026-05-14 cs.CL 57%

GeoBuildBench: A Benchmark for Interactive and Executable Geometry Construction from Natural Language

GeoBuildBench:一个用于从自然语言构建可执行几何构造的基准

Jinwoong Kim, Rui Yang, Huishuai Zhang

机构 * Peking University(北京大学) Wangxuan Institute of Computer Technology(王璇计算机技术研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 GeoBuildBench评估大语言模型能否将自然语言几何问题转化为可执行构造,包含489道中文教材问题,验证了多模态模型在交互构造任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12745 2026-05-14 cs.HC cs.AI 57%

What Do You Think I Think? Accounting for Human Beliefs Using Second-Order Theory of Mind

我思考什么?利用二级理论 of mind 账户人类信念

Patrick Callaghan, Reid Simmons, Henny Admoni

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出一种二级理论 of mind 框架,使智能体能检测并反馈人类错误信念及认知偏差,从而提升交互信息量。

Comments To appear in the proceedings of The 2026 Cognitive Science Society Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12662 2026-05-14 cs.LG q-bio.GN 57%

scShapeBench: Discovering geometry from high dimensional scRNAseq data

scShapeBench: 从高维scRNAseq数据中发现几何结构

Andrew J Steindl, João Felipe Rocha, Brian Tshilengi Di Bassinga, Zachary Warren, Matthew Scicluna, César Miguel Valdez Córdova, Shabarni Gupta, Leire Torices, Daniel Neumann, Timothy J. Mann, Ihuan Gunawan, Dhananjay Bhaskar, John G Lock, Christine L Chaffer, Guy Wolf, Smita Krishnaswamy

机构 * Yale University(耶鲁大学) Mila / Université de Montréal(Mila / 蒙特利尔大学) Garvan Institute of Medical Research(Garvan医学研究机构) School of Biomedical Sciences, University of New South Wales(新南威尔士大学生物医学科学学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 Agent评测 :agentic(abstract);分类 cs.LG

AI总结 scShapeBench通过合成和专家标注的单细胞数据集,提供高维数据形状检测的基准,结合扩散几何提取Reeb图,改进拓扑-aware评估指标,优于PAGA和Mapper。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11981 2026-05-13 physics.flu-dyn cs.AI 57%

High-lift Wing Separation Control via Bayesian Optimization and Deep Reinforcement Learning

高升力翼型分离控制通过贝叶斯优化和深度强化学习

Ricard Montalà, Bernat Font, Oriol Lehmkuhl, Ricardo Vinuesa, Ivette Rodriguez

机构 * TUAREG, Universitat Politècnica de Catalunya (UPC)(TUAREG,西班牙巴塞罗那理工大学) Mechanical Engineering, Delft University of Technology (TU Delft)(代尔夫特理工大学机械工程系) CASE, Barcelona Supercomputing Center (BSC)(巴塞罗那超级计算中心)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究通过贝叶斯优化和深度强化学习优化高升力翼型的主动流动控制,在Re=450000和攻角23度条件下,通过合成喷嘴提升效率,优化策略在维持升力的同时减少阻力,但深度强化学习效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11807 2026-05-13 cs.AI 57%

Why Users Go There: World Knowledge-Augmented Generative Next POI Recommendation

为何用户前往那里:世界知识增强的生成性下一个兴趣点推荐

Qiuyu Ding, Heng-Da Xu, Wei Zhang, Dongyi Lv, Changda Xia, Feng Xiong, Mu Xu

机构 * Amap, Alibaba Group(阿里巴巴集团阿地图) Xi’an Jiaotong University(西安交通大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出AWARE模型,通过LLM代理生成时空感知的上下文叙述,结合用户行为增强世界知识,提升POI推荐效果,实验证明其优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11363 2026-05-13 cs.CV cs.CL 57%

PresentAgent-2: Towards Generalist Multimodal Presentation Agents

PresentAgent-2: 向通用多模态展示代理迈进

Wei Wu, Ziyang Xu, Zeyu Zhang, Yang Zhao, Hao Tang

机构 * Peking University(北京大学) La Trobe University(拉特罗布大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 PresentAgent-2通过多模态资源收集与生成,实现基于用户查询的交互式展示视频生成,支持单人叙述、多人讨论及观众互动三种模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11036 2026-05-13 cs.CR cs.AI 57%

Sequential Behavioral Watermarking for LLM Agents

序列行为水印用于LLM代理

Hyeseon An, Shinwoo Park, Dongsu Kim, Yo-Sub Han

机构 * Department of Computer Science(计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出SeqWM,通过在历史条件下的转移模式中嵌入信号,实现对代理轨迹的无位置验证,提升水印鲁棒性与检测可靠性。

Comments 17 pages, 3 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11026 2026-05-13 cs.CR cs.CL 57%

AgentShield: Deception-based Compromise Detection for Tool-using LLM Agents

AgentShield:基于欺骗的工具使用LLM代理 compromise 检测

Yassin H. Rassul, Tarik A. Rashid

机构 * Computer Science and Engineering Department, School of Science and Engineering, University of Kurdistan Hewl\^{e}r, Erbil, Iraq(科罗曼嫩大学科学与工程学院计算机科学与工程系) Engineering Department, School of Science(科学学院工程系) Engineering, University of Kurdistan Hewl\ e r, Erbil, Iraq(科罗曼嫩大学工程学院) Innovation Centre, University of Kurdistan Hewl\ e r, Erbil, Iraq(科罗曼嫩大学创新中心)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 AgentShield 通过在代理工具接口中设置三层陷阱(假工具、假凭证、允许参数)来检测间接提示注入攻击,利用高精度标签训练自监督分类器,实现高准确率的实时检测与无误报的下游检测训练。

Comments 20 pages, 5 figures. Code: https://github.com/Yassin-H-Rassul/AgentShield

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07782 2026-05-13 cs.CL cs.PL 57%

CktFormalizer: Autoformalization of Natural Language into Circuit Representations

CktFormalizer: 自然语言到电路表示的自动形式化

Jing Xiong, Qi Han, Chenchen Ding, He Xiao, Zunhai Su, Chaofan Tao, Ngai Wong

机构 * The University of Hong Kong(香港大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 CktFormalizer通过依赖类型HDL在Lean 4中实现LLM生成硬件描述的自动形式化,解决Verilog中的宽度不匹配、组合环和不完整案例逻辑问题,提升后端实现率和仿真通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01682 2026-05-13 cs.LG cs.DS stat.ML 57%

Finite and Corruption-Robust Regret Bounds in Online Inverse Linear Optimization under M-Convex Action Sets

有限的和抗腐败的在线逆线性优化在M-凸行动集下的后悔界

Taihei Oki, Shinsaku Sakaue

机构 * Institute for Chemical Reaction Design and Discovery (ICReDD), Hokkaido University(化学反应设计与发现研究所(ICReDD),北海道大学) D3 Center, The University of Osaka(大阪大学D3中心) Center for Advanced Intelligence Project, RIKEN(先进智能项目中心,RIKEN) CyberAgent, Tokyo, Japan(CyberAgent,日本东京) National Institute of Informatics, Tokyo, Japan(信息技术国家研究所,日本东京)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究在线逆线性优化问题,提出在M-凸可行集下可实现O(d log d)的有限后悔界,并扩展到对抗性腐败反馈场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10585 2026-05-12 cs.LG 57%

Controllability in preference-conditioned multi-objective reinforcement learning

偏好条件多目标强化学习中的可控性

Pau de las Heras Molins, Beyazit Yalcinkaya, Lasse Peters, David Fridovich-Keil, Georgios Bakirtzis

机构 * LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎理工学院) University of California, Berkeley(加州大学伯克利分校) TU Delft(代尔夫特理工大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出一种新的评估指标,用于衡量偏好条件多目标强化学习中控制能力的可靠性,以解决现有指标无法准确反映偏好变化对智能体行为影响的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10447 2026-05-12 cs.MA cs.AI econ.GN q-fin.EC q-fin.ST 57%

Statistical Model Checking of the Keynes+Schumpeter Model: A Transient Sensitivity Analysis of a Macroeconomic ABM

凯恩斯+施穆埃特模型的统计模型检验:一个宏观经济ABM的暂态敏感性分析

Stefano Blando, Giorgio Fagiolo, Mauro Napoletano, Tania Treibich, Andrea Vandin

机构 * Institute of Economics L'EMbeDS Sant'Anna School of Advanced Studies, Pisa, Italy GREDEG, CNRS, Universit\'e C\ ote d'Azur Sophia Antipolis, France Maastricht University Maastricht, The Netherlands

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文通过MultiVeStA实现统计模型检验,对凯恩斯+施穆埃特模型进行暂态敏感性分析,展示其在宏观经济ABM中的应用,提供可重复且信息丰富的定量分析方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10170 2026-05-12 cs.LG 57%

Balancing Efficiency and Fairness in Traffic Light Control through Deep Reinforcement Learning

通过深度强化学习平衡交通灯控制的效率与公平性

Matteo Cederle, Giacomo Scatto, Gian Antonio Susto

机构 * University of Padova(帕多瓦大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出一种新型深度强化学习代理,通过整合公平性考虑平衡车辆和行人交通流,实验证明能有效减少拥堵并保障服务公平性。

Comments Paper accepted to the 2026 IFAC World Congress, held in Busan (KOR), August 23rd-28th, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19792 2026-05-12 cs.AI cs.DC cs.MA cs.NE 57%

OpenCLAW-P2P v7.0-P2PCLAW: Resilient Multi-Layer Persistence, Live Reference Verification, and Production-Scale Evaluation of Decentralized AI Peer Review v7.0 -- Mathematical Corrections & Ecosystem Developments Edition

OpenCLAW-P2P v7.0-P2PCLAW:具有容错多层持久性、实时参考验证和生产规模评估的去中心化AI同行评审v7.0--数学修正与生态系统发展版

Francisco Angulo de Lafuente, Teerth Sharma, Vladimir Veselov, Seid Mohammed Abdu, Nirmal Tej Kumar, Guillermo Perry

机构 * Independent AI Researcher & Science Fiction Writer(独立AI研究员及科幻作家) Bachelor of Technology (AI)(人工智能技术学士) Moscow Institute of Electronic Technology (MIET)(莫斯科电子技术学院) Dept. of Computer Science, Woldia University(沃尔迪亚大学计算机科学系) University of Texas at Dallas (UTD)(德克萨斯大学达拉斯分校) Andex Enterprising Inc.(安德克斯企业公司)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

AI总结 本文介绍OpenCLAW-P2P v7.0,一个去中心化集体智能平台的全面演进,允许自主AI代理发布、同行评审、评分并迭代改进科学论文。该版本包含数学修正和生态系统扩展。

Comments v7.0: Mathematical corrections (fixed-point condition Eq.4, dimensionally consistent tau-indicator Eq.7, fully specified reputation formula Eq.8 with quality terms q0 and q-bar, discrete-time PD Governor Eq.15, HSR parameter definitions Eq.16); ecosystem developments: CAJAL-4B/9B models, BenchClaw platform, 14 integrations. 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11674 2026-05-12 cs.RO cs.AI 57%

AffordSim: A Scalable Data Generator and Benchmark for Affordance-Aware Robotic Manipulation

AffordSim:一种可扩展的数据生成器和基准,用于面向 affordance 的机器人操作

Mingyang Li, Haofan Xu, Haowen Sun, Xinzhe Chen, Sihua Ren, Liqi Huang, Xinyang Sui, Chenyang Miao, Jiawei Ye, Qiongjie Cui, Zeyang Liu, Xingyu Chen, Xuguang Lan

机构 * School of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 AffordSim 通过整合开放词汇 3D affordance 预测,解决了机器人操作中接触信息获取的挑战,实现了高成功率的轨迹生成和跨仿真到现实的迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09818 2026-05-12 cs.LG 57%

Learning to Compress Time-to-Control: A Reinforcement Learning Framework for Chronic Disease Management

学习压缩时间到控制:一种用于慢性病管理的强化学习框架

Prabhjot Singh, Abhishek Gupta, Chris Betz, Abe Flansburg, Brett Ives, Sudeep Lama, Jung Hoon Son

机构 * Altitude

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出一种强化学习框架,通过结合偏好学习和强化学习,改进慢性病管理中的时间到控制(TTC)压缩,实验表明其在糖尿病管理中优于现有方法。

Comments 26 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09698 2026-05-12 cs.AI 57%

Ambig-DS: A Benchmark for Task-Framing Ambiguity in Data-Science Agents

Ambig-DS:数据科学代理任务框架模糊度的基准测试

Josefa Lia Stoisser, Marc Boubnovski Martell, Sidsel Boldsen, Kaspar Märtens, Robert Kitchen

机构 * Novo Nordisk London, UK(诺和制药伦敦分公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 Ambig-DS引入两个诊断套件,用于预测目标模糊度和评估目标模糊度,通过控制编辑生成模糊变体,发现任务框架模糊度是数据科学代理评估的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09636 2026-05-12 cs.AI 57%

PDEAgent-Bench: A Multi-Metric, Multi-Library Benchmark for PDE Solver Generation

PDEAgent-Bench: 一个多指标、多库的PDE求解器生成基准

Zhen Hang, Yushan Yashengjiang, Junhui Li, Huanshuo Dong, Yang Wei, Zhezheng Hao, Jiangtao Ma, Songlin Bai, Haozhong Kai, Xihang Yue, Gangzong Si, Dongming Jiang, Chao Yao, Zhanhua Hu, Jiangqing Zhang, Pengwei Liu, Yaomin Shen, Xingyu Ren, Lei Liu, Zikang Xu, Han Li, Qingsong Yao, Hande Dong, Hong Wang

机构 * University of Science and Technology of China(中国科学技术大学) Tencent(腾讯) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) Arizona State University(亚利桑那州立大学) Rice University(里士满大学) Technical University of Munich(慕尼黑技术大学) Stanford University(斯坦福大学) Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 PDEAgent-Bench是首个针对PDE求解器生成的多指标、多库基准,包含645个实例,涵盖6类数学问题和11种PDE家族,评估生成求解器的可执行性、数值精度和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09544 2026-05-12 cs.AI 57%

TIDE-Bench: Task-Aware and Diagnostic Evaluation of Tool-Integrated Reasoning

TIDE-Bench:面向任务的工具整合推理评估

Yize Li, Junzhi Li, Jason Song, Chuxiong Sun, Rui Wang, Changwen Zheng

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 Agent评测 :tool-use(abstract);分类 cs.AI

AI总结 本文提出TIDE-Bench,一个高效全面的工具整合推理评估基准,通过多样任务设置、任务感知评估协议和高质量评价集,揭示工具整合推理中的持续瓶颈。

Comments 10 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09295 2026-05-12 cs.CL 57%

LEAF-SQL: Level-wise Exploration with Adaptive Fine-graining for Text-to-SQL Skeleton Prediction

LEAF-SQL: 基于分层探索与自适应细化的文本到SQL骨架预测

Zhao Tan, Xiping Liu, Qing Shu, Qizhi Wan, Dexi Liu, Changxuan Wan

机构 * School of Computing(计算学院) Artificial Intelligence(人工智能) Jiangxi University of Finance(江西财经大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 LEAF-SQL通过分层探索与自适应细化方法,提升复杂SQL生成性能,实验表明其在BIRD基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11287 2026-05-12 cs.AR cs.SE 57%

Synthesis-in-the-Loop Evaluation of LLMs for RTL Generation: Quality, Reliability, and Failure Modes

LLM在RTL生成中的回路合成评估:质量、可靠性与故障模式

Weimin Fu, Zeng Wang, Minghao Shao, Ramesh Karri, Muhammad Shafique, Johann Knechtel, Ozgur Sinanoglu, Xiaolong Guo

专题命中 Agent评测 :agentic(abstract);分类 cs.SE

AI总结 本文评估32个语言模型在202个Verilog任务上的RTL生成能力,通过硬件质量指数衡量合成与实现质量,发现不同模型在HQI指标上的表现差异显著,揭示了专有模型与开源模型在合成故障上的系统性差异。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏