arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15841 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15841 篇

2607.18665 2026-07-22 cs.AI 新提交 57%

SciHazard: A Benchmark for Measuring Scientific Safety Risks with Decomposed Harm Scoring

SciHazard:一种通过分解危害评分来衡量科学安全风险的基准

Chunxiao Li, Yuan Xiong, Lijun Li, Tianyi Du, Wenlong Zhang, Lei Bai, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI

AI总结 研究针对大型语言模型可能传播有害科学知识的问题,引入SciHazard基准及评估框架,含多学科问题。开发分解评估程序计算DeHarm-Score,经专家验证和模型测试,显示该方法能有效衡量风险,还发现深度研究代理存在安全盲点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18659 2026-07-22 cs.CR cs.AI cs.MA 新提交 57%

Broken Gates: Re-evaluating Web Bot Defenses in the Age of LLM Agents

破碎的大门:在大语言模型代理时代重新评估网络机器人防御

Behzad Ousat, Nikita Turkmen, Lalchandra Rampersaud, Dillan Bailey, Amin Kharraz

机构 * Florida International University(佛罗里达国际大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究在大语言模型代理时代网络机器人防御的有效性,通过系统测量研究评估基于交互式挑战与非交互式信任的防御对商业验证码解决服务和大语言模型代理的弹性,发现非交互式防御安全边界在环境层,影响机器人管理系统设计评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18432 2026-07-22 cs.CL 新提交 57%

Building a European Multilingual Evaluation Dataset: The MMLU Localisation Project within the EMT Network

构建欧洲多语言评估数据集:EMT网络中的MMLU本地化项目

Pilar Sánchez-Gijón, Susana Valdez, Sofía Calvo Del Barrio, Florence Bellemont, Anna Kokkinidou, Mihai Cristian Brasoveanu

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 DGT与EMT合作将MMLU数据集本地化至11种欧洲语言,既为大语言模型评估打造更具包容性基准,又为硕士生提供专业培训,还突显了相关方法、管理及工作流程方面的挑战。

Journal ref Proceedings of the 3rd International Conference on New Trends in Translation and Interpreting Technology, June 24 - 27, 2026, Dubrovnik, Croatia

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18294 2026-07-22 cs.LG 新提交 57%

Uncertainty Quantification for AI-Driven Crash Simulation Surrogates: A Comparative Study of Monte Carlo Dropout and Deep Ensemble on Open-Source Bumper Beam Benchmark

人工智能驱动的碰撞模拟代理的不确定性量化:基于开源保险杠梁基准的蒙特卡洛随机失活和深度集成的比较研究

Sudeep Chavare

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 研究人工智能驱动碰撞模拟代理的不确定性量化,对蒙特卡洛随机失活和深度集成两种方法在开源管道上比较,用具体随机失活解决常见批评,经汽车碰撞模拟实验,揭示权衡,表明可低成本实现良好校准和无超参数的不确定性估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18272 2026-07-22 cs.GT cs.AI cs.SY eess.SY 新提交 57%

Market Strategy Evaluation for Prosumers in Local Electricity Markets

本地电力市场中 prosumer 的市场策略评估

Lukas Peter Wagner, Raoul Bisson, Felix Gehlhoff

机构 * Federal Ministry for Economic Affairs and Climate Action(经济事务和气候行动部) Projektträger Jülich GmbH(尤利奇项目载体)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究本地电力市场中 prosumer 的市场策略,开发基于代理的模拟平台,比较四种市场策略,通过模拟发现基于规则的资源控制可降社区能源支出,市场自适应策略收益最高,策略有效性取决于多种因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18240 2026-07-22 cs.AI 新提交 57%

Calibrated Selective Fact-Checking via Evidence Chain Evaluation

通过证据链评估进行校准的选择性事实核查

Dekun Yang

机构 * Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对大语言模型事实核查的可靠性问题,提出证据链评估框架ECE,通过网络搜索等收集证据并返回结构化裁决。在ECE - Bench上有较好表现,虽总体校准指标未超最强基线,但实现了选择性预测权衡,弃权可处理弱证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19334 2026-07-22 stat.ML cs.IT cs.LG math.IT math.ST stat.TH 新提交 57%

Fundamental limits of distributed multiclass classification from simple binary decisions

基于简单二元决策的分布式多类分类的基本限制

Ioannis Papageorgiou, Srinivas Nomula, Ayalvadi Ganesh, Sidharth Jaggi, Parimal Parag

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究从\(O(\log K)\)个简单二元分类器组合构建\(K\)类分类器的问题,当二元分类器为超平面时,在高斯设置下得出性能界限,并通过模拟实验验证理论结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17927 2026-07-21 cs.SE 新提交 57%

(Over)Reliance on Test Agents in AI-Assisted Software Testing

人工智能辅助软件测试中对测试代理的(过度)依赖

Eduard Paul Enoiu

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 探讨人工智能辅助软件测试中对测试代理的过度依赖问题,通过软件测试作为认知问题解决等三个理论视角阐述,提出收集过度依赖数据的框架及识别模式,旨在支持加速测试且不削弱测试判断与证据价值。

Comments Accepted @ ORCAS'2026, co-located with SAFECOMP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17701 2026-07-21 cs.AI 新提交 57%

ProEvent: An Event-centric Benchmark for Proactive Agents

ProEvent:面向主动智能体的以事件为中心的基准测试

Guanzhen Li, Liangming Pan, Leye Wang

机构 * School of Computing, Peking University(北京大学计算机学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对主动智能体研究忽视事件中心协助及评估难的问题,引入ProEvent基准测试,基于即时通讯聊天评估智能体维护用户时间表能力,实验发现当前智能体存在过度反应和事件取消处理难等问题,揭示了大语言模型的根本局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17250 2026-07-21 cs.CL 新提交 57%

EvolvingWorld: An Open-Schema Framework for Co-Evolving Role-Play Agents and World Model in Interactive Literary World

EvolvingWorld:用于交互式文学世界中角色与世界模型协同进化的开放架构框架

Qing Zong, Yue Guo, Mengxin Yang, Yiwen Guo, Yangqiu Song

机构 * Hong Kong University of Science and Technology(香港科技大学) LIGHTSPEED(光速) Huazhong University of Science and Technology(华中科技大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究交互式文学世界中角色与世界协同进化问题,提出EvolvingWorld框架,含角色智能体和世界模型两个耦合模块,制定7个可训练任务,构建数据集并引入评估协议,实验证明其能有效改进长期模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16351 2026-07-21 cs.CV cs.AI 新提交 57%

Privacy-Aware Synthetic Video Benchmarking and Relational Evaluation for Worker-Under-Suspended-Load Detection

用于悬吊负载下工人检测的隐私感知合成视频基准测试与关系评估

Anshu Singh, Alejandro Seif

机构 * Government Technology Agency of Singapore(新加坡政府科技局)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 研究悬吊负载下工人检测的隐私问题,引入SynthSite合成视频基准测试及隐私感知混合生成工作流程,在五种隐私条件下评估相关指标,发现保留结构的模糊处理效用更好,强调建筑安全分析隐私评估需兼顾外观抑制和几何线索保留。

Comments Accepted at the 3rd Workshop on Synthetic Data for Computer Vision (SynData4CV), CVPR 2026. OpenReview: https://openreview.net/forum?id=dMfhFmDWsg . Dataset and code: https://huggingface.co/datasets/govtech/SynthSite

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16194 2026-07-21 cs.LG econ.GN q-fin.EC 新提交 57%

Reinforcement Learning-Guided NSGA-II Enhanced with Gray Relational Coefficient for Multi-Objective Optimization: Application to NASDAQ Portfolio Optimization

基于灰色关联系数增强的强化学习引导的NSGA-II在多目标优化中的应用:以纳斯达克投资组合优化为例

Zhiyuan Wang, Qinxu Ding, Ding Ding, Siying Zhu, Jing Ren, Yue Wang, Chong Hui Tan

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文针对投资组合优化中的约束多目标优化问题,提出RL-NSGA-II-GRC方法,结合强化学习智能体与灰色关联系数,通过自适应控制参数及设计综合指标引导搜索,在基准测试和纳斯达克案例中提升收敛性,得到密集前沿及有效投资组合。

Journal ref Mathematics 14(2), 296 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17012 2026-07-21 cs.SE cond-mat.mtrl-sci physics.ins-det 新提交 57%

Schema-Bound LLM Control of Scientific Instrumentation through Model Context Protocol Skills

通过模型上下文协议技能对科学仪器进行模式绑定的大语言模型控制

Roberto dos Reis, Vinayak P. Dravid

专题命中 Agent评测 :agentic(abstract);分类 cs.SE

AI总结 研究如何通过模型上下文协议将本地大语言模型与科学仪器相连,结合多种技术实现连接,开源服务器展示相关工具等,通过软件验证,为闭环智能仪器研究提供基础。

Comments 36 pages, 8 figures, 7 tables. Open-source reference implementation, physics-plausible simulator, and validation suite. Software-only validation; live-instrument validation is not reported

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05558 2026-07-21 cs.LG 版本更新 57%

Autoregressive Diffusion World Models for Off-Policy Evaluation of LLM Agents

自回归扩散世界模型用于LLM智能体的离线评估

Kaixuan Liu, Guojun Xiong, Weinan Zhang, Shengpu Tang

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出ADWM框架,通过自回归扩散世界模型从预收集轨迹中模拟环境响应,实现无需在线交互的LLM智能体策略离线评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31581 2026-07-21 cs.AI 版本更新 57%

Choosing the Lens: Strategic Perspective Activation in Context-Dependent Argumentation

选择视角:上下文相关论证中的策略性视角激活

Albert Sadowski, Jarosław A. Chudziak

机构 * Warsaw University of Technology(华沙技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出上下文相关论证框架(CDAF),通过击败函数和视角标记特化,研究代理如何通过选择相关性集和优先级来策略性地影响论证结果。

Comments Accepted to LAMAS&SR workshop at FLoC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14161 2026-07-21 cs.LG 版本更新 57%

When Benchmarks Lie: Evaluating Malicious Prompt Classifiers Under True Distribution Shift

当基准谎言:在真实分布偏移下评估恶意提示分类器

Max Fomin

机构 * Zenity

专题命中 Agent评测 :agentic(abstract);分类 cs.LG

AI总结 研究通过LODO评估揭示了现有方法在真实分布偏移下的局限性,并展示了SAE特征在提升分类器解释性方面的潜力。

Comments v2: extended version of the AIWILD @ ICLR 2026 workshop paper; adds multi-model replication and additional analyses

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20720 2026-07-21 cs.CV cs.AI cs.RO 版本更新 57%

Li-ViP3D++: Query-Gated Deformable Camera-LiDAR Fusion for End-to-End Perception and Trajectory Prediction

Li-ViP3D++:基于查询的可变形相机-激光雷达融合用于端到端感知与轨迹预测

Matej Halinkovic, Nina Masarykova, Alexey Vinel, Marek Galinski

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Slovak University of Technology(斯洛伐克技术大学) Halmstad University(哈马比大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 Li-ViP3D++通过引入查询门控可变形融合技术,实现了端到端感知与轨迹预测,提升了自动驾驶系统的鲁棒性和效率。

Comments Published in IEEE Access. The version of record is available at DOI: 10.1109/ACCESS.2026.3709080

Journal ref IEEE Access, vol. 14, pp. 102999-103012, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06310 2026-07-21 cs.CY cs.AI cs.MA 57%

Too Human to Model:The Uncanny Valley of LLMs in Social Simulation -- When Generative Language Agents Misalign with Modelling Principles

过于人性化的模型:LLM在社交模拟中的怪诞谷--当生成语言代理与建模原则不一致时

Yongchao Zeng, Calum Brown, Mark Rounsevell

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文探讨了LLM在社交模拟中因过于人性化的特性导致的抽象与自然性矛盾,指出其在建模原则下的局限性,并提出重新定位LLM代理以适应不同应用场景的建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01701 2026-07-21 cs.GT cs.LG 版本更新 57%

Regret Minimization for Piecewise Linear Rewards: Contracts, Auctions, and Beyond

分段线性奖励的遗憾最小化:合同、拍卖及其他

Francesco Bacchiocchi, Matteo Castiglioni, Alberto Marchesi, Nicola Gatti

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究在相关模型参数未知且由概率分布确定时,如何优化未知随机分段线性奖励函数。提出通用在线学习框架,设计算法达\(\widetilde{O}(\sqrt{nT})\)遗憾值,解决了微观经济学习文献中的两个开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15883 2026-07-20 cs.HC cs.AI 新提交 57%

Perceived AGI: Believability as Dimensional Completeness, Not Capability

感知通用人工智能:可信度取决于维度完整性,而非能力

Sebastian Cochinescu

机构 * University of Bucharest(布加勒斯特大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究探讨大语言模型在对话中缺乏思维存在感的问题,提出可信度取决于维度完整性的假设,定义了时间、真相、熵和爱四个维度及相关行为立场,识别出行为层,还陈述了可证伪预测,为感知通用人工智能提供概念框架。

Comments 12 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15641 2026-07-20 cs.RO cs.AI 新提交 57%

IMBench: A Benchmark for Intuitive Robotic Manipulation

IMBench:直观机器人操作的基准测试

Anurag Maurya, Sukhvansh Jain, Prajwal Avhad, Gautham Balachandran, Ziyi Zhou, Atharva Kshirsagar, Satyam Singh, Bowen Li. Rishabh Mukund, Ritul Singh, Jatin Vira, Suvonil Chatterjee, Devesh K. Jha

专题命中 Agent评测 :tool use(abstract);分类 cs.AI

AI总结 IMBench旨在评估直观机器人操作这一综合能力,其任务含物理结构推断与动作序列生成。通过35个任务等进行实验,发现视觉语言模型和视觉 - 语言 - 动作模型的不足,为评估和发展物理智能提供基准。

Comments Accepted to SemRob Workshop, RSS 2026. Project Website: https://imbench.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14673 2026-07-17 cs.AI cs.HC 新提交 57%

Project Kaleidoscope: Contextual, Human-Aligned Evaluation for Real-World AI Applications

万花筒计划:面向现实世界人工智能应用的情境化、符合人类需求的评估

Leanne Tan, Rohan Jaggi, Shaun Khoo, Roy Ka-Wei Lee

机构 * GovTech(新加坡政府科技局) National University of Singapore(新加坡国立大学) University of British Columbia(英属哥伦比亚大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 该项目旨在解决现实世界AI应用评估瓶颈,提出万花筒计划,通过集成基于角色的测试生成、情境化评分标准和人工审查,实现可靠性门控自动评分,经试点和实验验证了其在端到端可靠自动评分方面的有用特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11624 2026-07-17 cs.RO cs.LG 版本更新 57%

SKooP: Symmetric Koopman Predictions for Faster and More Generalizable Legged Robot Locomotion with Reinforcement Learning

SKooP:用于强化学习的更快、更通用的有腿机器人运动的对称库普曼预测

Evelyn D'Elia, Weishu Zhan, Giulio Turrisi, Giulio Romualdi, Giuseppe L'Erario, Raffaello Camoriano, Wei Pan, Daniele Pucci

机构 * Italian Institute of Technology (IIT)(意大利理工学院) University of Manchester(曼彻斯特大学) Dynamic Legged Systems Laboratory, IIT(意大利理工学院动态腿式系统实验室) Generative Bionics S.R.L(生成仿生学有限公司) DAUIN, Politecnico di Torino(都灵理工大学DAUIN) Rehab Technologies Lab, IIT(意大利理工学院康复技术实验室) Newcastle University(纽卡斯尔大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究针对强化学习样本效率低问题展开,提出SKooP方法,结合形态对称与库普曼模型优势,在学习策略时学习系统动力学模型,将其预测用于评论家,还纳入群对称,验证了该方法能减少收敛时间并增加学习奖励,且策略可转移。

Comments This paper has been accepted for publication at the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Pittsburgh, USA, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17930 2026-07-17 cs.AI 版本更新 57%

How Inference Compute Shapes Frontier LLM Evaluation

推理计算如何塑造前沿LLM评估

Jessica McFadyen, Ole Jorgensen, Harry Coppock, Kevin Wei, Cozmin Ududec

机构 * UK AI Security Institute(英国人工智能安全研究所)

专题命中 Agent评测 :tool use(abstract);分类 cs.AI

AI总结 通过控制推理计算量(如token预算、上下文压缩和重复提交)评估12个前沿语言模型,发现更大计算量显著提升性能,固定预算评估低估模型能力,且不同基准对推理扩展方法敏感。

Comments 34 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15948 2026-07-17 cs.AI q-bio.NC 版本更新 57%

Subjective functions

主观函数

Samuel J. Gershman

机构 * Harvard University(哈佛大学) Department of Psychology(心理学系) Center for Brain Science(脑科学中心) Kempner Institute for the Study of Natural and Artificial Intelligence(自然与人工智能研究学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文探讨了主观函数的概念,通过预期预测误差作为例子,提出了一种赋予人工系统自主设定目标能力的方法,连接了心理学、神经科学和机器学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08423 2026-07-17 cond-mat.mtrl-sci cs.LG physics.ins-det 57%

Mic-hackathon 2024: Hackathon on Machine Learning for Electron and Scanning Probe Microscopy

Mic-hackathon 2024: 机器学习在电子显微镜和扫描探针显微镜上的黑客马拉松

Utkarsh Pratiush, Austin Houston, Kamyar Barakati, Aditya Raghavan, Dasol Yoon, Harikrishnan KP, Zhaslan Baraissov, Desheng Ma, Samuel S. Welborn, Mikolaj Jakowski, Shawn-Patrick Barhorst, Alexander J. Pattison, Panayotis Manganaris, Sita Sirisha Madugula, Sai Venkata Gayathri Ayyagari, Vishal Kennedy, Ralph Bulanadi, Michelle Wang, Kieran J. Pang, Ian Addison-Smith, Willy Menacho, Horacio V. Guzman, Alexander Kiefer, Nicholas Furth, Nikola L. Kolev, Mikhail Petrov, Viktoriia Liu, Sergey Ilyev, Srikar Rairao, Tommaso Rodani, Ivan Pinto-Huguet, Xuli Chen, Josep Cruañes, Marta Torrens, Jovan Pomar, Fanzhi Su, Pawan Vedanti, Zhiheng Lyu, Xingzhi Wang, Lehan Yao, Amir Taqieddin, Forrest Laskowski, Xiangyu Yin, Yu-Tsun Shao, Benjamin Fein-Ashley, Yi Jiang, Vineet Kumar, Himanshu Mishra, Yogesh Paul, Adib Bazgir, Rama chandra Praneeth Madugula, Yuwen Zhang, Pravan Omprakash, Jian Huang, Eric Montufar-Morales, Vivek Chawla, Harshit Sethi, Jie Huang, Lauri Kurki, Grace Guinan, Addison Salvador, Arman Ter-Petrosyan, Madeline Van Winkle, Steven R. Spurgeon, Ganesh Narasimha, Zijie Wu, Richard Liu, Yongtao Liu, Boris Slautin, Andrew R Lupini, Rama Vasudevan, Gerd Duscher, Sergei V. Kalinin

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本次黑客马拉松旨在通过促进机器学习与显微镜领域的合作,推动机器学习在电子显微镜和扫描探针显微镜中的应用,产生基准数据集和数字孪生以支持标准化工作流程。

Journal ref Mach. Learn.: Sci. Technol. 6 (2025) 040701

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02255 2026-07-17 cs.LG 版本更新 57%

SafeOR-Gym: A Benchmark Suite for Safe Reinforcement Learning Algorithms on Practical Operations Research Problems

SafeOR-Gym:用于实际运筹学问题的安全强化学习算法的基准套件

Asha Ramanujam, Adam Elyoumi, Hao Chen, Sai Madhukiran Kompalli, Akshdeep Singh Ahluwalia, Shraman Pal, Dimitri J. Papageorgiou, Can Li

机构 * Davidson School of Chemical Engineering, Purdue University(普渡大学化学工程学院) Energy Sciences, ExxonMobil Technology and Engineering Company(埃克森美孚技术与工程公司能源科学部)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 针对现有安全强化学习基准与高风险领域相关性有限的问题,提出SafeOR-Gym基准套件,含九个运筹学环境,集成CMDP接口,评估多种算法,揭示性能差异,为安全强化学习研究提供实用测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21688 2026-07-16 cs.LO cs.LG 版本更新 57%

A-IC3: Learning-Guided Adaptive Inductive Generalization for Hardware Model Checking

A-IC3:用于硬件模型检查的学习引导自适应归纳泛化

Xiaofeng Zhou, Guangyu Hu, Hongce Zhang, Wei Zhang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 针对IC3算法在硬件模型检查中归纳泛化策略固定的问题,提出基于机器学习的轻量级框架,利用多臂赌博机算法动态选择策略,经实验验证该方法能有效提升rIC3解决案例数量及PAR-2分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14001 2026-07-16 cs.LG 新提交 57%

Lyapunov Exponent as Physics-Informed Dense Reward: RL Discovery of Stabilization Beyond the Kapitza Pendulum

李雅普诺夫指数作为物理信息密集奖励:强化学习发现超越卡皮察摆的稳定方法

Slava Andrejev

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 该研究针对强化学习中稳定垂直运动倒立摆的问题,提出将李雅普诺夫特征指数作为密集奖励信号,智能体借此成功找到卡皮察摆振荡运动并抑制摆动,让摆处于直立位置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13621 2026-07-16 cs.AI 新提交 57%

UESF-Bench: Benchmarking and Probing for Unified Embodied Seeking and Following

UESF-Bench:统一的具身寻找与跟随的基准测试与探究

Kun Yu, Jianhua Yang, Yixiang Chen, Changwei Wang, Hongyuan Yu, Yan Huang, Fushuo Huo, Ya Jing, Zhumin Chen, Keji He

机构 * Shandong University(山东大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Qilu University of Technology(齐鲁工业大学) Xiaomi Inc(小米公司) Beijing University Of Technology(北京工业大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对现有具身智能体语言引导人类跟随基准测试的局限,引入UESF-Bench基准,提出SeekFollow-VLA框架,可处理语义引导探索等任务,实验显示该框架在单人和多人环境中比基线有明显改进,为统一具身寻找与跟随建立基线。

详情

展开后加载摘要…

URL PDF HTML 收藏