Transfer Learning for Customized Car Racing Environments
迁移学习用于定制化的赛车环境
机构 * seas(系统工程与科学学院)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文研究了迁移学习在深度强化学习中的应用,旨在通过在单一赛道上训练智能体,实现零样本迁移或进一步微调以在其他定制化赛车环境中获得更快的圈速,并比较了基于模型和非基于模型方法的性能。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
迁移学习用于定制化的赛车环境
机构 * seas(系统工程与科学学院)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文研究了迁移学习在深度强化学习中的应用,旨在通过在单一赛道上训练智能体,实现零样本迁移或进一步微调以在其他定制化赛车环境中获得更快的圈速,并比较了基于模型和非基于模型方法的性能。
行星探测中自然语言到一阶逻辑翻译的试点基准
机构 * Department of Computer Science and Engineering, College of Engineering, The Pennsylvania State University(计算机科学与工程系,工程学院,宾夕法尼亚州立大学)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 本文提出一个试点基准,用于在行星探测领域将自然语言转换为一阶逻辑,通过NASA PDS的实测文档构建数据集,并手动标注FOL表示,以支持语言理解和形式推理的交叉研究。
交互评估需要一种设计科学
机构 * University of Texas Austin(德克萨斯大学奥斯汀分校) ; California Institute of Technology(加州理工学院) ; Carnegie Mellon University(卡内基梅隆大学) ; Stanford University(斯坦福大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Microsoft Research(微软研究院) ; Northwestern University(西北大学) ; University of Cambridge(剑桥大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文探讨了交互评估应被视为一种原则性的评估范式,而非仅仅是新的智能体基准。通过定义评估为证据到判断的自主映射,文章展示了交互评估如何改变这一映射的两方面,并提出双轴分类法,制定设计原则和报告标准,分析了长期评估挑战在轨迹层面的再现。
Comments 10 pages
HydroAgent: 通过模拟器引导的强化学习缩小前沿大语言模型与人类专家在水文模型校准之间的差距
机构 * Civil, Environmental, and Architectural Engineering, University of Colorado Boulder(科罗拉多大学波尔德分校土木、环境与建筑工程系) ; Civil Engineering and Environmental Sciences, University of Oklahoma(俄克拉荷马大学土木工程与环境科学系) ; Department of Computer Science, University of Oklahoma(俄克拉荷马大学计算机科学系) ; Civil and Environmental Engineering, Stanford University(斯坦福大学土木与环境工程系) ; Department of Computer Science, Stanford University(斯坦福大学计算机科学系) ; NASA Goddard Space Flight Center(美国国家航空航天局戈达德空间飞行中心)
专题命中 Agent评测 :workflow(abstract);分类 cs.LG
AI总结 本文研究如何利用前沿大语言模型(LLM)代理替代人类水文模型师进行水文模型校准,提出HydroAgent方法,通过模拟器引导的强化学习(RLSF)进行微调,以提高模型在不同流域中的适应性和准确性。
勿信工具:在不可信工具反馈下评估和防御LLM代理
机构 * Southern University of Science and Technology(南方科技大学) ; University of Science and Technology of China(中国科学技术大学) ; University of Birmingham(伯明翰大学) ; Zhejiang University(浙江大学) ; East China Normal University(华东师范大学) ; Alibaba Group(阿里巴巴集团)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 本研究探讨了在不可信工具反馈环境下评估和防御LLM代理的问题,提出了一种新的失败模式'认知中毒',并介绍了TRUST-Bench基准、GuardedJoint惩罚指标和VISTA-Guard框架,展示了轨迹感知的最终动作评分在安全与效用权衡中的有效性。
随机最小成本到达-避免强化学习
机构 * Key Laboratory of System Software (Chinese Academy of Sciences), Institute of Software, Chinese Academy of Sciences, Beijing, China(中国科学院系统软件重点实验室,软件研究所,中国科学院,北京,中国) ; University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) ; School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学交叉学科学院,中国科学院大学,北京,中国)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文研究了随机最小成本到达-避免强化学习问题,提出了一种新的方法来在满足概率至少p的到达-避免约束的同时最小化预期累积成本。通过引入到达-避免概率证书(RAPCs)和基于收缩的Bellman公式,该方法能够将到达-避免考虑整合到强化学习中,并在概率约束下实现成本优化。
Comments Accepted at the Forty-third International Conference on Machine Learning (ICML 2026)
LEGO: 一个基于LLM技能的前端设计生成平台
机构 * School of IC, Peking University(北京大学集成电路学院) ; School of EECS, Peking University(北京大学电子信息技术学院) ; School of Microelectronics, Xidian University(西安电子科技大学微电子学院) ; Institute of EDA, Peking University(北京大学EDA研究院) ; Beijing Advanced Innovation Center for IC(北京集成电路先进创新中心)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出LEGO平台,通过将数字前端流程分解为六个独立步骤,并将每个代理能力表示为标准化的可组合电路技能,实现了高效的前端设计生成,显著提升了RTL设计自动化的效果。
Comments Accepted to ISEDA 2026. Best Paper Nomination. 7 pages, 3 figures
时间序列基础模型在交通预测中的强大基准作用:一项大规模基准分析
机构 * Technical University of Denmark(丹麦技术大学)
专题命中 Agent评测 :planning(abstract);分类 cs.LG
AI总结 本文通过在十个真实世界数据集上评估最新时间序列模型Chronos-2的零样本性能,证明了通用时间序列基础模型在交通预测中的有效性,展示了其在多数数据集上达到或超越传统统计基线和专用深度学习架构的准确性,尤其在长预测范围内表现突出。
Comments 6 pages
位置:通用时间序列基础模型建立在类别错误上
机构 * ZJU-UIUC Institute(浙大-UIUC研究院) ; School of Software(软件学院) ; Department of Computer Science and Engineering(计算机科学与工程系)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文指出,追求'通用时间序列基础模型'存在根本性的类别错误,将结构容器误认为语义模态。由于时间序列包含不兼容的生成过程(如金融与流体动力学),单一大模型退化为昂贵的'通用过滤器',在分布漂移下无法泛化。为此,我们引入'自回归盲目界限',证明仅依赖历史的模型无法预测干预驱动的制度转变。我们主张用因果控制代理范式取代通用性,其中代理利用外部上下文协调一系列专门的求解器,从冻结领域专家到轻量级即时适应器。最后,我们呼吁将基准从'零样本准确性'转向'漂移适应速度',以优先考虑鲁棒、控制理论系统。
社交学习网络中的因果影响
机构 * Dalle Molle Institute for Artificial Intelligence (IDSIA USI-SUPSI)(达勒莫勒人工智能研究所(IDSIA USI-SUPSI)) ; École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院(EPFL))
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文研究了由社交图连接的智能体之间的时间动态因果影响,分析了社交学习模型和分布式决策协议的动力学,并推导出揭示智能体对之间因果关系的表达式,解释了网络中的影响流动。结果依赖于图拓扑和每个智能体对推理问题的信息水平。基于这些结论,本文提出了一种算法来对智能体的整体影响进行排名,以发现具有高度影响力的智能体,并提供了一种从原始观测数据中学习必要模型参数的方法。结果和所提算法通过考虑合成数据和真实社交媒体数据进行了示例说明。
Comments Accepted to the Journal of Machine Learning Research
ASPI:寻求澄清会放大LLM代理中的提示注入漏洞
机构 * Scale AI ; Boston University(波士顿大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Human Frontier Collective(人类前沿集体)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 该研究探讨了LLM代理在执行任务时寻求澄清的行为对提示注入攻击的影响,发现这种行为会显著增加代理的脆弱性,并提出了ASPI基准测试来评估这一现象。
PaliBench: 一种多参考框架用于经典语言翻译基准测试
机构 * Independent Researcher(独立研究者) ; International Buddhist Studies College(国际佛教研究学院) ; Mahachulalongkornrajavidyalaya University(玛哈切通拉翁皇家师范大学)
专题命中 Agent评测 :workflow(abstract);分类 cs.CL
AI总结 本文提出PaliBench,一种用于巴利语到英语翻译的基准测试,以及构建多参考翻译基准测试的方法,通过结合LLM辅助对齐、自动化验证、质量过滤、去重和多指标评估,生成包含1700段文本、8389个段落和约345,000个token的基准测试数据集,评估了十个现代大语言模型的性能。
Comments Preprint. This manuscript has not yet been peer reviewed
具身视角形成与意图同调在人工体中
机构 * Active Inference Institute, CA, USA(主动推断研究所,加利福尼亚州,美国)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出了一种最小架构,用于人工体中的具身视角形成,通过引入内感受性活力信号、Fisher式度量以及意图同调机制,展示了如何在无奖励的网格世界中将学习到的身体倾向转化为稳定的体定向行为。
CheeseBench:在啮齿类行为神经科学范式上评估大语言模型
机构 * Astera Institute(Astera研究院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 CheeseBench通过九种经典行为神经科学范式评估大语言模型,发现模型规模、上下文历史、提示方式和架构对性能有显著影响,且当前模型在空间导航等任务上仍低于啮齿类动物基准。
Comments 8 pages, 6 figures, 4 tables
轻量级基于CNN的DDoS检测用于资源受限的边缘网络
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Green River College(绿河学院) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 Agent评测 :autonomous agent(abstract);分类 cs.LG
AI总结 本文提出一种轻量级监督深度学习方法,利用CNN检测DDoS攻击,通过提取包流特征并进行分类,实现低延迟的边缘网络检测。
生成式AI与双层在线心理健康社区
机构 * School of Management, Beijing Institute of Technology(北京理工大学管理学院) ; Simon Business School, University of Rochester(罗切斯特大学Simon商学院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 研究探讨生成式AI在双层在线心理健康社区中的影响,发现AI增强了响应速度和患者参与度,但导致部分顾问减少参与,产生跨层溢出效应。
Hawkeye:重现GPU级非确定性
机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构,匿名城市,匿名地区,匿名国家)
专题命中 Agent评测 :workflow(abstract);分类 cs.LG
AI总结 Hawkeye系统通过在CPU上重现GPU矩阵乘法运算,实现机器学习模型训练和推理流程的精确复现,解决了传统验证方法的计算开销和鲁棒性问题。
Comments Accepted to MLSys 2026
在破坏下连接区域的机制设计
专题命中 Agent评测 :agent(abstract)
AI总结 本文研究了在道路建设、桥梁关闭或自然障碍物导致区域分离的情况下,如何通过机制设计构建新的路径以维持代理的可达性,提出了策略证明的机制来近似优化社会或最大成本。
Comments full and extended version of the conference paper published in AAAI 2025
Bench2Drive-Robust: 在部署扰动下闭环自动驾驶的基准测试
机构 * Institute of Trustworthy Embodied AI (TEAI)(可信具身人工智能研究院) ; Great Wall Motor(长城汽车) ; Sch. of Computer Science & Sch. of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学计算机学院及人工智能学院) ; School of Computer Science, Wuhan University(武汉大学计算机学院) ; University of Science and Technology of China(中国科学技术大学)
专题命中 Agent评测 :planning(abstract)
AI总结 本文提出Bench2Drive-Robust,首个针对闭环端到端自动驾驶在现实部署扰动下的设备中心鲁棒性基准测试,评估了三种主要来源的部署相关扰动对自动驾驶系统的影响,揭示了传统图像级腐蚀评估未能完全捕捉的鲁棒性挑战。
无金属异质原子掺杂碳氮材料以增强光催化过氧化氢生成
专题命中 Agent评测 :agent(abstract)
AI总结 本研究探讨了无金属异质原子掺杂对石墨碳氮材料结构、电子和光催化性能的影响,发现掺杂后材料性能显著提升,其中硫掺杂材料表现出最高的过氧化氢生成速率和量子产率。
Comments 23 pages, 4 figures
Journal ref Nano Energy 146 (2025) 111551
住宅盗窃模型中犯罪热点动态与警察响应
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出并分析了结合警察部署的住宅盗窃数学模型,通过延迟反馈机制引入动态警察响应,研究了响应延迟对犯罪热点动态的影响。
具有方向加权对齐的主动物质集体动力学
专题命中 Agent评测 :agent(abstract)
AI总结 研究一种具有速度依赖对齐规则的基于代理的自驱动粒子模型,通过调整对齐强度产生多种集体状态,包括无序气体态、有序编队、高密度阻塞态和具有活性晶体行为的密集有序移动簇。
Comments 8 pages, 5 figures
重新思考侧信道分析:利用LLM辅助代理自动化发现和分析侧信道泄漏
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出SCAgent框架,利用LLM辅助代理自动分析侧信道风险,通过系统探索和语义推理发现侧信道并进行大规模分析,以解决侧信道泄漏的自动发现和分析问题。
UPSim:用于3D地图驱动FR3部署的UxNB传播模拟器
专题命中 Agent评测 :planning(abstract)
AI总结 本文提出UPSim,一种基于射线追踪校准的半确定性解决方案,用于无人机网络中空间一致的FR3空对地传播建模。通过阴影投影从3D建筑几何中推导出确定性可见区域,并补充了路径损耗、大尺度衰落和小尺度衰落等信息,从而准确再现经验信道分布。
VibeProteinBench: 一种用于语言接口的蛋白质设计评估基准
专题命中 Agent评测 :workflow(abstract)
AI总结 本文提出VibeProteinBench,一种用于评估语言接口蛋白质设计能力的基准,通过三个互补阶段验证模型在蛋白质设计中的通用能力,揭示当前LLM在蛋白质设计方面的挑战。
均场社会优化:反馈人与人之间的最优性和动态规划方程
专题命中 Agent评测 :agent(abstract)
AI总结 本文研究非线性扩散模型中的均场社会优化问题,通过动态规划方法推导出一个新的哈密顿-雅可比-贝尔曼方程,即价值函数的主方程,并在一定正则条件下建立了基于主方程的控制律的ε-人与人之间的最优性,为接近社会最优提供了必要条件。通过多尺度分析构造两个辅助主方程,得到社会成本的紧估计,并在线性二次情况下给出主方程的显式解,应用于系统性风险。
Comments The first version appeared as a GERAD Technical Report G-2024-45, Aug 2024 (https://www.gerad.ca); this version includes some editorial changes
动态信号的强支配
专题命中 Agent评测 :agent(abstract)
AI总结 本文探讨了动态决策问题中信息结构的支配性,通过信息表示揭示了动态信息结构的相对价值,提出了动态版本的揭示或细化条件。
通过环境条件下的紫外激光处理实现MoS₂单层光致发光的持久增强
专题命中 Agent评测 :agent(abstract)
AI总结 本研究通过紫外激光处理实现了MoS₂单层材料光致发光强度的显著增强,展示了其在纳米光电子器件中的应用潜力。
多语言模型系统表现出稳健的语义崩溃
专题命中 Agent评测 :agent(abstract)
AI总结 研究探讨了多语言模型系统在闭环设置中维持开放知识生产的基本限制,发现系统在语义表示上出现系统性收敛,尽管表面上有词汇变化。
Comments 64 pages, 8 figures, 7 tables; includes Supplementary Information
Off-Grid LoRa Mesh网络的韧性分析:在长距离传播场景中Meshtastic配置的评估
专题命中 Agent评测 :planning(abstract)
AI总结 本文研究了在智能城市应急场景中离网LoRa Mesh网络的韧性,通过控制引导链方法确定了Meshtastic固件的设计和规划准则,揭示了Spreading Factor对网络性能的影响,并提出了三种操作模式以指导智能城市部署。
Comments 18 pages, 5 tables, 4 figures. To appear in the proceedings of CATAI 2026. Workshop website: https://www.catai.fr/catai2026.html