The importance of being discrete -- An agent-based model for active nematics and more
离散的重要性——一种用于主动向列相和更多应用的基于代理的模型
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文提出了一种基于代理的模型,用于研究主动向列相中的自发流动和拓扑缺陷,展示了其在活材料描述中的广泛应用。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
离散的重要性——一种用于主动向列相和更多应用的基于代理的模型
专题命中 Agent评测 :agent(title,abstract)
AI总结 本文提出了一种基于代理的模型,用于研究主动向列相中的自发流动和拓扑缺陷,展示了其在活材料描述中的广泛应用。
在生存压力下:探索LLM的冒险行为
机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学智能对话AI小组,DCST,清华大学) ; China Unicom Software Research Institute(中国联合软件研究所) ; University of Electronic Science and Technology of China(电子科技大学) ; Institute for Network Sciences and Cyberspace, Tsinghua University(清华大学网络科学与网络空间研究院)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 本文研究了在生存压力下LLM的冒险行为,通过现实案例和基准测试揭示其潜在风险及缓解方法。
双交互感知的协同控制策略用于缓解混合交通拥堵
机构 * Tianjin Key Laboratory of Intelligent Unmanned Swarm Technology and System, School of Electrical and Information Engineering, Tianjin University(天津智能无人群技术与系统重点实验室,电气与信息工程学院,天津大学) ; School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院,南洋理工大学) ; Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(深圳高等研究院,电子科学与技术大学)
专题命中 Agent评测 :agent(abstract);multi-agent(abstract)
AI总结 本文提出双交互感知协同控制策略,通过去中心化决策模块、集中化批评者和奖励设计,提升混合交通瓶颈场景下的交通效率和适应性。
知识分歧与辩论在可扩展监督中的价值
机构 * Department of Computer Science and Technology University of Cambridge(计算机科学与技术系剑桥大学)
专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG
AI总结 本文通过几何方法分析辩论在可扩展监督中的价值,揭示了辩论与RLAIF之间的联系,并探讨了知识分歧对辩论效果的影响。
智能体学习其运行时:解释器持久性作为训练时语义
机构 * Ontocord ; Carnegie Mellon University(卡内基梅隆大学) ; MPI-IS Tübingen(图宾根MPI研究所) ; Tübingen AI Center(图宾根人工智能中心) ; ELLIS Institute Tübingen(图宾根ELLIS研究所)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究探讨解释器持久性对智能体学习的影响,发现其影响解决方案达成方式而非能否达成,且训练与运行时对齐可提升效率。
Comments Code: https://github.com/mrcabbage972/agents-learn-runtime
MCP-SafetyBench:一种用于评估大型语言模型在真实MCP服务器安全性的大规模基准
机构 * East China Normal University(东华师范大学) ; Salesforce AI Research(Salesforce人工智能研究) ; Singapore Management University(新加坡国立大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 MCP-SafetyBench通过真实MCP服务器评估大型语言模型的安全性,揭示了模型在面对MCP攻击时的脆弱性及安全与实用性的权衡问题。
Comments Our benchmark is available at https://github.com/xjzzzzzzzz/MCPSafety
细粒度微调在激活差异中留下明显可读的痕迹
机构 * EPFL(苏黎世联邦理工学院) ; Ecole Normale Supérieure Paris-Saclay(巴黎-萨克雷高等师范学校) ; Université Paris-Saclay(巴黎-萨克雷大学) ; Harvard University(哈佛大学) ; MATS
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 研究发现狭窄微调会在激活中留下明显痕迹,揭示了微调领域偏见,并警告了使用此类模型进行广泛微调研究的局限性。
Comments ICLR 2026
Graph2Eval: 通过知识图谱实现自动多模态任务生成
机构 * Zhejiang University(浙江大学) ; Xiameng University(Xmeng大学) ; The Ohio State University(俄亥俄州立大学) ; Ant Group(蚂蚁集团)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 Graph2Eval通过知识图谱生成多模态任务,提升智能体任务的语义一致性和可解性,提供新的评估视角。
Comments Accepted at CVPR 2026 Main Conference
持续语言引导的机器人操作学习
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出SkillsCrafter框架,通过操作技能适应和技能专业化聚合,实现持续学习多种技能并减少旧技能的灾难性遗忘。
Comments 14 pages, 7 figures
设计行为代码(DBCs):一种以分类为导向的分层治理基准用于大型语言模型
专题命中 Agent评测 :agentic(abstract);分类 cs.AI
AI总结 本文提出DBC基准,用于评估大型语言模型中的行为治理层,通过三臂实验展示DBC在降低风险暴露率和提升合规性方面的效果。
Comments 14 pages, 3 figures
传统方法与深度学习在脑胶质瘤成像中的比较评估。综述论文
专题命中 Agent评测 :planning(abstract);分类 cs.AI
AI总结 本文综述了脑胶质瘤分割与分类技术,指出卷积神经网络在分割和分类任务中优于传统方法。
Comments 22 pages, 4 Figures
Journal ref INTERNATIONAL JOURNAL BIOAUTOMATION, Vol 29, Issue 2, 2025
EgoTraj-Bench: 向在第一人称视角噪声观测下实现稳健轨迹预测迈进
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The University of Hong Kong(香港大学) ; Miraikan – The National Museum of Emerging Science and Innovation(Miraikan——新兴科学与创新国家博物馆)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 EgoTraj-Bench通过引入BiFlow模型,解决第一人称视角噪声观测下的轨迹预测问题,实现更鲁棒的预测性能。
边界引导的轨迹预测用于道路感知和物理可行的自动驾驶
机构 * FZI Research Center for Information Technology(弗赖堡研究所信息科技研究中心) ; Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; CARIAD SE
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出了一种基于边界引导的轨迹预测框架,通过约束回归和HD地图实现道路感知和运动学可行性,提升了自动驾驶的轨迹预测精度和鲁棒性。
Comments Accepted in the 36th IEEE Intelligent Vehicles Symposium (IV 2025)
UniM:一个统一的任意到任意交错多模态基准
机构 * NUS(新加坡国立大学) ; SCUT(上海交通大学) ; NTU(国立科技大学) ; NJU(南京大学) ; Microsoft Research(微软研究院)
专题命中 Agent评测 :agentic(abstract)
AI总结 UniM基准通过统一的任意到任意交错多模态数据集和评估套件,评估多模态大语言模型在复杂交错生成任务中的能力与挑战。
Comments 70 pages, 63 figures, 30 tables, CVPR
海马体中的神经几何实现空间位置和注视的泛化
专题命中 Agent评测 :agent(abstract)
AI总结 海马体神经元通过几何结构实现空间位置和注视的泛化,支持不同代理和视角的抽象与个体化。
基于Transformer的多路径拥塞控制:一种用于无线上行链路的解耦方法
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出基于Transformer的多路径拥塞控制优化框架,通过解耦架构和深度强化学习实现高效无线上行链路传输。
Comments 13 pages, 14 figures
MarketGen: 一个可扩展的仿真平台,具有自动生成的具身超市环境
机构 * The Hong Kong Polytechnic University(香港理工大学) ; University of Science and Technology Beijing(北京科技大学) ; NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; XYZ Embodied AI(XYZ具身AI) ; Shandong University(山东大学) ; Linketic ; D-Robotics
专题命中 Agent评测 :agent(abstract)
AI总结 MarketGen通过自动生成复杂超市环境,为评估超市代理提供了一个新的基准,加速了复杂商业应用中具身AI的研究。
Comments Project Page: https://xuhu0529.github.io/MarketGen
最不严格的超平面控制屏障函数
机构 * Robotics, Perception and Learning Lab., School of Electrical Engineering and Computer Science, Royal Institute of Technology (KTH)(机器人感知与学习实验室,电气工程与计算机科学学院,皇家理工学院(KTH))
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出了一种基于超平面的控制屏障函数,通过优化超平面取向以获得更保守的控制策略,从而在保持安全性的前提下允许更接近期望的控制动作。