Mobility Anomaly Generation using LLM-Driven Behavior with Kinematic Constraints
基于大语言模型驱动行为与运动约束的移动异常生成
机构 * Emory University, Atlanta, USA(埃默里大学,亚特兰大,美国)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出端到端生成框架,结合大语言模型注入语义异常与地图约束路由重建,合成带标注的真实轨迹异常数据集。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
基于大语言模型驱动行为与运动约束的移动异常生成
机构 * Emory University, Atlanta, USA(埃默里大学,亚特兰大,美国)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出端到端生成框架,结合大语言模型注入语义异常与地图约束路由重建,合成带标注的真实轨迹异常数据集。
Sim2Schedule: 一种模拟器引导的LLM框架用于自主露天矿调度
机构 * Department of Computer Science, Lakehead University(湖头大学计算机科学系) ; Quantum Communications and Computing Research Center and Department of Electrical and Computer Engineering, Memorial University of Newfoundland(新斯科舍纪念大学量子通信与计算研究中心及电气与计算机工程系) ; Department of Electrical and Computer Engineering, Memorial University of Newfoundland(新斯科舍纪念大学电气与计算机工程系)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出模拟器引导的LLM框架,将地质约束编码到动作生成中,零样本生成可解释调度方案,在保持线性计算时间下恢复MILP最优NPV的94%-99%。
FailureScope: 语言模型弱点的跨机制行为诊断
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 提出FailureScope方法,通过跨模型通过/失败模式聚类评估探针,在单轮基准、多轮对话和对抗性代理攻击三种机制下稳定生成可解释的失败分类,实现高效任务采样和跨模型失败预测。
个性化与安全的交汇:个性化大语言模型中的机制、风险与缓解措施
机构 * China Mobile Jiutian Artificial Intelligence Technology (Beijing) Co., Ltd.(中国移动九天人工智能技术(北京)有限公司) ; Chinese Academy of Sciences(中国科学院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文首次对个性化大语言模型进行安全导向的综述,从用户表征、个性化范式和评估三个维度组织,提出统一的安全风险分类,并分析各范式下的脆弱性及缓解策略。
面向城市交通系统协同中断响应的弹性即服务评估框架
机构 * Univ. Gustave Eiffel, COSYS, GRETTIA, Paris, France(古斯塔夫·埃菲尔大学,交通系统、网络与安全实验室,交通工程与智能交通系统研究组,法国巴黎) ; VEDECOM, mobiLAB, Department of Human factors and Economics of Sustainable Mobility, Versailles, France(VEDECOM研究所,移动出行实验室,可持续出行人因与经济系,法国凡尔赛)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出一个基于KPI的时间索引框架,结合优化模型与智能体仿真,从脆弱性、适应性、鲁棒性等多维度评估城市交通中断响应方案的弹性,并通过巴黎RER B线案例验证了协同策略的优越性。
当视频误读:面向探索性操作痕迹问答的阅读启发式闭环蒸馏
机构 * Tsinghua University(清华大学) ; DISCOVER Robotics
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 针对探索性操作中机器人误读视频痕迹的问题,提出闭环痕迹蒸馏方法,通过任务编码代理提取单行自然语言启发式提示,使冻结VLM准确预测最小成功动作链,在模拟和真实机器人任务上提升准确率0.38-0.47。
Comments 16 pages, 4 figures, 4 tables
弥合模拟到现实的差距:商业EDR自主网络防御配置评估框架
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出首个针对商业EDR自主防御智能体的评估框架,通过GOAD实验室与微软Defender XDR的实例化测试,揭示模拟和开源评估无法发现的三个关键差距。
Comments 12 pages including references
PACE: 自演化智能体的任意有效接受测试
机构 * Independent Researcher(独立研究员)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出PACE方法,将自演化智能体的变更接受问题转化为序贯假设检验,通过配对任意有效提交评估控制错误提交概率,在多个基准上显著减少虚假提交并降低评估成本。
MMAE:大规模多任务音频编辑基准
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Nanyang Technological University(南洋理工大学) ; Hunyuan Team, Tencent(腾讯 Hunyuan 团队) ; Tianjin University(天津大学) ; Fudan University(复旦大学)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 提出首个面向通用指令音频编辑的综合评估基准MMAE,涵盖7种音频模态、6级任务复杂度和8种操作类型,通过2000个样本和基于评分标准的评估框架揭示当前模型在精确执行和结构鲁棒性上的严重不足。
Comments Open-Source at https://github.com/ddlBoJack/MMAE
IRAF:面向噪声鲁棒的端到端全双工口语对话系统的抗干扰自适应融合
机构 * The Chinese University of Hong Kong(香港中文大学) ; AudioLab Hong Kong, Huawei Leibniz Research Center(香港AudioLab,华为Leibniz研究中心) ; Nanyang Technological University(南洋理工大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 提出IRAF模块,通过逐帧预测可靠性门控来调节用户音频对LLM的贡献,提升全双工对话系统在干扰说话人环境下的响应质量和交互稳定性。
Axient:杠杆事件市场的链上信用与损失分配——面向交易者、信用提供者、做市商及清算后援的场所无关协议
专题命中 Agent评测 :agent(abstract,comments)
AI总结 Axient是面向多角色的场所无关链上信用协议,通过形式化架构与内生模型实现损失分配等机制,实验验证其分层保护等特性,为杠杆事件市场提供解决方案。
Comments 90 pages, 17 figures. Formal protocol design and fixed-seed synthetic agent-based validation; no live Axient or venue data
非线性估值下可分物品的公平分配
专题命中 Agent评测 :agent(abstract);autonomous agent(comments)
AI总结 研究非线性估值下可分物品的公平分配问题,针对最大最小份额保证设计算法,给出\(\frac{1}{2n - 1}\)-MMS分配,证明对MMS的近似比例几乎是紧的;还研究无嫉妒性,证明其检查存在性对\(n\)个主体和至少三种物品是NP难的,对单个物品给出多项式时间算法。
Comments Appears in the 24th International Conference on Autonomous Agents and Multiagent Systems (AAMAS), 2025
OmniCAD:面向机器人装配任务的3D空间推理大规模基准测试集
专题命中 Agent评测 :agentic(abstract)
AI总结 本文提出OmniCAD——涵盖多类工业系统的3D空间推理大规模基准测试集,评估VLMs三类装配推理能力,发现当前VLMs在该任务中表现不佳,将开源相关资源推动该领域研究。
无嫉妒房屋分配中补贴最小化的复杂度
专题命中 Agent评测 :agent(abstract)
AI总结 本文研究无嫉妒房屋分配中最小化补贴的问题,证明二元实例下总补贴界为(n-1)且紧,一般及二元效用下该问题NP难,有限类型二元效用下可多项式求解,还提出两类一般效用智能体的最小补贴多项式算法。
超越真相发现:一种评估灾害期间虚假声明严重程度的两阶段框架
专题命中 Agent评测 :agent(abstract)
AI总结 该研究针对灾害中社交媒体虚假声明严重程度评估问题,提出两阶段框架,结合可信度与危害性维度构建基准,发现LLMs及上下文学习与人工判断对齐度更强。
Comments The 2026 ACM Conference on Human-AI Complementarity and Alignment
足球运动中球的有效引力场
专题命中 Agent评测 :agent(abstract)
AI总结 该研究以足球追踪数据为基础,探究球员围绕球的集体运动是否可用类引力有效场描述,得出了球员径向漂移的经验定律及漂移场模式。
Comments 13 pages, 11 figures, 6 tables
不可分割混合甘露的时间公平分配:易处理设置
专题命中 Agent评测 :agent(abstract)
AI总结 本文研究不可分割混合甘露的时间公平分配问题,确定了多个易处理设置,给出了对应规则或算法,同时证明了部分相关问题的NP难性。
超越文档检索:LLM智能体查询结构化企业数据时的架构挑战
专题命中 Agent评测 :agent(abstract)
AI总结 该研究针对企业智能体查询结构化数据的架构挑战,划分七个维度提出设计框架,经实验验证其可消除授权违规,还给出评估协议与开放问题。
Comments 9 pages, 4 tables, 2 figures
无单交叉的单调分配:何时归并,何时跳跃
专题命中 Agent评测 :agent(abstract)
AI总结 该论文针对存在最小有效规模代理人技术、斯彭斯-米尔利斯条件失效的筛选问题,研究了单调划分曲线与松弛解的相交方式,得出最优契约的三分法规则,并通过对偶方法证明了最优解的全局最优性。
Comments 85 pages, 10 figures. Replication code: https://doi.org/10.5281/zenodo.21854607
面向网络化动力学系统的精确鲁棒不稳定性分析及生物学应用
专题命中 Agent评测 :agent(abstract)
AI总结 本文针对名义不稳定的不确定网络化动力学系统,确定三类可简化分析的网络结构,推导鲁棒不稳定性半径的充分条件,并将结果应用于遗传调控网络的振荡行为分析。
可复现的多模态可供性预测
机构 * Istituto Italiano di Tecnologia(意大利技术研究院) ; EPFL(洛桑联邦理工学院)
专题命中 Agent评测 :agent(abstract)
AI总结 针对可供性预测方法评估难的问题,本文提出Affordance Sheet以规范任务表述等信息,实现可供性模型的可复现基准测试与现实场景可靠评估。
Comments Paper accepted to Workshop on Human-Centered Multimodal Intelligence in the Wild (HCMIW) in European Conference on Computer Vision (ECCV) 2026; 18 pages, 3 figures, 7 tables. Project webpage at https://apicis.github.io/aff-sheet
JANUS:面向无序材料的多模态基础神经采样器
专题命中 Agent评测 :agent(abstract)
AI总结 研究人员开发JANUS多模态神经采样器,用于无序材料的热力学采样,其以远少于传统方法的能量评估次数重现平衡性质,可用于合金逆设计及半导体缺陷探索,为相关研究提供了基础。
技术上可行但临床误导?患者个性化合成前列腺MRI的专家评估
专题命中 Agent评测 :workflow(abstract_cn)
AI总结 本研究用3D扩散模型合成患者个性化前列腺MRI,验证其技术可行性后开展专家研究,发现其虽技术可行但存在误导解读风险,提示需评估其临床应用安全性。
Comments To appear in SCAI 2026 proceedings
MANIGUARD:用于基于规范的机器人操作安全评估与改进的基准及数据集套件
机构 * Northwestern University(西北大学) ; Stanford University(斯坦福大学) ; William & Mary(威廉玛丽学院)
专题命中 Agent评测 :planning(abstract)
AI总结 本研究提出ManiGuard基准与数据集套件,针对机器人操作基础模型策略,通过含23000余次滚动的实验证实安全需独立于任务成功评估,微调可提升安全表现但仍存差距。
少有人走的路:面向FPGA的感知拥塞片上网络布局与分组路由
专题命中 Agent评测 :agent(abstract)
AI总结 本研究针对FPGA的片上网络拥塞问题,在开源CAD工具VPR中融入拥塞建模、转弯模型路由、SAT路由建模及强化学习智能体优化,显著降低了NoC拥塞并缩短了线长。
Comments 10 pages, 5 figures, 3 tables. Published at the 2024 34th International Conference on Field-Programmable Logic and Applications (FPL), Torino, Italy. Source code integrated into the VTR project: https://github.com/verilog-to-routing/vtr-verilog-to-routing
Journal ref 2024 34th International Conference on Field-Programmable Logic and Applications (FPL), Torino, Italy, 2024, pp. 33-42
面向活动-出行行为的福利导向推荐系统研究
专题命中 Agent评测 :agent(abstract)
AI总结 该研究针对活动-出行行为领域推荐系统忽视用户福利的问题,提出福利导向推荐框架,通过正效用概率、遗憾最小化准则设计算法,经智能体模拟验证,为优化推荐系统提供了实用方案。
通过强化学习优化电路结构实现变分量子传感自动化
专题命中 Agent评测 :agent(abstract)
AI总结 研究人员提出强化学习框架\textsc{AutoQSense},通过基于费舍尔信息的目标函数搜索量子传感电路架构,其性能优于固定拟设且适配噪声,为量子传感提供资源感知的硬件兼容方案。
Comments 17 pages, 13 figs
“看起来像用户”:通过社交媒体模拟测量实时审核效果
专题命中 Agent评测 :agent(abstract)
AI总结 该研究开发了校准后的SimSoM社交媒体模拟器,通过实验验证后发现静态审核会高估用户封禁效果,实时审核时补偿性转发会削弱低质量内容减少效果,为内容审核政策评估提供了基于模拟的框架。
Comments 15 pages, 4 figures, 2 tables. Accepted for presentation at the Social Simulation Conference (SSC) 2026
锚定求真:多设施选址的随机锚点体积机制
专题命中 Agent评测 :agent(abstract)
AI总结 该研究针对多设施选址问题,提出随机锚点体积机制,证明其在k=1、2、3时为期望防策略机制,k≥4时可被操纵,k=3时期望社会成本最多为8OPT₃。
证明大型语言模型在网络安全模拟中的效用:一项综合研究
专题命中 Agent评测 :agent(abstract)
AI总结 该研究通过对比实验证明,大型语言模型(LLMs)驱动的网络安全模拟方法,相比经典强化学习方法,在网络攻击模拟中效率更高、适应性更强,且速度提升达25000至50000倍,为构建智能网络防御系统提供了新路径。
Comments 13 pages, 4 figures, 2 tables