Diagnosis-Driven Automatic Repair for Agentic Workflow via Symbolic Inference
通过符号推理实现诊断驱动的智能工作流自动修复
专题命中 效率与部署 :LLM(abstract)
AI总结 针对智能工作流可靠性挑战,提出FlowFixer框架,通过将执行转化为符号跟踪、符号推理得行为规范,经规范验证进行故障归因与根因分析,生成修复补丁,还采用预执行评估降成本,实验证明其效果良好。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
通过符号推理实现诊断驱动的智能工作流自动修复
专题命中 效率与部署 :LLM(abstract)
AI总结 针对智能工作流可靠性挑战,提出FlowFixer框架,通过将执行转化为符号跟踪、符号推理得行为规范,经规范验证进行故障归因与根因分析,生成修复补丁,还采用预执行评估降成本,实验证明其效果良好。
面向解译的云去除:基于观测锚定残差流与地理上下文对齐
机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) ; Shanghai Ai Lab(上海人工智能实验室) ; Faculty of Geosciences and Engineering, Southwest Jiaotong University(西南交通大学地球科学与工程学院)
专题命中 效率与部署 :foundation model(abstract)
AI总结 提出GACR框架,通过观测锚定残差流(OAR-Flow)将云去除重构为物理残差反演,结合地理上下文先验对齐(GCPA)保持语义结构,在六个数据集和十二个下游任务中验证了重建质量和下游精度提升。
Comments accepted by ECCV 2026
VLA-Corrector:面向自适应动作视界的轻量级检测与校正推理
机构 * OmniAI Group of ZJU ACES Lab(浙江大学ACES实验室OmniAI组) ; Zhejiang University(浙江大学) ; Alibaba DAMO Academy(阿里巴巴达摩院)
专题命中 效率与部署 :foundation model(abstract)
AI总结 提出VLA-Corrector,一种轻量级校正推理框架,通过潜在空间视觉监控和在线梯度引导,实现事件触发的自适应动作视界,在不修改骨干策略权重的情况下,中断复合错误并提升鲁棒性。
Comments 22 pages, 14 figures
基于LVLM的机器人系统中的过度思考触发慢速攻击
专题命中 效率与部署 :language model(abstract)
AI总结 研究利用LVLM的过度思考行为,通过嵌入场景文本触发推理延迟,提出三阶段框架发现可迁移触发词,实验显示最高6.96倍延迟放大。
Comments 17 pages, 10 figures
CADENZA 在行动:通过意图依赖的计划空间打破语义查询的单一架构
专题命中 效率与部署 :LLM(abstract_cn)
AI总结 提出CADENZA语义算子优化器,将意图分解为步骤并选择物理实现,根据用户偏好调优参数,平衡质量、延迟和成本。
Journal ref VLDB 2026
SpiralFovea: 输入自适应的中央凹令牌化作为资源自适应推理的第三杠杆
专题命中 效率与部署 :foundation model(abstract)
AI总结 SpiralFovea提出输入自适应令牌化方法,根据局部视觉熵动态选择令牌的身份、位置、尺度和数量,在细粒度分类任务中以60%更少令牌提升准确率1.7-2.1个百分点,并降低84%自注意力计算量。
缝合嵌入:3D服装与2D纸样的统一潜在空间
机构 * University of Tübingen(图宾根大学) ; Tübingen AI Center(图宾根人工智能中心) ; Technical University of Munich(慕尼黑工业大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) ; Meta
专题命中 效率与部署 :foundation model(abstract)
AI总结 提出首个无需模拟的框架Stitched Embeddings,通过BoxMesh中间表示在统一双向潜在空间中实现3D服装重建与2D纸样推断,达到高精度高效率。
属性提示核哈希用于无监督数据高效跨模态检索
机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) ; VinUniversity
专题命中 效率与部署 :foundation model(abstract)
AI总结 提出属性提示核哈希(APKH),利用视觉-语言基础模型的广义属性先验,通过上下文优化属性核映射和核平滑对比对齐,在数据受限场景下实现从可见到不可见类别的跨模态检索。
一个带有辅助外部数据的个体治疗受益者共形选择框架
专题命中 效率与部署 :foundation model(abstract)
AI总结 提出一个模型无关的共形推断框架,将基于CATE的治疗受益选择转化为多重检验问题,通过共形p值和Benjamini-Hochberg程序控制FDR,并利用外部数据提高效率。
基于语义强化学习的通用机器人策略自适应
机构 * U.C. Berkeley(加州大学伯克利分校)
专题命中 效率与部署 :pretraining(abstract)
AI总结 提出语义动作强化学习(SARL),通过在线交互优化语言提示空间,利用通用策略的预训练技能解决复杂长时任务,显著优于现有方法。
Comments Website: https://semantic-action-rl.github.io/
基于全局邻域对齐哈希的无监督数据高效跨模态检索
机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) ; Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(华南理工大学吴贤铭智能工程学院) ; College of Computer and Information Engineering, Henan Normal University(河南师范大学计算机与信息工程学院) ; VinUniversity(Vin大学)
专题命中 效率与部署 :foundation model(abstract)
AI总结 提出全局邻域对齐哈希(GNAH),通过原型锚定全局对齐和对比随机邻域对齐,在少量图像-文本对下学习紧凑二进制码,实现数据高效的无监督跨模态检索。
Journal ref 2026 IEEE International Conference on Image Processing (ICIP)
面向空间异构连接性的云推理通信感知机器人执行
机构 * Graduate School of Information Science and Technology, The University of Osaka(大阪大学信息科学与技术研究生院) ; D3 Center, The University of Osaka(大阪大学D3中心)
专题命中 效率与部署 :foundation model(abstract)
AI总结 针对云推理中空间异构连接性导致执行脆弱的问题,提出请求-响应窗口框架,将下一请求点作为运动决策,选择通信质量足够的位置提交请求并保留响应检索机会,实验表明该方法在任务成功率、请求次数和失败率上均优于对比方法。
面向自动驾驶中高效视觉-语言-动作模型的推理感知推测解码
机构 * Air Force Research Laboratory(空军研究实验室)
专题命中 效率与部署 :post-training(abstract)
AI总结 提出推理感知推测解码框架,通过例程推理器处理常规推理、审慎推理器处理异常情况,结合FlatRoPE和AARL技术,将推理步骤运行时间降低约4倍。
Comments 10 pages
PolyFlow: 连续拓扑嵌入流匹配用于艺术家风格网格生成
机构 * ZJU(浙江大学) ; Tencent(腾讯) ; THU(清华大学) ; CUHK(香港中文大学) ; HKUST(香港科技大学) ; HKU(香港大学)
专题命中 效率与部署 :pretraining(abstract)
AI总结 提出PolyFlow,通过连续拓扑嵌入将离散网格转换为连续顶点状态空间,结合Transformer流匹配实现并行去噪,在保持高质量拓扑的同时大幅提升生成速度。
REDI-Match: 旋转等变蒸馏实现高效鲁棒密集匹配
机构 * Tsinghua University(清华大学) ; Southern University of Science and Technology(南方科技大学) ; Beihang University(北京航空航天大学) ; Zhejiang University(浙江大学)
专题命中 效率与部署 :foundation model(abstract)
AI总结 提出REDI-Match框架,通过旋转等变蒸馏将视觉基础模型的语义知识注入轻量等变编码器,结合熵驱动空间对齐模块,在密集匹配中实现高效鲁棒的旋转不变性,在SatAst数据集上提升13.89%姿态精度且速度提升1.9倍。
阶段至关重要:移动SoC上异构视觉-语言推理的特征分析
专题命中 效率与部署 :language model(abstract)
AI总结 本文通过硬件在环实验,系统表征了移动SoC上VLM推理的阶段性特征,发现NPU执行高度依赖阶段,在预填充阶段加速1.64倍,解码阶段仅1.18倍,视觉编码器加速20-45倍,并展示了四步图重写方法使Phi-3.5-V等编码器获得22倍加速。
Comments 6 pages, 5 figures. Published in MobiSys Workshop '26
Journal ref In Proceedings of the 24th Annual International Conference on Mobile Systems, Applications and Services Workshops (MobiSys Workshop '26), June 21-25, 2026, Cambridge, United Kingdom. ACM, New York, NY, USA, 6 pages
LocalNav: 蒸馏前沿视觉语言模型与具身强化学习用于设备端物体目标导航
机构 * Center for Project-Based Learning(项目学习中心) ; Integrated Systems Laboratory(集成系统实验室)
专题命中 效率与部署 :language model(abstract)
AI总结 提出蒸馏策略将大型VLM的空间语义推理迁移至轻量级本地VLM,结合E-RLVR与令牌生成正则化,在嵌入式设备上实现低延迟物体目标导航。
TuringViT:让最先进的视觉Transformer人人可用
机构 * Foundation Model Team, Xpeng Inc.(小鹏汽车基础模型团队)
专题命中 效率与部署 :pretraining(abstract)
AI总结 提出TuringViT,通过图灵线性注意力、VISTA-Curation数据构建和原生动态分辨率预训练,仅用10%数据即可超越开源ViT基线,并显著提升下游VLM性能和高分辨率延迟。
PYPILINE:通过可疑API知识和Agent工作流检测恶意PyPI包
专题命中 效率与部署 :LLM(abstract)
AI总结 提出PYPILINE方法,结合可疑API知识库与Agent工作流,通过静态分析构建知识库并自动检测恶意PyPI包,在精度、召回率和F1分数上显著优于现有工具。
RigPI: 通过VLM种子可微仿真进行刚体动力学参数辨识
机构 * Way-Robotics(Way-机器人)
专题命中 效率与部署 :language model(abstract)
AI总结 提出RigPI框架,结合视觉语言模型初始化和可微物理仿真梯度优化,两步策略实现刚体与多连杆刚体动力学参数精确辨识,实验验证了其鲁棒性和预测有效性。
Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2027)
PolicyTrim: 提升视觉-语言-动作模型的内在策略效率
机构 * Sichuan University(四川大学) ; Adelaide University(阿德莱德大学) ; Beijing Institute of Technology(北京理工大学)
专题命中 效率与部署 :post-training(abstract)
AI总结 提出PolicyTrim框架,通过强化学习后训练扩展动作块可靠长度并减少冗余物理步骤,实现高达5.83倍的端到端部署加速且不降低任务成功率。
Comments Accepted by ECCV 2026. Project page: https://inceptionwang.github.io/PolicyTrim/
学习跨视角语义先验用于单参考未见物体姿态估计
机构 * College of Aerospace Science and Engineering, National University of Defense Technology(国防科技大学航空航天科学与工程学院) ; Hunan Provincial Key Laboratory of Image Measurement and Vision Navigation(湖南省图像测量与视觉导航重点实验室)
专题命中 效率与部署 :foundation model(abstract)
AI总结 提出跨视角语义交互(CVSI)和两种训练约束,利用视觉基础模型特征实现单参考未见物体的6D姿态估计,在多个基准上达到最优性能。
Comments 13 pages, 11 figures
基于机器学习原子间势能的数据高效微调实现气压相变
专题命中 效率与部署 :foundation model(abstract)
AI总结 本研究通过微调MACE-MPA-0基础模型,仅用5-10个DFT构型即可准确模拟硫酸铵的气压相变,显著降低训练数据需求。
Comments 12 pages, 9 figures, submitted to Physical Review Materials
PhaseWin:一种用于忠实视觉归因的高效搜索算法
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) ; Shanghai Center for Mathematical Sciences, Fudan University(复旦大学上海数学中心) ; College of Electronic Science and Technology, National University of Defense Technology(国防科技大学电子科学学院) ; School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络空间安全学院)
专题命中 效率与部署 :language model(abstract)
AI总结 提出PhaseWin算法,通过分阶段窗口搜索将视觉归因的计算复杂度从O(n²)降至O(n),在保持接近贪心算法忠实度的同时大幅减少模型评估次数。
Comments 26 pages, 29 figures
通过几何感知蒸馏提升文本驱动视频分割
机构 * Beijing Institute of Technology(北京理工大学)
专题命中 效率与部署 :pretraining(abstract)
AI总结 提出GeoLaV两阶段框架,通过单目几何预训练和几何感知蒸馏,将3D几何知识从图像迁移到视频,提升文本驱动视频分割的时空一致性和语言定位能力,在多个基准上达到最优。
Comments Accepted by ECCV2026
P-MTP: 通过渐进深度缩放的多令牌预测实现高效文档解析
机构 * Department of Computer Vision Technology (VIS) Baidu Inc China(百度计算机视觉技术部(VIS)) ; Tsinghua University Shenzhen International Graduate School China(清华大学深圳国际研究生院)
专题命中 效率与部署 :language model(abstract)
AI总结 提出P-MTP框架,通过渐进式多令牌预测和轻量级MTP模块,结合渐进课程损失和置信门控动态草稿,实现文档解析高达5倍加速且精度损失极小。
Flow as Flow:将机器人速度场建模为概率速度场用于基于流的物体操作
机构 * Keio University(庆应义塾大学)
专题命中 效率与部署 :foundation model(abstract)
AI总结 提出Flow as Flow框架,将机器人速度场建模为概率流,基于流匹配公式实现高效高质量的机器人流生成,在标准基准和真实世界实验中优于基线方法。
数据强制蒸馏:恢复少步视频生成中的多样性和保真度
机构 * University of Michigan(密歇根大学) ; NVIDIA(英伟达) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 效率与部署 :post-training(abstract)
AI总结 针对分布匹配蒸馏(DMD)在少步视频生成中出现的模式坍塌和过饱和问题,提出数据强制蒸馏(DFD)框架,通过教师评分差异引导学生接近真实数据分布,仅需一行代码修改即可恢复多样性和保真度。
UniFS:面向视觉-语言-动作模型的统一快慢层次架构
机构 * Tianjin University(天津大学) ; Yiwu Research Institute of Fudan University(复旦大学义乌研究院)
专题命中 效率与部署 :language model(abstract)
AI总结 提出UniFS统一快慢层次架构,通过分层更新频率、潜向量反转和多级监督策略,解决快慢双系统视觉-语言-动作模型中的频率困境和信息耦合问题,在LIBERO上实现98.3%成功率并提速2.1倍。
Comments Code is opensourced at https://github.com/linsun449/UniFS
DE-FIVE: 通过傅里叶特征和图像向量嵌入检测恶意图像提示
专题命中 效率与部署 :language model(abstract)
AI总结 提出DE-FIVE框架,利用傅里叶域特征和图像向量嵌入,无需训练即可检测针对视觉语言模型的恶意图像提示,包括间接提示注入攻击。