World-Model-Augmented Web Agents with Action Correction
具有动作修正的世界模型增强型网络代理
机构 * Zhejiang University(浙江大学) ; Tencent AI Lab(腾讯AI实验室)
专题命中 VLA模型 :action model(abstract);分类 cs.AI
AI总结 WAC通过多代理协作和风险感知机制,提升网络代理在复杂任务中的鲁棒性和执行效率。
视觉与机器人
视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。
具有动作修正的世界模型增强型网络代理
机构 * Zhejiang University(浙江大学) ; Tencent AI Lab(腾讯AI实验室)
专题命中 VLA模型 :action model(abstract);分类 cs.AI
AI总结 WAC通过多代理协作和风险感知机制,提升网络代理在复杂任务中的鲁棒性和执行效率。
说、梦、做:学习视频世界模型以驱动指令式机器人操作
机构 * Fudan University(复旦大学)
专题命中 VLA模型 :action model(abstract);分类 cs.RO
AI总结 本文提出一种视频条件动作框架,通过生成稳健的视频模型和对抗性蒸馏,提升机器人操作中的预测能力和空间准确性。
基于预训练大语言模型的通用规划抽象生成
机构 * Hunan University of Science and Technology(湖南科技大学) ; Dongguan University of Technology(东莞理工学院)
专题命中 VLA模型 :action model(abstract);分类 cs.AI
AI总结 本文提出利用预训练大语言模型生成通用规划的抽象,并通过自动化调试修正抽象,以提升规划效率。
任意到全部MRI合成:鼻咽癌及其下游应用的统一基础模型
专题命中 VLA模型 :VLA(abstract);分类 cs.CV
AI总结 本文提出统一基础模型实现任意到全部MRI合成,提升鼻咽癌放疗的准确性和临床实用性。
通过显式物理整合解决极端数据稀缺问题:应用于地下水热传输的应用
机构 * Institute for Parallel and Distributed Systems, University of Stuttgart, Stuttgart, Germany(并行与分布式系统研究所,斯图加特大学,斯图加特,德国) ; Delft Institute of Applied Mathematics, Delft University of Technology (TU Delft), Delft, the Netherlands(代尔夫特应用数学研究所,代尔夫特理工大学(TU Delft),代尔夫特,荷兰)
专题命中 VLA模型 :action model(abstract);分类 cs.LG
AI总结 本文提出了一种局部-全局卷积神经网络,通过显式物理整合解决极端数据稀缺问题,应用于地下水热传输建模,展示了其在城市尺度和实际地下参数地图上的有效性。
通过基于强化学习的数值推理增强临床试验论文的论文级别推断
机构 * IBM Research Europe - Ireland(IBM欧洲研究院-爱尔兰) ; Dublin City University(都柏林城市大学) ; IT:U Interdisciplinary Transformation University Austria(IT:U跨学科转型大学奥地利)
专题命中 VLA模型 :action model(abstract);分类 cs.AI
AI总结 本研究通过强化学习和数值推理提升临床试验论文的论文级别推断,实现更准确的系统评价自动化。
Comments Accepted at EMNLP 2025 Main Conference. This revision corrects a minor typo in the camera-ready version
通过专家混合学习行为模型的多样化技能
专题命中 VLA模型 :action model(abstract);分类 cs.RO
AI总结 Di-BM通过专家混合学习方法,提升机器人行为模型在多任务场景下的性能和数据效率。
利用基于大语言模型的句子嵌入增强交易理解的基础模型
机构 * Visa Research(Visa研究)
专题命中 VLA模型 :action model(abstract);分类 cs.LG
AI总结 本文提出一种结合大语言模型生成的句子嵌入与轻量级交易模型的混合框架,以提升交易理解任务的性能和效率。
Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing: Industry Track (EMNLP 2025), pages 903-911
考虑他人的空间人机交互模型
机构 * Graduate School of Science and Technology, Shizuoka University(静冈大学理学技术研究生院)
专题命中 VLA模型 :action model(abstract);分类 cs.RO
AI总结 本文提出了一种考虑他人的空间人机交互模型,通过实验验证了该模型在调节人机交互行为方面的有效性。
超越补丁聚合:面向视觉增强文档检索的三阶段金字塔索引
机构 * Inception AI ; Mubadala
专题命中 VLA模型 :action model(abstract);分类 cs.AI
AI总结 VisionRAG是一种无OCR、模型无关的多模态检索系统,通过三阶段金字塔索引提升文档检索效率和准确性。
EduSim-LLM: 一个整合大语言模型和机器人模拟的教育平台,用于初学者
机构 * Hangzhou Dianzi University Information Engineering College(杭州电子科技大学信息工程学院)
专题命中 VLA模型 :action model(abstract);分类 cs.RO
AI总结 EduSim-LLM通过整合大语言模型与机器人模拟,实现自然语言到机器人行为的转换,提升初学者在人机交互和多机器人协作中的控制与操作能力。
FaceShield:防御面部图像 against 深度伪造威胁
机构 * Korea University(韩国大学) ; KAIST(韩国科学技术院) ; Samsung Research(三星研究)
专题命中 VLA模型 :action model(abstract);分类 cs.CV
AI总结 FaceShield通过操控扩散模型的注意力机制和面部特征提取器,提出了一种主动防御深度伪造的方案,有效提升对抗性扰动的鲁棒性和不可察觉性。
Comments Accepted to ICCV 2025. Keywords: Deepfake, Adversarial Attack, Diffusion Models, GANs, Face Swap, Proactive Defense
InterAgent:基于物理的多智能体命令执行通过交互图上的扩散
机构 * ShanghaiTech University(上海科技大学) ; University of Pennsylvania(宾夕法尼亚大学) ; ByteDance(字节跳动) ; Stanford University(斯坦福大学) ; InstAdapt
专题命中 VLA模型 :action model(abstract);分类 cs.CV
AI总结 InterAgent通过交互图上的扩散模型实现了基于物理的多智能体协调控制,能够从文本提示中生成连贯且物理合理的多代理行为。
Comments Project page: https://binlee26.github.io/InterAgent-Page
可解释的神经近似随机反应动力学:具有保证可靠性的方法
机构 * Department of Biosystems Science and Engineering, ETH Zurich(1 生物系统科学与工程系,苏黎世联邦理工学院)
专题命中 VLA模型 :action model(abstract);分类 cs.LG
AI总结 DeepSKA通过结合可解释性、可靠性保证和高效计算,为随机反应动力学提供了一种新的神经近似方法。
StrokeNet: 解析如何在在线手写体识别中学习细粒度交互
机构 * College of Computer Science and Technology(计算机科学与技术学院) ; Guangdong University of Technology(广东技术大学) ; CVTE Research(CVTE研究院)
专题命中 VLA模型 :action model(abstract);分类 cs.CV
AI总结 StrokeNet通过参考点对表示和动态选择参考点,有效捕捉手写体中细粒度交互,提升识别准确率。
Comments 17 pages, 5 figures
Journal ref ICDAR 2025
SoREX:面向具有相关自我路径提取的自解释社交推荐
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 Gallagher人工智能学院) ; Beijing Key Laboratory of Research on Large Models(北京大模型研究关键实验室) ; Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索工程研究中心)
专题命中 VLA模型 :action model(abstract);分类 cs.AI
AI总结 SoREX通过引入自解释的GNN框架,利用相关自我路径提取提升社交推荐的预测准确性与解释能力。
Comments ACM Transactions on Information Systems (TOIS), 2025. Online AM: 17 Nov 2025. DOI: 10.1145/3777374. Code: https://github.com/antman9914/SoREX
Journal ref ACM Transactions on Information Systems (TOIS), 2025
主动代理白板:增强图示学习
专题命中 VLA模型 :action model(abstract);分类 cs.AI
AI总结 DrawDash通过实时语音驱动的视觉辅助,主动完成和优化教育图表,以减少教师认知负担并提升图示教学效果。
EnzyCLIP:一种基于对比学习的跨注意力双编码框架,用于预测酶动力学常数
机构 * SCOPE ; Vellore Institute of Technology(维洛雷理工学院) ; BIT ; Department of Computer Science(计算机科学系) ; Department of Bioengineering and Biotechnology(生物工程与生物技术系)
专题命中 VLA模型 :action model(abstract);分类 cs.LG
AI总结 EnzyCLIP通过对比学习和跨注意力机制,结合蛋白质序列和底物分子结构预测酶动力学参数,提升Kcat和Km预测性能。
LAPS-Diff: 一种基于扩散的歌唱语音合成框架,具有语言感知的语调风格引导学习
机构 * Department of Electrical Engineering, Indian Institute of Technology, Bombay.(电子工程系,印度理工学院,博亚姆)
专题命中 VLA模型 :action model(abstract);分类 cs.AI
AI总结 LAPS-Diff通过语言感知嵌入和语音风格引导学习,提升低资源环境下印地语歌唱语音合成的质量。
Comments 10 pages, 5 figures, 3 Tables
具有自适应风险感知决策的分层时空注意力网络用于复杂场景的前方碰撞预警
机构 * organization= School of Automation \& School of Industrial Internet, Chongqing University of Posts ; organization= Platform Technology Development Department, AVATR Technology Co. LTD. , city= Chongqing , postcode= 400000 , country= China ; organization= School of Vehicle ; Mobility, Tsinghua University , city= Beijing , postcode= 100084 , country= China
专题命中 VLA模型 :action model(abstract);分类 cs.LG
AI总结 本文提出一种结合分层时空注意力网络和动态风险阈值调整算法的前方碰撞预警框架,通过高效模型和自适应机制提升复杂场景下的预警精度与可靠性。
GRAPHIC--指导人本设计与交互中算法实践的审查指南
专题命中 VLA模型 :action model(abstract);分类 cs.AI
AI总结 GRAPHIC框架旨在分析应用于图形设计的计算系统,通过三大维度揭示人机协作中的研究空白,促进基于核心设计原则的创新。
Comments 20 pages, 16 figures
机构 * Nanjing University(南京大学) ; Institute of Artificial Intelligence, China Telecom (TeleAI)(人工智能研究所)
专题命中 VLA模型 :action model(abstract);分类 cs.CV
机构 * University of Amsterdam(阿姆斯特丹大学)
专题命中 VLA模型 :action model(abstract);分类 cs.CV
机构 * UC San Diego(加州大学圣地亚哥分校) ; IIT Bombay(印度理工学院班加罗尔)
专题命中 VLA模型 :action model(abstract);分类 cs.LG
Journal ref Neurips 2024 paper
机构 * Leiden Institute for Advanced Computer Science (LIACS)(莱顿高级计算机科学研究所) ; SRON Space Research Organization Netherlands(荷兰空间研究组织SRON) ; Department of Earth Sciences(地球科学系) ; Φ \Phi -lab, ESA-ESRIN(Φ实验室,ESA-ESRIN) ; Chair for AI Methodology (AIM) at RWTH Aachen(RWTH亚琛大学人工智能方法学教授职位)
专题命中 VLA模型 :action model(abstract);分类 cs.CV
Comments Accepted at the MACLEAN workshop at ECML-PKDD 2025
机构 * CUHK(香港中文大学) ; HKUST(香港科技大学) ; HKU(香港大学) ; ByteDance Inc(字节跳动公司)
专题命中 VLA模型 :action model(abstract);分类 cs.CV
机构 * University of Pennsylvania(宾夕法尼亚大学) ; The University of Hong Kong(香港大学) ; Snap Inc(Snap公司)
专题命中 VLA模型 :action model(abstract);分类 cs.CV
专题命中 VLA模型 :action model(abstract);分类 cs.LG
机构 * Jina AI GmbH(Jina AI公司) ; University of Pittsburgh(匹兹堡大学)
专题命中 VLA模型 :action model(abstract);分类 cs.AI
机构 * CausalAI Lab, Columbia University(因果推理实验室,哥伦比亚大学)
专题命中 VLA模型 :action model(abstract);分类 cs.LG
Comments 35 pages, 8 figures, published at ICML 2025