arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 281 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 281 篇

2604.03781 2026-08-14 cs.RO 版本更新 70%

OpenRC: An Open-Source Robotic Colonoscopy Framework for Multimodal Data Acquisition and Autonomy Research

OpenRC:一种用于多模态数据采集和自主性研究的开源机器人结肠镜框架

Siddhartha Kapuria, Mohammad Rafiee Javazm, Naruhiko Ikoma, Joga Ivatury, Mohammad Ali Nasseri, Nassir Navab, Farshid Alambeigi

机构 * Walker Department of Mechanical Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校沃克机械工程系) Department of Surgical Oncology, Division of Surgery, The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心外科肿瘤学系) School of Medicine and Health, Technical University of Munich(慕尼黑工业大学医学与健康学院)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 OpenRC框架通过整合开源硬件和多模态数据集,为机器人结肠镜和手术自主性研究提供了可重复的基础,支持同时记录视频、操作指令、执行状态和末端位置,并验证了运动一致性和跨模态延迟。

Comments Abstract: Added repository and contribution statement

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12908 2026-08-13 cs.RO 版本更新 70%

Robotic Manipulation is Vision-to-Geometry Mapping: Vision-Geometry Backbones over Language and Video Models

机器人操作是视觉到几何映射(f(v)→G):超越语言和视频模型的视觉-几何骨干

Zijian Song, Qichang Li, Jiawei Zhou, Zhenlong Yuan, Tianshui Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(大数据分析与处理广东省重点实验室) X-Era AI Lab(X-Era人工智能实验室) AMAP, Alibaba(阿里妈妈实验室) Guangdong University of Technology(广东工业大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出基于视觉-几何骨干的机器人操作方法,通过直接利用预训练的3D表示生成动作,优于传统语言或视频模型,在精确操作和零样本泛化中表现更优。

Comments Accepted at ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01151 2026-08-11 cs.LG 版本更新 70%

Lagrangian Perturbation Diffusion Steering: Latent Reinforcement Learning for Generative Policies

拉格朗日扰动扩散引导:用于生成策略的潜在强化学习

Hikmet Simsir, Ozgur S. Oguz

机构 * University of Michigan(密歇根大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.LG

AI总结 提出拉格朗日扰动扩散引导(LP-DS),通过学习紧凑的噪声空间扰动来微调冻结的生成策略,利用拉格朗日信任区域目标优化,在保持潜在先验约束的同时提升下游价值,在多个基准上实现样本效率和回报提升。

Comments Accepted as a regular paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15890 2026-08-06 cs.CV 版本更新 70%

Exo2EgoPose: Leveraging Exocentric Demonstrations for Vision-Language guided Egocentric 3D Hand Pose Forecasting

Exo2EgoPose:利用外心演示进行视觉语言引导的自我中心3D手部姿态预测

Zhaofeng Shi, Heqian Qiu, Lanxiao Wang, Xiang Li, Hongliang Li

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.CV

AI总结 研究视觉语言引导的自我中心3D手部姿态预测任务,提出Exo2EgoPose框架,利用外心演示补偿自我中心视角线索不足,含双层外心重建模块和全局到局部调制模块,实验显示该方法优于现有技术,具备人机转移能力且有改进。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09971 2026-07-30 cs.RO 版本更新 70%

TiPToP: A Modular Open-Vocabulary Robot Manipulation System That Plans

TiPToP:一种用于机器人操作的模块化开放式词汇规划系统

William Shen, Nishanth Kumar, Sahit Chintalapudi, Ryan Lindeborg, Jie Wang, Christopher Watson, Edward Hu, Jing Cao, Dinesh Jayaraman, Leslie Pack Kaelbling, Tomás Lozano-Pérez

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 TiPToP是一种模块化开放式词汇规划系统,结合预训练视觉模型与任务规划器,通过自然语言指令和RGB图像直接解决多步骤操作任务,实现实时高效的操作规划。

Comments Project website: https://tiptop-robot.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18709 2026-07-23 cs.RO 版本更新 70%

RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation

RoboInter1.5:用于具身世界建模和机器人操作的整体中间表示套件

Ziqin Wang, Hao Li, Weijun Wang, Junhao Cai, Jia Zeng, Yilun Chen, Jiangmiao Pang, Si Liu

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 研究针对现有机器人数据集问题,基于RoboInter1.0提出RoboInter1.5套件,含多种中间表示资源及相关任务,通过广泛评估证明其为中间表示提供统一时空框架,将其作为双向接口,规范动作空间并约束物理模拟器潜在展开。

Comments 28 pages. arXiv admin note: substantial text overlap with arXiv:2602.09973

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25746 2026-07-22 cs.RO 版本更新 70%

TacRefineNet: Goal-Conditioned Tactile Grasp Refinement for Edge-Prominent Objects

TacRefineNet:用于边缘突出物体的目标条件触觉抓取优化

Shuaijun Wang, Haoran Zhou, Diyun Xiang, Yangwei You

机构 * Xiaomi Robotics(小米机器人)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 研究针对边缘突出物体抓取对齐难的问题,提出TacRefineNet框架,利用连体策略网络预测手腕姿态增量,经交叉组合训练,在模拟样本上训练后部署到实际五指手,实验表明其在可见物体抓取上有一定成功率及误差控制,还有长期扰动校正等特点。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15038 2026-07-20 cs.CV 版本更新 70%

Video = World + Event Stream

视频 = 世界 + 事件流

Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu, Chen Liang, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zhiwei Lin, Zoubin Bi

机构 * Alibaba Group(阿里巴巴集团)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.CV

AI总结 研究提出Wan-Streamer v0.3,将视频视为世界加事件流,据此有通用预训练任务,应用于实时全双工视听交互,保留v0.2运行点,为实时下游任务提供能力。

Comments website: https://wan-streamer.com/v0.3/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07420 2026-07-16 cs.RO cs.HC 版本更新 70%

Initiation Safety: A Missing Dimension in Generalist-Robot Safety

启动安全:通用机器人安全中缺失的维度

Zhijin Meng, Francisco Cruz

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 探讨通用机器人安全中缺失的启动授权维度,通过在人形机器人上实施PAS等方法进行研究,并提出包含三个条件的用户研究,涉及多方面开放性问题。

Comments 4 pages, 2 figures. Accepted to RSS 2026 Workshop on Rethinking Safety for Generalist Robots

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05461 2026-06-15 cs.AI 版本更新 70%

Output Type Before Quality: A Standards-Derived XAI Admissibility Rubric for Autonomous-Driving Safety

先输出类型,后质量:基于标准的自动驾驶安全XAI可接受性评估标准

Abhinaw Priyadershi, Mandar Pitale, Jelena Frtunikj, Maria Spence

机构 * NVIDIA Corporation(英伟达公司) NVIDIA GmbH(英伟达德国分公司)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.AI

AI总结 针对基于ML的自动驾驶安全标准与XAI方法输出类型不匹配的证据类型缺口,从多个安全标准推导出19项可测试证据标准,评估六类XAI方法,发现因果XAI在三个生命周期阶段结构上必需,并提出了结构可接受性概念。

Comments Accepted at SAFECOMP 2026 Workshops (SASSUR); to appear in Springer LNCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27476 2026-06-09 cs.CV 版本更新 70%

EdgeFM: Efficient Edge Inference for Vision-Language Models

EdgeFM: 为视觉-语言模型高效边缘推理设计的框架

Mengling Deng, Yuanpeng Chen, Sheng Yang, Wei Tao, Wenhai Zhang, Hui Song, Linyuanhao Qin, Kai Zhao, Xiaojun Ye, Shanhui Mo, Jingli Fan, Shuang Zhang, Bei Liu, Tiankun Zhao, Xiangjing An

机构 * Go Further. AI School of Data Science Fudan University(复旦大学数据科学学院) RUYi Dynamics Co. Ltd(RUYi Dynamics有限公司) Independent Researcher(独立研究者)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.CV

AI总结 EdgeFM通过轻量级代理驱动框架,优化边缘部署的视觉-语言模型推理,提升跨平台性能和可移植性,实现比传统工具链更快的推理速度。

Comments Technique Report version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15449 2026-08-19 astro-ph.GA 版本更新 67%

The Steep-spectrum Radio-loud AGN Luminosity Function and Its Implications for Black Hole Growth and Star Formation

阶梯谱射电明亮活动星系核的发光函数及其对黑洞生长和恒星形成的启示

Wenjie Wang, Zunli Yuan, B. Šlaus, Hongwei Yu, Yu Luo

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 研究利用4555个阶梯谱射电明亮AGN样本,探讨其宇宙演化,提出LADE框架模型,揭示低功率和高功率源的统一演化模式,并显示AGN发光函数与恒星形成率的关联。

Comments 27 pages, 14 figures, Comments welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29699 2026-08-14 cs.CV cs.AI cs.RO 版本更新 67%

Early Warning Signals for OpenVLA Failure under Visual Distribution Shift

视觉分布偏移下OpenVLA故障的早期预警信号

Dipesh Tharu Mahato, Rachel Ren

机构 * New York University(纽约大学)

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 研究在视觉分布偏移下,OpenVLA内部激活是否包含可线性解码的近期任务失败信息,通过LIBERO操作实验发现第16层逻辑探针在遮挡条件下预测失败AUROC达0.972。

Comments 16 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15844 2026-08-07 astro-ph.IM astro-ph.CO 版本更新 67%

Radio-Interferometric Image Reconstruction with Denoising Diffusion Restoration Models

利用去噪扩散恢复模型进行无线电干涉成像重建

Michel Morales, Emma Tolley, Remi Poitevineau

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 本文提出基于去噪扩散概率模型的无线电天空成像重建方法,通过训练DDPM并结合DDRM技术,在不依赖网格化可见度数据的情况下实现高保真重建,优于传统CLEAN方法。

Comments 11 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08105 2026-08-06 astro-ph.SR astro-ph.GA 版本更新 67%

The SOFIA Massive (SOMA) Radio Survey. III. Radio Emission from Intermediate-Mass Protostars

SOFIA大规模恒星形成调查。III. 中等质量原恒星的无线电发射

Francisco Sequeira-Murillo, Viviana Rosero, Joshua Marvil, Jonathan C. Tan, Ruben Fedriani, Yichen Zhang, Prasanta Gorai, James M. De Buizer, Maria T. Beltrán

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 SOFIA调查研究了中等质量原恒星的无线电发射,揭示了其形态和光谱特性,扩展了样本并提供了对原恒星演化模型的新约束。

Comments Accepted to ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22999 2026-08-05 cs.RO cs.AI cs.HC cs.LG 版本更新 67%

WCM: World-Cognition Model for Generalizable Human-Robot Interaction

WCM:用于通用人机交互的世界认知模型

Yuzhen Chen, KC Zhou

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 针对机器人在物理任务交互困难的问题,提出基于SLAK架构和异步运行时的世界认知模型(WCM),引入人在回路教学模式,经思维链监督改进模型,在九个现实世界人机交互任务中平均成功率达73.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22595 2026-07-15 astro-ph.CO 版本更新 67%

Radio spectral properties and aging of two tailed radio galaxies in a galaxy group at z=0.35

红移0.35星系群中两个尾射电星系的射电频谱特性与老化

Paula Vulić, Vernesa Smolčić, Alexis Finoguenov, Ghassem Gozaliasl, Hiddo Algera, Ivan Delvecchio

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 利用多波段射电观测,研究了一个年轻星系群核心中两个尾射电星系的频谱特性、光谱年龄和动力学年龄,发现光谱年龄远小于动力学年龄,表明星系与群内介质存在剧烈相互作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01763 2026-06-12 astro-ph.GA astro-ph.IM 版本更新 67%

When the Shadow Meets Its Measure: Assessing the Feasibility of Submillimeter Black Hole Shadow Imaging in Megamaser Disk AGN

当阴影遇到其尺度:评估巨脉泽盘活动星系核中亚毫米黑洞阴影成像的可行性

Roman N. Burridge, Geoffrey C. Bower

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 本文评估了利用水巨脉泽盘活动星系核进行亚毫米黑洞阴影成像的可行性,发现仅NGC 4258在地球-L2基线上可分辨,且自旋偏移测量因脉泽天体测量精度不足而不可行。

Comments 25 pages, 7 figures, 9 tables. Revised version with updated 230 GHz flux standardization, astrometric feasibility analysis for NGC 4258, mass/distance/inclination treatment, references, and machine-readable table description

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03429 2026-06-11 astro-ph.HE astro-ph.SR 版本更新 67%

Milliarcsecond-scale spectrum of the persistent radio source associated with FRB 20190417A and constraints for FRB 20181030A

与FRB 20190417A相关的持续射电源的VLBI谱

G. Bruni, L. Piro, Y. -P. Yang, L. Nicastro, A. Rossi, E. Palazzi, E. Maiorano, S. Savaglio, B. Zhang

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 利用EVN在5和8 GHz观测,确认FRB 20190417A的致密射电源具有非热性质和平坦谱(α=-0.19±0.29),支持星云起源,并限制FRB 20181030A的候选PRS具有陡谱。

Comments Accepted for publication in A&A Letters

Journal ref A&A 710, L31 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05950 2026-08-18 cs.CV cs.AI 版本更新 62%

Reprojection-Guided 3D Gaussian Splatting Diffusion for Weakly Supervised Single-Image Normal Estimation

CLONE: 基于3DGS的闭环可微优化框架用于单图像法线估计

Yanxing Liang, Yinghui Wang, Wei Li, Tao Yan, Jiaxing Shen

机构 * School of Artificial Intelligence and Computer Science, Jiangnan University, Wuxi, China(江南大学人工智能与计算机科学学院,中国无锡) School of Data Science, Lingnan University, Hong Kong, China(岭南大学数据科学学院,中国香港)

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.AI

AI总结 提出CLONE框架,通过3D高斯泼溅参数化场景并利用协方差特征分解得到连续可微法线,结合可微光照模型和一步确定性扩散精化网络,在统一重投影目标下联合优化,实现无需真值法线监督的几何一致性单图像法线估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17017 2026-08-04 cs.IR cs.AI cs.LG 版本更新 62%

WHALE: A Scalable Unified Model for Recommendation with Wukong-HSTU Architecture

WHALE:一种采用悟空 - HSTU 架构的可扩展统一推荐模型

Renqin Cai, Dawei Sun, Yuanjun Yao, Zhiyong Wang, Velvin Fu, Maggie Zhuang, Yu Shi, Zhongnan Fang, Xuan Cao, Jing Qian, Rui Li

机构 * Meta Platforms, Inc.(Meta平台公司)

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 研究如何在推荐建模中统一非序列与序列特征。核心方法是基于悟空和 HSTU 架构构建 WHALE 模型,含特定模块与融合方式,并采用协同设计技术。主要贡献是在工业数据上离线实验有收益,在线也有积极效果且已用于生产系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09938 2026-07-07 cs.RO cs.LG 版本更新 62%

CableTract: A Co-Designed Cable-Driven Field Robot for Low-Compaction, Off-Grid Capable Agriculture

CableTract:一种低压实、离网能力的农业电缆驱动田间机器人

Ozgur Yilmaz

机构 * Adana Science and Technology University(阿达纳科学与技术大学)

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.LG

AI总结 本文提出CableTract电缆驱动农业机器人,通过共设计电缆架构与实施库,实现低压实和离网作业,结合多种模型分析能量效率与经济性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16809 2026-07-07 cs.RO cs.AI 版本更新 62%

CABTO: Context-Aware Behavior Tree Grounding for Robot Manipulation

CABTO:面向机器人操作的上下文感知行为树接地

Yishuai Cai, Xinglin Chen, Yunxin Mao, Kun Hu, Yaodong Yang, Yuanpei Chen, Wenjing Yang, Ji Wang, Minglong Li

机构 * National University of Defense Technology(国防科技大学) PsiBot Peking University(北京大学) PKU-Psibot Lab(北京大学-PsiBot实验室)

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.AI

AI总结 本文提出CABTO框架,通过预训练大模型和上下文反馈,自动构建完整且一致的行为树系统,解决机器人操作中行为树接地的复杂性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22054 2026-07-07 cs.CV cs.AI 版本更新 62%

MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources

MetricAnything:利用噪声异构源扩展度量深度预训练

Baorui Ma, Jiahui Yang, Donglin Di, Xuancheng Zhang, Jianxun Cui, Hao Li, Yan Xie, Wei Chen

机构 * Li Auto Inc(李自动公司)

专题命中 VLA模型 :VLA(abstract);分类 cs.CV、cs.AI

AI总结 研究针对度量深度估计扩展难题,提出MetricAnything框架,通过随机掩码创建稀疏度量提示解耦空间推理与偏差,用多样3D数据预训练,在多任务中表现出色,推动度量感知发展。

Comments Accepted to ECCV 2026. Project Page: https://metric-anything.github.io/metric-anything-io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15061 2026-07-07 cs.RO cs.CV 版本更新 62%

Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue

Ask-to-Clarify: 通过多轮对话解决指令歧义

Xingyao Lin, Xinghao Zhu, Tianyi Lu, Guojin Zhong, Sicheng Xie, Hui Zhang, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

机构 * College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(复旦大学计算机科学与人工智能学院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Mechanical Systems Control Lab, UC Berkeley, California, USA(伯克利机械系统控制实验室)

专题命中 VLA模型 :VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Ask-to-Clarify框架,通过多轮对话解决指令歧义问题,结合视觉语言模型和扩散模型,采用两阶段知识绝缘策略训练,实现多任务中更高效的协作式具身代理。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02169 2026-08-17 cs.LG 版本更新 57%

Responsiveness Verification: Will Predictions Change? How Much? How Often?

响应性验证:预测会改变吗?改变多少?改变频率如何?

Harry Cheon, Meredith Stewart, Bogdan Kulynych, Tsui-Wei Weng, Berk Ustun

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本研究提出测量响应性的算法与交互模型框架,搭配统计保证,可用于检测累犯预测的排除情况、估计内容审核博弈成本、测试LLM基准鲁棒性,提升模型安全性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18064 2026-08-13 cs.AI 版本更新 57%

Towards Human Motion World Models via Executable Behaviour Representations

通过可执行模型理解人类行为

Rimvydas Rubavicius, Manisha Dubey, N. Siddharth, Subramanian Ramamoorthy

机构 * School of Informatics The University of Edinburgh(信息学院爱丁堡大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 本文提出EXACT语言,通过可执行神经符号模型分析人类动作,提升动作分割和异常检测的效率与直观性。

Comments Accepted in ECCV2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06435 2026-08-04 cs.AI 版本更新 57%

Trust but Verify:Evidence-Linked Multi-Agent Clinical Information Extraction in Pathology

从细则中发现幽门螺杆菌:基于证据关联的多智能体胃活检报告病例发现

Yufan Wang, Anit Kumar Sahu, Yan Fei Ng, Daniel Kang, Shayan Vassef, Soorya Ram Shimgekar, Koustuv Saha, Piyum Zonooz, Navin Kumar, Chee Leong Cheng, Li Yan Khor

机构 * Department of Anatomical Pathology, Singapore General Hospital(新加坡中央医院解剖病理科) Duke–NUS Medical School(新加坡国立大学Duke-NUS医学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Independent Researcher(独立研究者)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 研究针对胃活检报告中幽门螺杆菌证据提取难题,采用Nimblemind多智能体系统,经试点评估其总体准确率达98.61%,虽与其他比较器性能相似,但实现了工作流程整合和可追溯性,还能大幅减少审查时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27475 2026-08-03 cs.IR cs.LG 版本更新 57%

OneShot: Index-in-Ranking with Neural Scoring for Large-Scale Retrieval

OneShot:面向大规模检索的结合神经打分的排序内索引方法

Ziwei Li, Shuyao Li, Xufeng Cai, Xue Zou, Yiming Ma, Huiting Lu, Wujie Yan, Zhichen Zhao, Yang Lu, Zhe Wang, Rui Luo, Zhengyu Su, Dan Zhang, Yimin Tan, Ji Liu

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本研究针对推荐系统检索阶段排序目标与索引结构不一致的问题,提出OneShot框架,将索引学习与排序目标联合,突破点积瓶颈,部署于Instagram短视频推荐系统,提升了召回率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30544 2026-08-03 cs.AI 版本更新 57%

Latent Actions from Factorized Transition Effects under Agent Ambiguity

基于因子化转移效应的潜在动作在智能体模糊性下的研究

Heejeong Nam, Chandradithya S Jonnalagadda, Harshit Aggarwal, Eric Xu, Randall Balestriero

机构 * Brown University(布朗大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 针对多物体或干扰场景中动作源模糊问题,提出观测转移因子化(OTF)方法,将转移分解为稀疏的观测转移基元,并构建OTF-LAM模型,在逆向前向动力学框架下抽象出动作潜变量,实现零样本迁移和下游策略学习。

Comments Project Page: https://hazel-heejeong-nam.github.io/LAM/

详情

展开后加载摘要…

URL PDF HTML 收藏