arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12294 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2997 篇

2606.20161 2026-06-19 cs.CV 新提交 50%

ARTEMIS: Agent-guided Reliability-aware Temporal Mask Evolution for Imperfectly Supervised Video Polyp Segmentation

ARTEMIS: 基于智能体引导的可靠性感知时间掩码演化用于不完美监督的视频息肉分割

Tong Wang, Siwen Wang, Yaolei Qi, Jinxing Zhou, Yuting He, Guanyu Yang, Yutong Xie

机构 * Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University, Ministry of Education(东南大学教育部新一代人工智能技术及其跨学科应用重点实验室) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) School of Medicine, Case Western Reserve University(凯斯西储大学医学院)

专题命中 评测与基准 :language agent(abstract)

AI总结 提出ARTEMIS框架,利用视觉语言智能体选择可靠时间锚点,结合SAM2传播和可靠性感知鲁棒学习,从不完美监督(点、涂鸦、少量密集标签)中学习高质量视频息肉分割掩码,在多个基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20100 2026-06-19 cs.CV 新提交 50%

WeGenBench: A Multidimensional Diagnostic Benchmark towards Text-to-Image Model Optimization

WeGenBench:面向文本到图像模型优化的多维诊断基准

Qian Liang, Xiaomin Li, Ying Zhang, Jia Xu, Lihao Ni, Hongrui Li, Jingjing Li, Jing Lyu, Chen Li

机构 * University of Electronic Science and Technology of China(电子科技大学) Dalian University of Technology(大连理工大学) Weixin, Tencent(腾讯微信)

专题命中 评测与基准 :language model(abstract)

AI总结 提出WeGenBench基准,包含4000个中英双语提示,通过场景分类和多维标签实现跨维度评估,并设计基于视觉语言模型的新颖指标,精准定位模型在特定生成类别中的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19804 2026-06-19 cs.CV 新提交 50%

HypOProto: Hyperbolic Ordinal Prototypes for Left Ventricular Filling Pressure Classification

HypOProto: 用于左心室充盈压分类的双曲序数原型

Victoria Wu, Nima Hashemi, Hooman Vaseli, Christina Luong, Purang Abolmaesumi, Teresa S. M. Tsang

机构 * The University of British Columbia(不列颠哥伦比亚大学) Vancouver General Hospital(温哥华综合医院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出HypOProto框架,利用双曲空间中的序数原型对左心室充盈压进行分类,通过冻结的可解释基础模型实现高精度与临床可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19703 2026-06-19 cs.HC 新提交 50%

Vibe Coding for Visualization Implementation: An Empirical Study of Practices and Challenges

Vibe Coding 用于可视化实现:实践与挑战的实证研究

Zhengyu Sun, Xiaolin Wen, Fengjie Wang, Can Liu, Yi Lai, Christophe Hurter, Yong Wang

专题命中 评测与基准 :prompting(abstract)

AI总结 通过16名参与者的实证研究,探讨用户使用AI驱动的自然语言交互工具生成可视化时的实践(提示、评估、迭代)和挑战。

Comments 5 pages, 2 figures. Short paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18591 2026-06-18 cs.CV 新提交 50%

Bridging Creative Intent and Visual Quality: Creator-Driven Recurrent Video Generation with Agentic Feedback Loops

桥接创意意图与视觉质量:基于创作者驱动的循环视频生成与代理反馈循环

Denis Savytski, Aiden Lei, Heding Liu, Warren Yang, Sihan Liang, Alexander Liu, Zhe Zhao

机构 * University of California, Davis(加州大学戴维斯分校) The Harker School(哈克学校) Basis Independent Silicon Valley(硅谷贝斯独立学校) Saratoga High(萨拉托加高中)

专题命中 评测与基准 :LLM(abstract_cn)

AI总结 提出CHIEF框架,通过人类-AI协作的迭代视频精炼,结合创作者驱动和代理主观反馈,提升长视频的叙事连贯性与创意方向。

Comments Accepted to the Workshop on Human-AI Co-Creativity at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17639 2026-06-18 cs.RO cs.CV 新提交 50%

ERQA-Plus: A Diagnostic Benchmark for Reasoning in Embodied AI

ERQA-Plus:具身AI推理的诊断基准

Hong Yang, Basura Fernando

机构 * Centre for Frontier AI Research, Agency for Science, Technology and Research(新加坡科技研究局前沿人工智能研究中心) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 评测与基准 :language model(abstract)

AI总结 提出ERQA-Plus基准,包含1766个基于机器人中心图像的问答实例,覆盖感知、动作、社交、导航和常识推理,用于诊断具身AI的推理能力。

Comments under review at NeurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17475 2026-06-17 cs.CV 新提交 50%

StereoFactory: A Unified Merging Framework for Robust Stereo Matching

StereoFactory: 一种用于鲁棒立体匹配的统一合并框架

Xianda Guo, Pinhan Fu, Ruilin Wang, Wenke Huang, Mang Ye, Qin Zou

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) D-Star Robotics Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出StereoFactory,一种粗到细的进化框架,通过遗传算法选择模型子集和CMA-ES优化模块级路由,实现自适应模型合并,在多个基准上降低误差并显著减少训练时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17246 2026-06-17 cs.CV cs.MA 新提交 50%

GeoDisaster: Benchmarking Orchestrated Agents for Operational Disaster Geo-Intelligence

GeoDisaster: 用于操作化灾害地理智能的编排智能体基准测试

Maram Hasan, Aman Verma, Savitra Roy, Hariseetharam Gunduboina, Daksh Jain, Muhammad Haris Khan, Subhasis Chaudhuri, Biplab Banerjee

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出GeoDisaster基准,包含2921个实例和43种问题类型,用于评估遥感视觉语言模型在工具化空间推理和结构化决策方面的能力,并设计多智能体框架RCEA提升工具使用和证据基础。

Comments 28 pages, 11 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16788 2026-06-16 cs.RO 新提交 50%

SoK: Security and Privacy of Foundation-Model-Powered Robots

SoK: 基础模型驱动机器人的安全与隐私

Xueluan Gong, Chen Chen, Jinxin Liu, Qian Wang, Kwok-Yan Lam

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Cyber Science and Engineering, Wuhan University(武汉大学网络空间安全学院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本文提出F-E-S-G结构边界框架,系统分析基础模型驱动机器人的安全与隐私风险,并基于96篇论文揭示威胁模式、防御不匹配和评估差距。

Comments 21 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16470 2026-06-16 cs.CV cs.RO 新提交 50%

Decoupled Object-Centric Video Understanding for Generating Robotic Manipulation Commands

解耦的以对象为中心的视频理解用于生成机器人操作指令

Thanh Nguyen Canh, Thanh-Tuan Tran, Haolan Zhang, Ziyan Gao, Xiem HoangVan, Nak Young Chong

机构 * School of Information Science, Japan Advanced Institute of Science and Technology(日本北陆先端科学技术大学院大学信息科学学院) University of Engineering and Technology, Vietnam National University(越南国立大学工程与技术大学) Department of Robotics, Hanyang University(汉阳大学机器人学系)

专题命中 评测与基准 :language model(abstract)

AI总结 提出解耦动作识别与对象选择的框架,通过TSM分类动作和对象选择算法识别任务相关对象,结合VLM生成精确指令,在Something-Something V2上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15968 2026-06-16 eess.AS cs.SD 新提交 50%

Bridging the SEA Gap: An Initial Benchmark for Neural Audio Codec-Synthesized Speech Deepfakes in South-East Asian Languages

弥合SEA差距:南亚语言神经音频编码合成语音深度伪造的初步基准

Orchid Chetia Phukan, Girish, Mohd Mujtaba Akhtar, Arun Balaji Buduru

机构 * IIIT-Delhi, India(印度德里国家理工学院) UPES, India(印度UPES大学) VBSPU, India(印度VBSPU大学)

专题命中 评测与基准 :language model(abstract)

AI总结 针对南亚语言神经音频编码合成语音深度伪造检测缺乏基准的问题,构建首个大规模基准SEA-CF,并提出轻量级小模型GARUDA,在低资源场景下实现高效检测。

Comments Accepted to IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09098 2026-06-16 eess.AS 新提交 50%

HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis

HoliDubber: 通过文本引导的音频合成实现复杂声学场景的全景视频配音

Wenhao Guan, Yifan Duan, Junxi Liu, Yu Gu, Feng Dang, Kaidi Wang, Qingyang Hong, Lin Li, Xie Chen

专题命中 评测与基准 :language model(abstract)

AI总结 提出HoliDubber框架,基于补丁自回归扩散Transformer,从单一文本提示联合生成语音和音效,实现全景视频配音,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08525 2026-06-16 cs.CV 新提交 50%

DriveReward: A Comprehensive Dataset and Generative Vision-Language Reward Model for Autonomous Driving

DriveReward:面向自动驾驶的综合数据集与生成式视觉语言奖励模型

Qimao Chen, Fang Li, Yuechen Luo, Zehan Zhang, Haiyang Sun, Fangzhen Li, Bing Wang, Guang Chen, Yang Ji, Jiong Deng, Hongwei Xie, Hangjun Ye, Long Chen, Yi Zhang

机构 * Tsinghua University(清华大学) Xiaomi EV(小米汽车)

专题命中 评测与基准 :language model(abstract)

AI总结 提出DriveReward数据集和专用视觉语言奖励模型,通过反事实标注和时序视觉引导,解决自动驾驶中奖励获取的泛化问题,在强化学习和轨迹选择中取得与基于规则方法相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14556 2026-06-15 cs.CV 新提交 50%

Visual Quality Score Assessment of Large White Goods in Remanufacture with Multi-View Deformable-DETR

基于多视角可变形DETR的再制造大型白色家电视觉质量评分评估

Paul Koch, Vivek Chavan

机构 * Fraunhofer-Institut für Produktionsanlagen und Konstruktionstechnik (IPK)(弗劳恩霍夫生产设备和结构技术研究所)

专题命中 评测与基准 :pretraining(abstract)

AI总结 针对再制造中大型白色家电视觉质量评估依赖人工且难以处理小缺陷的问题,提出基于多视角可变形DETR的自动评分框架,通过自监督预训练和微调减少标注需求,实现精确评估与可解释性。

Comments Accepted to GCSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14153 2026-06-15 cs.CV cs.RO 新提交 50%

Encoder Winners Do Not Reliably Transfer Across VLA Backbone Scale: A Frozen-Backbone Grafting Diagnostic

编码器胜者无法可靠跨VLA骨干网络规模迁移:一种冻结骨干嫁接诊断方法

Qingping Zeng, Fei She

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出冻结骨干嫁接诊断方法,发现小规模VLA上最优的视觉编码器在大规模骨干上并非最优,编码器选择依赖于骨干网络规模。

Comments 23 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13394 2026-06-12 cs.RO 新提交 50%

GeoHAT: Geometry-Adaptive Hybrid Action Transformer for Mobile Manipulation

GeoHAT: 几何自适应混合动作Transformer用于移动操作

Xiangyu Zhu, Renjun Wu, Luzhou Ge, Jinyan Liu, Xuesong Li

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出GeoHAT框架,通过轻量级傅里叶空间编码器注入几何信息,并采用混合全身动作解码器分解机械臂与基座动作,在ManiSkill-HAB基准上成功率提升23.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12671 2026-06-12 cs.CV 新提交 50%

SalArt-VQA: Diagnosing Whether VLMs Understand Salient Artifacts in Generated Images

SalArt-VQA: 诊断VLM是否理解生成图像中的显著伪影

Xiaoxiao Sun, Ruotian Zhang, Junzhe Huang, James Burgess, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学) Zhejiang University(浙江大学) The University of Queensland(昆士兰大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出SalArt-VQA基准,通过950张图像和3681道多选题,从检测、定位、空间基础、缺陷识别四方面评估VLM对生成图像伪影的理解,揭示高检测准确率下隐藏的失败模式。

Comments 23 pages, 7 figures, 7 tables. Dataset: https://huggingface.co/datasets/salartvqa/SalArt-VQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12209 2026-06-11 q-bio.QM 新提交 50%

Interpretable enzyme function prediction via sparse autoencoder features of ESMC across the microbial protein universe

通过ESMC稀疏自编码器特征实现可解释的酶功能预测:跨越微生物蛋白质宇宙

Yue Hu, Wanyu Cheng, Junqing Wang, Yingchao Liu

专题命中 评测与基准 :language model(abstract)

AI总结 利用ESMC-6B蛋白质语言模型的稀疏自编码器特征,无需任务特定训练即可准确预测酶功能,在微生物酶基准上实现78.9% top-1准确率,并发现16.9万个暗酶候选。

Comments 17 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12069 2026-06-11 cs.CV 新提交 50%

Tac-DINO: Learning Vision-Tactile Features with Patch Alignment

Tac-DINO:基于补丁对齐的视觉-触觉特征学习

Hong Li, Yankang Dong, Yue Xu, Yihan Tang, Mingzhu Li, Jiamin Qiu, Qihang Yao, Xing Zhu, Yujun Shen, Nan Xue, Yong-Lu Li

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团) Shanghai Innovation Institute(上海创新研究院)

专题命中 评测与基准 :pretraining(abstract)

AI总结 提出Tac-DINO方法,通过构建大规模触觉数据集和视觉-触觉全息匹配基准,利用补丁对齐学习局部到全局的视觉-触觉表征,性能优于无对齐方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11606 2026-06-11 cs.CV 新提交 50%

Frozen Foundation-Model Embeddings Discard Small-Lesion Signal in Chest Radiography: Implications for Pre-Deployment Evaluation

冻结的基础模型嵌入在胸部X光检查中丢弃小病灶信号:对部署前评估的启示

Raajitha Muthyala, Zhenan Yin, Alekhya Jilla, Frank Li, Theo Dapamede, Bardia Khosravi, Mohammadreza Chavoshi, Judy Gichoya, Saptarshi Purkayastha

机构 * Department of Biomedical Engineering and Informatics, Indiana University(印第安纳大学生物医学工程与信息学系) Department of Radiology and Imaging Sciences, Emory University(埃默里大学放射学与影像科学系)

专题命中 评测与基准 :pretraining(abstract)

AI总结 本研究系统量化了五种冻结的视觉Transformer基础模型在胸部X光检查中保留或丢失小尺度、低对比度信号的情况,发现全局聚合步骤会无声地抑制小尺度信号,但可从补丁令牌中恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11563 2026-06-11 cs.CV cs.RO 新提交 50%

Cross-Modal Benchmarking for Robotic Perception in Natural Environments

自然环境中机器人感知的跨模态基准测试

David Hall, Joshua Knights, Mark Cox, Peyman Moghadam

机构 * CSIRO Robotics, CSIRO, Australia(CSIRO机器人研究所,CSIRO,澳大利亚) University of Sydney (USyd), Australia(悉尼大学(USyd),澳大利亚) Queensland University of Technology (QUT), Australia(昆士兰理工大学(QUT),澳大利亚)

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对自然环境中机器人感知的挑战,提出WildCross跨模态基准,用于大规模自然场景下的地点识别和度量深度估计,并扩展了度量深度估计实验。

Comments Accepted to the IEEE ICRA Workshop on Open Challenges for Rigorous Robot Perception 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11546 2026-06-11 cs.CV 新提交 50%

VL-DINO: Leveraging CLIP Vision-Language Knowledge for Open-Vocabulary Object Detectio

VL-DINO: 利用CLIP视觉-语言知识进行开放词汇目标检测

Hao Zhang, Qinran Lin, Linqi Song, Yong Li

机构 * Chongqing University(重庆大学) City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出VL-DINO,通过QPSC模块构建高质量正样本增强视觉-语言对齐,VSE模块蒸馏CLIP视觉知识,ORSA模块对齐区域特征与文本嵌入,在LVIS零样本检测上达到36.3/38.1 AP。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10778 2026-06-10 cs.CV 新提交 50%

From Patches to Patients: A study of the tile-to-slide performance transferability in Digital Pathology

从斑块到患者:数字病理学中斑块到全切片性能可迁移性的研究

Sofiène Boutaj, Leo Fillioux, Maria Vakalopoulou, Stergios Christodoulidis, Pierre Marza

机构 * Université Paris-Saclay, CentraleSupélec, Gustave Roussy, INSERM, IHU PRISM, Cancer Data Science Unit(巴黎-萨克雷大学、中央理工-高等电力学院、古斯塔夫·鲁西研究所、法国国家健康与医学研究院、IHU PRISM、癌症数据科学单元) Université Paris-Saclay, CentraleSupélec, MICS Laboratory(巴黎-萨克雷大学、中央理工-高等电力学院、MICS实验室)

专题命中 评测与基准 :foundation model(abstract)

AI总结 研究斑块级线性探测能否作为全切片级性能的可靠代理,通过19个基础模型在42个切片级和16个斑块级任务上的基准测试,发现斑块与切片性能高度相关,斑块级基准测试可有效筛选候选模型。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10465 2026-06-10 cs.SE 新提交 50%

MASTOR: A Multi-Agent Approach to Semantic Test Oracle Generation for RESTful APIs

MASTOR: 一种面向RESTful API的语义测试预言生成多智能体方法

Sida Deng, Rubing Huang, Zhenzhen Yang, Man Zhang, Xuan Xie, Rongcun Wang

专题命中 评测与基准 :prompting(abstract)

AI总结 提出MASTOR多智能体方法,通过分析源码上下文生成语义测试预言,包括状态字段预言和行为一致性预言,在13个开源项目上达到75.4%平均变异得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10211 2026-06-10 cs.SE 新提交 50%

TestMap: Evidence Infrastructure for Foundation-Model-Assisted Test Generation

TestMap:基础模型辅助测试生成的证据基础设施

Hunter Leary, Luke Hanuska, Chris Brown

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出TestMap基础设施,自动化C#/.NET仓库的测试生成与验证,记录候选测试生命周期,支持多维度评估。

Comments 10 pages, 1 figure, 2 tables. Accepted to present at AIWare 2026 (arXiv Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10142 2026-06-10 cs.CV 新提交 50%

DB-3DME: From Dataset to Benchmark for Human-aligned Automatic 3D Mesh Evaluation

DB-3DME:从数据集到基准测试,实现与人类对齐的自动3D网格评估

Nanshan Jia, Zhenyu Zhao, Sui Huang, Jingshen Wang, Zeyu Zheng

机构 * University of California, Berkeley(加州大学伯克利分校) Roblox Corporation(Roblox公司)

专题命中 评测与基准 :language model(abstract)

AI总结 提出DB-3DME数据集与基准,包含2619个合成3D网格及其人类评分,通过微调视觉编码器优化VLM评估性能,显著超越现有模型。

Comments CVPR 2026 workshop paper. 10 pages, 3 figures, 6 tables. Dataset available at GitHub and Hugging Face

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09615 2026-06-09 cs.RO cs.CV 新提交 50%

DexPIE: Stable Dexterous Policy Improvement from Real-World Experience

DexPIE:基于真实世界经验的稳定灵巧策略改进

Ruizhe Liao, Wenrui Chen, Liangji Zeng, Haoran Lin, Fan Yang, Kailun Yang, Yaonan Wang

机构 * Hunan University(湖南大学)

专题命中 评测与基准 :post-training(abstract)

AI总结 提出DexPIE后训练框架,通过灵巧手适配干预系统、多阶段DAgger数据收集、相对动作空间异步推理和连续最优性指标条件化,在三个真实灵巧操作任务上成功率提升37%。

Comments Project website: https://siiuuuuuu.github.io/DexPIE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09453 2026-06-09 cs.CV 新提交 50%

GD-MIL: Grade-Disentangled Multiple Instance Learning for Multimodal Biochemical Recurrence Prediction in Prostate Cancer

GD-MIL:用于前列腺癌多模态生化复发预测的等级解耦多实例学习

Dasari Naga Raju

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对前列腺癌生化复发预测,提出GD-MIL方法,通过梯度反转等级对抗训练实现H&E全切片图像特征与Gleason等级解耦,融合临床变量后C-index达0.704,显著优于临床基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09140 2026-06-09 cs.CV 新提交 50%

DiffSight-Former: Modeling Structural Differences and Temporal Dynamics for Glaucoma Progression Prediction

DiffSight-Former:建模结构差异和时间动态用于青光眼进展预测

Yi Huang, Lei Bi, Jinman Kim

机构 * The University of Sydney(悉尼大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出DiffSight-Former框架,通过时间变异特征提取、多结构差异建模和时间感知Transformer,从序列眼底图像中预测青光眼进展,在SIGF和GRAPE数据集上取得高AUC和灵敏度。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08278 2026-06-09 cs.RO 新提交 50%

SIMPLE: Simulation-Based Policy Learning and Evaluation for Humanoid Loco-manipulation

SIMPLE:基于仿真的人形机器人全身操作策略学习与评估

Songlin Wei, Zhenhao Ni, Jie Liu, Zhenyu Zhao, Junjie Ye, Hongyi Jing, Junkai Xia, Xiawei Liu, Michael Leong, Liang Heng, Di Huang, Yue Wang

机构 * USC Physical Superintelligence (PSI) Lab(南加州大学物理超级智能实验室)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出SIMPLE仿真平台,结合MuJoCo动力学与IsaacSim渲染,包含60个全身任务、50个室内场景和1000+物体资产,支持自动化轨迹生成和VR遥操作数据采集,并集成多种主流策略,实验证明仿真与真实世界性能强相关,可实现零样本迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏