arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

2026-08-28 至 2026-08-28 共收录 7
2608.27079 2026-08-28 cs.RO 新提交

GRAFT: Grounded and Efficient Online Reinforcement Adaptation for Fine-Grained Robot Manipulation

GRAFT:面向精细机器人操作的 grounded 高效在线强化适应

Yibo Qiu, Haoliang Ye, Shu'ang Sun, Zan Huang, Ronald X Xu, Mingzhai Sun

机构 * Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学生命科学与医学部生物医学工程学院)

AI总结 GRAFT是一种高效在线VLA适应框架,通过特定视角视觉锚点聚焦任务相关线索,在四项生物医学操作任务中提升25个百分点成功率并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26806 2026-08-28 cs.CV 新提交

Multi-Image Visual Token Pruning in Large Visual Language Models

多图像视觉语言模型中的多图像视觉令牌剪枝

Rongyang Zhang, Chengqiang Lu, Cong Li, Hongchao Gu, Tingjia Shen, Xuyang Zhi, Qimeng Wang, Yan Gao, Yi Wu, Yao Hu, Hao Wang, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Xiaohongshu Inc.(小红书科技有限公司)

AI总结 本文针对现有LVLMs多图像剪枝方法的局限,提出无需训练的AVTP框架,在多类LVLMs上实现显著推理加速,同时保持较高准确率,部分模型性能甚至优于基线。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26757 2026-08-28 cs.AI 新提交

DEEPCHART: How Far are LLMs from Faithful Data-Science Chart Generation?

DEEPCHART:大型语言模型在忠实的数据科学图表生成方面存在多大差距?

Jiahui tang, Kuicai Dong, Dexun Li, Hongchao Gu, Haocheng Yu, Wei Han, Chen Zhang, Yong Liu, Hao Wang, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

AI总结 该研究推出专家标注的DEEPCHART基准,将图表生成分为提取-推理-可视化流程,发现现有LLMs生成的图表常隐藏数据幻觉,仅靠大上下文窗口无法实现忠实图表生成,需可靠的证据提取与定量推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26752 2026-08-28 cs.CV 新提交

Glass Surface Detection Grounded in 3D Visual Geometry

基于3D视觉几何的玻璃表面检测

Yiwei Lu, Ke Xu, Tao Yan, Xiaojun Chang, Radu Timofte, Rynson W. H. Lau

机构 * Jiangnan University(江南大学) University of Science and Technology of China(中国科学技术大学) University of Wurzburg(维尔茨堡大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞))

AI总结 本文提出将玻璃表面检测(GSD)基于3D视觉几何的新范式,结合VGGT、FSAM与GeGB,在7个基准上达最优性能,泛化性好且提升玻璃场景重建效果。

Comments 9 pages, 10 figures. Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26583 2026-08-28 cs.RO 新提交

SOLO: Stable Omni-terrain Long-Horizon Perceptive Humanoid Locomotion

SOLO:稳定全地形长视距感知类人机器人运动

Pihai Sun, Gang Han, Jingkai Sun, Jiahao Ma, Zeran Su, Zelin Tao, Peiran Liu, Shuai Shi, Wei Cui, Zifan Wang, Jialin Yu, Wen Zhao, Kangning Yin, Jiaxu Wang, Jiahang Cao, Lingfeng Zhang, Hao Cheng, Jian Tang, Yijie Guo, Qiang Zhang

机构 * Artificial General Intelligence Institute, University of Science and Technology of China(中国科学技术大学通用人工智能研究院) X-Humanoid(X-人形机器人) The University of Hong Kong(香港大学) The Australian National University(澳大利亚国立大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

AI总结 SOLO是解决长视距类人机器人运动脆弱性的统一框架,通过QR与TA-MSE蒸馏提升地形感知与策略学习,仿真及实际测试中通行成功率显著优于基线方法,可零样本完成长距离复杂地形任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26535 2026-08-28 cs.AI 新提交

Multi2AV-Safety: Benchmarking Safety in Multimodal-to-Audio-Video Generation

Multi2AV-Safety:多模态到音视频生成的安全性基准测试

Kaichao Jiang, Changtao Miao, Baiqi Wu, Zhiyuan Lu, Kang Yang, Peiwei Zhao, Junchi Chen, Yunfeng Diao, He Liu, Qi Chu, Tao Gong, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Hefei University of Technology(合肥工业大学)

AI总结 本研究推出首个覆盖11种非单例多模态条件配置的音视频生成安全性基准Multi2AV-Safety,发现现有安全守卫存在组合风险感知不足的系统性弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26336 2026-08-28 cs.SD cs.CV cs.MM 新提交

StreamAV-Bench: A Comprehensive Benchmark for Streaming Audio-Video Generation

StreamAV-Bench:面向流式音视频生成的综合基准测试集

Kaiqi Liu, Haoxuan Zeng, Jingqi Liu, Jiacong Fang, Ziqi Cai, Yunyao Mao, Henglin Liu, Yu Sheng, Shuchen Weng, Boxin Shi

机构 * BAAI(北京智源人工智能研究院) PKU(北京大学) Kling THU(清华大学) USTC(中国科学技术大学)

AI总结 该研究针对现有基准无法捕捉流式音视频生成特性的问题,推出首个综合基准StreamAV-Bench,构建含双赛道的评估框架并评估13个系统,揭示当前模型的缺陷并给出模型开发见解。

详情

展开后加载摘要…

URL PDF HTML 收藏