arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Huazhong University of Science and Technology(华中科技大学)

2026-08-25 至 2026-08-25 共收录 10
2608.22990 2026-08-25 cs.RO 新提交

InstructMove: A Text-Indispensable Benchmark for Instruction-Following Manipulation

InstructMove:一种指令跟随操作的文本不可或缺基准

Mengao Zhao, Ziang Li, Chaodong Huang, Mengchen Ma, Haoyi Jiang, Yiwei Jin, Xinjie Wang, Yun Du, Xuewu Lin, Taojun Ding, Hongyu Xie, Jackson Jiang, Chunlei Yu, Kaihua Zhang, Lichao Huang, Liu Liu, Tianwei Lin, Zhizhong Su

机构 * Horizon Robotics(地平线机器人) WuwenAI(悟文智能) Southeast University(东南大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 针对现有操作基准无法充分检验机器人指令跟随能力的问题,提出文本不可或缺的InstructMove基准,将指令跟随分解为多环节,实验表明其可诊断视觉捷径且模拟数据能提升现实操作性能。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22858 2026-08-25 cs.LG cs.CV 新提交

Mapping the Concept Landscape: Structural Perception of Global Distributions for Transparent Data Pruning

概念图谱绘制:面向透明数据剪枝的全局分布结构感知

Dongyue Wu, Tao Ma

机构 * Huazhong University of Science and Technology(华中科技大学) Ant Group(蚂蚁集团) Chinese Academy of Sciences(中国科学院)

AI总结 该研究提出Mapping the Concept Landscape框架,以样本级图刻画语义概念全局分布,开发贪心概念覆盖最大化算法,实现更优数据剪枝效率并提供可解释的审计轨迹。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22760 2026-08-25 cs.CV 新提交

ByteAction: Byte-space Action Recognition Foundation Model

ByteAction:字节空间动作识别基础模型

Fangcheng Li, Zhen Yu, Kejun Wu, Qiong Liu, You Yang

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院)

AI总结 本文提出ByteAction这一字节空间动作识别基础模型,采用双视图字节级识别框架,结合比特流模式增强与损坏一致性训练,在多数据集上实现了优异的比特流损坏鲁棒性与动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21883 2026-08-25 cs.CV 新提交

VIG: Visual Information Gain as a Reward Signal for Multimodal Chain-of-Thought Compression

VIG:作为多模态思维链压缩奖励信号的视觉信息增益

Wen Luo, Xiaohan Yi, Xiaotao Huang, Liqun Huang

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) Tsinghua University(清华大学)

AI总结 该研究提出VIG奖励机制,通过提升视觉信息密度优化多模态CoT的准确率与效率权衡,无需额外资源,在多类基准及不同规模模型上均有效。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27504 2026-08-25 cs.CV 版本更新

ReWorld: Representation Learning for World Action Models

ReWorld:为世界动作模型学习更好的表示

Tianze Xia, Lijun Zhou, Kaixin Xiong, Jingfeng Yao, Zhenxin Zhu, Haiyang Sun, Bing Wang, Guang Chen, Wenyu Liu, Hangjun Ye, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米汽车)

AI总结 提出ReWorld框架,通过优化中间表示(未来预测监督、跨模态对齐、难负样本监督)提升自动驾驶世界动作模型的规划性能,在nuScenes和NAVSIM上取得显著提升。

Comments 15 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29708 2026-08-25 cs.CL 版本更新

RASET: Router-Agnostic Safety-Critical Expert Tuning Exposes Localized Safety Enforcement Failures in Mixture-of-Experts LLMs

理解混合专家大语言模型中的安全敏感专家行为

Zhibo Zhang, Yuxi Li, Zhen Ouyang, Ling Shi, Kailong Wang

机构 * Huazhong University of Science and Technology, Wuhan, China(华中科技大学,武汉,中国) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

AI总结 通过提出RASET框架,研究混合专家大语言模型中安全对齐与路由专家专业化之间的关系,发现路由模式主要由主题驱动,而安全行为可通过调整少数专家改变而不影响路由路径。

Comments 20 pages, 4 figures. Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26917 2026-08-25 cs.CV 版本更新

AnimateAnyMesh++: A Flexible Feed-Forward Framework for High-Fidelity Text-Driven Mesh Animation

AnimateAnyMesh++: 一种灵活的4D基础模型用于高质量文本驱动的网格动画

Zijie Wu, Chaohui Yu, Fan Wang, Xiang Bai

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) DAMO Academy, Alibaba Group(阿里巴巴达摩院) Hupan Lab, Hangzhou, China(湖畔实验室) School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院)

AI总结 本文提出AnimateAnyMesh++,通过扩展数据集、改进架构和生成能力,实现高质量文本驱动的网格动画,提升了轨迹重建和几何保真度。

Comments 15 pages, TPAMI 2026 accepted, code url: this https URL (https://github.com/JarrentWu1031/AnimateAnyMesh-pp)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29902 2026-08-25 cs.AI 版本更新

ATP-Bench: Towards Agentic Tool Planning for MLLM Interleaved Generation

ATP-Bench: 向多模态大语言模型交错生成的代理工具规划迈进

Yinuo Liu, Zi Qian, Heng Zhou, Jiahao Zhang, Yajie Zhang, Zhihang Li, Mengyu Zhou, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴通义千问大模型应用团队) Huazhong University of Science and Technology(华中科技大学) Zhejiang University(浙江大学)

AI总结 针对多模态大语言模型交错生成中事实性与创造性难以统一的问题,提出ATP-Bench基准,包含7702个问题-答案对,评估代理工具规划能力,揭示模型在交错规划中的不足。

Comments Accepted at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14617 2026-08-25 cs.LG 版本更新

HD3C: Efficient Medical Data Classification for Edge Devices

HDC-X:面向嵌入式设备的高效医疗数据分类

Jianglan Wei, Zhenyu Zhang, Pengcheng Wang, Mingjie Zeng, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出HDC-X框架,通过高维超向量编码和聚类原型聚合,实现低功耗医疗数据分类,在心脏病声音分类中比贝叶斯ResNet节能350倍,且具备抗噪声和数据限制的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07758 2026-08-25 cs.LG 版本更新

Rényi Sharpness: A Novel Sharpness that Strongly Correlates with Generalization

Rényy锐度:一种与泛化性强相关的新型锐度

Qiaozhe Zhang, Jun Sun, Ruijie Zhang, Yingzhuang Liu

机构 * School of Electronic Information and Communications(电子信息与通信学院) Huazhong University of Science and Technology(华中科技大学)

AI总结 针对现有锐度与神经网络泛化性相关性弱的问题,本文提出Rényi锐度,其与泛化性强相关,还建立了相关泛化界,提出的RSAM算法性能优于传统SAM。

详情

展开后加载摘要…

URL PDF HTML 收藏