arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Huazhong University of Science and Technology(华中科技大学)

2026-09-01 至 2026-09-01 共收录 13
2608.29958 2026-09-01 cs.CV 新提交

RIDGE: Region-Informed Derivative-Guided Evidence Selection for Long Video Understanding

RIDGE:用于长视频理解的区域感知导数引导证据选择

Shanqing Xu, Meng Luo, Mengchen Qian, Yuhui Gao, Siyue Peng, Xiaohan Zhong, Xiaojin Zhang, Zhongyu Wei, Wei Chen, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学)

AI总结 针对长视频理解中视觉内容超出LVLM固定token预算的问题,提出RIDGE框架,通过将帧-查询相似性曲线作为时间信号划分区域并选择证据,在多基准和主干上取得最优性能。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29865 2026-09-01 cs.CL 新提交

ManGo: Manga Active Narrative Grounding Optimization

ManGo:漫画主动叙事定位优化

Hao Qiu, Junyan Wang, Zheyuan Liu, Lei Fan, Hong Jia, Lianbo Guo, Zhulin Tao

机构 * Communication University of China(中国传媒大学) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) University of New South Wales(新南威尔士大学) University of Auckland(奥克兰大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 本研究针对漫画视觉问答的分镜叙事结构问题,提出无监督框架ManGo,通过主动叙事草图结合双奖励的组相对策略训练,在标准基准上取得最优性能。

Comments 16 pages, 9 figures, 7 tables. Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29233 2026-09-01 cs.CV 新提交

Generalization over Memorization: Generalization-Aware Diffusion Adaptation for Single-Image Multi-View Synthesis

超越记忆的泛化:面向单图像多视图合成的泛化感知扩散适配

Jie Li, Xingchen Zou, Yuxuan Liang

机构 * Huazhong University of Science and Technology(华中科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本研究提出ACM MM 2026单图像多视图合成挑战赛的获奖方案GoM,通过场景不相交验证等技术,在40个训练场景下实现293支队伍中排名第一,揭示小数据生成建模中验证设计与训练轨迹控制的关键作用。

Comments ACM Multimedia 2026 Grand Challenge Track winning paper; presents the 1st-place solution among 293 registered teams. 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29160 2026-09-01 cs.CV cs.AI 新提交

Training-Free Hidden-State Refinement for Flow-Matching Image Generators

无需训练的流匹配图像生成器的隐状态优化

Yuanyi Yan, Xinzhe Rao, Canyu Shen, Yang Chen, Yunlu Chen, Meng Tang, Teng Long, Vincent Tao Hu

机构 * Huazhong University of Science and Technology(华中科技大学) Tongji University(同济大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) University of California, Merced(加州大学默塞德分校) University of Amsterdam(阿姆斯特丹大学)

AI总结 该研究提出无需训练的循环框架优化流匹配图像生成器,在不改动权重与采样器的情况下提升质量指标,Loop Guidance在Scale-RAE DiT2.4B上显著提升GenEval与DPG-Bench指标。

Comments 7pages,4 figures,5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29113 2026-09-01 cs.CV 新提交

GramLoop: Training-Free Gram-Gated Replay for Robust Dense Prediction

GramLoop:用于鲁棒密集预测的无训练Gram门控重放方法

Yang Chen, Canyu Shen, Xinzhe Rao, Yuanyi Yan, Yunlu Chen, Meng Tang, Teng Long, Vincent Tao Hu

机构 * Huazhong University of Science and Technology(华中科技大学) Tongji University(同济大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) University of California, Merced(加州大学默塞德分校) University of Amsterdam(阿姆斯特丹大学)

AI总结 该研究提出无训练框架GramLoop,通过在冻结DINOv3的视觉骨干内添加推理计算,在不改变模型结构的情况下,提升了分布偏移下目标检测和语义分割等密集预测任务的鲁棒性,在COCO-O等基准上取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28687 2026-09-01 cs.CV 新提交

FLM: Frequency-Aware Language Models for Generative Image Compression

FLM:用于生成式图像压缩的频率感知语言模型

Jiarun Chen, Kejun Wu, Li Li, Chengtao Cai, Zhengguo Li, Chia-Wen Lin

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) University of Science and Technology of China(中国科学技术大学) College of Intelligent Systems Science and Engineering, Harbin Engineering University(哈尔滨工程大学智能系统科学与工程学院) Institute for Infocomm Research, Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局信息通信研究院) National Tsing Hua University(国立清华大学)

AI总结 本研究提出频率感知语言模型FLM,通过频域概率建模实现高效图像压缩,兼容有损与无损JPEG重压缩,在多数据集上较JPEG基准获显著BD-PSNR增益,性能优于传统及生成式压缩方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10810 2026-09-01 cs.CL cs.AI 版本更新

Surfacing the Unsaid: CUE-Bench for Affective Stance in Chinese Discourse

揭示未明之言:面向中文话语情感立场的CUE-Bench基准

Zhenyan Zheng, Yunyao Zhang, Junxi Sheng, Junqing Yu, Zikai Song

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 针对现有情感基准缺乏情感相关要素结构化说明的问题,本文构建了以情感立场为核心的CUE Bench基准,实验证实融入情感立场可提升细粒度情感识别与语用意图检测性能。

Journal ref EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14088 2026-09-01 cs.CV 版本更新

VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders

VideoRAE:通过表示自动编码器驯服用于生成建模的视频基础模型

Zhihao Xie, Junfeng Wu, Xinting Hu, Junchao Huang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huazhong University of Science and Technology(华中科技大学) Shenzhen Loop Area Institute(深圳河套学院) University of Science and Technology of China(中国科学技术大学)

AI总结 研究视频生成模型潜在空间问题,提出VideoRAE,利用冻结视频基础编码器特征经1D自注意力投影仪压缩,支持多种潜在空间,通过多码本高维量化等实现强大重建,收敛快,验证了冻结VFM表示的有效性。

Comments Home page: https://zhxie0117.github.io/VideoRAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28791 2026-09-01 cs.CL cs.AI 版本更新

Skill-Conditioned Gated Self-Distillation for LLM Reasoning

技能条件门控自蒸馏用于大语言模型推理

Jiazhen Huang, Xiao Chen, Xiao Luo, Yong Dai, Senkang Hu, Yuzhi Zhao

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) City University of Hong Kong(香港城市大学) Huazhong University of Science and Technology(华中科技大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 提出技能条件门控自蒸馏(SGSD),通过从经验技能库中检索技能-错误对构建多教师池,并利用验证器验证教师极性,以鲁棒门控目标蒸馏信息性师生差异,在弱先验信息假设下提升数学推理性能。

Comments Accepted by EMNLP 2026 Findings. Code is available at https://github.com/walawalagoose/SGSD

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27186 2026-09-01 cs.CL 版本更新

MAIGO: Mitigating Lost-in-Conversation with History-Cleaned On-Policy Self-Distillation

MAIGO: 通过历史清理的在线策略自蒸馏缓解对话丢失

Haoyu Zheng, Yun Zhu, Shu Yuan, Shangming Chen, Qing Wang, Wenqiao Zhang, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) Fuzhou University(福州大学) Tencent(腾讯)

AI总结 针对大语言模型在多轮对话中性能下降(对话丢失)的问题,提出MAIGO方法,通过在线策略自蒸馏和清理历史助手回复来减少自污染,无需验证器或推理时辅助,显著提升多轮对话准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06387 2026-09-01 cs.LG cs.AI 版本更新

Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level

非对称在线策略蒸馏:在令牌层面弥合利用与模仿

Nan Jia, Haojin Yang, Xing Ma, Jiesong Lian, Shuailiang Zhang, Weipeng Zhang, Ke Zeng, Xunliang Cai, Zequn Sun

机构 * Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Meituan(美团)

AI总结 本文提出非对称在线策略蒸馏,通过局部散度最小化改进传统策略蒸馏,提升数学推理任务表现,实现更稳定的策略熵和持续工具使用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09703 2026-09-01 cs.CV 版本更新

ProGS: Towards Progressive Coding for 3D Gaussian Splatting

ProGS:迈向3D高斯散射的渐进编码

Zhiye Tang, Lingzhuo Liu, Shengjie Jiao, Qiudan Zhang, Junhui Hou, You Yang, Xu Wang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院)

AI总结 ProGS通过八叉树结构实现3D高斯散射的高效渐进编码,显著提升压缩效率和视觉保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15957 2026-09-01 cs.CL cs.AI cs.IR 版本更新

Learning Personalized Prompts for Healthcare Guidance

学习用于医疗指导的个性化提示

Ruize Shi, Hong Huang, Wei Zhou, Kehan Yin, Kai Zhao, Yun Zhao

机构 * Huazhong University of Science and Technology(华中科技大学) Tongji Medical College(同济医学院) Hubei Maternity and Child Health Care Hospital(湖北省妇幼保健院)

AI总结 该研究针对现有LLM医疗指导缺乏个性化的问题,提出PPL框架,利用患者自身与同类病例信息构建初始提示并经RL优化,在妇产科数据上获专家97%的偏好,可与专有LLM无缝集成。

Comments Accepted at the EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏