arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

2026-09-01 至 2026-09-01 共收录 25
2608.26583 2026-09-01 cs.RO 版本更新

SOLO: Stable Omni-terrain Long-Horizon Perceptive Humanoid Locomotion

SOLO:稳定全地形长视距感知类人机器人运动

Pihai Sun, Gang Han, Jingkai Sun, Jiahao Ma, Zeran Su, Zelin Tao, Peiran Liu, Shuai Shi, Wei Cui, Zifan Wang, Jialin Yu, Wen Zhao, Kangning Yin, Jiaxu Wang, Jiahang Cao, Lingfeng Zhang, Hao Cheng, Jian Tang, Qiang Zhang, Yijie Guo

机构 * Artificial General Intelligence Institute, University of Science and Technology of China(中国科学技术大学通用人工智能研究院) X-Humanoid(X-人形机器人) The University of Hong Kong(香港大学) The Australian National University(澳大利亚国立大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

AI总结 SOLO是解决长视距类人机器人运动脆弱性的统一框架,通过QR与TA-MSE蒸馏提升地形感知与策略学习,仿真及实际测试中通行成功率显著优于基线方法,可零样本完成长距离复杂地形任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24109 2026-09-01 cs.GR cs.CV 版本更新

ExMesh++: From Multi-View Images to Relightable UV-PBR Mesh Assets via Topology-Adaptive Reconstruction and Decomposition

ExMesh++:通过拓扑自适应重建与分解从多视图图像生成可重光照UV-PBR网格资产

Chuanjin Fan, Lifan Wu, Wenjie Chang, Hanzhi Chang, Wenfei Yang, Tianzhu Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团)

AI总结 ExMesh++是一种分阶段框架,通过拓扑自适应重建与分解,从多视图图像生成可重光照UV-PBR网格资产,在几何精度、重光照性能上表现优异,导出资产可直接用于标准DCC工作流。

Comments Project page: https://fan-treasure.github.io/ExMeshpp_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20687 2026-09-01 cs.CV cs.GR 版本更新

TopoSurfel: Closing the Loop between Gaussian Surfels and Meshes for Surface Reconstruction

TopoSurfel:闭合高斯面元与网格间的循环以实现表面重建

Chuanjin Fan, Wenjie Chang, Bohao Liao, Yujia Chen, Wenfei Yang, Tianzhu Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Deep Space Exploration Laboratory(深空探测实验室)

AI总结 针对3D高斯溅射直接提取高保真表面易产生伪影和浮点数的问题,提出闭合高斯面元与网格循环的TopoSurfel框架,通过动态生成代理网格及相关策略实现高质量表面重建与新视图合成。

Comments Project page: https://fan-treasure.github.io/TopoSurfel_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11318 2026-09-01 cs.LG cs.AI 版本更新

Terminal Symmetry as a Carrier of Asymmetric Process Knowledge: Statewise Refinement for Anytime Verified Construction

终端对称性作为决策资源:用于任何时间验证构造的状态细化

Yi Liu

机构 * School of Astronomy and Space Science(天文与空间科学学院) University of Science and Technology of China(中国科学技术大学)

AI总结 该研究提出将终端对称性作为定向顺序构造的可复用决策资源,提出“传递—细化—验证”方法,经多任务实验,其状态级刷新提升了 AUC,且在 GRN 场景中验证器成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08103 2026-09-01 cs.LG 版本更新

Support Selection Beyond Smooth DAG Exactness: Completion Geometry,Score Margins, and Selective Certificates

超越平滑DAG精确性的支持选择:完备几何、得分边际与选择性证书

Rui Wu, Zongyuan Chen, Hong Xie, Defu Lian, Enhong Chen

机构 * School of Computer Science and Engineering, University of Science and Technology of China(中国科学技术大学计算机科学与工程学院)

AI总结 该研究针对超越平滑DAG精确性的支持选择,推导了孤立环精确选择时间,验证了相关规律,提出无真值分离统计量预测选择时间,用父集置信族等证明标签,区分DAG可行性等内容。

Comments 49 pages, 17 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14088 2026-09-01 cs.CV 版本更新

VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders

VideoRAE:通过表示自动编码器驯服用于生成建模的视频基础模型

Zhihao Xie, Junfeng Wu, Xinting Hu, Junchao Huang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huazhong University of Science and Technology(华中科技大学) Shenzhen Loop Area Institute(深圳河套学院) University of Science and Technology of China(中国科学技术大学)

AI总结 研究视频生成模型潜在空间问题,提出VideoRAE,利用冻结视频基础编码器特征经1D自注意力投影仪压缩,支持多种潜在空间,通过多码本高维量化等实现强大重建,收敛快,验证了冻结VFM表示的有效性。

Comments Home page: https://zhxie0117.github.io/VideoRAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01777 2026-09-01 eess.SP cs.AI 版本更新

Scene-Conditioned PINN-GNN for Multipath RF Maps: Cross-Scene Generation and In-Scene Completion

场景条件PINN-GNN用于多径射频地图:跨场景生成与场景内补全

Lizhou Liu, Xiaohui Chen, Zihan Tang, Mengyao Ma, Wenyi Zhang

机构 * Department of Electronic Engineering and Information Science, University of Science and Technology of China(电子工程与信息科学系,中国科学技术大学) Wireless Technology Lab, Huawei(华为无线技术实验室)

AI总结 提出基于物理信息神经网络和图神经网络的统一射频地图构建框架,支持跨场景生成和场景内补全,采用峰值加权动态时间弯曲度量评估多径重建质量,实验表明优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02290 2026-09-01 cs.CV 版本更新

DisciplineGen-1M: A Large-Scale Dataset for Multidisciplinary Visual Generation and Editing

DisciplineGen-1M:用于多学科视觉生成与编辑的大规模数据集

Zhaokai Wang, Mingxin Liu, Zirun Zhu, Ziqian Fan, Yiguo He, Mohan Zhang, Leyao Gu, Yan Li, Xiangyu Zhao, Ning Liao, Shaofeng Zhang, Xuanhe Zhou, Zhihang Zhong, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) South China University of Technology(华南理工大学) Xiamen University(厦门大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出百万级多学科数据集DisciplineGen-1M,涵盖10个学科,通过可扩展框架构建,并基于此开发学科感知推理生成模型,在学科和通用推理基准上显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16417 2026-09-01 cs.SD eess.AS 版本更新

Joycent: Multi-Accent TTS via Disentangled Accent Modeling and Layer-Specific Conditioning

Joycent: 基于扩散的口音语音合成,无需口音音素预测

Xintong Wang, Junchuan Zhao, Ye Wang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出Joycent,一种基于扩散模型的口音TTS方法,直接从标准音素序列和语音参考合成口音语音,无需口音音素预测,通过条件层归一化集成口音和说话人表征,并引入WhisAID口音识别模型,在保持说话人身份的同时提升口音自然度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15932 2026-09-01 cs.CL 版本更新

Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence

超越NL2Code:多模态代码智能的结构化综述

Xuanle Zhao, Qiushi Sun, Jingyu Xiao, Xuexin Liu, Haoyue Yang, Qiaosheng Chen, Xianzhen Luo, Jing Huang, Yufeng Zhong, Lei Chen, Shuai Fu, Zhenlin Wei, Jinhe Bi, Lei Jiang, Haibo Qiu, Siqi Yang, Peng Shi, Jian Hu, Zhixiong Zeng

机构 * Meituan(美团) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) Ludwig Maximilian University of Munich(慕尼黑大学) University of Science and Technology of China(中国科学技术大学) Queen Mary University of London(伦敦玛丽女王大学)

AI总结 本文系统综述多模态代码智能,将任务按代码角色分类,覆盖GUI、科学可视化、结构化图形及前沿任务,并提出四个基于验证的未来方向。

Comments Accepted by TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14636 2026-09-01 cs.LG 版本更新

Learning Generated Controls under Fractured Geometry: Projective Residualization and Variation-Allocation Frontiers

用于控制函数工具变量的图扩散残差

Rui Wu, Zongyuan Chen, Hong Xie, Defu Lian, Enhong Chen

机构 * School of Computer Science and Engineering, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院)

AI总结 提出自适应各向异性工具热流(A-IHF),一种基于图扩散的残差提取方法,用于灵活控制函数,通过检测处理跳跃并调整图传导性,在合成基准测试中优于多种基线方法。

Comments 86 pages, 9 figures, including supplementary material. Revised version; submitted to Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13368 2026-09-01 cs.AI cs.CV 版本更新

IterCAD: An Iterative Multimodal Agent for Visually-Grounded CAD Generation and Editing

IterCAD:一种用于视觉引导的CAD生成与编辑的迭代多模态智能体

Tao Hu, Jiaxin Ai, Licheng Wen, Xueheng Li, Shu Zou, Siqi Li, Nianchen Deng, Xinyu Cai, Hongbin Zhou, Pinlong Cai, Daocheng Fu, Yu Yang, Hairong Zhang, Botian Shi, Xuemeng Yang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出IterCAD,一种闭环交互式CAD生成与编辑的多模态智能体框架,通过渐进式SFT和几何感知强化学习优化,在代码可执行性和几何精度上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13061 2026-09-01 cs.CV 版本更新

LaME: Learning to Think in Latent Space for Multimodal Embedding via Information Bottleneck

LaME: 通过信息瓶颈在潜在空间中进行多模态嵌入的推理学习

Peixi Wu, Biao Yang, Feipeng Ma, Bosong Chai, Bo Lin, Wei Yuan, Fan Yang, Tingting Gao, Hebei Li, Xiaoyan Sun

机构 * University of Science and Technology of China(中国科学技术大学) Kuaishou Technology(快手科技) Zhejiang University(浙江大学) Tsinghua University(清华大学)

AI总结 提出LaME方法,将面向嵌入的潜在推理建模为弱监督信息瓶颈,使用可学习推理令牌在单次前向传播中完成推理,避免显式CoT的高计算成本和标注依赖,实现60倍加速。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07288 2026-09-01 cs.CV cs.GR 版本更新

ExMesh: Explicit Mesh Reconstruction with Topology Adaptation

ExMesh: 具有拓扑自适应的显式网格重建

Chuanjin Fan, Lifan Wu, Wenjie Chang, Hanzhi Chang, Wenfei Yang, Tianzhu Zhang

机构 * University of Science and Technology of China(中国科学技术大学) National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory(国家空间科学探测重点实验室,深空探测实验室)

AI总结 提出ExMesh框架,通过可微优化与离散拓扑更新直接优化显式网格,引入自适应顶点分裂合并和实时UV维护,实现从粗到细的优化,兼顾精度、效率和网格简洁性。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026 (CVPR 2026); Project page: https://fan-treasure.github.io/ExMesh_page.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06892 2026-09-01 cs.LG 版本更新

GRASP: Geometry-aware Residual Alignment for Scalable Pretraining Data Attribution

GRASP:面向可扩展预训练数据归因的几何感知残差对齐

Yue Min, Ruining Chen, Yujun Li

机构 * Wizard Quant University of Science and Technology of China(中国科学技术大学)

AI总结 提出GRASP方法,通过二次几何惩罚建模子集交互,结合低维特征草图与有限置信度选择协议,实现可扩展的预训练数据归因,显著提升反事实子集保真度并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30117 2026-09-01 cs.AI 版本更新

VLA-Trace: Diagnosing Vision-Language-Action Models through Representation and Behavior Tracing

VLA-Trace: 通过表示与行为追踪诊断视觉-语言-动作模型

Haoyuan Shi, Xiancong Ren, Yingji Zhang, Qinfan Zhang, Jiayu Hu, Haozhe Shan, Han Dong, Jinpeng Lu, Yinda Chen, Yi Zhang, Yong Dai, Xiaozhu Ju

机构 * University of Science and Technology of China(中国科学技术大学) University of Manchester(曼彻斯特大学) Beihang University(北航) Fudan University(复旦大学) University of New South Wales(新南威尔士大学)

AI总结 提出VLA-Trace诊断框架,通过表示演化、因果控制归因和行为表现分析,揭示VLA模型在多模态知识向具身控制转化中的机制,发现不同模型在微调适应、多模态路由和语义遵循上的差异与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27995 2026-09-01 cs.AI 版本更新

AsyncTool: Evaluating the Asynchronous Function Calling Capability under Multi-Task Scenarios

AsyncTool: 多任务场景下异步函数调用能力的评估

Kou Shi, Ziao Zhang, Shiting Huang, Avery Nie, Zhen Fang, Qiuchen Wang, Lin Chen, Huaian Chen, Zehui Chen, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) University of Toronto(多伦多大学)

AI总结 提出AsyncTool基准,通过模拟工具响应延迟的多任务环境,评估基于大语言模型的智能体在异步工具调用中的任务协调与效率。

Comments https://github.com/StoKou/repo-asynctool

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14712 2026-09-01 cs.RO cs.AI cs.CL cs.CV 版本更新

IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation

IntentVLA:用于有歧义机器人操作的短周期意图建模

Shijie Lian, Bin Yu, Xiaopeng Lin, Zhaolong Shen, Laurence Tianruo Yang, Yurun Jin, Haishan Liu, Changti Wu, Hang Yuan, Cong Huang, Kai Chen

机构 * HUST(华中科技大学) ZGCA(中钢集团人工智能研究院) ZGCI(中钢智能科技有限公司) HIT(哈尔滨工业大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ZZU(浙江工业大学) ECNU(华东师范大学) USTC(中国科学技术大学) DeepCybo

AI总结 IntentVLA通过编码近期视觉观测为紧凑的短周期意图表示,提升机器人操作的执行稳定性,并在多个基准测试中优于现有VLA基线。

Comments EMNLP 2026 Main Conference, Code can be found at https://github.com/ZGC-EmbodyAI/IntentVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24622 2026-09-01 cs.CV cs.AI 版本更新

CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies

CF-VLA:面向视觉-语言-动作策略的高效粗到细动作生成

Fan Du, Feng Yan, Jianxiong Wu, Xinrun Xu, Weiye Zhang, Weinong Wang, Yu Guo, Bin Qian, Zhihai He, Fei Wang, Heng Yang

机构 * Southern University of Science and Technology(南方科技大学) Xi’an Jiaotong University(西安交通大学) United Nova Technology(联合Nova技术) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出CF-VLA,通过粗到细两阶段方法优化视觉-语言-动作策略的动作生成,提升效率与性能,在低NFE条件下实现更优的效率-性能平衡。

Comments Accepted to ACM Multimedia (ACM MM) 2026 as an Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03540 2026-09-01 cs.RO 版本更新

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control

基于漂移的策略优化:面向在线机器人控制的原生一步生成策略

Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK

AI总结 本文提出一种原生一步生成策略框架,通过将迭代细化移至训练阶段,提升在线机器人控制的效率与稳定性,实验显示其在推理速度和性能上优于多步扩散策略。

Comments Accepted at the 34th ACM International Conference on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19305 2026-09-01 cs.RO cs.AI cs.CV 版本更新

PhyGile: Physics-Prefix Guided Motion Generation for Agile General Humanoid Motion Tracking

PhyGile: 面向敏捷通用人形运动跟踪的物理前缀引导运动生成

Jiacheng Bao, Haoran Yang, Yucheng Xin, Junhong Liu, Yuecheng Xu, Han Liang, Pengfei Han, Xiaoguang Ma, Dong Wang, Bin Zhao

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) Fudan University(复旦大学) ByteDance(字节跳动) Northeastern University(东北大学)

AI总结 提出PhyGile框架,通过物理前缀引导的机器人原生运动生成,结合课程混合专家训练和后训练,解决文本生成运动在机器人上物理不可行的问题,实现敏捷全身运动跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17546 2026-09-01 cs.CV 版本更新

ProGVC: Progressive-based Generative Video Compression via Auto-Regressive Context Modeling

ProGVC:基于渐进式的生成视频压缩 via 自动回归上下文建模

Daowen Li, Ruixiao Dong, Kai Li, Ying Chen, Ding Ding, Li Li

机构 * Alibaba Group(阿里巴巴集团) University of Science and Technology of China(中国科学技术大学)

AI总结 ProGVC提出一种统一渐进传输、高效熵编码和细节合成的视频压缩框架,通过多尺度自回归上下文模型实现低比特率下的高质量视频压缩与可扩展性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22187 2026-09-01 cs.CV cs.RO 版本更新

HybridWorldSim: A Scalable and Controllable High-fidelity Simulator for Autonomous Driving

HybridWorldSim: 一种可扩展且可控的高保真驾驶仿真器

Qiang Li, Yingwenqi Jiang, Tuoxi Li, Duyu Chen, Xiang Feng, Yucheng Ao, Shangyue Liu, Xingchen Yu, Youcheng Cai, Yumeng Liu, Yuexin Ma, Xin Hu, Li Liu, Yu Zhang, Linkun Xu, Bingtao Gao, Xueyuan Wang, Shuchang Zhou, Xianming Liu, Ligang Liu

机构 * XPeng Motors ShanghaiTech University(上海科技大学) University of Science and Technology of China(中国科学技术大学)

AI总结 HybridWorldSim通过整合多遍神经重建与生成模型,实现高保真驾驶仿真,提供可扩展且可控的仿真环境及新的多遍数据集MIRROR,推动自动驾驶研究。

Comments Project page: https://hybridworldsim.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09347 2026-09-01 cs.CL 版本更新

LLP: LLM-Based Product Pricing in E-commerce

LLP:基于大语言模型的电商产品定价方案

Hairu Wang, Sheng You, Qiheng Zhang, Xike Xie, Shuguang Han, Yuchen Wu, Fei Huang, Jufeng Chen

机构 * University of Science and Technology of China(中国科学技术大学) Xianyu of Alibaba(阿里巴巴闲鱼)

AI总结 针对C2C平台二手卖家定价难题,研究人员提出首个基于LLM的二手产品定价框架LLP,经两阶段优化与置信过滤后,在闲鱼部署的性能显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07289 2026-09-01 cs.LG 版本更新

MolGA: Molecular Graph Adaptation with Pre-trained 2D Graph Encoder

MolGA:基于预训练2D图编码器的分子图适应

Xingtong Yu, Chang Zhou, Xinming Zhang, Yuan Fang

机构 * Singapore Management University(新加坡管理大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本研究提出MolGA,通过分子对齐策略与条件适应机制,将预训练2D图编码器适配至下游分子应用,经11个公开数据集验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏