arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanjing University(南京大学)

共收录 1182
2608.16887 2026-08-18 cs.CV 新提交

An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models

像素空间文本到图像扩散模型训练的实证研究

Dengyang Jiang, Ruoyi Du, Zhennan Chen, Dongyang Liu, Zanyi Wang, Mingzhe Zheng, Xiangpeng Yang, Huanqia Cai, Aiming Hao, Yuming Jiang, Peng Gao, Harry Yang, Steven Hoi

机构 * Alibaba Token Hub(阿里巴巴令牌中心) Alibaba Group(阿里巴巴集团) Nanjing University(南京大学) University of California San Diego(加利福尼亚大学圣迭戈分校)

AI总结 本文通过实证研究提出潜空间到像素空间的训练策略,确定关键设计选择,使像素空间文本到图像扩散模型性能媲美或超越潜空间模型,且推理加速3.18至4.75倍,为相关研究提供实用指南。

Comments Z-Image-Pixel & Empirical Insight of Training Pixel-Space Diffusion Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16700 2026-08-18 cs.LG cs.AI 新提交

Learning to Unlearn: Machine Unlearning via Learning the Unlearning Behaviors

学习遗忘:通过学习遗忘行为实现机器遗忘

Hang Zhang, Kaifeng Zhang, Yixiao Ma, Weijie Xu, Ye Zhu, Kai Ming Ting

机构 * State Key Laboratory for Novel Software Technology Nanjing University(南京大学计算机软件新技术国家重点实验室) Centre for Cyber Resilience and Trust Deakin University(迪肯大学网络韧性与信任中心)

AI总结 该研究提出模型不可知的学习遗忘方法L2UL,通过从分布视角学习遗忘行为替代手动设计遗忘函数,在数据密集场景及ResNet等大模型上,实现与重新训练相当的准确率且效率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16345 2026-08-18 cs.LG 新提交

Task-Anchored Representation Shaping for Pre-Trained Model-Based Continual Learning

面向预训练模型的持续学习的任务锚定表示塑造

Zhiming Xu, Huiyu Yi, Zhen-Hao Xie, Baile Xu, Furao Shen, Jian Zhao, Suorong Yang

机构 * Nanjing University(南京大学)

AI总结 该研究针对预训练模型持续学习中的跨任务歧义瓶颈,提出TAILS模块,通过任务锚点修正特征表示,以轻量开销提升分类与任务推理性能。

Comments 7pages, 4figures, 5tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16333 2026-08-18 cs.CL cs.AI 新提交

Step-Level On-Policy Distillation: Interpolating Between On-Policy Distillation and Supervised Fine-Tuning

步骤级在线策略蒸馏:在线策略蒸馏与监督微调的插值方法

Changhui Sun, Lanbo Liu, Hang Lei, Tong Ling, Jiahang Xie, Zhiyong Zheng, Yujia Wang, Hao Liu, Feng Xiao, Lu Liu, Yanlong Du, Zifeng Cheng, Ziwei Jiang, Qing Gu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学现代软件技术国家重点实验室) XingYun Lab, HUJING Digital Media & Entertainment Group(星云实验室,沪景数字媒体娱乐集团) University of Chinese Academy of Sciences(中国科学院大学) School of Data Science, Fudan University(复旦大学数据科学学院)

AI总结 该研究针对令牌级在线策略蒸馏的局限,提出步骤级在线策略蒸馏SOPD,结合监督微调与在线策略蒸馏的优势,在推理和智能体任务上显著优于传统方法,为蒸馏研究提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14652 2026-08-18 cs.LG cs.AI cs.CV 新提交

Pushing the Limits of High-Resolution Weather Forecasting through Data Scaling

通过数据缩放推动高分辨率天气预报的极限

Yang Zhao, Peisong Niu, Tian Zhou, Ziqing Ma, Guanlong Ma, Rong Jin, Huiling Yuan, Liang Sun

机构 * State Key Laboratory of Severe Weather Meteorological Science and Technology, Nanjing University(南京大学灾害性天气气象科技国家重点实验室) School of Atmospheric Science, Nanjing University(南京大学大气科学学院) Ant Healthcare, Ant Group(蚂蚁集团蚂蚁医疗) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院)

AI总结 该研究针对高分辨率天气预报的 data bottleneck,提出BaguanHR框架,通过变量级超分辨率合成高分辨率数据,使预报性能超越现有方法,且数据量与预报误差呈幂律关系。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02765 2026-08-18 cs.LG 版本更新

Free-Flow Class-Incremental Learning: Towards Robust CIL under Variable Class Arrivals

迈向自由流类增量学习的现实性

Zhiming Xu, Baile Xu, Jian Zhao, Furao Shen, Suorong Yang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) Department of Computer Science and Technology, Nanjing University, China(南京大学计算机科学与技术系) School of Electronic Science and Engineering, Nanjing University, China(南京大学电子科学与工程学院)

AI总结 本文提出自由流类增量学习(FFCIL)框架,通过类均值目标和方法调整提升鲁棒性,解决现实场景中类增量学习的挑战。

Comments 7pages, 5figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05513 2026-08-18 cs.RO cs.AI 版本更新

DECO: Decoupled Multimodal Diffusion Transformer for Bimanual Dexterous Manipulation with a Plugin Tactile Adapter

DECO:解耦多模态扩散变压器用于配备插件触觉适配器的双臂灵巧操作

Xukun Li, Yu Sun, Lei Zhang, Bosheng Huang, Yibo Peng, Yuan Meng, Haojun Jiang, Shaoxuan Xie, Guocai Yao, Alois Knoll, Zhenshan Bing, Xinlong Wang, Zhenguo Sun

机构 * Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院) School of Computation, Information and Technology, Technical University of Munich, Garching, Germany(慕尼黑技术大学计算与信息学院) Department of Shenyang Institute of Computing Technology, University of Chinese Academy of Sciences, Beijing, China(中国科学院沈阳计算技术研究所部门) State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家重点实验室) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)

AI总结 DECO通过解耦多模态输入和触觉适配器,实现了双臂灵巧操作的高效整合与高成功率

Comments 25 pages, 8 figures. Project Page: https://baai-humanoid.github.io/DECO-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14227 2026-08-17 cs.AI cs.CE cs.LG 新提交

Attributing Preprocessing Invariance in Spectral Foundation Models

归因于光谱基础模型中的预处理不变性

Dongjun Wei, Hongyi Wu, Yinuo Zou

机构 * ESCP Business School(ESCP商学院) OpluxCare Co., Ltd.(欧普乐康护理有限公司) The University of Hong Kong(香港大学) Nanjing University(南京大学)

AI总结 该研究以拉曼光谱基础模型为例,指出其声称的预处理不变性多源于归一化而非学习,多数系统的归一化已消除相关变换,训练编码器未带来显著增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13113 2026-08-14 cs.CV cs.AI 新提交

EgoMonth: A Month-Level Egocentric Video Benchmark for Long-Term Spatiotemporal Memory

EgoMonth:面向长期时空记忆的月级自我中心视频基准

Weitao Chen, Hu Jiaxin, Xie Tianyidan, Yang Li, Yuyi Qian, Banghao Xu, Ziheng Tang, Shenyi Wang, Mingyue Yu, Duo Li, Jiacheng Shi, Gao Wang, Zhan Xu, Zhicheng Qiu, Xuanfu Li, Jian Yang, Lanjun Wang, Zili Yi

机构 * Nanjing University(南京大学) Huawei Technologies Co., Ltd.(华为技术有限公司) Tianjin University(天津大学)

AI总结 研究人员推出首个月级自我中心视频基准EgoMonth,评估发现当前主流MLLMs的长期时空记忆能力远逊于人类,仅为有损总结器而非忠实记忆器。

Comments 21 pages, 4 figures, 6 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05498 2026-08-14 cs.RO 版本更新

JailWAM: Jailbreaking World Action Models in Robot Control

JailWAM: 在机器人控制中对World Action Models进行劫持

Hanqing Liu, Songping Wang, Jiahuan Long, Jiacheng Hou, Jialiang Sun, Chao Li, Yang Yang, Wei Peng, Xu Liu, Tingsong Jiang, Yao Mu, Wen Yao

机构 * MoE key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部重点实验室) PR Lab, Nanjing University(南京大学PR实验室) Defense Innovation Institute, Chinese Academy of Military Science(军事科学院国防创新研究院)

AI总结 本文提出JailWAM框架,通过三级安全分类体系和三个核心组件,系统评估WAM的安全性,实验表明其能有效暴露物理漏洞,攻击成功率高达84.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03181 2026-08-14 cs.RO cs.CV 版本更新

SpatialVAM:Spatial-Aware Multi-View Video Diffusion as a Data-Efficient Robot Policy

多视角视频扩散策略:一种3D空间-时间感知的视频动作模型

Peiyan Li, Yixiang Chen, Yuan Xu, Jiabing Yang, Xiangnan Wu, Jun Guo, Nan Sun, Long Qian, Xinghang Li, Xin Xiao, Jing Liu, Nianfeng Liu, Tao Kong, Yan Huang, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges(五时代) Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学) Wuhan University(武汉大学) Nanjing University(南京大学)

AI总结 本文提出MV-VDP,通过联合建模环境的3D空间-时间状态,解决机器人操控中对3D空间结构和时间演变理解不足的问题,实现高效、鲁棒且可解释的动作执行。

Comments Updated Version; Project Website: https://spatialvam.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11820 2026-08-13 cs.CV 新提交

TD-VAD: Breaking Visual Dependence in Video Anomaly Detection with Text-Driven Learning

TD-VAD:通过文本驱动学习打破视频异常检测中的视觉依赖

Shuangqing Zhang, Lei-Lei Ma, Zhao Wang, Wen Dong, Xinyi Xu, Guo-Sen Xie, Caifeng Shan, Fang Zhao

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Artificial Intelligence Engineering, Hefei Institute of Technology(合肥工业大学人工智能工程学院) China Mobile Zijin Innovation Institute(中国移动紫金创新研究院) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)

AI总结 针对现有视频异常检测依赖视觉数据的问题,提出TD-VAD方法,利用LLM生成的文本描述训练模型,结合事件演化因果注意力模块与CLIP编码器,在XD-Violence和UCF-Crime上性能大幅优于现有方法。

Comments Accepted to ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10915 2026-08-13 cs.AI 版本更新

ComBodied Agents: a New Paradigm of Human-Centric Agentic AI

具身融合智能体:以人为中心的智能体人工智能新范式

Qianggang Ding, Xingyao Wang, Rui Feng, Zhibin Wang, Feixiang Yao, Kelong Mao, Hao Sun, Zhiyao Luo, Jiankai Tang, Lei Li, Jiadong Guo, Minheng Ni, Weicong Lin, Chenxi Yang, Hongxiang Gao, Zhenghua Chen, Yang Bai, Min Wu, Jun Cheng, Huazhu Fu, Dacheng Tao, Bang Liu

机构 * Université de Montréal(蒙特利尔大学) Mila – Quebec Artificial Intelligence Institute(米拉-魁北克人工智能研究所) Institute of Advanced Intelligence and Computing (IAIC), A*STAR(新加坡科技研究局高级智能与计算研究所) Nanjing Medical University(南京医科大学) Nanjing University(南京大学) Renmin University of China(中国人民大学) University of Cambridge(剑桥大学) University of Oxford(牛津大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong Polytechnic University(香港理工大学) Southern University of Science and Technology(南方科技大学) Southeast University(东南大学) University of Glasgow(格拉斯哥大学) Nanyang Technological University(南洋理工大学)

AI总结 该研究提出以人为中心的 Combodied Agents 新范式,整合多类智能体能力形成闭环,聚焦人类状态轨迹建模,推动智能体 AI 从任务完成转向人类持续福祉。

Comments 38 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17585 2026-08-13 cs.CV 版本更新

Pixel-Space Diffusion Transformers

像素空间扩散变换器

Renye Yan, Jikang Cheng, You Wu, Ling Liang, Wei Peng, Athanasios V. Vasilakos, Qingyu Zhao, Yu Zhang, Yimao Cai, Kilian M. Pohl, Guoying Zhao

机构 * Peking University(北京大学) Nanjing University(南京大学) Stanford University(斯坦福大学) Cornell University(康奈尔大学) University of Oulu(奥卢大学)

AI总结 本文探讨像素空间扩散变换器,针对潜在扩散模型的局限,研究直接对原始像素建模的像素空间扩散方法,介绍其在高维建模中的挑战与多模态建模优势,从多方面回顾pDiTs,总结方法、识别挑战并展望未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11167 2026-08-12 cs.CV cs.CL cs.LG 新提交

MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment

多模态代码切换:将视觉对象交织入语言以实现显式对象级对齐

Changhao Xiang, Shangyu Xing, Zhen Wu, Jianbing Zhang, Xinyu Dai

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

AI总结 针对现有多模态大语言模型的图像级对齐存在指称歧义的问题,提出多模态代码切换(MMCS)范式,构建含77.3万样本的数据集,仅用5万样本即可匹配或超越60万图像-文本对训练的模型,提升了视觉基础与感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10500 2026-08-12 cs.CV 新提交

DSAR: Dual-Stream Autoregressive Modeling of Temporal Cloth Dynamics for Photorealistic Animatable Avatars

DSAR:用于生成逼真可动画化虚拟化身的布料时序动力学双流自回归建模

Haozhong Xiong, Yao Yu, Yu Zhou, Sidan Du

机构 * Nanjing University(南京大学)

AI总结 本文提出DSAR双流自回归框架,显式建模布料时序因果结构,解决现有方法布料动力学捕捉不足问题,在多方面性能获显著提升。

Comments Accepted to ECCV 2026. 25 pages, 7 figures, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10438 2026-08-12 cs.AI 新提交

Continuous Interaction Diffusion: A Diffusion-Native Runtime for Asynchronous Tool-Augmented Reasoning

连续交互扩散:面向异步工具增强推理的原生扩散运行时

Yuhang Cao

机构 * Nanjing University(南京大学)

AI总结 针对扩散语言模型异步工具增强推理的局限,提出连续交互扩散架构,将工具交互整合至迭代去噪,可提升效率并减少冗余,首次聚焦只读工具。

Comments 15 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08594 2026-08-12 cs.AI 版本更新

SDDBMs: Soft Denoising Diffusion Bridge Models

SDDBMs:软去噪扩散桥模型

Shiyi Qi, Kun He, Mingmou Liu

机构 * Nanjing University(南京大学) Renmin University of China(中国人民大学)

AI总结 本文提出SDDBMs,一种正则化扩散桥的通用框架,以非退化高斯终端边际替代硬端点约束,涵盖现有多种扩散桥模型,图像修复实验显示其数值稳定性与生成质量更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11611 2026-08-12 cs.AI 版本更新

CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG

CuSearch:通过搜索深度进行课程展开采样以实现代理RAG

Jianghan Shen, Siqi Luo, Xinyu Cheng, Jing Xiong, Yue Li, Jiyao Liu, Jiashi Lin, Yirong Chen, Junjun He

机构 * Nanjing University(南京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学) University of Hong Kong(香港大学)

AI总结 本文提出CuSearch,通过搜索深度贪心分配策略改进代理RAG训练,提升检索监督密度,实验显示在ZeroSearch上性能提升达11.8个精确匹配点。

Comments The paper has been accepted by COLM 2026. Code: https://github.com/MrToser/CuSearch

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09011 2026-08-11 cs.LG 新提交

Dynamic Distribution-Aware Uncertainty Tracking in Vision-Language Representation Learning

视觉-语言表示学习中的动态分布感知不确定性跟踪

Ao Zhou, Zhiwei Jiang, Zifeng Cheng, Cong Wang, Shufan Yang, Haoru Chen, Qing Gu

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ByteDance Inc(字节跳动公司)

AI总结 针对视觉-语言模型事后不确定性量化方法忽略测试分布动态性的问题,提出DDA-UQ框架,通过高斯混合模型建模嵌入空间,实现动态不确定性估计,性能优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09006 2026-08-11 cs.CV cs.AI 新提交

SignLlama: Enhancing Gloss-free Sign Language Translation by Prioritizing Visual Features for LLMs

SignLlama:通过优先考虑视觉特征增强无词素手语翻译的大语言模型

Shiwei Gan, Xiao Liu, Yafeng Yin, Zhiwei Jiang, Bowen Guo, Lie Xie, Sanglu Lu, Hongkai Wen

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) University of Warwick(华威大学)

AI总结 该研究针对无词素手语翻译(GFSLT)中LLMs的视觉特征利用问题,提出SignLlama模型,通过过滤伪词素CTC预训练与视觉优先蒸馏策略,在多数据集上取得极具竞争力的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07948 2026-08-11 cs.CV 新提交

SynVAR: Synergizing Spatial and Semantic Alignment in Visual Autoregressive Model

SynVAR:在视觉自回归模型中协同空间与语义对齐

Zhennan Chen, Tianxing Shi, Pengcheng Xu, Kepan Nan, Qian Wang, Zili Yi, Jian Yang, Ying Tai

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Western University(西安大略大学) JIUTIAN Research, CMCC, China(中国移动通信集团九天研究)

AI总结 本文提出首个专为视觉自回归模型(VAR)定制的无训练增强框架SynVAR,通过空间-语义协同控制策略及三个关键组件抑制误差,显著提升了VAR的复杂场景建模能力。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07916 2026-08-11 cs.CV 新提交

SegDem: Segmentation helps Demosaicing

SegDem:分割任务助力去马赛克

Ping Chen, Xiangming Wang, Yongyong Chen, Jiezhang Cao, Kai Zhang, Jingyong Su, Jie Liu, Haijin Zeng

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Nanjing University (Suzhou)(南京大学(苏州))

AI总结 该研究提出SegDem框架,通过实例分割与跨任务解码器表示迁移,结合DINOv2共享表示空间,在单/四拜耳去马赛克任务上,于多类数据集实现不同架构下的性能稳定提升。

Comments 20 pagess

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05144 2026-08-11 cs.AI 版本更新

Argus: A General-Purpose Agentic Reasoning Runtime for Long-Horizon Tasks

Argus:面向长程推理的通用智能体运行时

Boxiu Li, Zimo Wen, Yijia Fan, Chuan Wen, Fan Yang, Hangxi Guo, Jiaao Wu, Jiachen Zhang, Junxiang Lei, Mukai Li, Ruize Tang, Runjing Gu, Shibo Hu, Sihan Chen, Sufeng Guo, Wanbo Zhang, Xian Zhang, Xiaoyu Chen, Xuanhe Zhou, Xuyao Huang, Yifei Gao, Yifei Shen, Yilin Chen, Yuheng Wu, Yuzhe Zhang, Zelong Zhao, Zhijie Deng

机构 * Microsoft(微软公司) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Nanjing University(南京大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学) Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Donghua University(东华大学)

AI总结 Argus是面向长程推理的通用智能体运行时,通过多角色协作与自进化,在多个基准测试中表现优于同类方法,还完成了实际应用任务并产出结构化轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02508 2026-08-11 cs.LG cs.CL 版本更新

RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States

RoMeRL:通过降阶效用状态平衡自进化智能体记忆中的反馈覆盖与记忆-奖励陷阱

Yi Yang, Zhennan Chen, Yihong Zhuang, Tiehan Fan, Yinan Chen, Jian Li, Jian Yang, Ying Tai

机构 * Nanjing University(南京大学) Xiamen University(厦门大学) Zhejiang University(浙江大学)

AI总结 RoMeRL通过降阶效用状态解决自进化LLM智能体记忆的反馈分散与记忆-奖励陷阱问题,在ALFWorld等基准上显著提升任务性能、降低记忆规模与LLM调用

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02501 2026-08-11 cs.RO cs.CV cs.OS 版本更新

Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots

Embodied.cpp:面向异构机器人的具身AI模型可移植推理运行时

Ling Xu, Borui Li, Hao Wu, Chuyu Han, Xiangyu Li, Mohan Hua, Shiqi Jiang, Ting Cao, Chuanyou Li, Sheng Zhong, Shuai Wang

机构 * Southeast University(东南大学) Nanjing University(南京大学) Microsoft Research(微软研究院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR))

AI总结 提出Embodied.cpp,一个基于C++的可移植推理运行时,通过五层架构支持多速率执行、延迟优先融合推理和可扩展接口,在异构机器人上高效部署VLA和世界动作模型。

Comments 18 pages, 2 figures, Project website: https://github.com/SEU-PAISys/Embodied.cpp

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21629 2026-08-11 cs.PL cs.AI cs.CL cs.LG 版本更新

Quokka: Accelerating Program Verification with LLMs via Invariant Synthesis

Quokka:通过不变式合成加速程序验证

Anjiang Wei, Tianran Sun, Tarun Suresh, Haoze Wu, Ke Wang, Alex Aiken

机构 * Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amherst College(阿默斯特学院) Nanjing University(南京大学)

AI总结 Quokka通过利用大语言模型生成有用的循环不变式,提升程序验证效率,其评价导向框架在多个模型家族中表现出色,优于现有基于LLM的验证器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05940 2026-08-11 cs.CL 版本更新

R3S: Refining and Recovering Reinforcement Signals for Multilingual Understanding and Reasoning

通过翻译-推理联合训练实现自我改进的多语言长推理

Junxiao Liu, Zhijun Wang, Yixiao Li, Zhejian Lai, Liqian Huang, Xin Huang, Xue Han, Junlan Feng, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) University of Tübingen(图宾根大学) China Mobile Communications Company Limited Research Institute(中国移动通信集团有限公司研究院)

AI总结 TRIT通过整合翻译训练提升多语言长推理能力,在MMATH上超越基线7个百分点,提升答案正确性和语言一致性。

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11480 2026-08-11 cs.CL cs.AI cs.PF cs.PL cs.SE 版本更新

SuperCoder: Assembly Program Superoptimization with Large Language Models

SuperCoder:基于大语言模型的汇编程序超优化

Anjiang Wei, Tarun Suresh, Huanmi Tan, Yinglun Xu, Gagandeep Singh, Ke Wang, Alex Aiken

机构 * Stanford University(斯坦福大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学) Nanjing University(南京大学)

AI总结 SuperCoder利用大语言模型实现汇编程序超优化,通过强化学习微调后,正确性达95%且平均速度提升1.46倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07045 2026-08-10 cs.RO cs.CV 新提交

C2Dex: Contact-Consistent Reconstruction and Retargeting for Dexterous Manipulation from Monocular Video

C2Dex:基于单目视频的接触一致性重建与灵巧操作重定向

Jie Ren, Zhehao Jiang, Yinhong Yang, Haorui Jia, Han Jiang, Ben Li, Yao Yao, Cheng Lin, Qiu Shen, Zhenshan Bing, Xiao-Xiao Long, Xun Cao

机构 * Nanjing University(南京大学) China Mobile Research Institute(中国移动研究院)

AI总结 C2Dex是基于单目视频的灵巧操作框架,通过聚合物体侧稳定接触实现HOI重建与手物几何保留,在DexYCB、TACO上的轨迹成功率显著优于基线,且真实机器人复现可行。

Comments 9 pages, 5 figures. Submitted to IEEE Robotics and Automation Letters (RA-L). Project page: https://k-jie.github.io/C2Dex/

详情

展开后加载摘要…

URL PDF HTML 收藏