arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2026-08-26 至 2026-08-26 共收录 25
2608.24877 2026-08-26 cs.CV 新提交

From Seeing to Acting: Smart Glasses as First-Person Intelligence Platforms

从感知到行动:智能眼镜作为第一人称智能平台

Jiangning Zhang, Haojun Chen, Yong Liu

机构 * Zhejiang University(浙江大学)

AI总结 该综述首次以统一框架系统研究智能眼镜,提出L0-L5框架等,连接任务与多类要素,制定评估协议,为智能眼镜的可信第一人称智能发展提供路线图。

Comments Project at this https URL (https://github.com/zhangzjn/awesome-smart-glasses)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24848 2026-08-26 cs.CL 新提交

BrowserForge: Scaling Web Episode via Parallel Browser Sandboxes

BrowserForge:通过并行浏览器沙盒扩展网页交互序列数据规模

Fei Tang, Huawen Shen, Zhiqiong Lu, Zhengxi Lu, Pengyuan Lyu, Chengquan Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Tencent(腾讯)

AI总结 提出BrowserForge框架,通过并行浏览器沙盒从开放网络生成20余万条不同网站的网页交互轨迹,微调多模态模型后在两个基准任务上性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24714 2026-08-26 cs.RO 新提交

GaussianWAM: Distilling Geometry and Semantics from 3D Gaussian Fields into World-Action Models

GaussianWAM:将三维高斯场的几何与语义知识蒸馏至世界-动作模型

Zijian Zhang, Yuqing Jiang, Weitao Zhou, Minglei Li, Jinhao Zhang, Yao Mu, Xiaofan Li, Hao Zhao, Haibao Yu

机构 * Tuojing Intelligence(拓境智能) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) Simple AI(简智人工智能) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) The University of Hong Kong(香港大学)

AI总结 GaussianWAM是训练时的表征增强框架,通过三维高斯场蒸馏几何与语义监督,在LIBERO-Plus等任务上显著提升了WAM类模型的机器人操作性能,且不改变部署架构。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24674 2026-08-26 cs.CV 新提交

TurboT2VA: Fast Large-Scale Text-to-Video-Audio Generation via Score-Regularized Consistency Distillation

TurboT2VA:基于分数正则化一致性蒸馏的快速大规模文本-视频-音频生成

Xiaoda Yang, Yuxiang Liu, Kaiwen Zheng, Yuan Liu, Yibo Lai, Shengpeng Ji, Kai Jiang, Jianfei Chen, Xiaobin Hu, Shuicheng Yan, Jintao Zhang, Jun Zhu, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tianjin University(天津大学) Tsinghua University(清华大学) Qingdao University(青岛大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出TurboT2VA框架,通过多模态归一化与渐进式课程方案,在保持音视频生成质量的同时,大幅加速190亿参数联合T2VA模型的推理,在不同分辨率下实现最高54.67倍的生成器加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24275 2026-08-26 cs.AI cs.CL 新提交

RePolicy: Reinforcement Learning for Safety-Policy Invocation in Agent Safeguards

RePolicy:用于智能体安全保障中安全策略调用的强化学习方法

Houcheng Jiang, Boxuan Zhang, Qiyong Zhong, Junfeng Fang, Xiang Wang, Xiangnan He

机构 * Zhejiang University(浙江大学) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

AI总结 针对现有智能体安全保障方法难以适应未见轨迹和变化策略上下文的问题,提出RePolicy方法,结合PolicyTraj-20K与带可验证奖励和策略上下文扰动的GRPO,在六个智能体安全基准上取得良好安全检测与策略调用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24231 2026-08-26 cs.CL 新提交

RecurSE: Bounded Recursive Self-Evaluation for LLM Rubric Judges

RecurSE:面向LLM规则评判器的有界递归自评估

Kaiyuan Liu, Ziyuan Zhuang, Rongxiang Weng, Jieping Ye

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Meituan LongCat Team(美团龙猫团队)

AI总结 本研究提出RecurSE,一种无需外部监督的LLM规则评判器优化方法,通过同步评判器与检查器的协同演化、接口解耦及PAV监控,在多基准上实现泛化提升,可增强下游策略对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24223 2026-08-26 cs.CV cs.RO 新提交

Event-Based Motion Estimation via Oriented Distance Fields

基于定向距离场的事件驱动运动估计

Lei Sun, Yuqin Ma, Weilun Li, Haoran Liang, Runyi Yang, Kaiwei Wang, Danda Pani Paudel, Luc Van Gool

机构 * INSAIT Sofia University “St. Kliment Ohridski”(索非亚大学“圣·克莱门特·奥赫里德斯基”) Zhejiang University(浙江大学)

AI总结 提出ODF运动估计方法,结合自适应事件选择与无参数滤波器,在低延迟下实现亚像素精度,其通用性在实时图像去模糊和低功耗跟踪应用中得到验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24214 2026-08-26 cs.AI 新提交

MetaRAG: Belief-Action Aligned Policy Optimization for Agentic RAG

MetaRAG:面向智能体检索增强生成的信念-行动对齐策略优化

Qiuyi Qi, Tian Liang, Jiamu Wang, Jinjian Zhang, Wei Zhou, Pengcheng Zhu, Linjian Mo, Ming Kong, Jie Liu, Qiang Zhu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) City University of Hong Kong(香港城市大学)

AI总结 MetaRAG是面向智能体RAG的信念-行动对齐策略优化框架,通过优先验证的行动生成与内部信念探测,提升了智能体RAG的准确率-效率权衡,收益可迁移至多种场景与模型。

Comments EMNLP 2026 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24174 2026-08-26 cs.AI 新提交

Task-Adaptive Rubrics for GUI Reward Modeling

面向GUI奖励建模的任务自适应评分规则

Tao Xiong, Xavier Hu, Wenkai Wang, Qinzhuo Wu, Changqiao Wu, Pengzhi Gao, Wei Liu, Jian Luan, Shengyu Zhang

机构 * Zhejiang University(浙江大学) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)

AI总结 针对现有GUI奖励验证器任务自适应不足的问题,提出AdaptRubric框架,经实验验证其在离线奖励评估和在线强化学习中均优于现有方法,提升了F1值与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24135 2026-08-26 cs.AI cs.SE 新提交

Robust Code RL via Faulty-Code-Driven Test case Synthesis and Dense Reward Shaping

基于故障代码驱动的测试用例合成与密集奖励塑造的鲁棒代码强化学习

Yiwen Zhang, Xiaodong Yan, Zhenyu Huang, Deng Zhao, Liang Jiang, Qing Cui, Zujie Wen, Zhiqiang Zhang, Jun Zhou

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

AI总结 该研究提出RobustTests框架,通过故障代码驱动的测试用例合成与密集奖励塑造,实现RL微调的Qwen3-32B在LiveCodeBench上较基线方法获绝对3%性能提升,增强了LLM代码生成能力。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24119 2026-08-26 cs.CV cs.AI 新提交

TransPhy: Visual In-Context Learning for Physically Grounded Image Editing

TransPhy:面向物理基础图像编辑的视觉上下文学习

Siyi Xie, Xuanke Shi, Jinsheng Quan, Haoran Tang, Zukai Chen, Lei Yang, Quan Wang

机构 * Peking University(北京大学) SenseTime Research(商汤科技研究院) Zhejiang University(浙江大学)

AI总结 针对现有视觉上下文学习对物理基础图像变换支持不足的问题,提出TransPhy框架,通过分解为物理规则归纳和过渡对齐渲染,在PhysVICL-74基准上提升了相关性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24099 2026-08-26 cs.AI 新提交

Are Android GUI Agents Robust Against Runtime Anomalies? AnTrap: Evaluating Agents in Dynamic Adversarial Environments

Android GUI智能体对运行时异常是否具备鲁棒性?AnTrap:在动态对抗环境中评估智能体

Guo Gan, Yilun Zhao, Cong Chen, Jinbiao Wei, Tingyu Song, Zheyuan Yang, Lin Fu, Hong Zhou

机构 * Zhejiang University(浙江大学) Yale University(耶鲁大学) University of Chinese Academy of Sciences(中国科学院大学) Tongji University(同济大学)

AI总结 本研究针对Android GUI智能体抗运行时异常鲁棒性不足的问题,提出AnTrap基准评估框架,发现16款领先GUI模型普遍受动态异常影响,且深度上下文陷阱暴露模型内在局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23982 2026-08-26 cs.AI cs.CL cs.LG 新提交

Memory Is Not Always Needed: Characterizing Conditional Memory in Scientific Reasoning

记忆并非总是必需:科学推理中条件记忆的特征分析

Zhen Bi, Xueshu Chen, Yan Wang, Zhizhi Peng, Haosen Hong, Zhen Wang, Zhixuan Chu, Bingyu Zhu, Jungang Lou

机构 * Huzhou Normal University(湖州师范大学) Alibaba Group(阿里巴巴集团) Bota Biosciences(博塔生物科技) Zhejiang University(浙江大学)

AI总结 本研究探究科学推理中条件记忆的参与机制,提出知识边界感知路由器,在生物化学推理基准上验证其可保留有益记忆贡献并抑制退化,确立选择性记忆分配的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23728 2026-08-26 cs.CV 新提交

Velocity-coupled Representation Refinement for Satellite Orbit Prediction

用于卫星轨道预测的速度耦合表示精化

Yue Yang, Zhiqiang Wu, Saiyu Qi, Fan Ma

机构 * Xi’an Jiaotong University(西安交通大学) Zhejiang University(浙江大学)

AI总结 该研究针对现有卫星轨道预测方法未利用位置与速度耦合关系的问题,提出OrbitNet方法,通过速度耦合表示精化和轨道片段建模,在Starlink域内及6个星座零样本评估中均优于对比模型。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20804 2026-08-26 cs.CL cs.AI 版本更新

Denoising the Future: Context-Aware Spectral Diffusion for Temporal Knowledge Graph Extrapolation

去噪未来:用于时序知识图谱外推的上下文感知谱扩散

Yanglei Gan, Peng He, Run Lin, Peiyuan Jiang, Yifan Wang, Qiao Liu

机构 * Southwest Minzu University(西南民族大学) University of Electronic Science and Technology of China(电子科技大学) Zhejiang University(浙江大学) Tencent(腾讯)

AI总结 针对现有扩散式时序知识图谱外推方法的目标判别信号削弱问题,提出FreqDiff频率感知扩散框架,通过双流去噪器与频域正则化项提升性能,在四个公开基准上达最优表现。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19567 2026-08-26 cs.CV 版本更新

Block3D: Efficient Text-to-3D Generation via Block-Wise Diffusion

Block3D:基于分块扩散的高效文本到3D生成

Bowen Cui, Weijie Wang, Zeyu Zhang, Yefei He, Mingda Lin, Haoyu Zhao, Yuanyu He, Donny Y. Chen, Feng Chen, Bohan Zhuang

机构 * ZipLab, Zhejiang University(浙江大学ZipLab) University of California, Berkeley(加州大学伯克利分校) Wuhan University(武汉大学) Monash University(莫纳什大学) University of Adelaide(阿德莱德大学)

AI总结 针对文本到3D生成成本高的问题,提出Block3D分块扩散框架,通过分块生成、联合去噪及置信度引导的块内修正,在保持几何保真度的同时实现5.15倍的速度提升。

Comments Project page: this https URL (https://alexandertsui.github.io/block3d/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26958 2026-08-26 cs.CL cs.AI 版本更新

Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation

Tournament-GRPO:面向开放式长文本生成强化学习的群组锦标赛奖励

Zixuan Yang, Yiqun Chen, Wei Yang, Erhan Zhang, Zihan Shen, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Jiaxin Mao

机构 * Renmin University of China(中国人民大学) University of Southern California(南加州大学) Zhejiang University(浙江大学) Xiaohongshu Inc.(小红书公司)

AI总结 针对开放式长文本生成中缺乏可靠参考答案和自动评估指标的问题,提出Tournament-GRPO框架,通过同一查询生成结果间的多轮锦标赛比较将基于规则的LLM评判转化为相对奖励,在Deep Research Bench上取得4.52分提升。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12144 2026-08-26 cs.CV cs.RO eess.IV 版本更新

O3N: Omnidirectional Open-Vocabulary Occupancy Prediction for Embodied Intelligent Robotics

O3N: 全向开放词汇占用预测

Mengfei Duan, Hao Shi, Fei Teng, Guoqiang Zhao, Yuheng Zhang, Zhiyong Li, Kailun Yang

机构 * Hunan University(湖南大学) Zhejiang University(浙江大学)

AI总结 O3N通过全向感知和开放词汇方法,实现三维空间的连续表示和长距离上下文建模,提升具身智能在开放世界中的感知与建模能力。

Comments The source code will be made publicly available at this https URL (https://github.com/MengfeiD/O3N)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00188 2026-08-26 cs.CV cs.AI cs.LG 版本更新

ST-Lite: Training-Free KV Cache Compression with Spatio-Trajectory Guidance for Long-Horizon GUI Agents

通过无训练KV缓存压缩实现高效的长周期GUI代理

Bowen Zhou, Zhou Xu, Wanli Li, Jingyu Xiao, Pingan Gan, Haoqian Wang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 ST-Lite通过无训练的KV缓存压缩方法,提升GUI代理的解码效率,实现2.45倍加速并保持性能优势。

Comments Accepted to Findings of EMNLP 2026. Camera-ready version. 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05633 2026-08-26 cs.CL 版本更新

CASTLE: A Comprehensive Benchmark for Evaluating Student-Tailored Personalized Safety in Large Language Models

CASTLE:一个评估大语言模型学生定制个性化安全性的综合基准

Rui Jia, Ruiyi Lan, Fengrui Liu, Zhongxiang Dai, Bo Jiang, Jing Shao, Jingyuan Chen, Guandong Xu, Fei Wu, Min Zhang

机构 * East China Normal University(华东师范大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Education University of Hong Kong(香港教育大学)

AI总结 CASTLE基准通过评估学生定制个性化安全性,揭示大语言模型在不同学生属性下的安全缺陷。

Comments Accepted to main of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19509 2026-08-26 cs.RO 版本更新

Analytical Covariance Propagation for DVL-Aided Loosely Coupled SINS Under Attitude Uncertainty

辅助惯性导航策略用于自主水下航行器的松散耦合系统:姿态误差建模与方差传播

Jin Huang, Zichen Liu, Haoda Li, Zhikun Wang, Yuan Zhao, Xianyu Peng, Yongqun Yu, Ying Chen

机构 * State Key Laboratory of Ocean Sensing, Ocean College of Zhejiang University(浙江大学海洋传感国家重点实验室)

AI总结 本文提出一种结合姿态误差建模与方差传播的松散耦合惯性导航策略,有效抑制长期误差发散,提升自主水下航行器的导航精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08626 2026-08-26 cs.CL 版本更新

How Order-Sensitive Are LLMs? OrderProbe for Deterministic Structural Reconstruction

大语言模型对顺序敏感性如何?OrderProbe用于确定性结构重建

Zhaolu Kang, Yingjie He, Kehan Jiang, Leqi Zheng, Jiachen Qian, Qianyuan Zhang, Chunlei Meng, Yujie Feng, Yuan Wang, Stephen Dou, Aming Wu, Pengxiang Zhao, Jiaxin Liu, Guansu Wang, Zeyu Zhang, Lei Wang, Qishi Zhan, Xiaomin He, Meisheng Zhang, Jianyuan Ni, Richeng Xuan

机构 * Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) City University of Hong Kong(香港城市大学) Fudan University(复旦大学) The Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) University of Illinois Urbana-Champaign(伊利诺伊大学香槟分校) Marquette University(马凯特大学) Juniata College(朱尼阿特学院)

AI总结 研究通过OrderProbe基准评估大语言模型对输入顺序的敏感性,发现即使在前沿模型上,结构重建仍面临挑战,且语义能力与结构鲁棒性存在脱节。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07737 2026-08-26 cs.CV cs.AI 版本更新

Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes

看见 vs. 相信:评估开源多模态大模型在反直觉场景中的语言偏见

Chen Ling, Tongwei Zhang, Hanqian Li, Nai Ding

机构 * Zhejiang University(浙江大学) Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 为评估多模态大模型处理反直觉动作场景的能力,提出CAIT基准(400个高保真合成场景),发现开源模型因语言先验而忽视视觉证据,性能接近随机水平,而链式思维推理虽提升准确率但导致过度思考拒绝视觉内容,通过微调和结构化提示可缓解此偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08873 2026-08-26 cs.AI 版本更新

UCO: A Multi-Turn Interactive Reinforcement Learning Method for Adaptive Teaching with Large Language Models

UCO:一种用于基于大语言模型的自适应教学的多轮交互强化学习方法

Shouang Wei, Min Zhang, Xin Lin, Bo Jiang, Kun Kuang, Zhongxiang Dai

机构 * East China Normal University(东华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 UCO通过多轮交互强化学习方法,利用进展奖励和支架奖励函数,提升大语言模型在教育场景中的自适应教学能力。

Comments Accepted to EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12899 2026-08-26 cs.CL 版本更新

EduDial: Constructing a Large-scale Multi-turn Teacher-Student Dialogue Corpus

EduDial:构建大规模多轮师生对话语料库

Shouang Wei, Min Zhang, Xin Lin, Bo Jiang, Zhongxiang Dai, Kun Kuang

机构 * East China Normal University(华东师范大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本研究构建了大规模师生对话语料库EduDial,开发了EduDial-LLM 32B及11维教学能力评估框架,实验显示该模型在主流LLMs中表现最优。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏