arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The University of Hong Kong(香港大学)

共收录 2459
2609.03729 2026-09-04 cs.CV 新提交

Unfold The World: Factorize 4D Properties in Reinforcing Spatial Reasoning

展开世界:分解四维属性以增强空间推理能力

Yijun Yang, Shenghe Zheng, Wenbo Li, Jianhui Liu, Haoze Sun, Yanbing Zhang, Jiaxiu Jiang, Lin Song, Haoyang Huang, Nan Duan, Lei Zhu

机构 * Joy Future Academy(京东探索研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) The University of Hong Kong(香港大学)

AI总结 该研究针对VLMs的空间推理瓶颈,提出分解式强化学习框架FactoSR,将世界一致性推理分解为三个几何子目标,在相关基准上实现三维、四维推理性能的显著提升,为发展具世界感知的VLMs提供关键路径。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03588 2026-09-04 cs.AI 新提交

KC-Bench: A Dynamic Interactive Benchmark for Evaluating Knowledge Conflicts in LLM Agents

KC-Bench:用于评估大语言模型智能体中知识冲突的动态交互式基准

Yaxing Lyu, Shengjie Zhou, Binbin Toh, Pengyu Zhu, Lijun Li

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Xiamen University Malaysia(马来西亚厦门大学) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 KC-Bench是评估LLM智能体知识冲突处理能力的动态交互式基准,经筛选含238个任务,对9款模型评估发现其跨领域表现差异大,为相关安全措施开发提供可复现诊断依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03544 2026-09-04 cs.CV 新提交

SafeRI: Recognition and Intervention for Token-Level Safety Intervention in Large Vision Language Models

SafeRI:大视觉语言模型中令牌级安全干预的识别与干预

Caoyuan Ma, Tian Gu, Wenpu Liu, Weichu Xie, Shuai Dong, Yuqi Xu, Ji Zhao, Ziyue Wang, Wenzheng Chang, Taiqiang Wu, Yongfu Zhu, Wenqi Shao, Zheng Wang, Yinqiang Zheng

机构 * Wuhan University(武汉大学) The University of Tokyo(东京大学) Peking University(北京大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学)

AI总结 针对现有视觉语言模型安全对齐会全局修改模型的问题,提出流式识别与门控LoRA框架,实现按需令牌级安全干预,在多基准上验证了方法的有效性。

Comments Preprint. 13 pages, 4 figures. Main paper with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03416 2026-09-04 cs.AI cs.LG 新提交

Dude: A Dual-Detection Multi-Agent System for Paper-Code Discrepancy Detection

Dude:用于论文-代码差异检测的双检测多智能体系统

Weijie Liu, Running Zhao, Wenhao Yuan, Jinfeng Xu, Zhanfeng Xu, Xiaoxi Zhang, Edith Cheuk-Han Ngai

机构 * The University of Hong Kong(香港大学) Sun Yat-sen University(中山大学)

AI总结 针对单智能体LLM论文-代码差异检测召回率低的问题,提出首个双检测多智能体系统Dude,通过粒度对齐协商与两阶段显著性过滤机制,在真实数据集上使F1分数最高提升18.7%。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27345 2026-09-04 cs.CV cs.AI 版本更新

PAWBench: How Far Are We from Probabilistically Aligned World Modeling?

PAWBench:我们离概率对齐的世界建模还有多远?

Yuandong Pu, Le Zhuo, Sayak Paul, Gabriel Jorge Menezes, Avram Đorđević, Shiyang Li, Yifan Zhou, Bin Fu, Wenlong Zhang, Junjun He, Yu Qiao, Yihao Liu, Jinbo Xing, Xi Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Krea AI Huggingface Shanghai Innovation Institute(上海创新研究院) Tongyi Lab(通义实验室) The University of Hong Kong(香港大学)

AI总结 本研究针对当前视频生成器未满足概率对齐世界建模要求的问题,提出PAWBench基准与PAWEval协议,经50种场景和11个系统测试发现无模型达要求,为相关研究奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02546 2026-09-03 cs.RO 新提交

ZETA: A Controlled Study of Zero-Shot Cross-Embodiment VLA Transfer for Tabletop Manipulation

ZETA:面向桌面操作的零样本跨 embodiment VLA 迁移的受控研究

Mi Yan, Wenhao Zhang, Zhiqi Zhang, Yu Peng, Tangxinyu Wang, Lingfei Zhai, Jiayi Su, Shengliang Deng, Lin Peng, Yaowei Liu, Yuxing Chen, Zhiyuan Wei, Jilong Wang, Jiayi Chen, Jiangran Lyu, Zhizheng Zhang, He Wang

机构 * Galbot(智元机器人) CFCS, School of CS, Peking University(北京大学计算机学院CFCS) Peking University(北京大学) Renmin University of China(中国人民大学) Xiamen University Malaysia(马来西亚厦门大学) The University of Hong Kong(香港大学) Beihang University(北京航空航天大学)

AI总结 ZETA研究区分两类零样本跨embodiment VLA迁移,引入含14个目标embodiment的受控基准,发现状态-动作表示等因素可提升迁移性能,为桌面操作场景提供实用指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02316 2026-09-03 cs.IR cs.CL cs.CR 新提交

Counter-GEO-Bench: Evaluating Defenses Against Information-Distorting Generative Engine Optimization

Counter-GEO-Bench:评估针对信息扭曲生成式引擎优化的防御措施

Bing Zheng, Zongyao Zhao, Wenming Yang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The University of Hong Kong(香港大学)

AI总结 Counter-GEO-Bench是评估GEO错误信息防御的基准,实验显示现有防御效果有限,而新提出的C-GEO Guard可大幅降低攻击成功率且效用损失极小,验证了威胁可应对。

Comments Accepted to EMNLP 2026 (Main Conference). 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02163 2026-09-03 cs.CL 新提交

Do Cantonese-Adapted Language Models Better Predict Cantonese Reading? A Cross-Model Eye-Tracking Evaluation

适配粤语的语言模型能否更好地预测粤语阅读?一项跨模型眼动评估

Ziqi Zhang, Emmanuele Chersoni, Mohammad Momenian

机构 * The Hong Kong Polytechnic University(香港理工大学) The University of Hong Kong(香港大学)

AI总结 本研究通过自然粤语眼动数据,对比两组同系列适配模型,发现更广泛的粤语专属训练模型CantoneseLLM-7B的预测拟合度更强,模型排序取决于所用信息论指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02134 2026-09-03 cs.RO cs.GR 新提交

Unified Motion Retargeting for Humanoids with Learned Point Cloud Correspondence

基于学习点云对应关系的人形机器人统一运动重定向

Hanyang Cao, Yuetong Fang, Taesoo Kwon, Runyi Yu, Ji Ma, Jing Tan, Yangchen Zhou, Baoze Du, Yi Gu, Yukang Gao, Ruoli Dai, Lei Han, Renjing Xu

机构 * HKUST(GZ)(香港科技大学(广州)) Noitom Robotics(诺亦腾机器人公司) Hanyang University(汉阳大学) HKUST(香港科技大学) HKU(香港大学)

AI总结 本文提出UMR框架,通过学习密集点云对应关系实现无需人工映射的人形机器人统一运动重定向,在多场景下比现有最优方法实现更高运动保真度,为大规模人类运动数据转机器人训练数据提供可扩展基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05049 2026-09-03 cs.CV 版本更新

OmniEdit-Bench: A Comprehensive Benchmark for Instruction-based Video Editing

OmniEdit-Bench:基于指令的视频编辑综合基准

Chenxuan Miao, Yutong Feng, Yi Lu, Yunfeng Yan, Donglian Qi, Shiwei Zhang, Yu Liu, Xi Chen, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Peking University(北京大学)

AI总结 针对现有基于指令的视频编辑基准的任务覆盖有限、指标不足的问题,OmniEdit-Bench将编辑任务分解为多维度并提出含惩罚机制的评估框架,实验显示当前IVE模型仍待提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16337 2026-09-03 cs.AI cs.HC cs.LG 版本更新

Medical Heuristic Learning: An LLM-Driven Framework for Interpretable and Auditable Clinical Decision Rules

医学启发式学习:一个用于可解释和可审计临床决策规则的LLM驱动框架

Wei Xu, Ke Yang, Gang Luo, Keli Zheng, Lingyan Hu, Jing Wang, Kefeng Li

机构 * Centre for Artificial Intelligence Driven Drug Discovery, Macao Polytechnic University(人工智能驱动药物发现中心,澳门理工学院) Key Laboratory of Short-Range Radio Equipment Testing and Evaluation, Ministry of Industry and Information Technology Terahertz Science Application Center (TSAC), Beijing Institute of Technology(工业和信息化部短距离无线电设备测试与评估重点实验室,太赫兹科学应用中心(TSAC),北京理工大学) Department of Critical Care Medicine, Yantai Yuhuangding Hospital, Qingdao University(重症医学科,烟台友谊医院,青岛大学) Faculty of Education, The University of Hong Kong(教育学院,香港大学) College of Information Engineering, Dalian University(信息工程学院,大连大学)

AI总结 提出医学启发式学习(MHL),利用LLM驱动的工作流优化确定性可执行决策系统,生成可解释、可审计的Python决策规则,在医学数据集上达到与最先进方法相当的性能,并支持小样本和高度不平衡场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27284 2026-09-03 cs.RO cs.AI 版本更新

FineVLA: Fine-Grained Instruction Alignment for Steerable Vision-Language-Action Policies

FineVLA:面向可操控视觉-语言-动作策略的细粒度指令对齐

Xintong Hu, Xuhong Huang, Jinyu Zhang, Yutong Yao, Yuchong Sun, Qiuyue Wang, Mingsheng Li, Sicheng Xie, Yitao Liu, Junhao Chen, Yixuan Chen, Yingming Zheng, Shuai Bai, Tao Yu

机构 * XLANG Lab, The University of Hong Kong(XLANG实验室,香港大学) Qwen Team, Alibaba Inc.(通义团队,阿里巴巴公司)

AI总结 提出FineVLA框架,通过构建细粒度数据集和训练策略,在保持任务成功率的同时实现机器人动作的细粒度可控性。

Comments 26 pages, 7 figures, 25 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01515 2026-09-02 cs.CV cs.AI 新提交

TempCloze: Can Video-LLMs Identify the Missing Middle?

TempCloze:视频-大语言模型能否识别缺失的中间片段?

Wenqi Pei, Henry Hengyuan Zhao, Yilai Liu, Jiahao Meng, Han Chen, Ziyu Wang, Hongyang Du

机构 * The University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) Peking University(北京大学)

AI总结 本研究提出TempCloze视频时序推理基准,针对Video-LLMs的时序对齐瓶颈展开评估,通过多维度干扰项设计减少语言捷径,分析了模型错误的影响因素。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01068 2026-09-02 cs.CL 新提交

OUTLETS: Output-Length Prediction from Speculative Decoding Backbones

OUTLETS:基于推测解码主干的输出长度预测

Weihuang Wen, Yingying Liu, Yichuan Liu, Wenqi Zeng, Li Zhou, Chumin Sun, Jie Sun, Tianshu Yu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Hong Kong(香港大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

AI总结 针对LLM服务输出长度重尾分布的调度难题,OUTLETS利用推测解码草稿表示构建轻量长度预测器,降低MAE并将短请求P99延迟减少34.8%。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01062 2026-09-02 cs.AI cs.NI eess.SP 新提交

Space Generative AI with Solar Energy Harvesting

利用太阳能收集的空间生成式人工智能

Jierui Zhang, Jianhao Huang, Zhanwei Wang, Kaibin Huang

机构 * The University of Hong Kong (HKU)(香港大学)

AI总结 该研究针对太阳能收集的空间生成式AI的计算-通信权衡,提出联合资源优化框架,其策略可动态平衡图像生成质量与传输可靠性,性能优于静态基线。

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00956 2026-09-02 cs.CV 新提交

PredErase: Training-Free Object-and-Effect Removal with Predictive Latent Guidance

PredErase:基于预测潜在引导的无训练物体与效果移除方法

Waikit Xiu, Qiang Lu, Junbiao Chen, Xiying Li

机构 * The University of Hong Kong(香港大学) Sun Yat-sen University(中山大学)

AI总结 PredErase是基于冻结FLUX.2和I-JEPA的无训练方法,通过分离可重写像素位置与孔洞结构,改进了原生FLUX.2在物体移除任务上的表现,且不替代有监督配对数据擦除器。

Comments 16 pages, 6 figures. Code: https://github.com/xiuwk0820-collab/PredErase

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00955 2026-09-02 cs.CV 新提交

ASSERT: Adaptive Stochastic Sampling for Robust Diffusion Models on Analog Compute-in-Memory Hardware

ASSERT:面向模拟存算一体硬件的鲁棒扩散模型的自适应随机采样

Yuannuo Feng, Yizhe Chen, Wenshuai Yao, Yuxin Xie, Ngai Wong, Wenyong Zhou, Wang Kang

机构 * School of Integrated Circuit Science and Engineering, Beihang University(北京航空航天大学集成电路科学与工程学院) Zhicun Research Lab(知存研究院) School of Integrated Circuits, Peking University(北京大学集成电路学院) Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电机电子工程学系)

AI总结 针对模拟存算一体硬件中扩散模型受空间内存变异影响的问题,提出无需训练的自适应随机采样器ASSERT,通过调整不同去噪阶段的随机性,显著降低FID且不改变模型参数。

Comments Accepted by ASP-DAC 2027, Tokoy, Japan

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31075 2026-09-02 cs.AI 版本更新

Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence

超越人类监督扩展大型推理模型:通往超级智能的路径

Zhiqin Yang, Jingwen Fu, Yuhan Liu, Hengyu Liu, Yonggang Zhang, Kainan Cao, Zizhuo Zhang, Chenxin Li, Ruibin Yuan, Jiahao Pan, Jiankai Sun, Zhenyuan Zhang, Yibo Li, Yunlong Lin, Jing Xiong, Sida Lin, Bo Han, Wei Xue, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zhongguancun Academy(中关村学院) Xi’an Jiaotong University(西安交通大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Hong Kong Baptist University(香港浸会大学) Hunyuan Tencent(腾讯混元) National University of Singapore(新加坡国立大学) Xiamen University(厦门大学)

AI总结 本文研究人类监督逐步退出时大型推理模型(LRMs)的扩展路径,提出五级阶梯框架,分析自主化带来的风险,围绕策略能力等开展评估,为开发通往超级智能的自我维持学习系统提供结构化方案。

Comments 72pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03146 2026-09-02 cs.IT cs.AI cs.LG cs.NI math.IT 版本更新

Channel-Adaptive Edge AI: Maximizing Inference Throughput by Adapting Computational Complexity to Channel States

通道自适应边缘AI:通过适应通道状态来最大化推理吞吐量

Jierui Zhang, Jianhao Huang, Kaibin Huang

机构 * Department of Electrical and Electronic Engineering, The University of Hong Kong(电子与电气工程系,香港大学)

AI总结 本文提出了一种自适应AI算法,通过动态调整计算复杂度和信道状态以优化边缘推理性能。

Comments 15 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25050 2026-09-02 cs.LG 版本更新

Advantage Weighted Matching: Aligning RL with Pretraining in Diffusion Models

优势加权匹配:在扩散模型中对齐强化学习与预训练

Shuchen Xue, Chongjian Ge, Shilong Zhang, Yichen Li, Zhi-Ming Ma

机构 * UCAS(中国科学院大学) Adobe Research(Adobe研究) HKU(香港大学) MIT(麻省理工学院)

AI总结 本研究提出优势加权匹配(AWM)方法,解决扩散模型RL与预训练目标不一致的问题,在多个基准测试中实现最高34倍加速且不损害生成质量。

Comments Accepted at ICML 2026; updated to the camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10349 2026-09-02 cs.DC cs.LG 版本更新

FlexP-SFT: A Flexible Aggregation-Free Framework for On-Device Personalized Split Federated Fine-Tuning of LLMs

FlexP-SFT:一种用于设备端个性化拆分联邦大语言模型微调的灵活无聚合框架

Jiaxiang Geng, Tianjun Yuan, Pengchao Han, Ying Gao, Xianhao Chen, Bing Luo

机构 * Duke Kunshan University(杜克大学昆山学院) The University of Hong Kong(香港大学) Guangdong University of Technology(广东技术大学)

AI总结 FlexP-SFT是一种无聚合的设备端个性化拆分联邦LLM微调框架,通过层灵活对齐策略与资源感知拆分比例优化,解决了现有框架的通信瓶颈与掉队者问题,在准确率和延迟上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30261 2026-09-01 stat.ML cs.LG 新提交

Estimating Population-Risk Curves Along Nonconvex Gradient Flows from the Training Sample

基于训练样本估计非凸梯度流的总体风险曲线

Mingzhi Song

机构 * The University of Hong Kong(香港大学)

AI总结 该研究针对训练样本估计非凸梯度流的条件总体风险曲线,提出Flow-ALO方法,通过误差分解与相关条件推导得到误差界,可完成条件总体风险曲线的恢复,且对特定两层平均场网络得分误差界在宽度上均匀。

Comments 63 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31096 2026-09-01 cs.CV cs.LG 新提交

One Adapter, Many Tasks: Task-Conditioned Feature Transformations for Continual Learning

一个适配器,多项任务:面向持续学习的任务条件特征变换

Yunxiang Fu, Meng Lou, Yizhou Yu

机构 * School of Computing and Data Science(计算与数据科学学院) The University of Hong Kong(香港大学)

AI总结 该研究针对持续学习的类增量学习问题,提出FACET方法,通过任务条件特征变换与特征一致性损失,在单适配器下实现高效且抗灾难性遗忘的性能,在长短任务序列上均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31009 2026-09-01 cs.LG 新提交

Language-Informed Flow Matching for Trend-Guided Structure-Based 3D Molecular Generation

用于趋势引导的基于结构的3D分子生成的语言知情流匹配

Tianyu Gao, Zhikai Su, Jiashu Li, Wenjun Gao, Zichuan Ying, Zhe Zhao, Fei Zhang, Ye Wei

机构 * City University of Hong Kong(香港城市大学) The University of Hong Kong(香港大学) Stanford University(斯坦福大学)

AI总结 该研究提出基于流匹配的语言知情跨模态框架LiFT,通过“感知-演化-组装”智能体和自条件解耦路由器实现趋势引导的3D分子生成,在Cross-Docked2020数据集上验证了其分布匹配、药物化学指标及结构有效性的优势。

Comments Accepted at Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30657 2026-09-01 cs.CV 新提交

InfraOcc: An Infrastructure Occupancy Benchmark with Static-to-Dynamic Reasoning

InfraOcc:具备静态-动态推理能力的基础设施占用基准测试集

Lei Yang, Xiaokai Bai, Boqi Li, Chunmian Lin, Li Wang, Ziying Song, Jiahuan Zhang, Enhui Ma, Haibao Yu, Jiaqi Ma, Kaicheng Yu

机构 * Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Beijing Institute of Technology(北京理工大学) Yanshan University(燕山大学) Westlake University(西湖大学) University of Hong Kong(香港大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

AI总结 本文构建了首个基础设施占用基准InfraOcc,提出ProSD-Occ方法实现静态-动态渐进推理,在多赛道排名第一,为固定视角路边占用提供了新的推理范式。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30517 2026-09-01 cs.AI cs.CL 新提交

ScienceArena: Benchmarking LLMs on Latest Scientific Olympiad Competitions

ScienceArena:在最新科学奥林匹克竞赛上对大语言模型(LLM)进行基准测试

Guangxiang Zhao, Qilong Shi, Xusen Xiao, Wenpu Liu, Yaoming Li, Linfeng Hao, Shuyang Hou, Zijian Guo, Xinrui Zhang, Yuntian Zhao, Zhengyang Wang, Wenrui Liu, Yuhan Wu, Tong Yang, Lin Sun, Xiangzheng Zhang

机构 * Qiyuan Tech(奇安信科技) Tsinghua University(清华大学) The University of Hong Kong(香港大学) Peking University(北京大学)

AI总结 本研究推出ScienceArena基准,涵盖多类科学竞赛,经专家审核构建并校准LLM评判者,评估14个LLM发现顶尖模型获奖牌级分数,化学与长程一致性仍为瓶颈。

Comments 18 pages, EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29997 2026-09-01 cs.CV 新提交

Discrete Diffusion Bridges for Spatiotemporally Aligned Image Translation and Generation

用于时空对齐图像翻译与生成的离散扩散桥

Xing Xie, Jiawei Liu, Shijun Zhou, Huijie Fan, Zhi Han, Yandong Tang, Liangqiong Qu

机构 * Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) The University of Hong Kong(香港大学) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)

AI总结 该研究提出离散扩散桥(DDB)框架,解决离散扩散在图像翻译与生成中的时空错位问题,通过混合吸收机制和信息引导噪声调度实现平衡,在多生成任务中表现优异且适配低采样步数场景。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29881 2026-09-01 cs.CV 新提交

OptiGeo: Efficient Monocular Geometry for Embodied Perception in Optically Challenging Scenes

OptiGeo:面向光学挑战性场景具身感知的高效单目几何方法

Muxin Liu, Tianbo Liu, Jing Xia, Xiaoyang Lyu, Xiaoshan Wu, Bo Wang, Peng Dai, Zhongrui Wang, Shaoshuai Shi, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) Voyager Research, DiDi Chuxing(滴滴出行 Voyager 研究院) Southern University of Science and Technology(南方科技大学)

AI总结 OptiGeo是一种感知偏差的训练框架,利用小目标渲染集修正局部几何畸变,在透明场景基准上性能远超更大规模模型,可作为光学挑战性场景的高效感知模块。

Comments Project Page: https://mx-liu6.github.io/OptiGeo-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29616 2026-09-01 cs.CL 新提交

JPO: Juris Policy Optimization for Structured Legal Reasoning in Criminal Judgment Prediction

JPO:用于刑事判决预测中结构化法律推理的司法策略优化

Zhaolu Kang, Yantao Liu, Tailong Luo, Leqi Zheng, Lei Wei, Chenghua Zhu, Junhao Gong, Jiachen Qian, Eric Hanchen Jiang, Jiaxin Liu, Yuan Wang, Hao Zhang, Zixia Wang, Rong Fu, Zheng Lin, Richeng Xuan, Zhichao Hu

机构 * Tencent(腾讯) Peking University(北京大学) Tsinghua University(清华大学) City University of Hong Kong(香港城市大学) University of California(加利福尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Zhejiang University(浙江大学) University of Hong Kong(香港大学)

AI总结 JPO是用于中国刑事判决预测的后训练框架,通过监督四步推理过程与带复合奖励的强化学习,提升判决预测及推理质量。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29607 2026-09-01 cs.CV cs.IR 新提交

SnapBench: Benchmarking Snap-and-Ask Multimodal Retrieval for Mobile Interactions

SnapBench:面向移动交互的抓拍提问多模态检索基准测试

Zirong Chen, Fuda Ye, Kuan Zhang, Enjun Du, Junfu Pu, Xinlei Wang, Xinyu Zuo, Lisheng Duan, Jin Ma, Yongqi Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tencent Yuanbao(腾讯元宝) Tsinghua University(清华大学) ARC Lab, Tencent(腾讯ARC实验室) The University of Hong Kong(香港大学)

AI总结 本研究推出首个鲁棒抓拍提问多模态检索配对基准SnapBench,评估16种多模态检索器,发现图像损坏严重影响检索,还提出自适应融合方法MOOR,凸显模态校准的必要性。

Comments 37 pages. Yuanbao Technical Report. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏