arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-09-01 至 2026-09-01 共收录 18
2608.31075 2026-09-01 cs.AI 新提交

Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence

超越人类监督扩展大型推理模型:通往超级智能的路径

Zhiqin Yang, Jingwen Fu, Yuhan Liu, Hengyu Liu, Yonggang Zhang, Kainan Cao, Zizhuo Zhang, Chenxin Li, Ruibin Yuan, Jiahao Pan, Jiankai Sun, Zhenyuan Zhang, Yibo Li, Yunlong Lin, Jing Xiong, Sida Lin, Bo Han, Wei Xue, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zhongguancun Academy(中关村学院) Xi’an Jiaotong University(西安交通大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Hong Kong Baptist University(香港浸会大学) Hunyuan Tencent(腾讯混元) National University of Singapore(新加坡国立大学) Xiamen University(厦门大学)

AI总结 本文研究人类监督逐步退出时大型推理模型(LRMs)的扩展路径,提出五级阶梯框架,分析自主化带来的风险,围绕策略能力等开展评估,为开发通往超级智能的自我维持学习系统提供结构化方案。

Comments 72pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30944 2026-09-01 cs.LG 新提交

Nonparametric Contextual Pricing and Inventory Learning under Censored Demand

删失需求下的非参数情境定价与库存学习

Zean Han, Jing Liang, Ruihan Lin, Zezhen Ding, Jiheng Zhang

机构 * The Hong Kong University of Science and Technology(香港科技大学)

AI总结 针对在线零售中删失需求下的情境定价与库存学习问题,提出Mean-Calibrated Kernel UCB算法,证明其极小极大最优性并通过实验验证有效性。

Comments 31 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30730 2026-09-01 cs.LG cs.CL 新提交

E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation

电商基准测试集:评估大语言模型智能体在长周期自主商业运营中的表现

Wei Fan, Xinjie Shen, Xudong Guo, Jianhong Tu, Yang Su, Yinger Zhang, Lianghao Deng, Fengyu Wang, Baohua Dong, Yangqiu Song, Dayiheng Liu

机构 * Qwen Team, Alibaba Group(通义千问团队,阿里巴巴集团) Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系) Taobao & Tmall Group, Alibaba Group(阿里巴巴集团淘宝天猫集团)

AI总结 该研究推出首个开源电商长周期自主商业运营基准E-Commerce Bench,评估18个前沿LLM智能体,发现无单一模型占优,GPT-5.6 Sol盈利最高,Qwen3.8-Max-Preview为开源模型最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30713 2026-09-01 cs.SD 新提交

Closing the Verification Loop: Self-Check Captioning for Long-Paragraph Detailed Audio Captioning

闭合验证循环:用于长段落详细音频字幕的自检查字幕生成

Fengji Ma, Yan Rong, Xu Li, Chen Zhang, Pengfei Wan, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Kuaishou Technology(快手科技)

AI总结 本研究针对长段落详细音频字幕的未解决问题,提出SCC框架,构建LACap-50k语料库与LC-SFT方法,使系统在开源字幕生成器中达最优性能。

Comments EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30277 2026-09-01 cs.AI cs.MA 新提交

SimCRAFT: Distilling Remote Sensing Agents via Synthetic Trajectories and Contextual Retrieval-Augmented Fine-Tuning

SimCRAFT:通过合成轨迹和上下文检索增强微调蒸馏遥感智能体

Haoran Wang, Jing Yao, Xu Yang, Zeqing Wang, Yang Zhang, Pedram Ghamisi, Zhengchao Chen

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Helmholtz-Zentrum Dresden-Rossendorf(德累斯顿-罗森多夫亥姆霍兹中心)

AI总结 本研究提出SimCRAFT框架,通过合成轨迹与上下文检索增强微调,将复杂遥感编排能力蒸馏到7B模型,性能优于开源LLM,为轻量遥感智能提供开源基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30252 2026-09-01 cs.LG 新提交

Strong Drafts Need Compact Memories: Long-Context Speculative Decoding with Compressed KV Cache

强草稿需要紧凑记忆:带压缩KV缓存的长上下文推测解码

Tong Yuan, Chengxi Liao, Zeyi Wen

机构 * Data Science and Analytics Thrust, Information Hub(数据科学与分析方向、信息枢纽) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出记忆增强草稿技术,为长上下文推测解码配备压缩KV记忆,可降低70%以上草稿侧内存,使Llama~3.1-8B和70B模型分别实现最高2.08倍、3.33倍解码加速,同时保持推测解码的无损保证。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30156 2026-09-01 cs.CL 新提交

Reactivating Test-Time Scaling for Plane Geometry Problem Solving

重新激活平面几何问题求解的测试时缩放能力

Xiaoqiang Kang, Shengen Wu, Maizhen Ning, Xiaobo Jin, Kaizhu Huang, Yutao Yue, Xiaowei Huang, Qiufeng Wang

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西交利物浦大学先进技术学院) University of Liverpool(利物浦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hithink Research(海天瑞声研究院) Digital Innovation Research Center, Duke Kunshan University(昆山杜克大学数字创新研究中心)

AI总结 该研究针对平面几何问题求解中测试时缩放失效的问题,提出多轨迹合成、感知增强训练及共识引导多轨迹集成方法,提升了不同模型规模下的几何问题求解性能,且采样成本最高降低8倍。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29966 2026-09-01 cs.CL 新提交

DataFoundry: Evolving Data Preparators via Recursive Self-Improvement

DataFoundry:通过递归自改进演化数据准备器

Cehao Yang, Xiaojun Wu, Xueyuan Lin, Chengjin Xu, Xuhui Jiang, Hui Xiong, Jian Guo

机构 * IDEA Research, International Digital Economy Academy(国际数字经济研究院IDEA研究院) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DataArc Tech Ltd.(DataArc科技有限公司)

AI总结 该研究提出DataFoundry框架,通过Skills-as-Modules架构的递归自改进演化数据准备器,在DataPrep-Bench多领域基准上验证其生成训练数据的下游效用优于基线,且改进不依赖特定模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29880 2026-09-01 cs.AI cs.MM 新提交

Perceive to Hypothesize, Verify to Ground: An Agentic Reasoning Framework for Open-World Geo-Localization

感知以假设,验证以落地:面向开放世界地理定位的智能体推理框架

Yutian Jiang, Ruijie Li, Sisuo Lyu, Xixuan Hao, Qingxiang Liu, Yongzi Yu, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本研究针对开放世界地理定位的感知幻觉与上下文漂移问题,提出双层智能体框架GeoPAVE,并引入含完整推理轨迹的新型数据集PAVED,以提升地理定位的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29711 2026-09-01 cs.CL 新提交

DVBench: Benchmarking MLLMs for Understanding Dynamic Charts and Narratives in Data Videos

DVBench:用于评估多模态大语言模型(MLLMs)理解数据视频中动态图表与叙事的基准

Bomiao Wang, Zekai Shao, Jiexiang Lan, Xiaoliang Fu, Xingchen Zeng, Siming Chen

机构 * Fudan University(复旦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本研究推出DVBench基准,评估MLLMs在结合动态图表与叙事的数据视频理解上的表现,发现开源模型性能不严格随参数规模扩展等现象,为MLLM发展提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29607 2026-09-01 cs.CV cs.IR 新提交

SnapBench: Benchmarking Snap-and-Ask Multimodal Retrieval for Mobile Interactions

SnapBench:面向移动交互的抓拍提问多模态检索基准测试

Zirong Chen, Fuda Ye, Kuan Zhang, Enjun Du, Junfu Pu, Xinlei Wang, Xinyu Zuo, Lisheng Duan, Jin Ma, Yongqi Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tencent Yuanbao(腾讯元宝) Tsinghua University(清华大学) ARC Lab, Tencent(腾讯ARC实验室) The University of Hong Kong(香港大学)

AI总结 本研究推出首个鲁棒抓拍提问多模态检索配对基准SnapBench,评估16种多模态检索器,发现图像损坏严重影响检索,还提出自适应融合方法MOOR,凸显模态校准的必要性。

Comments 37 pages. Yuanbao Technical Report. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29575 2026-09-01 cs.CL 新提交

SemTrace: Source-Grounded Semantic Signatures for Tracing LLM Exposure to Protected Documents

SemTrace:用于追踪大语言模型受保护文档暴露情况的基于源的语义签名

Junyan Zhang, Yudong Zeng, Yongwei Huang, Zuhao Ouyang, Hong Chen, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Bosum Institute of Management Science(博硕管理科学研究院)

AI总结 针对大语言模型文档暴露溯源问题,提出基于源的语义水印SemTrace,通过构建文档特定二进制签名实现模型不可知的受保护副本暴露检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29233 2026-09-01 cs.CV 新提交

Generalization over Memorization: Generalization-Aware Diffusion Adaptation for Single-Image Multi-View Synthesis

超越记忆的泛化:面向单图像多视图合成的泛化感知扩散适配

Jie Li, Xingchen Zou, Yuxuan Liang

机构 * Huazhong University of Science and Technology(华中科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本研究提出ACM MM 2026单图像多视图合成挑战赛的获奖方案GoM,通过场景不相交验证等技术,在40个训练场景下实现293支队伍中排名第一,揭示小数据生成建模中验证设计与训练轨迹控制的关键作用。

Comments ACM Multimedia 2026 Grand Challenge Track winning paper; presents the 1st-place solution among 293 registered teams. 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29092 2026-09-01 cs.AI cs.CV 新提交

EviAnchor: Mitigating Hallucinations in Large Vision-Language Models via Regional Visual Evidence Compensation

EviAnchor:通过区域视觉证据补偿减轻大型视觉语言模型的幻觉问题

Sihang Jia, Shuliang Liu, Songbo Yang, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 研究针对大型视觉语言模型的幻觉问题,提出无需训练的EviAnchor框架,通过区域证据锚点和决策条件证据路由提升视觉证据利用率,在多个基准测试中改善了视觉接地性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29081 2026-09-01 cs.CV 新提交

AdapToPASS: Ambiguity-aware Adaptive Spherical Transformer for Panoramic Semantic Segmentation

AdapToPASS:面向全景语义分割的歧义感知自适应球形Transformer

Soumyaratna Debnath, Weiming Zhang, Shriram Damodaran, Dingwen Xiao, Addison Lin Wang

机构 * NTU Singapore(新加坡南洋理工大学) HKUST(香港科技大学)

AI总结 AdapToPASS是一种生物启发的球形Transformer,通过自适应建模歧义提升全景语义分割性能,在未见过的球形变换下较次优方法相对mIoU提升最高18.77%,轻量变体参数不足2M且性能优于紧凑基线。

Comments 25 Pages, 7 Tables, 15 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28833 2026-09-01 cs.AI 新提交

Evaluating the Hidden Costs of Personalization in Large Language Models

评估大语言模型个性化的隐性成本

Yumeng Wang, Yuchen Wu, Cheng Qian, Zhiyuan Fan, Hyeonjeong Ha, Shujin Wu, Jiayu Liu, Heng Ji, Ge Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) HKUST(香港科技大学)

AI总结 本研究针对大语言模型个性化的三种隐性风险,提出PRISK评估框架,经13个模型实证分析,发现个性化信息会加剧偏见并导致特定指标下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28605 2026-09-01 cs.AI cs.CV 新提交

MedTVL: Harnessing Vision and Language for Medical Time Series Classification

MedTVL:利用视觉与语言进行医学时间序列分类

Jiexia Ye, Jia Li, Fugee Tsung

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 该研究提出文本引导双路径架构MedTVL,结合卷积时间路径与Transformer视觉路径,辅以自适应医学文本语义和混合专家机制,支持多模态对比学习,在多医学任务上展现出优越的分类性能与可迁移性。

Comments 12 pages, 10 figures, 7 tables

Journal ref KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28590 2026-09-01 cs.AI 新提交

DS-Lighting: Making Agent Harnesses Explicit for Data-Science Automation

DS-Lighting:让智能体管控框架显式化以实现数据科学自动化

Fan Liu, Hao Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 DS-Lighting是一款显式化数据科学自动化管控框架的工具包,将管控框架分解为四层,集成多基准实现可控比较,可提升结果的可复现性、可比性与可靠性,减少系统级故障。

详情

展开后加载摘要…

URL PDF HTML 收藏