arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-01-13 至 2026-01-13 共收录 15
2601.07779 2026-01-13 cs.MA cs.AI cs.CL cs.CV cs.HC

OS-Symphony: A Holistic Framework for Robust and Generalist Computer-Using Agent

OS-Symphony: 一个用于鲁棒且通用计算机使用代理的综合框架

Bowen Yang, Kaiming Jin, Zhenyu Wu, Zhaoyang Liu, Qiushi Sun, Zehao Li, JingJing Xie, Zhoumianze Liu, Fangzhi Xu, Kanzhi Cheng, Qingyun Li, Yian Wang, Yu Qiao, Zun Wang, Zichen Ding

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) CUHK MMLab(香港中文大学MMLab) Xi’an Jiaotong University(西安交通大学) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 OS-Symphony通过反思记忆代理和多功能工具代理,提升计算机使用代理在长周期任务和新领域中的鲁棒性和泛化能力。

Comments 31 pages, 11 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07558 2026-01-13 cs.RO

FlyCo: Foundation Model-Empowered Drones for Autonomous 3D Structure Scanning in Open-World Environments

FlyCo:基于基础模型的无人机自主3D结构扫描系统

Chen Feng, Guiyong Zheng, Tengkai Zhuang, Yongqian Wu, Fangzhan He, Haojia Li, Juepeng Zheng, Shaojie Shen, Boyu Zhou

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(香港科技大学电子与计算机工程系) School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) Department of Mechanical and Energy Engineering, Southern University of Science and Technology(南方科技大学机械与能源工程系) Differential Robotics, Hangzhou, China(杭州差分机器人)

AI总结 FlyCo通过整合基础模型实现无人机自主3D扫描,提升开放世界环境下的目标定位与预测效率。

Comments 34 pages, 24 figures, 9 tables. Video: https://www.youtube.com/playlist?list=PLqjZjnqsCyl40rw3y15Yzc7Mdo-z1y2j8

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07518 2026-01-13 cs.CV cs.AI

Mon3tr: Monocular 3D Telepresence with Pre-built Gaussian Avatars as Amortization

Mon3tr: 单目3D远程存在与预构建高斯人偶作为记忆化

Fangyu Lin, Yingdong Hu, Zhening Liu, Yufan Zhuang, Zehong Lin, Jun Zhang

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科技大学)

AI总结 Mon3tr通过单目3DGS技术实现远程存在,利用预构建的高斯人偶降低系统复杂性,实现实时高精度3D可视化与低带宽传输。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07347 2026-01-13 cs.CL

DiffER: Diffusion Entity-Relation Modeling for Reversal Curse in Diffusion Large Language Models

DiffER: 用于扩散大语言模型中反转诅咒的扩散实体-关系建模

Shaokai He, Kaiwen Wei, Xinyi Zeng, Xiang Chen, Xue Yang, Zhenyang Li, Jiang Zhong, Yu Tian

机构 * Chongqing University(重庆大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Hong Kong University of Science and Technology(香港理工大学)

AI总结 DiffER通过实体感知训练和平衡数据构建,解决扩散大语言模型中的反转诅咒问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07296 2026-01-13 cs.AI cs.CL

LRAS: Advanced Legal Reasoning with Agentic Search

LRAS: 基于代理搜索的先进法律推理

Yujin Zhou, Chuxue Cao, Jinluan Yang, Lijun Wu, Conghui He, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 LRAS通过整合反思模仿学习和难度感知强化学习,使大推理模型能够识别知识边界并处理法律推理的复杂性,从而在法律领域取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07023 2026-01-13 cs.AI

CloneMem: Benchmarking Long-Term Memory for AI Clones

CloneMem:用于AI克隆的长期记忆基准测试

Sen Hu, Zhiyu Zhang, Yuxiang Wei, Xueran Han, Zhenheng Tang, Huacan Wang, Ronghao Chen

机构 * Peking University(北京大学) UC Davis(加州大学戴维斯分校) Georgia Tech(佐治亚理工学院) MBZUAI(穆桑人工智能研究所) HKUST(香港科技大学) UCAS(中国科学技术大学)

AI总结 CloneMem是一个用于评估AI克隆长期记忆能力的基准,通过非对话数字痕迹数据,评估代理对个人状态演变的跟踪能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05635 2026-01-13 cs.CR cs.CL

Continual Pretraining on Encrypted Synthetic Data for Privacy-Preserving LLMs

在加密合成数据上进行持续预训练以实现隐私保护的大语言模型

Honghao Liu, Xuhui Jiang, Chengjin Xu, Cehao Yang, Yiran Cheng, Lionel Ni, Jian Guo

机构 * The PII shown in the figure is synthetic and not real(合成的PII) International Digital Economy Academy(国际数字经济学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) DataArc Tech Ltd(DataArc科技有限公司)

AI总结 本文提出了一种基于实体的加密合成数据预训练框架,通过加密保护PII,实现隐私保护的大语言模型预训练,同时保持模型的指令遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05680 2026-01-13 cs.LG cs.AI

Learning Design-Score Manifold to Guide Diffusion Models for Offline Optimization

学习设计-分数流形以指导扩散模型进行离线优化

Tailin Zhou, Zhilin Chen, Wenlong Lyu, Zhitang Chen, Danny H. K. Tsang, Jun Zhang

机构 * The Hong Kong University of Science and Technology, Hong Kong, China(香港科学与技术大学(香港)) The Hong Kong University of Science and Technology (Guangzhou), Guangzhou, China(香港科学与技术大学(广州)) Huawei Technologies Co., Ltd.(华为技术有限公司)

AI总结 本文提出ManGO,一种基于扩散模型的框架,通过学习设计-分数流形指导离线优化,实现超越训练数据的泛化能力,并在多个领域中优于现有方法。

Comments This manuscript was accepted by npj AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13772 2026-01-13 cs.SD cs.AI cs.LG cs.MM eess.AS

Jailbreak-AudioBench: In-Depth Evaluation and Analysis of Jailbreak Threats for Large Audio Language Models

Jailbreak-AudioBench: 对大型音频语言模型中 jailbreak 威胁的深入评估与分析

Hao Cheng, Erjia Xiao, Jing Shao, Yichi Wang, Le Yang, Chao Shen, Philip Torr, Jindong Gu, Renjing Xu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Oxford(牛津大学) Xi’an Jiaotong University(西安交通大学) Hong Kong University of Science and Technology(香港科技大学) Northeastern University(东北大学) Beijing University of Technology(北京理工大学)

AI总结 Jailbreak-AudioBench 通过构建工具箱、数据集和基准,深入评估大型音频语言模型中 jailbreak 威胁,并促进安全防护机制的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06781 2026-01-13 cs.HC cs.AI cs.CV

AutoTour: Automatic Photo Tour Guide with Smartphones and LLMs

AutoTour:基于智能手机和LLMs的自动照片导览系统

Huatao Xu, Zihe Liu, Zilin Zeng, Baichuan Li, Mo Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 AutoTour利用智能手机和LLMs自动为用户照片生成细粒度地标注释和描述,实现可扩展且上下文感知的交互式探索体验。

Comments 21

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06724 2026-01-13 cs.AR cs.LG

DS-CIM: Digital Stochastic Computing-In-Memory Featuring Accurate OR-Accumulation via Sample Region Remapping for Edge AI Models

DS-CIM:数字随机计算-内存通过样本区域重映射实现准确的或-累积用于边缘AI模型

Kunming Shao, Liang Zhao, Jiangnan Yu, Zhipeng Liao, Xiaomeng Wang, Yi Zou, Tim Kwang-Ting Cheng, Chi-Ying Tsui

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) South China University of Technology(华南理工大学) MoE Engineering Research Center of Design and Technology Co-Optimization of IC(MoE设计与技术协同优化集成电路工程研究中心) Westlake University(西湖大学)

AI总结 DS-CIM通过样本区域重映射实现高精度和高效率的边缘AI模型计算,适用于INT8 ResNet18和FP8 LLaMA-7B模型。

Comments Accepted by 2026 Design, Automation and Test in Europe Conference (DATE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06475 2026-01-13 cs.CV cs.AI

VVTRec: Radio Interferometric Reconstruction through Visual and Textual Modality Enrichment

VVTRec: 通过视觉和文本模态增强进行无线电干涉图重建

Kai Cheng, Ruoqi Wang, Qiong Luo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

AI总结 VVTRec通过融合视觉和文本模态增强,提升无线电干涉图重建的图像质量和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06472 2026-01-13 cs.LG

StablePDENet: Enhancing Stability of Operator Learning for Solving Differential Equations

StablePDENet: 提高求解微分方程的算子学习稳定性

Chutian Huang, Chang Ma, Kaibo Wang, Yang Xiang

机构 * Department of Mathematics, The Hong Kong University of Science and Technology(香港科技大学数学系) Algorithms of Machine Learning and Autonomous Driving Research Lab(机器学习与自动驾驶算法研究实验室) HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute(香港科技大学深圳-香港协同创新研究院)

AI总结 StablePDENet通过对抗训练提升神经算子学习的稳定性,确保在正常和对抗条件下均能保持高精度求解微分方程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18992 2026-01-13 cs.CV

VPGS-SLAM: Voxel-based Progressive 3D Gaussian SLAM in Large-Scale Scenes

基于体素的渐进式3D高斯SLAM:用于大规模场景的VPGS-SLAM

Tianchen Deng, Wenhua Wu, Junjie He, Yue Pan, Shenghai Yuan, Danwei Wang, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(自动化与智能感知学院,上海交通大学) Key Laboratory of System Control and Information Processing, Ministry of Education(系统控制与信息处理重点实验室,教育部) Thrust of Robotics and Autonomous Systems, The Hong Kong University of Science and Technology (Guangzhou)(机器人与自主系统研究 thrust,香港科技大学(广州)) University of Bonn(波恩大学) School of Electrical and Electronic Engineering, Nanyang Technological University(电子与电气工程学院,南洋理工大学)

AI总结 VPGS-SLAM提出了一种基于体素的渐进式3D高斯SLAM方法,适用于大规模室内外场景,通过多子地图实现紧凑准确的场景表示,并结合2D-3D融合跟踪和回环闭合方法提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08706 2026-01-13 cs.CV

HiRes-LLaVA: Restoring Fragmentation Input in High-Resolution Large Vision-Language Models

HiRes-LLaVA: 高分辨率大视觉-语言模型中碎片化输入的恢复

Runhui Huang, Xinpeng Ding, Chunwei Wang, Jianhua Han, Yulong Liu, Hengshuang Zhao, Hang Xu, Lu Hou, Wei Zhang, Xiaodan Liang

机构 * Shenzhen campus of Sun Yat-sen University(中山大学深圳校区) Huawei(华为) The Hong Kong University of Science and Technology(香港科技大学) The University of Hong Kong(香港大学)

AI总结 HiRes-LLaVA通过引入SliceRestore适配器和Self-Mining Sampler,有效恢复高分辨率输入的碎片化问题,提升模型在文档相关任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏