arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

National University of Singapore(新加坡国立大学)

共收录 3816
2609.04193 2026-09-04 cs.RO 新提交

GIFT: Guided Intermediate Feature Training via Action-Oriented Structural Supervision for Robotic Manipulation

GIFT:面向机器人操作的基于动作导向结构监督的引导式中间特征训练

Yupeng Zheng, Xiang Li, Songen Gu, Yuhang Zheng, Shuai Tian, Weize Li, Linbo Wang, Chaoyue Li, Qichao Zhang, Haoran Li, Zhongpu Xia, Ya-Qin Zhang, Shuicheng Yan, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Fudan University(复旦大学)

AI总结 该研究提出 GIFT 框架,通过几何对齐、可供性预测和目标区域重建约束中间特征,在 LIBERO-Plus 和 RoboCasa 数据集上,其多个变体在机器人操作任务中显著优于基准模型,性能提升明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04131 2026-09-04 cs.CV 新提交

Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding

超越检索:面向流视频理解的渐进式潜在记忆演化

Hongyu Qu, Guangming Yao, Ling Xing, Xiaobin Hu, Rongxing Ding, Guibin Zhang, Fan Zhang, Yi Yuan, Xiangbo Shu, Shuicheng Yan

机构 * Nanjing University of Science and Technology(南京理工大学) Ant Group(蚂蚁集团) National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本研究针对流视频理解中存储-检索范式无法内化历史证据的问题,提出LatentStream框架,通过分层内存组织、渐进式演化及置信度优化实现流记忆的检索-内化,在视频基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04120 2026-09-04 cs.CV 新提交

BooM-VVT: Boosting Mask-Free Video Virtual Try-On with Image-Level Pseudo Data

BooM-VVT:借助图像级伪数据提升无掩码视频虚拟试穿性能

Wei Zhang, Xin Li, Peishu Shi, Jialin Gao, Xuekang Peng, Zhichao Lian, Yeying Jin

机构 * Nanjing University of Science and Technology(南京理工大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Meituan(美团)

AI总结 针对现有无掩码视频虚拟试穿依赖掩码、成本高及服装一致性差的问题,提出BooM-VVT框架,采用图像级伪数据、服装敏感关键帧采样等技术,构建OmniView数据集,实现更优的时间一致性与服装保真度。

Comments 23 pages, 18 figures, 8 tables. Accepted to ACM Multimedia 2026 (MM '26)

Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04021 2026-09-04 cs.AI cs.LG 新提交

FLY-EVAL++: An Evidence-Driven Evaluation Protocol for Safety-Constrained Flight Prediction with Large Language Models

FLY-EVAL++:面向大语言模型的安全约束飞行预测的证据驱动评估协议

Yalun Wu, Junfeng Fang, Jiawei Wang, Haotian Liu, Qijun Yang, Minghan Yang, Hongcheng Guo, Zhoujun Li, Boyang Wang

机构 * National University of Singapore(新加坡国立大学) Xiamen University(厦门大学) University of Manchester(曼彻斯特大学) Yunnan University(云南大学) Fudan University(复旦大学) Beihang University(北京航空航天大学) China Telecom Artificial Intelligence Technology(Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司)

AI总结 研究针对LLM在安全关键飞行预测中的评估缺陷,提出FLY-EVAL++协议,验证66个LLM后发现安全合规性是关键区分维度,表明需明确评估约束满足度。

Comments Published as a conference paper at COLM 2026

Journal ref Proceedings of the Conference on Language Modeling (COLM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03572 2026-09-04 cs.CV 新提交

Drive-HWM: Hierarchical World Models for Dynamic-Latent Guided Autonomous Driving

Drive-HWM:用于动态隐变量引导自动驾驶的分层世界模型

Zhaoxin Fan, Tianbao Zhang, Wenjun Wu, Xiaofeng Wang, Yeying Jin, Jian Zhao, Zheng Zhu, Shuicheng Yan

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Shanghai Jiao Tong University(上海交通大学) Dim12 AI GigaAI(极佳科技) National University of Singapore(新加坡国立大学) TeleAI

AI总结 Drive-HWM是一种分层快慢世界建模框架,通过动态感知隐变量引导,在NAVSIM数据集上实现了出色的自动驾驶性能,验证了其设计的有效性。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03507 2026-09-04 cs.LG cs.AI 新提交

LongCounsel-8: A Benchmark Suite for Longitudinal Depression Tracking from Multi-Session Counseling Dialogues

LongCounsel-8:基于多会话咨询对话的纵向抑郁跟踪基准套件

Jiayi Li, Zhaomin Wu, Bingsheng He

机构 * National University of Singapore(新加坡国立大学)

AI总结 LongCounsel-8是含7749条五会话咨询轨迹的基准套件,用于解决纵向抑郁跟踪数据稀缺问题,实验揭示现有方法在恶化轨迹上可靠性低等发现,推动抑郁评估向纵向跟踪发展。

Comments Dataset: https://huggingface.co/datasets/hiddensev/LongCounsel-8

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03860 2026-09-04 cs.AI math.OC 新提交

Adapting to Evolving Requirements: Agentic AI for Retail Supply Chain Operations

适应不断变化的需求:面向零售供应链运营的智能体AI

Lei Zheng, Liping Yang, Zihao Li, Guodong Lyu, Chaik Ming Koh, Chung-Piaw Teo

机构 * School of Business and Management, Hong Kong University of Science and Technology(香港科技大学工商管理学院) School of Management, University of Science and Technology of China(中国科学技术大学管理学院) Institute of Operations Research and Analytics, National University of Singapore(新加坡国立大学运筹学与分析研究所) NUS Business School, National University of Singapore(新加坡国立大学商学院)

AI总结 该研究针对零售供应链运营需求演变的问题,提出图约束的智能体框架,结合GPT、Qwen、DeepSeek等大语言模型,可提升需求重构的正确性与端到端成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02991 2026-09-04 cs.LG cs.NA math.NA stat.ML 新提交

TRACE: Spatiotemporal Contact Memory Graph Network Simulator for Granular Dynamics

TRACE:用于颗粒动力学的时空接触记忆图网络模拟器

Changjian Zhou, Negin Yousefpour, Jie Qi, Junfeng Fang, Guillermo A. Narsilio, Hans Petter Jostad

机构 * Faculty of Engineering and IT, The University of Melbourne(墨尔本大学工程与信息技术学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) Norwegian Geotechnical Institute(挪威岩土工程研究所)

AI总结 TRACE是直接在接触边存储交互历史的图网络模拟器,经单步预训练与自回归微调后,在2D、3D颗粒柱坍塌基准上,相比GNS、NMGNS等方法误差显著降低且运行更快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03762 2026-09-04 cs.LG math.OC quant-ph 新提交

Projected Riemannian Gradient Descent for the Bures-Wasserstein Barycenter: Dimension-Independent Linear Convergence at Unit Step Size

用于Bures-Wasserstein重心的投影黎曼梯度下降:单位步长下与维度无关的线性收敛

A. Afham

机构 * National University of Singapore(新加坡国立大学)

AI总结 该研究针对Bures-Wasserstein重心计算的二分性问题,提出投影黎曼梯度下降算法,在单位步长下实现与维度无关的线性收敛,多项式改进了迭代复杂度,还将该保证扩展到了不变矩阵投影场景。

Comments 33 Pages, 3 figures. Comments welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01431 2026-09-04 cs.LG cs.AI 版本更新

Efficiently Estimating Optimal Hyperparameter Scaling Laws through Power-Law Entropy Search

通过幂律熵搜索高效估计最优超参数缩放定律

Zhiliang Chen, Sebastian Ament, David Eriksson, Maximilian Balandat, Bryan Kian Hsiang Low, Eytan Bakshy, Jihao Andreas Lin

机构 * Meta National University of Singapore(新加坡国立大学) Atomic Machines(原子机器公司)

AI总结 该研究提出幂律熵搜索(PLES),一种基于多保真度贝叶斯优化的获取函数,可高效估计LLM的最优超参数缩放定律,其计算预算仅为传统网格搜索的十分之一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28974 2026-09-04 cs.AI 版本更新

From Analytics to Tumor Boards: An Evidence-Linked Multi-Agent Workflow for Oncology Feature Extraction

从分析学到肿瘤委员会:一种用于肿瘤学特征提取的证据关联多智能体工作流

Daniel Kang, Michelle Hu, Soorya Ram Shimgekar, Shayan Vassef, Yufan Wang, Anit Kumar Sahu, Munmun De Choudhury, Vedant Das Swain, Christian Poellabauer, Li Yan Khor, Koustuv Saha, Robert Wojciechowski, Elliot Kidd, Piyum Zonooz, Navin Kumar

机构 * Nimblemind School of Interactive Computing, Georgia Institute of Technology(佐治亚理工学院交互计算学院) NYU Tandon School of Engineering, New York University(纽约大学坦登工程学院) Florida International University(佛罗里达国际大学) Duke-NUS Medical School(杜克-新加坡国立大学医学院) Singapore General Hospital(新加坡中央医院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) OncoLens

AI总结 该研究针对肿瘤学文档的结构化提取需求,提出nMAS多智能体工作流,在230份肿瘤学文档上的F1值达85.0%,优于对照模型,验证了其将碎片化肿瘤学文档转为结构化数据的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25593 2026-09-04 cs.CL cs.LG 版本更新

JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution

JIT-Agent:通过即时测试框架演进扩展测试框架智能

Guibin Zhang, Leo Lu, Fangzhou Xie, Kang Zhu, Junhao Wang, Zhifei Xie, Zhaochen Yu, Zihang Liu, Zhongxiang Sun, Qiankun Li, Yue Liao, Heng Chang, Xiaobin Hu, Qibing Ren, Wangchunshu Zhou, Chuanrui Hu, Yafeng Deng, Shuicheng Yan

机构 * LV-NUS Lab(LV-NUS实验室)

AI总结 JIT-Agent是首个专为即时生成智能体测试框架设计的模型,可定制、修复、自我演进测试框架,提升DeepSeek、GLM等模型在多基准任务的性能,确立测试框架智能为智能体能力的独立可扩展维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13416 2026-09-04 cs.CV 版本更新

StreamTTT: Reconciling Real-Time Perception and Long-Term Memory in Streaming VLMs

StreamTTT:在流式视觉语言模型中协调实时感知与长期记忆

Joya Chen, Zeyun Zhong, Mike Zheng Shou

机构 * National University of Singapore(新加坡国立大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

AI总结 StreamTTT通过将长程历史写入注意力外的快速权重、保留短滑动键值缓存,在OVO-Bench和StreamingBench上提升了流式VLMs的实时感知与长程记忆能力,且代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28053 2026-09-04 cs.LG 版本更新

RW-TTT: Batched Serving for Request-Owned Test-Time Training State

RW-TTT:面向请求自有测试时训练状态的批量服务

Jian Yang, Zhizhuo Kou, Yao Tian, Hao Zhang, Han Chen, Sirui Han, Yike Guo

机构 * HKUST(香港科技大学) CUHK(香港大学) NUS(新加坡国立大学)

AI总结 提出RW-TTT框架,通过标记解码步骤的所有者、版本和读写效果,实现请求自有测试时训练状态下的高效批量LLM服务,在单GPU上达到274.61 tok/s聚合吞吐,较顺序服务提升9.31倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01658 2026-09-04 cs.AI 版本更新

CORAL: Towards Autonomous Multi-Agent Evolution for Open-Ended Discovery

CORAL:迈向自主多智能体进化以实现开放性发现

Ao Qu, Han Zheng, Zijian Zhou, Yihao Yan, Yihong Tang, Shao Yong Ong, Fenglu Hong, Kaichen Zhou, Chonghe Jiang, Minwei Kong, Jiacheng Zhu, Xuan Jiang, Sirui Li, Cathy Wu, Bryan Kian Hsiang Low, Jinhua Zhao, Paul Pu Liang

机构 * MIT(麻省理工学院) NUS(新加坡国立大学) MiniMax McGill(麦吉尔大学) Stanford(斯坦福大学) SambaNova Meta Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联合研究技术联盟) Amazon(亚马逊) Microsoft(微软)

AI总结 本文提出CORAL框架,通过自主多智能体进化方法,实现了在开放性问题上的发现,展示了智能体自主性和多智能体进化对提升开放性发现的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02192 2026-09-04 cs.RO 版本更新

A Quantitative Comparison of Centralised and Distributed Reinforcement Learning-Based Control for Soft Robotic Arms

一种集中式与分布式强化学习控制在软机器人手臂中的定量比较

Linxin Hou, Qirui Wu, Zhihang Qin, Neil Banerjee, Yongxin Guo, Cecilia Laschi

机构 * Department of Electrical and Computer Engineering, National University of Singapore(电子与计算机工程系,新加坡国立大学) Department of Computer Science, National University of Singapore(计算机科学系,新加坡国立大学) Department of Mechanical Engineering, National University of Singapore(机械工程系,新加坡国立大学)

AI总结 本文比较了集中式与分布式强化学习在软机器人手臂控制中的性能,发现分布式策略在样本效率和鲁棒性上更优,但集中式策略在训练时间上更高效。

Comments 7 pages, 4 figures, 2 tables, accepted by RoboSoft 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01734 2026-09-04 cs.LG 版本更新

MSign: An Optimizer Preventing Training Instability in Large Language Models via Stable Rank Restoration

MSign: 通过稳定秩恢复防止大语言模型训练不稳定

Lianhai Ren, Yucheng Ding, Xiao Liu, Peng Cheng, Yeyun Gong

机构 * National University of Singapore(新加坡国立大学) Microsoft Research(微软研究院)

AI总结 MSign通过稳定秩恢复机制防止大语言模型训练不稳定,有效减少训练失败并降低计算开销

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02886 2026-09-03 cs.CV 新提交

SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models

SolarWM:面向长时序视频世界模型的开放数据与可扩展训练

Junchao Huang, Guian Fang, Shengju Qian, Xianghao Kong, Zhuoran Zhao, Wei Huang, Yihua Du, Zixin Zhang, Justin Cui, Yuchao Gu, Yukang Chen, Xinting Hu, Tianyu He, Shaoshuai Shi, Zhuotao Tian, Xin Wang, Mike Zheng Shou, Li Jiang

机构 * CUHK-SZ(香港中文大学(深圳)) SLAI(深圳先进人工智能研究院) NUS(新加坡国立大学) CUHK(香港中文大学) HKUST(香港科技大学) HKUST-GZ(香港科技大学(广州)) NVIDIA(英伟达公司) UCLA(加利福尼亚大学洛杉矶分校) MSRA(微软亚洲研究院)

AI总结 SolarWM是面向长时序视频世界模型的开放基础框架,通过多源数据引擎与适配框架实现异构数据训练,实例化多款5B至33B模型,仅用5秒序列训练即可支持长时序实时交互,为相关研究提供可复扩展的基础。

Comments https://junchao-cs.github.io/SolarWM-Web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02549 2026-09-03 cs.LG cs.AI 新提交

ProbeMatchDTI: Probe-Driven Multi-Scale Biochemical Pattern Matching for Drug-Target Interaction Prediction

ProbeMatchDTI:用于药物-靶点相互作用预测的探针驱动多尺度生化模式匹配

Quan Hao, Mengyue Fan, Zifan Dong, Youru Li, Jianduo Zhao, Lechuan Xu, Hao Zhang, Fei Xia, Jigang Wang, Chong Qiu, Liguo Zhang

机构 * Beijing University of Technology(北京工业大学) China Academy of Chinese Medical Sciences(中国中医科学院) National University of Singapore(新加坡国立大学) University of New South Wales(新南威尔士大学)

AI总结 ProbeMatchDTI是含IterProbe和BindingProbe的探针驱动框架,用于解决DTI预测中微弱生化模式被抑制的问题,在两个数据集上提升AUC-ROC,且可用于药物发现候选物优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02417 2026-09-03 cs.LG cs.AI 新提交

Coverage, Not Targeting: A Structural Regime in Multi-Turn Agent Credit Assignment

覆盖率,而非靶向:多轮智能体信用分配中的一种结构 regime

Chenyu Zhou, Qiliang Jiang, Shuning Wu, Xu Zhou

机构 * School of Engineering, Institute of Science Tokyo(东京科学技术学院工学院) College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) National University of Singapore(新加坡国立大学)

AI总结 该研究发现多轮智能体信用分配中,终端状态验证器处于低信息密度 regime,均匀分布奖励(覆盖率)优于靶向分配,在多个基准及模型家族上可复现,提出需用匹配浓度打乱对照检验靶向主张。

Comments 22 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02217 2026-09-03 cs.AI 新提交

SkillGLoW: Procedural-Family Skill Consolidation for Self-Improving Agents on Long-Horizon Task Streams

SkillGLoW:面向长周期任务流的自改进智能体的过程族技能巩固

Ao Yan, Xin Zhang, Jiawei Du, Joey Tianyi Zhou

机构 * National University of Singapore(新加坡国立大学) Institute of Advanced Intelligence and Computing (IAIC)(先进智能与计算研究院)

AI总结 本研究提出SkillGLoW,通过聚合任务执行生成的局部技能为过程族并压缩为全局先验,在四类基准和三个模型上提升了智能体的长周期任务性能,且实现了紧凑的技能库与任务间的过程迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01679 2026-09-03 cs.LG 新提交

A Survey on Self-Improving Test-Time Intelligence: Feedback-Driven Adapting, Learning, and Scaling at Inference

自改进测试时智能:推理阶段的反馈驱动适配、学习与扩展综述

Shuaicheng Niu, Guohao Chen, Yaofo Chen, Zhiquan Wen, Jinwu Hu, Zeshuai Deng, Deyu Chen, Shuhai Zhang, Renjie Chen, Zihao Lian, Shoukai Xu, Gang Dai, Yunbei Zhang, Wei Luo, Yifan Zhang, Mingkui Tan, Cheng Deng

机构 * South China University of Technology(华南理工大学) Nanyang Technological University(南洋理工大学) Tulane University(杜兰大学) Pazhou Laboratory(琶洲实验室) National University of Singapore(新加坡国立大学) Hohai University(河海大学)

AI总结 本综述提出反馈驱动的测试时智能(TTI)作为统一视角,关联测试时适配、学习与扩展,梳理相关方法、应用与挑战,为推理阶段自改进AI研究提供基础与路线图。

Comments accepted by Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00618 2026-09-03 cs.IR cs.AI 版本更新

Towards Effective Structured Context Modeling for Conversational Recommender Systems via Dual-node Monte Carlo Tree Search

基于双节点蒙特卡洛树搜索的会话式推荐系统有效结构化上下文建模研究

Jincheng Zhang, Chen Huang, Wenqiang Lei, See-Kiong Ng, Yang Deng

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究院) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算与信息系统学院)

AI总结 该研究针对会话式推荐系统的用户偏好追踪问题,提出双节点蒙特卡洛树搜索的DREAMS框架,经基准数据集实验验证其有效性。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24016 2026-09-03 cs.CV 版本更新

DailyBench: A Unified Benchmark for AI-Generated and Manipulated Images from Modern Generative Models

DailyBench:用于评估现代生成模型生成和处理的人工智能图像的统一基准

Xin Jiang, Hao Tang, Junyao Gao, Meiqi Cao, Fei Shen, Dongming Zhang, Yongdong Zhang

机构 * People’s Daily Online(人民网) Nanyang Technological University(南洋理工大学) Tongji University(同济大学) Nanjing University of Science and Technology(南京理工大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

AI总结 研究针对现有生成模型图像检测基准与现实差距问题,提出统一基准DailyBench,含FakeBench和ManipulationBench两个子集,通过实验揭示当前检测器鲁棒性差,凸显其可用于开发更强大的人工智能生成图像检测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11581 2026-09-03 cs.CV 版本更新

Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO

作为自身评论家的智能体:通过循环组相对策略优化统一区域理解与定位

Xin Zhang, Haochen Wang, Yikang Zhou, Zhuochen Wang, Xiangtai Li, Robby T. Tan

机构 * National University of Singapore(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

AI总结 研究针对多模态大语言模型的区域理解与定位问题,提出循环组相对策略优化框架CycleGRPO,利用任务对偶性构建自我评估范式,仅需区域输入,通过质量感知奖励评估字幕,在多基准测试中提升能力,为推进MLLMs像素级能力提供新途径。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14845 2026-09-03 cs.LG cs.CL 版本更新

Prompting the Unknown: Understanding Response Uncertainty in Large Language Models

提示未知:理解大语言模型中的响应不确定性

Ze Yu Zhang, Arun Verma, Finale Doshi-Velez, Bryan Kian Hsiang Low

机构 * Alibaba Group(阿里巴巴集团) Harvard University(哈佛大学) National University of Singapore(新加坡国立大学)

AI总结 该研究针对大语言模型响应不确定性与提示的关系问题,提出含四类不确定性来源的提示-响应概念模型,经实验验证模型及相关理论结果。

Comments Accepted at ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01573 2026-09-02 cs.CL cs.AI cs.LG 新提交

Scaling Near-Optimal SFT-RL Annotation Budget Allocation from Small to Large LLMs

将近最优SFT-RL标注预算分配从小型大语言模型扩展至大型大语言模型

Jingtan Wang, Arun Verma, Xiaoqiang Lin, Zhengyuan Liu, Nancy F. Chen, Daniela Rus, Bryan Kian Hsiang Low

机构 * National University of Singapore(新加坡国立大学) Agency for Science, Technology, and Research (A*STAR)(新加坡科技研究局) Singapore-MIT Alliance for Research and Technology Centre(新加坡-麻省理工研究与技术联盟中心)

AI总结 该研究提出近最优区域框架,发现SFT-RL的近最优区域可从小型代理模型迁移至大型LLM,据此提出无需大规模搜索的实用标注预算分配策略,且结果在多任务、多模型及不同RL方法中一致。

Comments Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01560 2026-09-02 cs.CV cs.AI 新提交

H3-World: Turning Language Understanding into World Control

H3-World:将语言理解转化为世界控制

Danze Chen, Zeqing Wang, Ziyue Lin, Xingyi Yang, Yeying Jin

机构 * Tencent(腾讯) National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 H3-World是复用大型视频生成器语义表示的高效框架,仅需少量样本与参数,即可将语言接口转化为精确的交互式世界控制,且能泛化到未见场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01515 2026-09-02 cs.CV cs.AI 新提交

TempCloze: Can Video-LLMs Identify the Missing Middle?

TempCloze:视频-大语言模型能否识别缺失的中间片段?

Wenqi Pei, Henry Hengyuan Zhao, Yilai Liu, Jiahao Meng, Han Chen, Ziyu Wang, Hongyang Du

机构 * The University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) Peking University(北京大学)

AI总结 本研究提出TempCloze视频时序推理基准,针对Video-LLMs的时序对齐瓶颈展开评估,通过多维度干扰项设计减少语言捷径,分析了模型错误的影响因素。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01281 2026-09-02 cs.RO cs.AI 新提交

EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents

EmbodiedSkills:用于编排、训练和部署VLA智能体的统一框架

Wei Wang, Wenqiao Zhang, Yutong Lin, Yuqian Yuan, Tianwei Lin, Jinhao Mao, Zhenxuan Fan, Mingjian Gao, Yang Dai, Wentong Li, Zheqi Lv, Zheng Dong, Yingjie Niu, Jiaqi Zhu, Jun Xiao, Chao Li, Yueting Zhuang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Cornell University(康奈尔大学) Universal Ubiquitous AI Co., Ltd.(Universal Ubiquitous AI有限公司) Hangzhou DEEP Robotics Technology Co., Ltd.(杭州深度机器人科技有限公司) National University of Singapore(新加坡国立大学)

AI总结 本研究提出EmbodiedSkills统一框架,通过可执行技能接口整合VLA智能体的感知、规划等环节,经实例化验证其在RoboTwin 2.0、LIBERO等任务上的执行性能,为构建闭环具身系统提供支持。

Comments 20 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏