arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

2026-08-28 至 2026-08-28 共收录 5
2608.27348 2026-08-28 cs.CL 新提交

INTENT-AS-A-TOOL Makes it Easy to Track Agentic Misalignment

意图作为工具:轻松追踪智能体失配问题

Yutong Zhang, Jianshuo Dong, Peng Xu, Long Wang, Jie Zhang, Tianwei Zhang, Xiaoping Zhang, Han Qiu

机构 * Tsinghua University(清华大学) MatrixOrigin(矩阵起源) SiliconProspect AI(硅景人工智能) Nanyang Technological University(南洋理工大学)

AI总结 本研究针对智能体失配问题,提出INTENT-AS-A-TOOL方法,通过添加意图专用工具追踪智能体推理过程中的意图变化,补充CoT监控,为智能体安全追踪提供细粒度信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27065 2026-08-28 cs.CV 新提交

Video-OPSD: Exploiting Privileged Visual Evidence for On-Policy Self-Distillation in Video Large Language Models

Video-OPSD:利用特权视觉证据实现视频大语言模型中的在线自蒸馏

Ziyue Wang, Shiqi Huang, Weiwen Xu, Bihan Wen, Xudong Jiang

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) The Chinese University of Hong Kong(香港中文大学)

AI总结 该研究提出Video-OPSD框架,利用视频内特权视觉证据构建自教师并优化令牌级蒸馏,在多个视频基准上优于标准OPSD,性能接近GRPO且训练时间大幅缩短,为Video-LLMs提供高效后训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26982 2026-08-28 cs.CL 新提交

JudgeStealer: Extracting LLM Judging Capabilities across Evaluation Protocols

JudgeStealer:跨评估协议提取大语言模型评判能力

Chen Chen, Yaolin Chen, Xuehan Sun, Juan Lin, Xueluan Gong, Yuhang Zheng, Qian Wang, Kwok-Yan Lam

机构 * Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

AI总结 JUDGESTEALER是首个跨评估协议提取LLM评判能力的高效查询框架,通过利用跨协议一致性等技术提升提取效果,在三类评估任务上优于基线且具鲁棒性。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26947 2026-08-28 cs.RO cs.CV 新提交

4DSynth: Controllable Procedural World Synthesis for Dynamic Embodied Simulation

4DSynth:面向动态具身模拟的可控程序式世界合成

Zehao Qi, Haochen Luo, Jia-Wang Bian, Zeyu Ma, Shuyang Sun

机构 * Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学) Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

AI总结 本文提出可控程序式4D环境生成系统4DSynth,可将自然语言等输入转化为可编辑4D环境,并构建交互式导航基准4DSynth-Nav,为具身智能体开发评估提供实用基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26713 2026-08-28 cs.CV cs.AI 新提交

AesCanvas: A Large-Scale Dataset and Benchmark for Aesthetic Critique and Contextual Suitability

AesCanvas:用于美学评论与情境适配性的大规模数据集和基准

Xuanwei Hu, Haoyu Dong, Kejun Wu, Tianyi Liu, Jianjun Gao

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院)

AI总结 研究针对现有图像美学评估基准的不足,构建含两个互补组件的AesCanvas数据集与基准,评估不同类型MLLMs,发现评论生成与情境敏感判断存在差距,确立文化情境化适配性为美学建模新目标。

Comments 10 pages, 4 figures, 6 tables. Supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏