arXivDaily arXiv每日学术速递 周一至周五更新

University Research

高校专区

按论文英文发表机构汇总 AI、计算机相关高校的最新研究成果。

2026-09-04 至 2026-09-04 共收录 241
2609.04200 2026-09-04 cs.CV 新提交

Principia: Relational Physics Tests for Video Models

Principia:面向视频模型的关系物理测试基准

Varun Varma Thozhiyoor, Shivam Tripathi, Venkatesh Babu Radhakrishnan, Anand Bhattad

机构 * Indian Institute of Science(印度科学学院) Johns Hopkins University(约翰斯·霍普金斯大学)

AI总结 Principia是评估视频模型物理推理的校准无关基准,涵盖八种物理现象,实验显示现有视频生成器和视觉语言模型在该基准上表现远差于通用视频基准VBench。

Comments Project Page: https://principiabench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04199 2026-09-04 cs.CL cs.AI cs.LG 新提交

Compile by Training: Turning Natural-Language Specifications into Local Neural Functions

通过训练进行编译:将自然语言规范转换为局部神经函数

Yuntian Deng, Pengyu Nie, Stuart Shieber

机构 * University of Waterloo(滑铁卢大学) Harvard University(哈佛大学)

AI总结 该研究提出“通过训练进行编译”方法,将自然语言规范转为可复用神经函数,在FuzzyBench-Hard上达83.6%语义准确率,可部署于多场景。

Comments EMNLP 2026 System Demonstrations. Demo: https://programasweights.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04196 2026-09-04 cs.CV 新提交

Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States

Puffin-World:基于原生3D世界状态扩展统一多模态模型

Kang Liao, Yihang Luo, Xiao-Ming Wu, Linyi Jin, Size Wu, Chunyu Lin, Yao Zhao, Fei Wang, Wei Li, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab) University of Michigan(密歇根大学) Beijing Jiaotong University(北京交通大学) ACE Robotics(ACE机器人公司)

AI总结 研究提出无需外部离线模块的Puffin-World统一多模态模型,联合建模三类原生3D世界状态与Omni-Camera表示,构建含1500万三元组的Puffin-16M数据集,支持多任务协同的闭环应用并发布相关资源。

Comments Project Page: https://kangliao929.github.io/projects/puffin-world/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04194 2026-09-04 cs.CL cs.LG 新提交

Legibility is Not Interpretability: Comparing Judged and Actual Importance in Chain-Of-Thought Reasoning

可解释性≠可理解性:对比思维链推理中的主观判断重要性与实际重要性

Kevin Du, Alexander Hoyle, Laura Ruis, Acyr Locatelli

机构 * ETH Zürich(苏黎世联邦理工学院) MIT(麻省理工学院) Cohere(科here公司)

AI总结 该研究对比思维链推理的可理解性与实际重要性,发现LLM评判识别高优势步骤的能力有限,微调步骤级批评家仅对错误响应有效,警示勿将推理轨迹可理解性等同于可解释性。

Comments Published at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04193 2026-09-04 cs.RO 新提交

GIFT: Guided Intermediate Feature Training via Action-Oriented Structural Supervision for Robotic Manipulation

GIFT:面向机器人操作的基于动作导向结构监督的引导式中间特征训练

Yupeng Zheng, Xiang Li, Songen Gu, Yuhang Zheng, Shuai Tian, Weize Li, Linbo Wang, Chaoyue Li, Qichao Zhang, Haoran Li, Zhongpu Xia, Ya-Qin Zhang, Shuicheng Yan, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Fudan University(复旦大学)

AI总结 该研究提出 GIFT 框架,通过几何对齐、可供性预测和目标区域重建约束中间特征,在 LIBERO-Plus 和 RoboCasa 数据集上,其多个变体在机器人操作任务中显著优于基准模型,性能提升明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04190 2026-09-04 cs.CV cs.AI 新提交

One Editor, Many Edits: A Unified Training-Free Framework for Diverse Video Editing

一个编辑器,多种编辑:用于多样化视频编辑的统一无训练框架

Adheesh Sunil Juvekar, Onkar Kishor Susladkar, Kiet A. Nguyen, Muntasir Wahed, Nabeel Bashir, Xiaona Zhou, Tianjiao Yu, Vedant Shah, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 针对单一框架内实现高质量多样化视频编辑的挑战,提出无训练框架EditVid,结合稀疏因果记忆等技术,在FiVE、IVEBench数据集及用户研究中均取得优于基线的结果。

Comments https://plan-lab.github.io/editvid

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04189 2026-09-04 cs.LG cs.GT cs.LO cs.MA 新提交

Robust PAC Learning of Concurrent Stochastic Games

并发随机博弈的鲁棒PAC学习

Angel Y. He, David Parker

机构 * University of Oxford(牛津大学)

AI总结 提出带转移不确定性的一般和并发随机博弈的鲁棒PAC学习框架,通过维护转移核置信集、引入纳什边际特征,在满足可达性条件下以多项式样本复杂度终止,基准博弈实验验证其性能与理论一致性。

Comments Main text: 10 pages, 1 figure, 2 tables; Appendix: 22 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04180 2026-09-04 cs.CL cs.AI 新提交

Knowledge Acquisition During Pre-training? Large Language Models Learn Better With Auxiliary Views

预训练期间的知识获取?辅助视角让大语言模型学习得更好

Joseph Lee, Yidi Huang, Dokyoon Kim, Shu Yang, Li Shen

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 本研究通过受控实验证实,辅助视角(知识的重构形式)是大语言模型预训练成功的关键因素,可提升学习效果,解释了数据多样性的重要性。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04177 2026-09-04 cs.AI 新提交

A Computationally Feasible Framework for Causal Probabilistic Explanation

一种计算可行的因果概率解释框架

Rafal Urbaniak, Sam Witty, Daniel Waxman, Andy Zane, Poorva Garg, Emily Bunnapradist, Sankaran Vaidyanathan, Jack Feser, Drew Lehe, Eli Bingham

机构 * Basis Research Institute(贝西斯研究所) Sorbus AI(索巴斯人工智能公司) Massachusetts Institute of Technology(麻省理工学院) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) HouseIQ(豪斯IQ公司)

AI总结 该研究针对现有因果解释工具的局限性,提出概率因果影响(PCI)框架,将可解释性转化为概率因果模型的估计问题,可高效计算且符合因果逻辑,经多类案例验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04174 2026-09-04 cs.CV 新提交

Zero-Shot Novel Depth Synthesis Using 3D Foundation Models Scene Representations

基于3D基础模型场景表示的零样本新视角深度合成

Denis M. Akola, David F. Fouhey

机构 * New York University(纽约大学) Tandon School of Engineering(坦登工程学院) Courant Institute of Mathematical Sciences(柯朗数学科学研究所)

AI总结 该研究提出基于3D基础模型的Z3D方法,通过对其内部表示做潜在扩散,实现零样本下多数据集新视角真实感深度图的预测。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026. Project page: https://akola-mbey-denis.github.io/Z3D-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04172 2026-09-04 cs.AI cs.CL 新提交

Rethinking On-Policy Distillation of Large Language Models II: One Training Example

大型语言模型的在线策略蒸馏再思考 II:一个训练示例

Zixuan Fu, Bingxiang He, Yuxin Zuo, Haohuan Huang, Jinqian Zhang, Ruhang Xiao, Cheng Qian, Qinyu Luo, Huan-ang Gao, Yudong Wang, Zhiyuan Liu, Ning Ding, Chaojun Xiao

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰斯·霍普金斯大学)

AI总结 该研究通过单查询训练探究在线策略蒸馏(OPD)的训练数据作用,发现单查询 OPD 可恢复大部分全数据增益,16 个语义查询可匹配全数据效果,指出 OPD 数据过剩但算法不足,为后续研究指明方向。

Comments 29 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04148 2026-09-04 cs.AI cs.CL 新提交

Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments

Terminal-Universe:将智能体轨迹转化为可扩展的终端环境

Jie Wu, Zhenru Zhang, Beichen Zhang, Xuwu Wang, Yuhui Su, Mouxiang Chen, Peng Wang, Zhihai Wang, Que Shen, Hao Zhou, An Yang, Fei Huang, Yujiu Yang, Dayiheng Liu

机构 * Qwen Team, Alibaba Group(通义千问团队,阿里巴巴集团) Tsinghua University(清华大学)

AI总结 Terminal-Universe 是将智能体轨迹转化为可重用终端环境的框架,可扩展任务的广度与深度,经其生成的语料库微调 Qwen3.5-27B,显著提升了代码智能体的单轮与多轮任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04141 2026-09-04 cs.AI 新提交

Efficient Test-Time Adaptation through Human-AI Interaction

通过人机交互实现高效的测试时自适应

Zora Zhiruo Wang, Apurva Gandhi, Rulin Shao, Aspen Chen, Jonas Mueller, Zhiqi Liang, Jett Chen, Michael Ryan, Qianou Ma, Luxi He, Zhoujun Cheng, Andre He, Seungone Kim, Jiayi Geng, Mingqian Zheng, Weiwei Sun, Zheyuan Zhang, Xinran Zhao, Yike Wang, Abe Hou, Liwei Jiang, Pang Wei Koh, Diyi Yang, Graham Neubig, Daniel Fried

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学) Handshake AI(汉德shake人工智能公司) Stanford University(斯坦福大学) Princeton University(普林斯顿大学) University of California San Diego(加利福尼亚大学圣迭戈分校)

AI总结 本研究提出TAHI方法,通过人机交互将跨会话信号整合到智能体中,针对30位用户的600项任务自适应后,单独任务成功率提升4.5-20.9%,还可跨用户提升最高8.8%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04134 2026-09-04 cs.LG cs.NE q-bio.NC 新提交

Prospective Coding Improves Learning in Deep Continuous-Time Recurrent Networks

前瞻性编码改善深度连续时间循环网络的学习效果

Shivang Rawat, Mirko Morello, Flaviano Morone, David J. Heeger

机构 * Telepath New York University(纽约大学)

AI总结 该研究开发递归正交滤波器(RQFs)并提出前瞻性输入编码修正,缓解深度连续时间循环网络的梯度衰减,在语音命令等任务上取得优异性能,验证了其参数高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04131 2026-09-04 cs.CV 新提交

Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding

超越检索:面向流视频理解的渐进式潜在记忆演化

Hongyu Qu, Guangming Yao, Ling Xing, Xiaobin Hu, Rongxing Ding, Guibin Zhang, Fan Zhang, Yi Yuan, Xiangbo Shu, Shuicheng Yan

机构 * Nanjing University of Science and Technology(南京理工大学) Ant Group(蚂蚁集团) National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本研究针对流视频理解中存储-检索范式无法内化历史证据的问题,提出LatentStream框架,通过分层内存组织、渐进式演化及置信度优化实现流记忆的检索-内化,在视频基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04127 2026-09-04 cs.AI 新提交

Epistemic Warrant for LLM Recommendations: Characterizing the Basis for Reliance When Ground Truth Is Unavailable

LLM推荐的认知保证:当真实值不可用时表征依赖的基础

Shai Vardi, João Sedoc

机构 * University of South Florida(南佛罗里达大学) Muma College of Business(马玛商学院) New York University(纽约大学)

AI总结 针对LLM推荐缺乏可靠依赖依据的问题,引入认知保证构造并通过四级依赖证书实现,经验证其能有效表征LLM推荐的依赖基础,与置信度、决策难度无关。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04120 2026-09-04 cs.CV 新提交

BooM-VVT: Boosting Mask-Free Video Virtual Try-On with Image-Level Pseudo Data

BooM-VVT:借助图像级伪数据提升无掩码视频虚拟试穿性能

Wei Zhang, Xin Li, Peishu Shi, Jialin Gao, Xuekang Peng, Zhichao Lian, Yeying Jin

机构 * Nanjing University of Science and Technology(南京理工大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Meituan(美团)

AI总结 针对现有无掩码视频虚拟试穿依赖掩码、成本高及服装一致性差的问题,提出BooM-VVT框架,采用图像级伪数据、服装敏感关键帧采样等技术,构建OmniView数据集,实现更优的时间一致性与服装保真度。

Comments 23 pages, 18 figures, 8 tables. Accepted to ACM Multimedia 2026 (MM '26)

Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04110 2026-09-04 cs.CV 新提交

The Shape of Time: Video-Token Contrast for Temporal Understanding in VideoLMs

时间的形态:用于视频语言模型(VideoLMs)时间理解的视频 token 对比

Yumeng Shi, Quanyu Long, Yin Wu, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学)

AI总结 针对 VideoLMs 时间理解中监督与视频表示不匹配的问题,提出 VT-Contrast 表示级时间反事实目标,通过对比视频 token 的顺序视图与反事实提升时间理解性能,且无需改动架构。

Comments Accepted to EMNLP 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04108 2026-09-04 cs.CL cs.AI cs.LG 新提交

Sequential Beats Joint: On the Interplay between On-Policy Distillation and RLVR

顺序式优于联合式:论在线蒸馏与可验证奖励强化学习的相互作用

Boyan Li, Bingsen Chen, Chenghao Yang, Ping Nie, Chen Zhao, Xi Ye

机构 * New York University(纽约大学) University of Chicago(芝加哥大学) University of Waterloo(滑铁卢大学) University of Alberta(阿尔伯塔大学) NYU Shanghai(纽约大学上海分校) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所)

AI总结 该研究提出OPD-then-RL的两阶段方案,在逻辑与数学推理基准上优于纯OPD、纯RLVR及联合基线,为结合两种后训练方法提供了实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04096 2026-09-04 cs.RO cs.AI cs.CV 新提交

Adaptive Vision-Language Grasping via Composable Foundation Priors and Generalizable Grasp Synthesis

基于可组合基础先验与通用抓取合成的自适应视觉-语言抓取

Sixu Yan, Shikang Wang, Binhua Huang, Xuanlai Tang, Guohua Fan, Fan Huang, Haoxuan Li, Yongkang Li, Yuhan Li, Bencheng Liao, Zeyu Zhang, Wenyu Liu, Hangxin Liu, Xinggang Wang

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) KEENON Robotics Co., Ltd.(科语机器人有限公司) Suzhou Silicon Era Intelligent Technology Co., Ltd.(苏州硅时代智能科技有限公司) College of Materials, Xiamen University(厦门大学材料学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) ByteDance(字节跳动) State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院通用人工智能国家重点实验室) Hubei Automation Institute(湖北省自动化研究所)

AI总结 本文提出AdaRoboVLG框架,通过解耦物理抓取合成与任务依赖理解,结合可组合基础先验实现自适应通用抓取,在仿真与真实实验中展现出高效学习、跨机械臂泛化及应对复杂环境的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04094 2026-09-04 cs.AI cs.LG cs.SE 新提交

DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training

DRACO:面向长视界智能体训练的基于动态规则的细粒度信用分配

Shubham Gandhi, Saurabh Goyal, Kiran Kate, Yara Rizk

机构 * Carnegie Mellon University(卡内基梅隆大学) IBM Research(IBM研究院)

AI总结 针对长视界智能体训练中缺乏可验证奖励的问题,提出DRACO方法,通过动态生成规则并重新分配判断结果,在AppWorld和Tau-Bench上均取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04090 2026-09-04 cs.LG 新提交

Conditioning Degenerate Diffusion Models

退化扩散模型的条件设置

Uğur Aydın, Tamer Başar

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 针对奇异扩散系数且密度不光滑的条件生成模型,该研究提出基于因果最优传输的近似损失函数,以实现最小熵控制的引导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04088 2026-09-04 cs.CV 新提交

Efficient Semantic Understanding from Digital Foveation

基于数字凹视的高效语义理解

Caterina Caccavella, Vittorio Fra, Andreas Ziegler, Giulia D'Angelo, Yulia Sandamirskaya

机构 * Zurich University of Applied Sciences (ZHAW)(苏黎世应用科技大学) ETH Zürich(苏黎世联邦理工学院) Politecnico di Torino(都灵理工大学) University of Tübingen(蒂宾根大学) Czech Technical University(捷克技术大学)

AI总结 该研究提出轻量主动视觉流水线,通过数字凹视实现高效语义理解,在ADE20K-Object数据集上仅用少量计算即可达到接近基线的准确率,为语义分割提供高效替代方案

Comments Accepted at the 3rd Human-inspired Computer Vision Workshop at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04083 2026-09-04 cs.CV cs.AI cs.CL cs.IR 新提交

CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker Distillation

CORE:通过重排器蒸馏提升多模态大语言模型(MLLM)嵌入中的组合推理能力

Tingyu Song, Mingxin Li, Yanzhao Zhang, Dingkun Long, Chu Liu, Pengjun Xie, Yilun Zhao, Shu Wu

机构 * Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学) Yale University(耶鲁大学) CASIA(中国科学院自动化研究所)

AI总结 该研究提出CORE方法,通过将MLLM重排器的组合判断蒸馏到嵌入模型,在COLA等三个组合推理基准及MCMR基准上实现了最优性能,提升了嵌入模型的组合检索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04070 2026-09-04 cs.CV cs.RO 新提交

Continuous Actions from Discrete Minds: Latent-Aligned Planning for End-to-End Autonomous Driving

离散思维到连续动作:面向端到端自动驾驶的隐式对齐规划

Ruoyu Yao, Yusen Xie, Qingzhao Liu, Pei Liu, Zewei Yang, Yipeng Zhu, Xiaolong Wang, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Central Media Technology Institute, Huawei(华为中央媒体技术研究院)

AI总结 该研究提出具备隐式对齐规划的VLA框架LaPla,通过残差VQ-VAE消除量化误差,在nuScenes基准和AlpaSim模拟器上分别实现长时程L2误差降低、驾驶成功率提升的效果。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04066 2026-09-04 cs.LG cs.AI cs.RO 新提交

Subspace Inference Enables Efficient Active Reward Learning from Preferences

子空间推理实现高效的基于偏好的主动奖励学习

Yutai Zhou, Erdem Bıyık

机构 * University of Southern California(南加州大学)

AI总结 本文提出PreferenceEKF方法,通过低维子空间的扩展卡尔曼滤波实现高效序贯贝叶斯推理,在D4RL等基准上较其他贝叶斯深度学习方法更优,助力RLHF的高效奖励学习。

Comments Published at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04031 2026-09-04 cs.CV 新提交

DSAQuant: Denoising-Stage-Aligned Quantization-Aware Training for Video Generation

DSAQuant:面向视频生成的去噪阶段对齐量化感知训练

Shuaiting Li, Zelin Gao, Haibin Shen, Yujun Shen, Haotong Qin, Yinghao Xu

机构 * Robbyant(睿冰科技(Robbyant)) ZJU(浙江大学) HKUST(香港科技大学) PolyU(香港理工大学)

AI总结 DSAQuant是面向VDMs的去噪阶段对齐量化感知训练框架,适配视频去噪阶段特性,在W3A3量化下将VBench平均分数提升最高6.60,优于SOTA基线。

Comments Project page: \url{https://robbyant-research.github.io/DSAQuant/}; Code: \url{https://github.com/robbyant-research/DSAQuant}

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04026 2026-09-04 cs.CV 新提交

Stable and Scalable Bundle Adjustment of Holistic 3D Structures

整体三维结构的稳定且可扩展的光束平差法

Shaohui Liu, Rémi Pautrat, Daniel Barath, Richard Hartley, Viktor Larsson, Marc Pollefeys

机构 * ETH Zurich(苏黎世联邦理工学院) Microsoft Spatial AI Lab(微软空间人工智能实验室) Australian National University(澳大利亚国立大学) Lund University(隆德大学)

AI总结 本文提出统一框架扩展光束平差法,将高阶几何关系建模为类相机实体,保留稀疏性并提升稳定性,在相当运行时下生成更丰富三维结构与更高几何精度。

Comments To appear at ECCV 2026. Code available as part of the LIMAP toolbox at https://github.com/cvg/limap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04021 2026-09-04 cs.AI cs.LG 新提交

FLY-EVAL++: An Evidence-Driven Evaluation Protocol for Safety-Constrained Flight Prediction with Large Language Models

FLY-EVAL++:面向大语言模型的安全约束飞行预测的证据驱动评估协议

Yalun Wu, Junfeng Fang, Jiawei Wang, Haotian Liu, Qijun Yang, Minghan Yang, Hongcheng Guo, Zhoujun Li, Boyang Wang

机构 * National University of Singapore(新加坡国立大学) Xiamen University(厦门大学) University of Manchester(曼彻斯特大学) Yunnan University(云南大学) Fudan University(复旦大学) Beihang University(北京航空航天大学) China Telecom Artificial Intelligence Technology(Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司)

AI总结 研究针对LLM在安全关键飞行预测中的评估缺陷,提出FLY-EVAL++协议,验证66个LLM后发现安全合规性是关键区分维度,表明需明确评估约束满足度。

Comments Published as a conference paper at COLM 2026

Journal ref Proceedings of the Conference on Language Modeling (COLM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04018 2026-09-04 cs.LG stat.AP stat.ME 新提交

A location-invariant estimator of extremal quantile treatment effects for heavy-tailed distributions

针对重尾分布的极值分位数处理效应的位置不变估计量

Xin Yu, Shuwei Huang, Jicheng Liu, Jielin Tang, Bolin Wang, Yunxiao Zhang, Tian Zhao

机构 * Huazhong University of Science and Technology(华中科技大学) Tencent(腾讯)

AI总结 针对重尾分布极值QTE估计量的位置偏移不不变问题,通过适配位置不变EVI估计量并替换外推方案,提出位置不变的极值QTE估计量,经模拟验证其性质良好。

详情

展开后加载摘要…

URL PDF HTML 收藏