arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Xi'an Jiaotong University(西安交通大学)

2026-02-04 至 2026-02-04 共收录 3
2602.02593 2026-02-04 cs.LG cs.AI math.OC

Effective Frontiers: A Unification of Neural Scaling Laws

有效前沿:神经缩放定律的统一

Jiaxuan Zou, Zixuan Gong, Ye Su, Huayi Tang, Yong Liu

机构 * Department of Mathematics and Statistics, Xi'an Jiaotong University(西安交通大学数学与统计学系) Department of Artificial Intelligence, Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) University of Chinese Academy of Sciences(中国科学院大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

AI总结 本文提出有效前沿框架,统一神经缩放定律,揭示容量、覆盖和优化瓶颈的相互作用,证明Kaplan和Chinchilla定律是同一问题的不同解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02196 2026-02-04 cs.AI

TIDE: Trajectory-based Diagnostic Evaluation of Test-Time Improvement in LLM Agents

基于轨迹的测试时改进诊断评估:LLM代理中的测试时改进

Hang Yan, Xinyu Che, Fangzhi Xu, Qiushi Sun, Zichen Ding, Kanzhi Cheng, Jian Zhang, Tao Qin, Jun Liu, Qika Lin

机构 * Xi’an Jiaotong University(西安交通大学) The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) National University of Singapore(新加坡国立大学)

AI总结 TIDE提出了一种评估框架,用于诊断LLM代理在测试时改进中的性能瓶颈,通过分析任务完成的时间动态、递归循环行为和记忆负担,优化代理与环境的交互。

Comments 29pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17736 2026-02-04 cs.CV cs.AI cs.CL

V2P-Bench: Evaluating Video-Language Understanding with Visual Prompts for Better Human-Model Interaction

V2P-Bench: 通过视觉提示评估视频语言理解以提升人机交互

Yiming Zhao, Yu Zeng, Yukun Qi, YaoYang Liu, Xikun Bao, Lin Chen, Zehui Chen, Qing Miao, Chenxi Liu, Jie Zhao, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Xi’an Jiaotong University(西安交通大学)

AI总结 V2P-Bench通过视觉提示评估视频语言理解,提升人机交互效率与体验,揭示模型在时空理解上的不足及Hack现象。

Comments Project Page: https://vlm-reasoning.github.io/V2P-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏