arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Cornell University(康奈尔大学)

2026-08-28 至 2026-08-28 共收录 4
2608.27391 2026-08-28 cs.AI cs.CL cs.IR cs.LG 新提交

CorporateBench: Large-Scale Q&A Benchmarking with Temporal Knowledge Bases

CorporateBench:基于时序知识库的大规模问答基准测试

Sil Hamilton, Albert Yu Sun, Oscar J. Romero, Carl-Leander Henneking, David Mimno, Bishan Yang, Igor Labutov

机构 * Epiq AI Labs(Epiq AI实验室) Cornell University(康奈尔大学)

AI总结 研究针对企业级LLM评估的数据集难题,构建了含23万+文档的CorporateBench基准,从信息提取与知识库查询维度评估5种LLM,发现输入规模接近实际时性能下降,填补了相关评估指标空白。

Comments Accepted to EMNLP Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26386 2026-08-28 cs.CL cs.AI cs.LG 新提交

Co-Evolving Structured Knowledge and Reasoning in Language Models

语言模型中结构化知识与推理的协同演化

Ryan Thomas Noonan, Linxi Zhao, Menghan Xu, Akanksha Sarkar, Mihir Mishra, Dongyoung Go, Kilian Q. Weinberger, Yoav Artzi, Jennifer J. Sun

机构 * Cornell University(康奈尔大学)

AI总结 针对检索增强方法的局限,提出协同演化框架KBevo,联合学习构建结构化知识库与推理,提升了知识结构质量、答案可达性及推理与可控性。

Comments COLM2026. Code available at this https URL (https://github.com/kilian-group/KBevo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08801 2026-08-28 cs.LG cs.CL 版本更新

$p1$: Better Prompt Optimization with Fewer Prompts

用更少提示实现更好的提示优化

Zhaolin Gao, Yu (Sid) Wang, Bo Liu, Thorsten Joachims, Kianté Brantley, Wen Sun

机构 * Cornell University(康奈尔大学) Microsoft(微软) Harvard University(哈佛大学) Databricks AI Research(Databricks AI研究)

AI总结 研究揭示提示优化有效性取决于系统提示与响应方差,提出$p1$过滤方法提升优化效果,实验显示其在推理基准上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20159 2026-08-28 cs.CV cs.AI cs.LG cs.MM cs.RO 版本更新

A Very Big Video Reasoning Suite

一个非常大的视频推理套件

Maijunxian Wang, Ruisi Wang, Juyi Lin, Ran Ji, Thaddäus Wiedemer, Qingying Gao, Dezhi Luo, Yaoyao Qian, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Jiachen Li, Hanwen Xing, Tianqi Zhao, Fengyuan Yu, Weihang Xiao, Yizheng Jiao, Jianheng Hou, Danyang Zhang, Pengcheng Xu, Boyang Zhong, Zehong Zhao, Gaoyun Fang, John Kitaoka, Yile Xu, Hua Xu, Kenton Blacutt, Tin Nguyen, Siyuan Song, Haoran Sun, Shaoyue Wen, Linyang He, Runming Wang, Yanzhi Wang, Mengyue Yang, Ziqiao Ma, Raphaël Millière, Freda Shi, Nuno Vasconcelos, Daniel Khashabi, Alan Yuille, Yilun Du, Ziming Liu, Bo Li, Dahua Lin, Ziwei Liu, Vikash Kumar, Yijiang Li, Lei Yang, Zhongang Cai, Hokin Deng

机构 * University of California, Berkeley(加州大学伯克利分校) Nanyang Technological University(南洋理工大学) Northeastern University(东北大学) University of Tübingen(图宾根大学) Johns Hopkins University(约翰霍普金斯大学) University of Michigan(密歇根大学) University of Southern California(南加州大学) Washington University in St. Louis(圣路易斯华盛顿大学) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Stanford University(斯坦福大学) University of Texas at Austin(得克萨斯大学奥斯汀分校) University of California, Los Angeles(加州大学洛杉矶分校) Cornell University(康奈尔大学) San Jose State University(圣何塞州立大学) University of California, Irvine(加州大学尔湾分校) Technical University of Munich(慕尼黑技术大学) University of California, San Diego(加州大学圣地亚哥分校) Imperial College London(伦敦帝国学院) University of Wisconsin--Madison(威斯康星大学麦迪逊分校) University of Edinburgh(爱丁堡大学) Hong Kong University of Science(香港科学大学) New York University(纽约大学) Auburn University(阿伯丁大学) Columbia University(哥伦比亚大学) University of Bristol(布里斯托大学) University of Waterloo(滑铁卢大学) The Chinese University of Hong Kong(香港中文大学) Carnegie Mellon University(卡内基梅隆大学) University of Oxford(牛津大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 VBVR数据集和评估框架旨在解决视频推理能力研究中的大规模数据缺乏问题,通过大规模实验观察到对未见任务的泛化能力。

Comments Homepage: this https URL (https://video-reason.com/?v=vbvr)

详情

展开后加载摘要…

URL PDF HTML 收藏