arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Columbia University(哥伦比亚大学)

2026-08-28 至 2026-08-28 共收录 5
2608.27309 2026-08-28 cs.CL cs.AI cs.CY 新提交

Difference-in-Differences on a Censored Rating Scale Can Manufacture an Effect: Evidence from a Pre-Registered LLM-Judge Audit

删失评分量表上的双重差分可制造效应:来自预注册的LLM评判审计的证据

Shuyi Fan, Boyuan Deng, Mengyu Xu, Xinhong Xie, Chenyang Li, Hongyang Zhang

机构 * Columbia University(哥伦比亚大学) Johns Hopkins University(约翰斯·霍普金斯大学) The University of Chicago(芝加哥大学) The Pennsylvania State University(宾夕法尼亚州立大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 该研究指出,删失评分量表上的双重差分法会制造虚假效应,通过预注册的LLM评判审计案例,发现名义显著的交互作用实为删失导致的偏差,推导了机制且其贡献可测量。

Comments 15 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26887 2026-08-28 cs.CL 新提交

Planting a Latent Variable in Natural-Looking Text: a More Realistic Test of Belief States in LLMs and Their Link to Concept Geometry

在自然文本中植入潜在变量:对大语言模型(LLM)信念状态及其与概念几何联系的更真实测试

Alexandru-Iulius Jerpelea

机构 * Columbia University(哥伦比亚大学)

AI总结 本研究在自然文本中植入可控潜在变量,训练小型Transformer追踪其贝叶斯后验信念,发现其状态按马尔可夫链排列成环,为LLM信念状态与概念几何的关联提供了实证支持。

Comments 9 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26701 2026-08-28 cs.AI 新提交

Accelerating Scientific Research with Gemini in the Real-World

利用Gemini加速现实世界中的科学研究

Samuel Schmidgall, Xiaokai Zhu, Marian Shaw, Lin Yang, Valentin Liévin, Jingyun Yang, Yuchen Zhuang, Tim Strother, Alex Bijamov, Min Woo Sun, Anil Palepu, Justin Chen, David Steiner, Jacqueline Shreibati, Wei-Hung Weng, Yilin Zhao, Xingjian Hu, Nicholas Zahn, Sadhya Garg, Julia Kirby, Yuxiang Gan, Jiaoli Li, Divy Thakkar, Shekoofeh Azizi, David Racz, Juraj Gottweis, Vivek Natarajan, Chenglin Wu, Tal Danino, Keran Rong, Haozhe Wang, Benoit Schillings, Yong Cheng, Quoc V. Le, Tao Tu

机构 * Google DeepMind(谷歌DeepMind) Duke University(杜克大学) Columbia University(哥伦比亚大学) Google Research(谷歌研究) Texas A&M University(德克萨斯农工大学)

AI总结 该研究扩展并验证了基于Gemini的多智能体系统Co-Scientist,其可在材料、生物、计算机科学领域推进闭环科学工作流,提升研究效率并减少幻觉抄袭。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26372 2026-08-28 cs.CL cs.AI 新提交

Knowledge-Verified Emergent Deception in LLM Agents Under Conflicting Incentives

利益冲突情境下LLM智能体中经知识验证的涌现式欺骗

Zheyuan Liu, Weiliang Zhao, Xiangchi Yuan, Ningshan Ma, Yue Huang, Meng Jiang

机构 * University of Notre Dame(圣母大学) Columbia University(哥伦比亚大学) Georgia Institute of Technology(佐治亚理工学院) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本研究针对利益冲突下LLM智能体的诚实性问题,构建KnownLieBench基准并开展实验,发现不同模型的涌现式欺骗存在差异,诚实导向微调可减少激励下的欺骗。

Comments A benchmark for knowledge-verified emergent deception in LLM agents under conflicting incentives

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20159 2026-08-28 cs.CV cs.AI cs.LG cs.MM cs.RO 版本更新

A Very Big Video Reasoning Suite

一个非常大的视频推理套件

Maijunxian Wang, Ruisi Wang, Juyi Lin, Ran Ji, Thaddäus Wiedemer, Qingying Gao, Dezhi Luo, Yaoyao Qian, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Jiachen Li, Hanwen Xing, Tianqi Zhao, Fengyuan Yu, Weihang Xiao, Yizheng Jiao, Jianheng Hou, Danyang Zhang, Pengcheng Xu, Boyang Zhong, Zehong Zhao, Gaoyun Fang, John Kitaoka, Yile Xu, Hua Xu, Kenton Blacutt, Tin Nguyen, Siyuan Song, Haoran Sun, Shaoyue Wen, Linyang He, Runming Wang, Yanzhi Wang, Mengyue Yang, Ziqiao Ma, Raphaël Millière, Freda Shi, Nuno Vasconcelos, Daniel Khashabi, Alan Yuille, Yilun Du, Ziming Liu, Bo Li, Dahua Lin, Ziwei Liu, Vikash Kumar, Yijiang Li, Lei Yang, Zhongang Cai, Hokin Deng

机构 * University of California, Berkeley(加州大学伯克利分校) Nanyang Technological University(南洋理工大学) Northeastern University(东北大学) University of Tübingen(图宾根大学) Johns Hopkins University(约翰霍普金斯大学) University of Michigan(密歇根大学) University of Southern California(南加州大学) Washington University in St. Louis(圣路易斯华盛顿大学) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Stanford University(斯坦福大学) University of Texas at Austin(得克萨斯大学奥斯汀分校) University of California, Los Angeles(加州大学洛杉矶分校) Cornell University(康奈尔大学) San Jose State University(圣何塞州立大学) University of California, Irvine(加州大学尔湾分校) Technical University of Munich(慕尼黑技术大学) University of California, San Diego(加州大学圣地亚哥分校) Imperial College London(伦敦帝国学院) University of Wisconsin--Madison(威斯康星大学麦迪逊分校) University of Edinburgh(爱丁堡大学) Hong Kong University of Science(香港科学大学) New York University(纽约大学) Auburn University(阿伯丁大学) Columbia University(哥伦比亚大学) University of Bristol(布里斯托大学) University of Waterloo(滑铁卢大学) The Chinese University of Hong Kong(香港中文大学) Carnegie Mellon University(卡内基梅隆大学) University of Oxford(牛津大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 VBVR数据集和评估框架旨在解决视频推理能力研究中的大规模数据缺乏问题,通过大规模实验观察到对未见任务的泛化能力。

Comments Homepage: this https URL (https://video-reason.com/?v=vbvr)

详情

展开后加载摘要…

URL PDF HTML 收藏