arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Cornell University(康奈尔大学)

共收录 1492
2609.03807 2026-09-04 cs.LG cs.AI 新提交

Free Pause Tokens

免费暂停令牌

John Langford, Nathan Godey, Giovanni Monea, Yoav Artzi, Harry Dong, Ying Fan, Gustavo de Rosa, Zheng Zhan

机构 * Microsoft(微软) Cornell University(康奈尔大学)

AI总结 该研究提出免费暂停令牌,通过权重共享主干的并行预测流承载额外计算,在不增加推理开销的前提下,以1.14倍训练计算成本实现Transformer下一个令牌预测性能提升2-3centinats。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02959 2026-09-04 cs.LG cs.AI cs.CL stat.ML 新提交

The Geometry of Ignorance: LLMs Know When to Temper Bayesian Priors

无知的几何:大语言模型知道何时调整贝叶斯先验

Toni J. B. Liu, Jiajun Bao, Yizhou Liu, Gurbir Arora, Nicolas Boullé, Raphaël Sarfati, Christopher J. Earls

机构 * Cornell University(康奈尔大学) MIT(麻省理工学院) Imperial College London(伦敦帝国学院) Goodfire AI

AI总结 该研究揭示大语言模型存在“无知方向”这一几何结构,可用于计算先验加载因子λ,该因子能衡量模型对一元先验的依赖,且具有因果作用,不同规模模型的λ存在差异,为理解模型的不确定性处理机制提供了新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01507 2026-09-04 cs.LG cs.AI 版本更新

LatentPress: Context Compression Beyond Text and Vision

LatentPress:超越文本与视觉的上下文压缩技术

Zhengze Zhou, Hejian Sang

机构 * Cornell University(康奈尔大学) Arizona State University(亚利桑那州立大学)

AI总结 LatentPress将上下文压缩为连续记忆令牌,仅训练小型适配器,在多个长上下文任务中压缩后性能优于文本摘要和OCR,且读写速度更快,证实其作为机器面向上下文接口的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02914 2026-09-04 cs.AI cs.CL 版本更新

Large AI Models in Dental Healthcare: From General-Purpose Systems to Domain-Specific Foundation Models

牙科医疗中的大型AI模型:从通用系统到领域特定基础模型

Sema Helali, Lina Abu Nada, Sausan Al Kawas, Alaa Abd-Alrazaq, Faleh Tamimi, Rafat Damseh

机构 * University of Al Ain, UAE(阿联酋阿恩大学) Sharjah University, UAE(阿联酋谢尔杰大学) Cornell University, Qatar(卡塔尔康奈尔大学) McGill University(麦吉尔大学)

AI总结 本文通过系统综述,提出二维分类框架,比较语言生成模型、判别视觉基础模型和牙科特定基础模型在牙科任务中的表现,发现集成管道优于单一模型,并指出数据不对称、幻觉和缺乏标准化基准等障碍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07761 2026-09-04 cs.RO 版本更新

High-Altitude Balloon Station-Keeping with First Order Model Predictive Control

基于一阶模型预测控制的高空气球驻留控制

Myles Pasetsky, Jiawei Lin, Bradley Guo, Sarah Dean

机构 * Cornell University(康奈尔大学) University of California San Diego(加州大学圣地亚哥分校)

AI总结 本文针对高空气球驻留控制问题,开发了一阶模型预测控制(FOMPC),其无需离线训练,性能优于现有最优强化学习策略,实现半径内时间提升24%,在线规划在多种配置下均有效。

Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01815 2026-09-03 cs.AI 新提交

Induction and Inquiry via Probabilistic Reasoning over Language and Code

基于语言与代码的概率推理实现归纳与探究

Wasu Top Piriyakulkij, Sam Acquaviva, Cassidy Langenfeld, Joshua Tenenbaum, Kevin Ellis

机构 * Cornell University(康奈尔大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 该研究提出结合自然语言与源代码的心理程序编码模型,经LLM引导的贝叶斯学习算法推断,成功复现人类归纳学习与主动探究特征,优于纯LLM及经典贝叶斯模型,为人类知识生成机制提供新解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01667 2026-09-03 cs.CR cs.LG 新提交

Private Computation Space: Experience with Trusted Multi-Cluster Federated Learning for Agriculture

私有计算空间:农业可信多集群联邦学习的实践

Shuangyu Lei, Muhammad Salman Abid, Jacob Belding, Sam Mosher, Manushi B. Trivedi, Shivranjani Baruah, Liam Wickes-Do, Andrew Anderson, Braulio Dumba, Alyssa Whitcraft, Ritvik Sahajpal, Sijin Li, Kelly Robbins, Michael Gore, Margaret Frank, Steven Wolf, Liz Jones, Abraham Stroock, Kaitlin Gold, Hakim Weatherspoon

机构 * Cornell University(康奈尔大学) IBM Research(IBM研究院) University of Maryland(马里兰大学)

AI总结 针对美国农民数据隐私担忧限制AI在农业应用的问题,推出开源私有计算空间PCS,结合多集群编排、异步FL、DP和TEEs,在两项农业任务中提升模型准确率并保护隐私。

Comments 15 pages, 13 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01914 2026-09-03 nlin.CD cs.LG 新提交

Basin Geometry and Reliable Recall of Dynamical Memories in Reservoir Computing

储层计算中动力记忆的盆地几何结构与可靠回忆

Ling-Wei Kong, Ying-Cheng Lai

机构 * Cornell University(康奈尔大学) Arizona State University(亚利桑那州立大学)

AI总结 该研究揭示储层计算中记忆盆地的章鱼状结构,提出线索驱动广义同步可绕过不可预测性实现可靠回忆,且该结构在训练后的循环神经网络中也存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02126 2026-09-03 cs.LG cond-mat.mtrl-sci 新提交

Scalable Bayesian Optimization of Composite Functions for Image-Based Inverse Problems in Materials Characterization

面向材料表征中基于图像的逆问题的复合函数可扩展贝叶斯优化

Dasol Yoon, Poompol Buathong, Chia-Hao Lee, Yujia Zhang, David A. Muller, Peter I. Frazier

机构 * Cornell University(康奈尔大学)

AI总结 本研究针对材料表征中基于图像的逆问题,提出SBOCF方法,通过优化复合函数实现高效参数估算,在基准测试和实验数据上表现优于标准贝叶斯优化,可用于下游成像重建。

Comments 28 pages. Dasol Yoon and Poompol Buathong contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21377 2026-09-03 cs.CL cs.AI cs.LG cs.MA 版本更新

Agentic Scaffolding Amplifies Sycophantic Behavior in Large Language Models

智能体式支架会放大大语言模型中的谄媚行为

Thantham Jittham

机构 * Cornell University(康奈尔大学)

AI总结 该研究探究智能体式交互支架是否放大LLM的谄媚行为,发现其会系统性放大且伴随准确率下降,提出ASA概念及相关指标,警示AI自主性提升会加剧谄媚。

Comments Withdrawn by the author. The reported results do not correspond to the executed evaluation and are unsupported. The paper should not be cited

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05033 2026-09-03 cs.LG math.OC 版本更新

Gradient Descent on Logistic Regression with Non-Separable Data and Large Step Sizes

不可分数据下带大步长的逻辑回归梯度下降算法

Si Yi Meng, Antonio Orvieto, Daniel Yiming Cao, Christopher De Sa

机构 * Cornell University(康奈尔大学) ELLIS Institute Tübingen(ELLIS图宾根研究所) MPI for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

AI总结 该研究分析不可分数据下带大步长的逻辑回归梯度下降的动力学,发现其全局收敛性不成立,步长在1/λ与2/λ间时可收敛到稳定周期,高维下步长小于1/λ也可能出现该情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01588 2026-09-02 cs.HC cs.AI cs.CL 新提交

Designing Proactive Thought Partners for Writing

设计用于写作的主动式思维伙伴

Chao Zhang, Abe Davis, Chih-Wei Chen, Chin-Chia Hsu

机构 * Google DeepMind(谷歌DeepMind) Cornell University(康奈尔大学)

AI总结 本文设计主动式思维伙伴AI智能体,以可定制的高层次认知支持辅助写作,经16名参与者一周测试,明确了主动式写作助手的设计要点。

Comments 30 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01281 2026-09-02 cs.RO cs.AI 新提交

EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents

EmbodiedSkills:用于编排、训练和部署VLA智能体的统一框架

Wei Wang, Wenqiao Zhang, Yutong Lin, Yuqian Yuan, Tianwei Lin, Jinhao Mao, Zhenxuan Fan, Mingjian Gao, Yang Dai, Wentong Li, Zheqi Lv, Zheng Dong, Yingjie Niu, Jiaqi Zhu, Jun Xiao, Chao Li, Yueting Zhuang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Cornell University(康奈尔大学) Universal Ubiquitous AI Co., Ltd.(Universal Ubiquitous AI有限公司) Hangzhou DEEP Robotics Technology Co., Ltd.(杭州深度机器人科技有限公司) National University of Singapore(新加坡国立大学)

AI总结 本研究提出EmbodiedSkills统一框架,通过可执行技能接口整合VLA智能体的感知、规划等环节,经实例化验证其在RoboTwin 2.0、LIBERO等任务上的执行性能,为构建闭环具身系统提供支持。

Comments 20 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00700 2026-09-02 cs.AI cs.CL 新提交

Value Over Language Model: Detecting Original Contribution in Writing

超越语言模型的价值:检测写作中的原创贡献

Vibhhu Sharma, Thorsten Joachims, Sarah Dean

机构 * Cornell University(康奈尔大学)

AI总结 本研究提出VOLM框架,通过对比文档与仅由LLM从任务描述生成的文本,检测写作中的原创人类贡献,在三类文本上表现优异且对内容保留转换具鲁棒性。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00508 2026-09-02 cs.AI 新提交

CoVer: Conflict-Aware Claim Verification

CoVer:感知冲突的主张验证

Shuning Zhang, Dai Shi, Bohao Chu, Hui Wang, Yuwei Chuai, Yifan Wang, Jingruo Chen, Simin Li, Xin Yi, Hewu Li

机构 * Tsinghua University(清华大学) Tongji University(同济大学) University of Duisburg-Essen(杜伊斯堡-埃森大学) University of Luxembourg(卢森堡大学) University of Washington(华盛顿大学) Cornell University(康奈尔大学) Beihang University(北京航空航天大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 针对社交媒体事实核查的证据级与聚合级冲突挑战,提出大规模数据集ContraNote及三阶段裁决框架CoVer,在多数据集上实现了优于基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00450 2026-09-02 cs.LG cs.AI cs.AR 新提交

HBQ: Hierarchical Scaling Block Quantization with Hardware-Efficiency-Aware Design for Accurate LLM Inference

HBQ:面向高效硬件设计的分层缩放块量化,用于准确的大语言模型推理

Chun-Ting Chen, Dongmin Han, Hangyeol Mun, Jake Hyun, Arnab Raha, Amit Agarwal, Mark Anders, Mohamed Abdelfattah, Jae-sun Seo

机构 * Cornell University(康奈尔大学) Intel Corporation(英特尔公司)

AI总结 该研究针对大语言模型推理的块量化设计空间不足问题,提出分层块量化HBQ,通过二级尾数缩放补偿大块误差,实现了比现有权重量化和块量化更高的面积、能量效率与推理速度,达到最优精度。

Comments This work is accepted to the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00488 2026-09-02 cs.LG physics.chem-ph 新提交

AdaptNTK: Adaptive Uncertainty Quantification and Active Learning for Neural Network Potentials

AdaptNTK:面向神经网络势的自适应不确定性量化与主动学习

Prajwal Ananth, Shuwen Yue

机构 * Center for Applied Mathematics, Cornell University(康奈尔大学应用数学中心) R. F. Smith School of Chemical and Biomolecular Engineering, Cornell University(康奈尔大学R.F.史密斯化学与生物分子工程学院)

AI总结 AdaptNTK是面向神经网络势的单模型框架,通过神经正切核特征空间的正则化马氏距离量化不确定性,在rMD17和Transition-1X主动学习任务中实现低力误差与2.6倍加速,提升了数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31023 2026-09-01 cs.CV 新提交

SMG: Semantic Motion Graph for Monocular Dynamic Gaussian Splatting

SMG:用于单目动态高斯溅射的语义运动图

Haozheng Yu, Xinyu Yang, Rundong Luo, Jennifer J. Sun, Bharath Hariharan

机构 * Cornell University(康奈尔大学)

AI总结 该研究针对单目动态高斯溅射过拟合、复杂场景下表现差的问题,提出SMG模型,引入新数据集,实现了该任务的最优性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30391 2026-09-01 cs.CL cs.AI 新提交

Using Grounded Theory for Agent Behavior Analysis at Scale

用扎根理论进行大规模智能体行为分析

Zhuoran Lu, Yangyang Yu, Zhuoyan Li, Yibo Meng, Nan Jiang, Chengxi Zang, Jie Gao, Ziang Xiao

机构 * Purdue University(普渡大学) Stevens Institute of Technology(史蒂文斯理工学院) Cornell University(康奈尔大学) University of Texas at El Paso(德克萨斯大学埃尔帕索分校) Johns Hopkins University(约翰斯·霍普金斯大学)

AI总结 该研究将扎根理论引入智能体轨迹分析,提出AutoTraceGT流程,在六个语料库上可恢复多数人类标注失败模式,其编码本在失败预测任务中优于LLM基线,为智能体行为分析提供可扩展工具。

Comments 33 pages. Accepted to the Findings of the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29209 2026-09-01 cs.CL cs.HC 新提交

Toward Cultural Alignment: Human-Centered Evaluation of Multimodal AI Stories Across Five African Communities

迈向文化对齐:五个非洲社区对多模态AI故事的以人为中心的评估

Millicent Ochieng, Felermino D. M. A. Ali, Elizabeth A. Ankrah, Najeeb Gambo Abdulhamid, Migisha Boyd, Stephanie Nyairo, Mercy Muchai, Samuel Chege Maina, Aditya Vashistha, Anja Thieme, Jacki O'Neill

机构 * Microsoft Research Africa(微软研究院非洲分部) Swansea University(斯旺西大学) Cornell University(康奈尔大学) Microsoft Research Cambridge(微软研究院剑桥分部)

AI总结 本文以五个非洲社区为对象,通过混合方法评估AI生成多模态故事的文化对齐情况,构建了相关分类体系,并发现多模态LLM裁判需经社区校准才能可靠评估文化对齐。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29008 2026-09-01 cs.AI 新提交

Multi-Step Forecasting of Grape Berry Temperature based on LSTM Model with Feed-Forward Attention

基于带前馈注意力机制的LSTM模型的葡萄浆果温度多步预测

Srikanth Gorthi, L. G. Divyanth, Dattatray Bhalekar, Markus Keller, Lav Khot

机构 * Washington State University(华盛顿州立大学) Cornell University(康奈尔大学)

AI总结 本研究开发FAM-LSTM模型,结合露天气象站与葡萄园微气候数据,在15分钟至72小时的多步预测中,其葡萄浆果温度预测性能优于LSTM等基准模型,可支撑葡萄园精准热胁迫管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28913 2026-09-01 cs.CV cs.GR cs.LG eess.SP 新提交

mmIR: Frequency-Space Inverse Rendering for 3D Millimeter-Wave Radar ADC Synthesis

mmIR:用于3D毫米波雷达ADC合成的频率空间逆渲染方法

Adnan Armouti, Yixuan Gao, Rajalakshmi Nandakumar

机构 * Cornell Tech(康奈尔科技学院)

AI总结 提出开源可微分的FMCW雷达逆渲染器mmIR,采用LiDAR辅助逆渲染,在ColoRadar数据集上实现高分辨率3D雷达数据合成,相关性能优于Sionna-RT且可跨雷达硬件迁移。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026. Project page: https://mmwave-inverse-rendering.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21719 2026-09-01 cs.DC cs.AI 交叉投稿

PowerSlider: Exploiting Phase Asymmetry for LLM Serving under Demand Response

PowerSlider:利用相位不对称性实现需求响应下的大语言模型服务

Yueying Li, Jiayang Chen, Yuanfan Chen, Leo Han, Haoran Qiu, Esha Choukse, Rodrigo Fonseca, Udit Gupta

机构 * Cornell University(康奈尔大学) Microsoft Azure Research(微软Azure研究院) Cornell Tech(康奈尔科技学院)

AI总结 PowerSlider通过分解大语言模型服务阶段并结合KKT在线求解器,在电网需求响应的时变功率上限下,显著提升了服务吞吐量与延迟性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21281 2026-09-01 cs.CV 版本更新

WildFin: An In-the-Wild Dataset for Fish Behavioral Recognition

WildFin:用于鱼类行为识别的野外数据集

Abigail G. Grassick, Jerome Tze-Hou Hsu, Ethan Lin, Ziang Liu, Max Whitton, Madelyn Hair, Liam Gutierrez, Haozheng Yu, Kristin Branson, Vivek Jayaraman, Michael A. Gil, Andrew M. Hein, Jennifer J. Sun

机构 * Cornell University(康奈尔大学) University of Colorado Boulder(科罗拉多大学博尔德分校) HHMI Janelia Research Campus(HHMI珍妮亚研究园区)

AI总结 针对复杂海洋环境中鱼类行为识别模型失效问题,推出WildFin野外数据集,经大规模整理标注后对视觉基础模型测试,发现其与现实需求存在显著差距。

Comments 31 pages, 4 figures ECCV Marine 26 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29018 2026-09-01 cs.AI cs.CL 版本更新

Adopt $\neq$ Adapt: Longitudinal Analyses of LLM Conversations in the Wild

采用 ≠ 适应:野外LLM对话的纵向分析

Rebecca M. M. Hicke, Kiran Tomlinson

机构 * Cornell University(康奈尔大学) Microsoft Research(微软研究院)

AI总结 通过分析约12,000名Microsoft Bing Copilot用户的对话轨迹及WildChat-4.8M数据,发现用户行为高度固化,活跃用户更倾向复杂专业任务,且WildChat数据集偏向高熟练度“超级用户”,表明现有用户行为难以改变并揭示用户异质性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28099 2026-08-31 cs.AI cs.CL 新提交

Speculative Probing: LLM Monitoring at Speculative-Decoding Cost

推测式探测:以推测解码成本实现大语言模型监控

Collin Zhang, Tingwei Zhang, Vitaly Shmatikov

机构 * Cornell Tech(康奈尔科技学院)

AI总结 该研究提出将LLM的推测解码模块改造为序列分类器,在可忽略开销下实现高效分类,其小型探测模型在多任务上优于零样本GPT-5.4-mini,部分任务性能匹配专用8B安全分类器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25449 2026-08-31 cs.CL cs.AI cs.LO 版本更新

MathAdv: What Theorem Provers Know, Reason, Formalize, and Generalize

MathAdv:定理证明器所知晓、推理、形式化及泛化的内容

Jiaxin Yuan, Connor Martinez Lockhart, Xiaoyu Liu, Jiaqi Wang, Chenghao Deng, Xiayimei Han, Vlassis Mastrantonis, Dmitrii Gudin, Shaopeng Zhu, Abdirisak Mohamed, Bilal Aytekin, Jiewen Lang, Zezheng Song, Furong Huang

机构 * University of Maryland(马里兰大学) Georgia Institute of Technology(佐治亚理工学院) Cornell University(康奈尔大学) All Purpose AI

AI总结 本研究推出涵盖13个数学领域的诊断基准MathAdv,结合Lean 4评估当代定理证明器,发现形式化是瓶颈、性能跨领域差异大等问题,为分组件评估模型能力提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16742 2026-08-31 cs.CV 版本更新

When the City Teaches the Car: Label-Free 3D Perception from Infrastructure

当城市教导汽车:从基础设施实现无标签的3D感知

Zhen Xu, Jinsu Yoo, Cristian Bautista, Zanming Huang, Tai-Yu Pan, Zhenzhen Liu, Katie Z Luo, Mark Campbell, Bharath Hariharan, Wei-Lun Chao

机构 * The Ohio State University(俄亥俄州立大学) Google(谷歌) Cornell University(康奈尔大学) Stanford University(斯坦福大学) Boston University(波士顿大学)

AI总结 本文提出一种无标签的3D感知方法,利用道路设施作为无监督教师,通过固定视角和重复观测学习局部3D检测器,并广播预测作为伪标签监督,无需基础设施即可训练独立的车辆检测器。

Comments ECCV 2026; Project Page: https://jinsuyoo.info/civet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16145 2026-08-31 cs.RO 版本更新

Differentiable Dynamics and Fast Simulation of Continuous Elastic Robotic Fish

可微动力学与连续弹性机器鱼的快速仿真

Zhiheng Chen, Jiayi Jin, Wei Wang

机构 * Marine Robotics Lab, Department of Mechanical Engineering, College of Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校工程学院机械工程系水下机器人实验室) Sibley School of Mechanical and Aerospace Engineering, Cornell University(康奈尔大学Sibley机械与航空航天工程学院)

AI总结 本文针对现有机器鱼动力学模型的不足,提出基于哈密顿原理的可微全身动力学模型与快速仿真框架,经数值与实验验证,可用于机器鱼身体刚度分布的梯度优化设计。

Comments Under review at IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27391 2026-08-28 cs.AI cs.CL cs.IR cs.LG 新提交

CorporateBench: Large-Scale Q&A Benchmarking with Temporal Knowledge Bases

CorporateBench:基于时序知识库的大规模问答基准测试

Sil Hamilton, Albert Yu Sun, Oscar J. Romero, Carl-Leander Henneking, David Mimno, Bishan Yang, Igor Labutov

机构 * Epiq AI Labs(Epiq AI实验室) Cornell University(康奈尔大学)

AI总结 研究针对企业级LLM评估的数据集难题,构建了含23万+文档的CorporateBench基准,从信息提取与知识库查询维度评估5种LLM,发现输入规模接近实际时性能下降,填补了相关评估指标空白。

Comments Accepted to EMNLP Findings

详情

展开后加载摘要…

URL PDF HTML 收藏