arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

共收录 3728
2609.04141 2026-09-04 cs.AI 新提交

Efficient Test-Time Adaptation through Human-AI Interaction

通过人机交互实现高效的测试时自适应

Zora Zhiruo Wang, Apurva Gandhi, Rulin Shao, Aspen Chen, Jonas Mueller, Zhiqi Liang, Jett Chen, Michael Ryan, Qianou Ma, Luxi He, Zhoujun Cheng, Andre He, Seungone Kim, Jiayi Geng, Mingqian Zheng, Weiwei Sun, Zheyuan Zhang, Xinran Zhao, Yike Wang, Abe Hou, Liwei Jiang, Pang Wei Koh, Diyi Yang, Graham Neubig, Daniel Fried

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学) Handshake AI(汉德shake人工智能公司) Stanford University(斯坦福大学) Princeton University(普林斯顿大学) University of California San Diego(加利福尼亚大学圣迭戈分校)

AI总结 本研究提出TAHI方法,通过人机交互将跨会话信号整合到智能体中,针对30位用户的600项任务自适应后,单独任务成功率提升4.5-20.9%,还可跨用户提升最高8.8%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03688 2026-09-04 cs.CV 新提交

ToPO: Token-Conditioned Preference Routing for Attention-Based Latent Diffusion Models

ToPO:面向注意力型潜在扩散模型的令牌条件偏好路由

Juntao Xu, Shihong Li, Hoi Fan Au, Ning Zhu

机构 * Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学) Stanford University(斯坦福大学)

AI总结 该研究提出ToPO方法,通过构建时空路由优化注意力型潜在扩散模型的偏好,在SD-1.5和SDXL相关指标上优于Diffusion-DPO,且在盲测中胜率更高。

Comments 37 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03366 2026-09-04 cs.CL cs.CY cs.LO 新提交

Accountable AI with Grounded, Faithful, Consistent, Actionable Rationales: A Case Study in Clinical Trial Matching with VERDICT

基于 grounded、忠实、一致、可行动的理由的可问责人工智能:以VERDICT用于临床试验匹配的案例研究

Zikai Zhou, Yufei Jin, Yilin Xu, Yu-Chiang Wang, Chieh-Ju Chao, Monica S. Lam

机构 * Stanford University(斯坦福大学) Emory University(埃默里大学) Mayo Clinic(梅奥诊所)

AI总结 该研究针对LLM决策存在的不忠实、不一致问题,提出VERDICT智能体,将决策任务转化为SMT问题推导决策,在临床试验匹配任务中实现高准确性、完美政策一致性及受临床医生青睐的可问责理由。

Comments Accepted to EMNLP 2026 (Main Conference). 46 pages, 6 figures, 28 tables. Code and prompts: https://github.com/stanford-oval/clinical-trial-matching

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03261 2026-09-04 cs.CV cs.CL 新提交

MedQA-MM: Shortcuts Behind Medical Visual Reasoning

MedQA-MM:医学视觉推理背后的捷径

Benlu Wang, Yifan Zhang, Jiaqing Yu, Chin Siang Ong, Juncheng Huang, Zhuohao Li, Zhenyu Zhang, Arman Cohan, Hong Yu, Zonghai Yao

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Yale University(耶鲁大学) University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校) VA Bedford Healthcare System(贝斯以色列女执事医疗中心贝德福德分部) Qingdao Medical College of Qingdao University(青岛大学青岛医学院) Yale School of Medicine(耶鲁医学院) National University Hospital, Singapore(新加坡国立大学医院) Zhejiang University(浙江大学) Stanford University(斯坦福大学)

AI总结 该研究针对医学多模态MCQ的推理膨胀问题,构建捷径缓解子集MedQA-MM,通过多维度审计与消融实验揭示模型依赖文本等捷径,证明医学图像推理需路径层面证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03229 2026-09-04 cs.LG 新提交

Language-encoded network topology enables large language models to reason about complex networks

语言编码的网络拓扑结构使大型语言模型能够对复杂网络进行推理

Ucchwas Talukder Utsha, Sakib Mostafa, James Zou, Md Tauhidul Islam

机构 * Stanford University(斯坦福大学) Stanford University School of Medicine(斯坦福大学医学院)

AI总结 本文提出BioGlyph将网络拓扑编码为结构角色语言,提升开源LLMs的网络结构推理能力,在20个跨领域网络上准确率较现有方法最高提升26个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03067 2026-09-04 cs.RO cs.SY eess.SY 新提交

GPU-Accelerated Astrodynamics World Models for Spacecraft Rendezvous and Proximity Operations

用于航天器交会与接近操作的GPU加速天体动力学世界模型

Duncan Eddy, Isaac R. Ward, Grace Ra Kim, Mykel J. Kochenderfer

机构 * Stanford University(斯坦福大学)

AI总结 本文提出一种基于Transformer的世界模型方法,结合GPU加速的ISS对接环境,实现航天器交会与接近操作,在对接成功率、分布外泛化及异常检测上优于基线,已开源相关资源。

Comments 20 pages, 12 figures, 5 tables, Presented at Advanced Maui Optical and Space Surveillance Technologies Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01938 2026-09-04 cs.RO 版本更新

One Demonstration, Many Objects: Generalizing Manipulation via Local Contact Geometry

一个演示,多个物体:通过局部接触几何泛化操作任务

Satvik Sharma, Samrat Sahoo, Huang Huang, Fei-Fei Li, Jiajun Wu, Dorsa Sadigh, Jeannette Bohg

机构 * Stanford University(斯坦福大学)

AI总结 提出DemoMimic策略,以接触点局部几何为核心,结合接触中心奖励,在16个物体、4个任务上实现71%操作成功率,提升了跨物体泛化能力与现实迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24101 2026-09-04 cs.RO 版本更新

TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks

TrAct:通过视觉轨迹连接机器人控制与视觉预测

Zhi Cao, Howard Ji, Kevin Zhang, Kuangzhi Ge, Li Fei-Fei, Jiajun Wu, Huang Huang

机构 * University of Michigan(密歇根大学) Stanford University(斯坦福大学)

AI总结 TrAct是基于世界模型的机器人决策框架,以视觉轨迹为控制与预测的中间接口,在LIBERO-INTEGRAL基准和Franka任务上,相较基线π₀.5显著提升了操作成功率与视频预测质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14991 2026-09-04 cs.LG math.OC q-fin.PM 版本更新

Adaptive Partitioning and Learning for Stochastic Control of Diffusion Processes

用于扩散过程随机控制的自适应划分与学习

Hanqing Jin, Renyuan Xu, Yanzhao Yang

机构 * Mathematical Institute, University of Oxford(牛津大学数学研究所) Department of Management Science and Engineering, Stanford University(斯坦福大学管理科学与工程系)

AI总结 研究无界连续状态空间等设定下扩散过程的强化学习,引入基于模型算法自适应划分联合状态-动作空间,平衡探索与近似,分析得出依赖多因素的遗憾界并验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12037 2026-09-04 cs.LG 版本更新

Adaptive Resolving Methods for Markov Decision Processes with Function Approximations

基于函数近似的马尔可夫决策过程自适应求解方法

Jiashuo Jiang, Yinyu Ye, Yiming Zong

机构 * Department of Industrial Engineering & Decision Analytics, The Hong Kong University of Science and Technology(香港科学与技术大学工业工程与决策分析系) Department of Management Science & Engineering, Stanford University(斯坦福大学管理科学与工程系)

AI总结 本研究针对带函数近似的马尔可夫决策过程,提出基于线性规划重构的自适应求解算法,其实例依赖保证更紧且经验性能高效,具有广泛应用价值。

Comments Accepted for publication in Operations Research Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03096 2026-09-03 cs.LG cs.CL 版本更新

When Prompts Interact: Assessing Prompt Arithmetic for Deconfounding under Distribution Shift

提示词交互时:评估分布偏移下用于去混淆的提示词算术

Zhecheng Sheng, Yongsen Tan, Xiruo Ding, Trevor Cohen, Serguei Pakhomov

机构 * University of Minnesota(明尼苏达大学) University of Washington(华盛顿大学) Stanford University(斯坦福大学)

AI总结 本研究提出混合提示词算术(HyPA),结合任务提示词与线性化混淆提示词,在多个基准测试中改善分布偏移下的鲁棒性-性能权衡,为提升混淆偏移下的模型鲁棒性提供了参数高效的方法。

Comments 20 pages, 11 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02776 2026-09-03 cs.CV 新提交

Video-Based Palm-Vein Authentication under Challenging Conditions

挑战性条件下基于视频的掌纹认证

Xiaofeng Yan, Kechen Liu, Abhilash Venkatesh, Cathy Zhang, Xia Zhou, Salvatore Stolfo

机构 * Columbia University(哥伦比亚大学) Princeton University(普林斯顿大学) Stanford University(斯坦福大学) Amazon.com Services LLC(亚马逊服务有限责任公司)

AI总结 该研究推出首个公开视频掌纹数据集CUP,提出融合时间共识与空间区域匹配的鲁棒认证方法,在脏污等挑战性条件下大幅降低EER,还发现温暖条件下与身体水分、性别相关的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02358 2026-09-03 cs.RO cs.LG cs.SY eess.SY 新提交

Humanoid Safe Stop via Learned Stoppability Value

基于可停止性值学习的人形机器人安全停止

Junfeng Long, Pieter Abbeel, Koushil Sreenath, Roberto Horowitz, Guanya Shi, C. Karen Liu

机构 * UC Berkeley(加州大学伯克利分校) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

AI总结 该研究针对人形机器人紧急停止问题,提出Safe-Stop框架,结合学习的停止策略与互补的可停止性估计器,实现无需重训练的跨任务迁移,在鲁棒性与反应性间取得平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02191 2026-09-03 cs.AI 新提交

Examining the Vulnerability of Multi-Agent Medical Systems to Human Interventions for Clinical Reasoning

探究多智能体医疗系统在临床推理中对人为干预的脆弱性

Benjamin C Liu, Dillon Mehta, Rishi Malhotra, Adam Zobian, Yong Ying Tan, Samir Chopra, Daniella Rand, Natalie Pang, Abhiram Gudimella, Kevin Zhu

机构 * Stanford University(斯坦福大学) Jordan High School(乔丹高中) UC San Diego(加利福尼亚大学圣迭戈分校) Winchester High School(温彻斯特高中) James Logan High School(詹姆斯·洛根高中) Rutgers University(罗格斯大学) Foothill–De Anza College(福希尔-德安扎学院) Fordham University(福特汉姆大学) Chapman University(查普曼大学) UC Berkeley(加利福尼亚大学伯克利分校)

AI总结 该研究针对多智能体医疗系统,借助MedQA数据集分析人为干预对其临床推理的影响,发现正确干预可提升诊断准确率、错误干预会降低性能,还揭示了模拟智能体与现实临床的认知偏见相似性,为提升系统诊断鲁棒性提供思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02059 2026-09-03 cs.AI cs.CV cs.LG 新提交

DocHop: Benchmarking Out-of-domain Multi-hop Reasoning in Information-Dense Documents

DocHop:面向信息密集型文档的域外多跳推理基准测试

Zhuoran Yu, Le Thien Phuc Nguyen, Jaden Park, Xinyi Gu, Zexue He, Soochahn Lee, Rogerio Feris, Yong Jae Lee

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) Kookmin University(国民大学) MIT-IBM Watson AI Lab, IBM Research(麻省理工学院-IBM沃森人工智能实验室,IBM研究院)

AI总结 该研究推出DocHop基准,针对信息密集型文档的域外多跳推理,构建含2074个样本的测试集,发现MLLMs性能远低于人类,为相关研究提供可控测试平台。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01832 2026-09-03 cs.CL cs.AI cs.LG q-bio.NC 新提交

Interpretable Symptom Vectors for Depression in a Large Language Model

大型语言模型中用于抑郁症的可解释症状向量

Fangyi Zhu, Ajay Subramanian, Allison Constant, Camille Wang, Ravish Gupta, Corey J. Keller

机构 * Stanford University School of Medicine(斯坦福大学医学院) Wu Tsai Neurosciences Institute, Stanford University(斯坦福大学吴蔡神经科学研究所) Kaiser Permanente(凯撒医疗机构) BigCommerce(BigCommerce公司) Veterans Affairs Palo Alto Healthcare System(帕洛阿尔托退伍军人事务医疗系统) Sierra Pacific Mental Illness, Research, Education, and Clinical Center (MIRECC)(塞拉太平洋精神疾病研究、教育和临床中心(MIRECC))

AI总结 本研究通过机制可解释性技术分析Gemma-3-27B-PT的残差流,构建与临床医生判断一致的抑郁症状向量,其第21层的抑郁向量可区分抑郁与非抑郁文本,为可解释抑郁评估工具提供机制基础。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01823 2026-09-03 cs.CV 新提交

Kirin: Animal Motion Generation from In-the-Wild Video

Kirin:从野外视频生成动物动作

Brian Nlong Zhao, Zhuoyang Pan, James M. Rehg, Jiajun Wu, Shangzhe Wu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Pennsylvania(宾夕法尼亚大学) Stanford University(斯坦福大学) University of Cambridge(剑桥大学)

AI总结 针对动物动作数据稀缺的问题,提出Kirin框架,构建首个四足动物视频-文本-动作对齐大规模数据集AiM3D,开发双条件动作生成模型,实现可渲染动画动物的自动生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19686 2026-09-03 cs.CL cs.LG 版本更新

Multi-Mask Diffusion Language Models for Few-Step Generation

用于少步生成的多掩码扩散语言模型

Sijin Chen, Yinuo Ren, Heyang Zhao, Ziheng Cheng, Quanquan Gu, Lexing Ying

机构 * ByteDance Seed(字节跳动种子) Princeton University(普林斯顿大学) Stanford University(斯坦福大学) UCLA(加州大学洛杉矶分校) UC Berkeley(加州大学伯克利分校)

AI总结 研究针对掩码扩散模型少步生成难的问题,提出多掩码扩散模型MultiMDM,通过特定前向过程使反向过程有起草能力,推导训练目标并制定蒸馏方案,经实验验证其为少步生成提供了有效基础。

Comments 38 pages; Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08552 2026-09-03 cs.DB cs.AI 版本更新

Automated Standardization of Legacy Biomedical Metadata Using an Ontology-Constrained LLM Agent

使用本体约束的LLM代理自动化标准化遗留生物医学元数据

Josef Hardi, Martin J. O'Connor, Marcos Martinez-Romero, Jean G. Rosario, Stephen A. Fisher, Mark A. Musen

机构 * Division of Computational Medicine, Stanford University(斯坦福大学计算医学部) Department of Biology, University of Pennsylvania(宾夕法尼亚大学生物学系)

AI总结 提出基于LLM的元数据标准化系统,通过实时查询标准指南和本体服务,在839条HuBMAP记录上验证,相比纯LLM方法显著提升预测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19539 2026-09-03 cs.CL cs.AI 版本更新

FDARxBench: Benchmarking Regulatory and Clinical Reasoning on FDA Generic Drug Assessment

FDARxBench:基于FDA通用药物评估的监管与临床推理基准测试

Betty Xiong, Jillian Fisher, Benjamin Newman, Meng Hu, Shivangi Gupta, Yejin Choi, Lanyan Fang, Russ B Altman

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) U.S. Food and Drug Administration(美国食品药品监督管理局)

AI总结 本文提出FDARxBench基准测试,用于评估基于文档的问答任务,通过FDA药物标签文档生成高质量问答示例,揭示语言模型在事实基础、长上下文检索和安全拒绝行为方面的差距。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00940 2026-09-02 cs.CL 新提交

A Dataset for Modeling Iterative Problem-Solving

用于建模迭代问题解决的数据集

Fagun Patel, Sang T. Truong, Duc Q. Nguyen, Kazunori Fukuhara, Benjamin W. Domingue, Sanmi Koyejo, Nick Haber

机构 * Stanford University(斯坦福大学) National University of Singapore(新加坡国立大学)

AI总结 该研究构建了包含3286名本科生超300万次代码提交的CodeInsight数据集,在此基准上评估了RSSM和LLM等模型,发现RSSM预测性能更优,LLM更适合作为生成式求解器。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00753 2026-09-02 cs.LG cs.CL 新提交

How Do Language Models Choose Between Context and Memory?

语言模型如何在上下文与记忆之间做出选择?

Benjamin Shih, John Winnicki, Arianna Cao

机构 * Stanford University(斯坦福大学) Perpetual Labs(永久实验室)

AI总结 该研究通过反事实实验,在Qwen、Llama、OLMo模型上揭示语言模型的上下文与参数知识选择受任务依赖的权威方向影响,局部方向对源选择转变的重现效果优于跨任务方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00731 2026-09-02 cs.AI cs.LG q-fin.ST 新提交

Agentic Empirical Asset Pricing: Methodological Foundations

智能体实证资产定价:方法论基础

Yingjian Pan, Xiaowei Ding, Kay Giesecke

机构 * Stanford University(斯坦福大学) Nanjing University(南京大学) Hasso Plattner Institute(哈索·普拉特纳研究所)

AI总结 该研究提出智能体实证资产定价(AEAP)范式,明确其核心构建模块,构建因子发现的参考架构与评估标准,通过SEADS实验发现单一指标无法稳定评估系统,还揭示了AEAP系统的评估陷阱。

Comments 26 pages, 5 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00612 2026-09-02 cs.RO 新提交

A Wearable Pneumatic Device for Continuous, Closed-Loop, Bidirectional Tactile Interaction

用于连续、闭环、双向触觉交互的可穿戴气动装置

Cosima du Pasquier, Aliyah Smith, Serin Huber, Joshua Phelps, Ilana A. Cohen, Ava Chen, Monroe Kennedy, Allison M. Okamura

机构 * Stanford University(斯坦福大学)

AI总结 该研究提出一种可穿戴气动触觉装置系统,集成传感与反馈,可实现双向触觉交互,实验显示其能改善远程操作性能并降低心理负荷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00479 2026-09-02 cs.AI 新提交

EGT-KG: Evidence-Grounded Typed KG Retrieval for Practical Scientific QA with Small Language Models

EGT-KG:基于证据的类型化知识图谱检索,用于结合小型语言模型的实用科学问答

Muran Yu, Jiechao Gao, Yuandong Pan, Barney H. Miao, Andrew C. Lesh, Kincho H. Law, Jie Wang, Michael D. Lepech

机构 * Stanford University(斯坦福大学) University of Calgary(卡尔加里大学)

AI总结 针对本地SLMs科学问答的约束,提出EGT-KG检索框架,经六维评估框架在生物聚合物结合土壤复合材料基准上验证,其多数场景优于普通RAG,llama3:8b变体提升显著。

Comments Accepted in EMNLP Industry track 2026

Journal ref EMNLP Industry track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00297 2026-09-02 cs.LG cs.AI 新提交

Geometry-aware Latent Autoregressive Generative Model for PDEs in Complex Domains

面向复杂区域偏微分方程的几何感知隐式自回归生成模型

Zi Wang, Minghui Xu, Tapan Mukerji

机构 * Stanford University(斯坦福大学)

AI总结 本文针对复杂几何下PDE求解难题,提出GeoLAMP模型,通过双编码器、流匹配Transformer与灵活解码器实现稳定预测,构建多物理场基准数据集并取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00196 2026-09-02 cs.LG cs.AI 新提交

WHALE: A Simple Recipe for Joint Harness-Weight Optimization

WHALE:一种用于联合 harness-权重优化的简单方案

Haechan Kim, Yoonho Lee, Gisang Lee, Chelsea Finn, Kangwook Lee

机构 * KRAFTON(克拉夫顿公司) KAIST(韩国科学技术院) Stanford University(斯坦福大学)

AI总结 该研究针对智能体性能受模型权重与 harness 代码单独优化瓶颈的问题,提出 WHALE 交替优化方案,结合在线拒绝采样微调与 Meta-Harness,在多领域 Qwen 智能体上较基线方法提升了准确率与 rollout 效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00611 2026-09-02 hep-ex cs.CV 新提交

Panda Diplomacy: Foundation Model Pre-training across Particle Imaging Detectors for High Energy and Nuclear Physics

Panda Diplomacy:面向高能与核物理的跨粒子成像探测器基础模型预训练

Samuel Young, César Jesús-Valls, Kazuhiro Terao

机构 * Stanford University(斯坦福大学) European Organization for Nuclear Research (CERN)(欧洲核子研究组织(CERN)) SLAC National Accelerator Laboratory(SLAC国家加速器实验室)

AI总结 本文提出跨探测器的点云自蒸馏框架,构建Panda V2基础模型,仅用千级标注数据即实现粒子聚类、识别等任务的最优性能,大幅降低高能核物理标注成本。

Comments 24 pages, 11 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21776 2026-09-02 cs.CL 版本更新

PromptNCE: Conditional Probabilities and PMI Using Only LLMs and Contrastive Estimation Prompts

PromptNCE:仅使用LLM和对比估计提示进行点互信息预测

Juliette Woodrow, Chris Piech

机构 * Department of Computer Science Stanford University(计算机科学系 斯坦福大学)

AI总结 本文提出PromptNCE方法,通过将条件概率估计转化为对比任务,并引入显式的OTHER类别来恢复真实的条件概率,从而在低数据情况下实现零样本点互信息估计。

Comments Camera-ready version for COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01030 2026-09-02 cs.AI 版本更新

Uncovering the Computational Ingredients of Human-Like Representations in LLMs

揭示大型语言模型(LLM)中类人表征的计算要素

Zach Studdiford, Timothy T. Rogers, Kushin Mukherjee, Siddharth Suresh

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Stanford University(斯坦福大学)

AI总结 该研究通过对75余个模型开展 triplet 相似度任务,发现指令微调与大注意力头维度是LLM类人概念表征对齐的关键要素,明确了现有基准无法完全衡量人与模型的对齐程度。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏