arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-31 至 2026-08-31 共收录 41 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 41 篇

2603.19423 2026-08-31 cs.CR cs.AI cs.LG 版本更新 92%

The Autonomy Tax: Defense Training Breaks LLM Agents

自主性税:防御训练破坏LLM智能体

Shawn Li, Yue Zhao

机构 * University of Southern California(南加州大学)

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 揭示防御训练在提升LLM智能体安全性时,系统性地破坏其工具执行能力,导致任务失败率飙升,且无法有效防御复杂攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28482 2026-08-31 cs.LG cs.AI 新提交 90%

How Proper Scoring Rules Shape LLM Forecasting

恰当评分规则如何塑造大语言模型(LLM)的预测

Benjamin Turtel, Paul Wilczewski, Kris Skotheim, Ville A. Satopää, Philip E. Tetlock

机构 * Lightning Rod Labs(闪电杆实验室) INSEAD(欧洲工商管理学院) School of Arts & Sciences, University of Pennsylvania(宾夕法尼亚大学文理学院)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文研究了5种恰当评分规则作为训练目标对LLM预测的影响,发现不同规则训练的模型在校准、概率使用等方面有差异,Brier训练模型表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22454 2026-08-31 cs.CL cs.AI 版本更新 90%

CASPER in the Machine: Insights into Character Variety in LLM-Generated Stories

机器中的CASPER:LLM生成故事中角色多样性的洞察

Anneliese Brei, Abhisheik Sharma, Nicholas Sanaie, Lu Wang, Snigdha Chaturvedi

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Georgia Institute of Technology(佐治亚理工学院) University of Michigan(密歇根大学)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文借用叙事学定义,从八个维度分析LLM与人类创作故事中角色的刻画,发现两者在角色类型和多样性上既有相似也有差异。

Comments Proceedings of ACL, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28399 2026-08-31 cs.AI q-fin.TR 新提交 90%

RetailAgent: Structured Adverse Timing in Self-Conditioned Multimodal LLM Trading Agents

RetailAgent:自条件多模态大语言模型交易智能体中的结构化不利时机

Yupeng Zhang, Liuyuan Jiang, Hongyi Huang, Bingheng Li, Lisha Chen

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Michigan State University(密歇根州立大学) University of Rochester(罗切斯特大学)

专题命中 其他LLM :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出RetailAgent框架,发现LLM交易智能体的决策存在跨维度的持续不利时机,动作与后续收益的一致性是该效应的关键驱动因素,同时自生成记忆会增强策略持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25210 2026-08-31 cs.DB 版本更新 89%

Bolt-on, Verifiable Provenance for LLM-Powered Data Processing

用于大语言模型驱动数据处理的外挂式可验证来源

Yiming Lin, Sepanta Zeighami, Aditya G. Parameswaran

专题命中 其他LLM :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM黑盒无法提供答案来源及可信度的问题,提出外挂式框架BLIP,可高效生成小尺寸可验证来源,在七个数据集上准确率较最优基线高30%以上且成本低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18414 2026-08-31 cs.CR cs.AI 版本更新 87%

Prompts Don't Protect: Architectural Enforcement via MCP Proxy for LLM Tool Access Control

提示不保护:通过MCP代理实现的架构强制以实现LLM工具访问控制

Rohith Uppala

机构 * Independent Researcher(独立研究员)

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种受控的MCP代理,通过在工具发现和工具调用两个阶段实施基于属性的访问控制(ABAC),有效阻止了未经授权的工具调用,而提示基于的限制仅能减少11-18个百分点的未授权调用率,证明了架构强制在部署的智能体系统中实现可靠工具访问控制的必要性。

Comments 7 pages, 4 tables, 2 figures. Camera-ready version accepted to the EMNLP 2026 Industry Track; adds benign-utility and abstention evaluation, latency percentiles, and revised limitations

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00728 2026-08-31 cs.LG 版本更新 87%

Meta-Prompt Optimization for LLM-Based Sequential Decision Making

基于大语言模型的序列决策中的元提示优化

Mingze Kong, Zhiyong Wang, Yao Shu, Zhongxiang Dai

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Chinese University of Hong Kong(香港中文大学) Guangdong Lab of AI and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对基于大语言模型的序列决策中因奖励非平稳导致的元提示优化难题,提出EXPO及扩展的EXPO-ES算法,可显著提升相关任务性能。

Comments EMNLP 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27797 2026-08-31 cs.AI cs.CL cs.FL 新提交 87%

CEDAR: Automata as Verifiable Interfaces for Language-Guided Embodied Action

CEDAR:作为语言引导具身动作可验证接口的自动机

Lekai Chen, Alvaro Velasquez, Ashutosh Trivedi

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 其他LLM :LLM(summary_cn,abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出 CEDAR 框架,将具身智能体的自然语言指令转化为正则语言并表示为确定有限自动机,在 Minecraft 中可维持基线无法保留的时空约束并减少 LLM 查询,提供了实用的验证层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28361 2026-08-31 cs.AI cs.LG 新提交 86%

GRACE:Gradient-guided Coreset Selection for LLM Unlearning

GRACE:面向大语言模型遗忘的梯度引导核心集选择方法

Praveen Bushipaka, Andrea D'Angelo, Lucia Passaro, Tommaso Cucinotta

机构 * University of Pisa(比萨大学) Aarhus University(奥胡斯大学)

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对大语言模型遗忘中需从异构语料推断遗忘集和保留集的问题,提出GRACE梯度引导核心集选择方法,通过梯度计算与匹配追踪选择核心集,在多领域、多模型、多算法实验中提升模型效用且保持遗忘质量。

Comments 20 pages, 16 tables, 5 figures, accepted to EMNLP Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28389 2026-08-31 cs.CR cs.CL 新提交 85%

CamoDocs: A Poisoning Attack Against Retrieval-Augmented Language Models Using Camouflaged Documents

CamoDocs:针对检索增强语言模型的伪装文档中毒攻击

Jaewon Jung, Haizhong Zheng, Hongsun Jang, Jaeyong Song, Beidi Chen, Jinho Lee

专题命中 其他LLM :LLM(summary_cn,abstract_cn);language model(title);分类 cs.CL

AI总结 本研究提出CamoDocs伪装文档中毒攻击,将对抗性文档伪装在良性内容中,在多种RAG防御、LLM及专有模型上实现高攻击成功率,同时避免易被检测的查询重叠痕迹。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27531 2026-08-31 cs.CR cs.CV 新提交 85%

Fully Unleashing the Multimodal Attacker: Meta-Adaptive Jailbreaking of Vision-Language Models

充分释放多模态攻击者的潜力:视觉语言模型的元自适应越狱攻击

Benlei Cui, Shen Pang, Yuke Wang, Xuemei Dong, Yuwen Zhai, Jingqun Tang, Haiyang Yu, Hui Xue, Longtao Huang, Haiwen Hong

专题命中 其他LLM :language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 提出元自适应多模态越狱攻击(MAMJ),通过优化攻击策略提示与攻击者权重提升多模态越狱效果,在MM-SafetyBench上对多款前沿VLMs的攻击成功率显著优于基线,且可迁移至未见过的目标模型。

Comments Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28178 2026-08-31 cs.AI 新提交 83%

Expert Knowledge & Machine Understanding: Bridging Reactome's Ontology with LLM Semantic Embeddings

专家知识与机器理解:将Reactome的本体与LLM语义嵌入相结合

Susanna Bravi, Riccardo De Luca, Rosa Sicilia, Christine Nardini, Mario Santoro

机构 * Istituto per le Applicazioni del Calcolo Mauro Picone, Italian National Research Council(意大利国家研究委员会 Mauro Picone 应用计算研究所) Università Campus Bio-Medico di Roma(罗马校园生物医学大学) UniCamillus-Saint Camillus International University of Health Sciences(圣卡米勒斯国际健康科学大学)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI

AI总结 本研究利用句子Transformer模型SPECTER2等技术,通过Reactome的文本元数据重构语义层级结构,证实可借助专家编写的文本元数据推断通路的全局层级结构,为生物知识库的自动扩展提供了可行方法。

Comments Accepted at the CIBB 2026 conference ( this https URL (https://cibb2026.teralab.ai/) )

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17694 2026-08-31 cs.CL 版本更新 83%

Do LLM Agents Mirror Socio-Cognitive Effects in Power-Asymmetric Conversations?

大语言模型在权力不对称对话中是否反映社会认知效应?

Anvesh Rao Vijjini, Sagar Manjunath, Snigdha Chaturvedi

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 其他LLM :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨了大语言模型在被赋予高或低地位角色时是否表现出与人类相似的社会认知效应,通过模拟多轮权力不对称对话,分析语言协调、代词使用、说服成功率和对危险请求的遵从性,发现模型在权力效应上表现出关键特征,但存在差异和变异性。

Comments ACL 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28541 2026-08-31 cs.LG cs.AI 新提交 82%

An Enclosed Mode Is a Gauge Choice: Topology Relative to Reach in Certified Code World Models

闭合模式是一种规范选择:认证代码世界模型中相对于可达性的拓扑结构

Javier Aguilar Martín

机构 * AGILabs

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 该研究探讨认证代码世界模型中相对于可达性的拓扑,通过LLM合成实验得出三条原则,揭示危险与可达性的关联、修复的限制及缓解措施需匹配错误维度方向的结论。

Comments 33 pages, 2 figures. Paper 3 of a series (companion papers: arXiv:2607.14169 (https://arxiv.org/abs/2607.14169), arXiv:2608.17956 (https://arxiv.org/abs/2608.17956) ). Code, data, and Lean formalization: this https URL (https://github.com/JaviMaligno/code-world-models)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28010 2026-08-31 cs.LG cs.AI 新提交 82%

When Can Conditional Flow Matching Replace Pointwise Negative Log-Likelihood?

条件流匹配何时能替代逐点负对数似然?

Yansen Han, Hongxin Sun, Tao Lin

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Fudan University(复旦大学)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文通过理论分解刻画了条件流匹配(CFM)可替代逐点负对数似然(NLL)的条件,指出其在离策略总体最优处的局限性,相关结论及分解为适配LLM方法至流匹配提供了理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14278 2026-08-31 cs.CL cs.AI cs.IR 版本更新 82%

PRISM: Agentic Retrieval with LLMs for Multi-Hop Question Answering

PRISM:用于多跳问答的基于大语言模型的智能体检索框架

Md Mahadi Hasan Nahid, Davood Rafiei

机构 * Department of Computing Science University of Alberta(计算科学系阿尔伯塔大学)

专题命中 其他LLM :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出PRISM智能体检索框架,通过三个专门LLM智能体迭代交互优化多跳问答的证据检索,在四个基准上性能优于强基线,减少无关信息并提升下游QA模型表现。

Comments EMNLP 2026 (long, main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28170 2026-08-31 cs.CL cs.AI 新提交 81%

Text Restoration of Ancient Documents with Language Models

利用语言模型修复古代文档的文本

Shibingfeng Zhang, Edoardo Caraffa, Annafelicia Zuffrano, Maddalena Modesti, Giovanni Colavizza

机构 * University of Bologna(博洛尼亚大学) University of Copenhagen(哥本哈根大学)

专题命中 其他LLM :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究探究用语言模型修复古代手稿缺损文本的可行性,提出适配场景的模型与解码策略,发现模型性能受文档结构和缺损长度影响,为开发古文字学辅助工具提供指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28124 2026-08-31 cs.CR 新提交 80%

TagZilla: Automated Owner and Abuse Type Tagging for Indicators of Compromise in Threat Reports

TagZilla:针对威胁报告中恶意代码指示器的所有者与滥用类型自动标注平台

Gibran Gomez, Juan Caballero

专题命中 其他LLM :LLM(summary_cn,abstract)

AI总结 TagZilla是基于LLM的IoC自动标注平台,采用开放与闭世界分类法,在100份含1534个IoC的报告上F1值达0.94和0.93,可标注多行为者报告并生成IoC档案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28246 2026-08-31 cs.RO cs.AI 新提交 79%

Training-free Suction Grasp Detection for Deformed Aseptic Cartons Using Vision-Language Models and Geometric Surface Scoring

基于视觉语言模型与几何表面评分的免训练变形无菌纸箱吸盘抓取检测

Marin Maletic, Goran Vasiljevic

机构 * University of Zagreb Faculty of Electrical Engineering and Computing(萨格勒布大学电气工程与计算机学院)

专题命中 其他LLM :language model(title,abstract);分类 cs.AI

AI总结 该研究针对可回收废物机器人分拣的挑战,提出一种免训练的变形无菌纸箱吸盘抓取系统,结合视觉语言模型、SAM2与几何表面评分方法,在真实机器人实验中取得了良好的抓取与检索效果。

Comments 6 pages, ICCAS 2026 preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15102 2026-08-31 cs.CL 版本更新 79%

A Declarative-Procedural Perspective on Expert Routing in Bilingual Mixture-of-Experts Language Models

双语混合专家语言模型中专家路由的声明式-过程式视角

Amrit Gopinath, Raghul, Durairaj Thenmozhi

机构 * Sri Sivasubramaniya Nadar College of Engineering(斯里·西瓦苏布拉马尼亚·纳达尔工程学院) Shiv Nadar University Chennai(钦奈希夫·纳达尔大学)

专题命中 其他LLM :language model(title,abstract);分类 cs.CL

AI总结 该研究探究双语MoE语言模型的专家路由是否形成语言结构,对比课程学习与无课程训练的模型,发现无课程模型专业化更强但依赖随机种子,课程模型路由更均衡,揭示MoE路由可出现可解释语言组织。

Comments 15 pages, 6 figures, 12 tables (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28218 2026-08-31 cs.CV 新提交 78%

Focus Where It Counts: A Salience-Driven Vision-Language Model for Low Vision Assistance

聚焦关键之处:面向低视力辅助的显著性驱动视觉-语言模型

Jiazhao Liang, Hao Huang, Shuaihang Yuan, Congcong Wen, Geeta Chandra Raju Bethala, Giles Hamilton-Fletcher, Yu Hao, John-Ross Rizzo, Mengyu Wang, Anthony Tzes, Yi Fang

机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院) New York University Abu Dhabi(纽约大学阿布扎比分校) NYU Grossman School of Medicine(纽约大学格罗斯曼医学院) NYU Langone Health(纽约大学兰贡医疗中心) Harvard University(哈佛大学)

专题命中 其他LLM :language model(title,abstract)

AI总结 针对现有视觉-语言模型未建模人类感知优先级的问题,提出显著性驱动的Salience-LLaVA模型,构建三个显著性数据集并引入SCMI评估,部署于辅助眼镜实现低视力辅助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27496 2026-08-31 cs.CR 新提交 75%

ROPE: Routed Origin Policy Enforcement against Indirect Prompt Injection

ROPE:针对间接提示注入的路由来源策略执行

Xinhang Ma, Chaowei Xiao, William Yeoh, Ning Zhang, Yevgeniy Vorobeychik

专题命中 其他LLM :LLM(abstract,abstract_cn);language model(abstract)

AI总结 本文提出ROPE防御间接提示注入,通过确定性来源检查实现可证明的安全保证,在低攻击成功率的同时保留高智能体效用,优于现有系统级防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27808 2026-08-31 cs.AI cs.CV cs.LG 新提交 73%

CURA: Certified Runtime Alarms for Computer-Use Agents

CURA:面向计算机使用智能体的可验证运行时警报

Divake Kumar, Sina Tayebati, Devashri Naik, Amanda Sofie Rios, Nilesh Ahuja, Omesh Tickoo, Ranganath Krishnan, Amit Ranjan Trivedi

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Intel Labs(英特尔实验室) Capital One AI Labs(Capital One AI实验室)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对计算机使用智能体自报告失效问题,提出仅读取测试环境遥测的外部监控器CURA,可在运行时检测失败,提升任务解决率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27782 2026-08-31 cs.CR cs.CL cs.LG 新提交 73%

Memorization Is Not Extraction: Tight Differential-Privacy Bounds and Audit Blind Spots

记忆并非提取:严格的差分隐私边界与审计盲区

Xujun Che, Depeng Xu, Shuhan Yuan

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究明确了大型语言模型中反事实记忆与自适应提取的差分隐私边界,发现二者互不控制,存在双向盲区,且在数十亿参数模型上依然存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13396 2026-08-31 cs.AI cs.CL cs.SE 版本更新 73%

Set-shifting Behavioral Test for Harnessed Agents

用于受约束智能体的集合转移行为测试

Ye Ziwei

专题命中 其他LLM :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究当可靠工具在会话中悄然改变时语言模型智能体的工具选择,借鉴认知心理学的集合转移构建基准和评估框架,计算集合转移准确率,测试发现不同失败模式及集合框架对路由动态有影响。

Comments Accepted at COLM 2026 Workshop on Agent Behavior

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26647 2026-08-31 cs.LG cs.AI stat.ML 版本更新 73%

More Expressive Feedforward Layers: Part I. Token-Adaptive Mixing of Activations

更具表达力的前馈层:第一部分。激活的令牌自适应混合

Mingze Wang, Jinbo Wang, Yikuan Xia, Kai Shen, Shu Zhong

机构 * Peking University(北京大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出令牌自适应激活混合(MoA)和可学习激活(LA)方法,通过轻量级输入相关门混合多个激活函数,在理论和实验上证明其比固定激活FFN具有更强的表达能力和更优的缩放行为。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11017 2026-08-31 cs.CL cs.AI 版本更新 73%

Beyond the Rosetta Stone: Unification Forces in Generalization Dynamics

超越罗塞塔石碑:泛化动态中的统一力量

Carter Blum, Katja Filippova, Ann Yuan, Asma Ghandeharioun, Julian Zimmert, Fred Zhang, Jessica Hoffmann, Tal Linzen, Martin Wattenberg, Lucas Dixon, Mor Geva

机构 * Google DeepMind(谷歌DeepMind) Tel Aviv University(特拉维夫大学) Harvard University(哈佛大学) New York University(纽约大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过在合成多语言数据集上训练小型Transformer模型,揭示了LLMs跨语言知识迁移困难的原因,提出了统一表征视角,为改善LLMs跨语言迁移提供了方法。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28184 2026-08-31 cs.LG 新提交 70%

Biologically Inspired Mechanisms for Facilitating Grokking in Multilayer Perceptrons

促进多层感知机中Grokking的生物启发机制

Florin Leon

机构 * Faculty of Automatic Control and Computer Engineering(自动控制与计算机工程学院) “Gheorghe Asachi” Technical University of Iași(雅西“格奥尔基·阿萨奇”技术大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究探究生物启发机制能否促进多层感知机的Grokking转变,经在稀疏奇偶校验和带噪异或分类基准上实验,发现稳态调节增益最强,为相关机制应用于大语言模型提供支撑。

Comments 51 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27790 2026-08-31 cs.AI cs.DB 新提交 70%

Credo: Reusable Declarative Primitives for Agentic Workflows

Credo:面向智能体工作流的可复用声明式原语

Duo Lu, Andrew Crotty, Uğur Çetintemel

机构 * Brown University(布朗大学) Northwestern University(西北大学)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 Credo可恢复智能体工作流harness的结构化声明式描述,标记元数据并带来源编目,编译器可绑定其原语生成新任务harness,避免从头搜索,还提出了数据库界可开展的相关研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22697 2026-08-31 cs.AI econ.GN 版本更新 70%

Does Rank Still Matter? Position Bias When AI Agents Shop on Our Behalf

排名仍然重要吗?AI代理代人购物时的位置偏差

Davood Wadi, Yu Ma

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究对比四种大语言模型与人类实地数据,发现AI代理代人购物时搜索深度更高、从不弃权,列表位置对其查看影响弱且非单调,结果属性比位置更重要,最终所有模型均选相同非劣势列表。

详情

展开后加载摘要…

URL PDF HTML 收藏