arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12294 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2073 篇

2607.28884 2026-08-03 cs.CR 新提交 91%

Hollow-LLM Attack: Computationally Trivial Weights in Zero-Knowledge Verification of LLM Inference

Hollow-LLM攻击:LLM推理零知识验证中的计算上微不足道的权重

Chen Gong, Beijie Liu, Mengyuan Li

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 该研究提出Hollow-LLM攻击,利用LLM零知识验证的工作量缺口,通过嵌入幽灵权重使不诚实提供者以小模型成本生成有效证明,需额外措施绑定正确性与计算工作。

Comments Accepted to the 2026 IEEE Symposium on Security and Privacy (S&P 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01313 2026-07-03 cs.LG cs.AI cs.CL cs.CR 新提交 91%

Black-Box Inference of LLM Architectural Properties with Restrictive API Access

受限API访问下LLM架构属性的黑盒推断

Christopher Ellis, Shreyas Chaudhari, Mei-Yu Wang, Leighton Barnes, Giulia Fanti, José M. F. Moura

机构 * Carnegie Mellon University(卡内基梅隆大学) Pittsburgh Supercomputing Center(匹兹堡超级计算中心)

专题命中 效率与部署 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对当前商业LLM API仅返回单logit且禁止logit偏置的限制,提出NightVision方法,通过新型公共集提示技术和首令牌时间测量,估计隐藏维度、深度和参数数量,在32个开源模型上验证了可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27492 2026-06-29 cs.MA 新提交 91%

QueenBee Planner: Skill-Evolving Communication Topologies for Token-Efficient LLM Multi-Agent Systems

QueenBee Planner:面向Token高效LLM多智能体系统的技能演化通信拓扑

Congjia Tian, Yuhang Yao, Jiaming Cui

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出QueenBee Planner框架,将智能体间通信拓扑视为可检索和自改进的设计技能,通过外部LLM规划器学习生成时间通信DAG,并利用执行轨迹蒸馏出设计规则,在固定工人池下实现通信结构的自我演化,降低消息数、模型调用和token成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25353 2026-06-25 cs.AR 新提交 91%

Cache-Resident LLM Inference in GB-Scale Last-Level Caches

GB级末级缓存中的缓存驻留LLM推理

Wanning Zhang, Tongzhou Gu, Marco Canini, Ceyu Xu, Jian Weng

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出一种缓存驻留执行模型,通过权重-注意力解耦架构和子算子依赖同步,在具有GB级末级缓存的CPU上实现LLM推理加速,TPOT提升2.04-13.9倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18042 2026-06-18 cs.DC 新提交 91%

Latency Prediction for LLM Inference on NPU Systems

NPU系统上LLM推理的延迟预测

Juhyun Park, Seungwoo Jeong, Jingyu Lee, Kyungyong Lee

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对NPU上LLM推理延迟预测面临微架构不公开、编译器优化不可预测和分桶导致非线性延迟的挑战,提出LENS延迟估计器,通过每个桶两次端到端测量组合预测任意输入输出长度组合的延迟,平均预测误差2.15%。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17787 2026-06-17 cs.DC 新提交 91%

LUMEN: Coordinated Failure Recovery for Distributed LLM Serving

LUMEN:分布式LLM服务的协调故障恢复

Zhang Cao, Shujie Han, Juncheng Zhang, Yuanming Ren, Yongkun Li, Patrick P. C. Lee

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对分布式LLM服务中工作节点故障导致KV缓存丢失和请求重算的问题,提出LUMEN系统,通过负载感知的协调恢复策略(检查点放置、中断请求分配、容量恢复)显著提升服务与恢复时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17421 2026-06-17 cs.CR 新提交 91%

Bifrost: Hybrid TEE-FHE Inference for Privacy-Preserving Transformer and LLM Serving

Bifrost: 面向隐私保护Transformer和LLM服务的混合TEE-FHE推理架构

Chenghao Chen, Kailun Qin, Xiaolin Zhang, Chi Zhang, Dawu Gu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出Bifrost混合架构,利用CPU TEE处理非线性操作和状态刷新,FHE加密线性层委托给加速器,实现安全高效的LLM推理,相比纯FHE方案延迟降低9-53倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17058 2026-06-17 cs.DC 新提交 91%

Evaluating LLM Coding Agents on SZ-Family Lossy Compression Across Architectures

评估LLM编码代理在不同架构上的SZ系列有损压缩

Changqing Li, Shouwei Gao, Kai Zhao, Sheng Di, Wenqian Dong

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 评估LLM编码代理在SZ系列有损压缩内核上的表现,发现GPU上强模型性能高但对提示敏感,Cerebras上主要挑战是生成可运行程序,且代理在模块化内核上更有效。

Comments 5 pages, 4 figures. Accepted to IPDPS 2026 HPAI4S Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15789 2026-06-16 cs.AR 新提交 91%

Approaching Shannon Bound with Lossless LLM Weight Compression

接近香农极限的无损LLM权重压缩

Hongshi Tan, Yao Chen, Gustavo Alonso, Weng-Fai Wong, Bingsheng He

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 通过熵分析发现LLM权重有效熵远低于存储位宽,提出基于非对称数字系统的瓦片级无损解压框架,实现接近香农极限的压缩率,在SGLang中集成后显著提升批处理大小和吞吐量。

Comments Accepted to ISCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09537 2026-06-16 cs.NI 新提交 91%

STEPS: Semantic Contract-Guided Scheduling for LLM-Assisted Natural Language-Driven Edge AI Services

STEPS: 面向LLM辅助自然语言驱动的边缘AI服务的语义契约引导调度

Houyi Qi, Minghui Liwang, Xianbin Wang, Xinlei Yi, Seyyedali Hosseinalipour

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出STEPS框架,通过语义契约将用户自然语言需求转化为可执行接口,利用LLM解析服务级别和置信度,构建势博弈模型联合优化节点选择、资源分配和带宽分配,提升语义契约满足率并适应模糊请求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12950 2026-06-12 cs.DC 新提交 91%

Maestro: Workload-Aware Cross-Cluster Scheduling for LLM-Based Multi-Agent Systems

Maestro: 面向基于LLM的多智能体系统的工作负载感知跨集群调度

Jinghao Wang, Xiao Zhou, Xiaoyang Sun, Yihui Zhang, Yilong Li, Tianyu Wo, Xu Wang, Chunming Hu, Renyu Yang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出Maestro调度系统,利用智能体语义预测输出长度和内存使用,通过层次化调度(节点级多模型共置、集群级延迟感知路由、全局工作流感知优先级)在严格GPU预算下优化LLM多智能体服务,减少KV缓存HBM占用67.2%,提高高竞争SLO达标率23.6个百分点。

Comments Accepted to the 46th IEEE International Conference on Distributed Computing Systems (ICDCS 2026). 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11145 2026-06-10 cs.CR 新提交 91%

OpenPCC: Open and Confidential LLM Serving on Commodity TEEs

OpenPCC:在商用TEE上提供开放且保密的LLM服务

Haoling Zhou, Shixuan Zhao, Chao Wang, Zhiqiang Lin

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对云推理服务中用户请求包含敏感信息的问题,提出OpenPCC框架,利用商用TEE实现开放、保密的LLM服务,并通过原型验证其可行性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09061 2026-06-09 cs.DC cs.PF 新提交 91%

Fairness-Aware and Latency-Controllable Scheduling for Chunked-Prefill LLM Serving

面向分块预填充LLM服务的公平感知与延迟可控调度

Haoxin Liu, Jiayi Wang, Yueshen Xu, Rui Li

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对分块预填充LLM服务中的调度公平性与延迟稳定性问题,提出基于老化策略的动态优先级调度、延迟预测请求调度和主动预填充控制,在NVIDIA GPU和Ascend加速器上实验表明,相比FCFS,平均端到端延迟降低10%以上,P99尾延迟显著减少。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17055 2026-08-19 cs.CY cs.HC cs.LG 新提交 91%

Wasted large language models: A life cycle thinking approach

被浪费的大语言模型:一种生命周期思维方法

Erik Johannes Husom, Maria Emine Nylund, Ophelia Prillard

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 该研究将生命周期思维与欧盟废弃物层级应用于LLMs,提出通过预防、再利用等措施减少LLMs废弃物及环境影响,强调预防不必要使用的重要性。

Comments 5 pages, 1 figures. Accepted at the 2nd International Workshop on Low Carbon Computing (LOCO 2026), Lancaster University, United Kingdom, 10-11 September 2026. Part of the LOCO 2026 proceedings, arXiv: LOCO2026/P14

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11981 2026-08-13 cs.CL 新提交 91%

Benchmarking Trustworthiness of SLMs: Pre-trained vs. Compressed

小型语言模型(SLM)的可信性基准测试:预训练模型与压缩模型的对比

Haokun Lin, Kaijie Zhu, Haobo Xu, Yichen Wu, Zhichao Lu, Qingfu Zhang, Zhenan Sun

机构 * Institute of Automation, CAS(中国科学院自动化研究所) Tsinghua University(清华大学) Harvard Medical School(哈佛医学院) City University of Hong Kong(香港城市大学)

专题命中 效率与部署 :SLM(title_cn,summary_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究评估SLM的可信性,发现量化压缩预训练模型比剪枝更能保留可信性,且量化压缩可靠大模型得到的SLM比从头训练的小型模型更优,知识蒸馏可进一步提升其可靠性。

Comments Published in IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23345 2026-06-23 cs.AI 新提交 91%

Abstract representational geometry supports inference in large language models

抽象表征几何支持大型语言模型中的推理

Yunan Zeng, Yuwang Wang

机构 * College of Future Information Technology, Fudan University(复旦大学未来信息科技学院) Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学与技术国家研究中心,清华大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本研究通过文本版情境反转学习范式,比较人类与LLM的行为和表征,发现LLM内部状态在推理时形成类似海马体的抽象几何结构,且该结构分层组织,高层次表征与推理相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22788 2026-08-25 cs.AI cs.LG 新提交 91%

TailSieve: Partial-Rollout-Guided Tail Routing for LLM Rollouts

TailSieve:面向大语言模型(LLM)rollout的部分rollout引导式长尾路由

Tianqi Xu, Lu Lv, Haoyang Huang, Wenjie Huang, Zhanming Shen, Yuhao Shen, Baolin Zhang, Xinyi Hu, Shuang Ge, Jun Dai, Tianyu Liu, Suorong Yang, Zhikai Li, Ye Bai, Jun Zhang, Lei Chen, Yue Li, Mingchen Wan

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 TailSieve是面向LLM rollout的部分rollout引导式框架,通过联合控制长尾路由与副本分配,仅路由即可实现最高1.67倍加速,结合专用推测解码可达2.59倍加速,同时保留策略内生成并避免长度偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11045 2026-08-12 cs.LG cs.CL 新提交 91%

ReRound: Reconstructive Rounding to Resolve Midpoint Ambiguity in Calibration-Free LLM Quantization

ReRound:用于解决无校准LLM量化中中点歧义的重构舍入法

He-Yen Hsieh, H. T. Kung

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.CL、cs.LG

AI总结 ReRound是一种后训练量化方法,通过条件扩散模型解决无校准LLM量化的中点歧义,在小型LLM的3、4比特量化上优于标准RTN,性能接近依赖校准方法且无额外推理开销。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23419 2026-06-23 cs.LG cs.AI 新提交 91%

GRINQH: Graded Input-based Quantization Hierarchy for Efficient LLM Generation

GRINQH:基于分级输入的量化层次结构用于高效LLM生成

Jette Oberländer, Jan Finkbeiner, Catherine M. Schöfmann, Emre Neftci

机构 * Fakultät für Informatik, RWTH Aachen(亚琛工业大学计算机科学系) Fakultät für Elektrotechnik und Informationstechnik, RWTH Aachen(亚琛工业大学电气工程与信息技术系) Peter Grünberg Institut, Forschungszentrum Jülich GmbH(于利希研究中心彼得·格林贝格研究所)

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出GRINQH框架,利用激活幅度动态分配权重通道精度,统一量化与稀疏化,加速LLM解码阶段,在Llama3和Qwen3上优于现有方法,实现2位生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04002 2026-08-05 cs.HC 新提交 91%

Semantic Bundling: Interactive Node and Edge Bundling to Simplify Knowledge Graphs using Large Language Models

语义捆绑:使用大语言模型简化知识图谱的交互式节点与边捆绑

Adam Coscia, Zeyu Hua, Eric Krokos, Timothy Lin, Alex Endert

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 该研究提出基于LLM的语义捆绑技术,在开源系统AgentK中实现,用于简化知识图谱,通过节点边捆绑形成高级结构,在电影评论等场景中可揭示文档集合新见解。

Comments Under review. 12 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08776 2026-07-13 cs.LG cs.AI cs.CL cs.GT 新提交 91%

A Unified Approach to Interpreting Knowledge Distillation for Large Language Models via Interactions

一种通过交互解释大语言模型知识蒸馏的统一方法

Qingzhuo Wang, Ruiyang Qin, Zhenxin Qin, Wen Shen, Zhihua Wei

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言模型知识蒸馏有效性背后机制,提出统一方法,通过交互分解输出分数,发现共同机制是交互稀疏化,不同方法性能差异源于处理复杂交互能力,进而提出CIP损失函数,实验证明其能提升多种KD方法性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08057 2026-07-10 cs.LG cs.AI cs.CL 新提交 91%

Towards Efficient Large Language Model Serving: A Survey on System-Aware KV Cache Optimization

迈向高效大语言模型服务:关于系统感知键值缓存优化的综述

Jiantong Jiang, Peiyu Yang, Rui Zhang, Feng Liu

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院) School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 该综述聚焦大语言模型服务中系统感知的键值缓存优化,从执行与调度、放置与迁移、表示与保留三个维度回顾相关工作,分析跨行为协同设计及行为与目标联系,为理解和创新键值缓存设计提供基础。

Comments Accepted to ACL 2026 as a Findings paper

Journal ref Findings of the Association for Computational Linguistics: ACL 2026 (pp. 38450-38476)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23771 2026-07-28 cs.AI 新提交 91%

Training Language Models to Cooperate with Inference-Time Controllers

训练语言模型以与推理时控制器协作

Moumita Choudhury, Vanshaj Khattar, Jing Liu, Toshiaki Koike-Akino, Ankush Chakrabarty, Shlomo Zilberstein, Ye Wang

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);post-training(abstract)

AI总结 研究LLM性能依赖推理时控制器的问题,提出CALM框架,将其表述为多任务强化学习,通过模块级分解研究训练策略,评估显示该框架能提升推理时工作流程的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19704 2026-07-23 cs.LG stat.ML 新提交 91%

Efficient Clustering with Provable Guardrails for LLM Inference at Scale

大规模LLM推理中具有可证明护栏的高效聚类

Longshaokan Wang, Wai Tsang Keung, Punit Ghodasara, Roman Wang, Ali Dashti, Francesc Moreno-Noguer

机构 * Amazon(亚马逊)

专题命中 效率与部署 :LLM(title,title_cn);foundation model(abstract);分类 cs.LG

AI总结 研究针对大规模LLM推理成本和延迟瓶颈,提出两阶段聚类算法,先用Mini-batch K-Means生成初始聚类,再在其中选代表,能保证逐样本质量控制,运行高效且可扩展,相比常见方法有显著优势,部署后大幅降低成本和延迟。

Comments Accepted for presentation at ICML HiLD workshop 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30850 2026-07-01 cs.AI 新提交 91%

BayesBench: Evaluating LLM Belief Trajectories Under Multi-Turn Evidence Accumulation

BayesBench: 评估多轮证据积累下LLM信念轨迹

Ankur Samanta, Akshayaa Magesh, Tal Lancewicki, Ayush Jain, Youliang Yu, Paul Sajda, Kaveh Hassani, Aditya Modi, Daniel R. Jiang, Yonathan Efroni

机构 * Meta AI Columbia University(哥伦比亚大学) Meta Superintelligence Labs(Meta超级智能实验室) Tel Aviv University(特拉维夫大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出BayesBench基准,通过三个渐进复杂任务评估LLM在多轮证据积累中的信念更新是否接近贝叶斯理性,发现规模提升改善潜在推理但未可靠转化为预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24970 2026-06-25 cs.LG 新提交 91%

Don't Go Breaking My LLM: The Impact of Pruning Attention Layers on Explanation Faithfulness and Confidence Calibration

不要破坏我的LLM:剪枝注意力层对解释忠实性和置信度校准的影响

Pietro Tropeano, Maria Maistro, Tuukka Ruotsalo, Christina Lioma

机构 * University of Copenhagen(哥本哈根大学) LUT University(拉赫蒂理工大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究剪枝LLM注意力层对解释忠实性和置信度校准的影响,发现尽管准确率保持,但忠实性和校准度常下降,表明模型置信度、可解释性与准确性之间存在错位。

Comments Accepted at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21023 2026-06-23 cs.LG 新提交 91%

Demystifying Numerical Instability in LLM Inference: Achieving Reproducible Inference for Mission-Critical Tasks with HEAL

揭秘LLM推理中的数值不稳定性:使用HEAL实现关键任务的可复现推理

Zhenting Zhu, Lucas Thai, Shan Yu, Yicheng Liu, Yifan Qiao, Chenxi Wang, Harry Xu, Junyi Shu

机构 * UCLA(加州大学洛杉矶分校) UC Berkeley(加州大学伯克利分校) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对LLM在关键任务中因16位精度导致输出不一致的问题,提出HEAL方法,通过INT16量化和代数误差补偿,在保持FP32精度的同时减少性能开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16014 2026-06-16 cs.HC cs.AI cs.MA 新提交 91%

Orchestrated Reality: From Role-Play to Living, Playable Game Worlds -- LLM-Driven World Simulation as a Parameterized-Action POMDP

编排现实:从角色扮演到活生生的、可玩的游戏世界——作为参数化动作POMDP的LLM驱动世界模拟

Yuhang Huang, Chenmiao Li, Chaowei Fang

机构 * The University of Tokyo(东京大学) Individual Researcher(个人研究员)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 提出编排现实框架,将LLM驱动的游戏世界形式化为参数化动作POMDP,通过单例编排代理维护规范JSON状态,实现数值状态、叙事声音和规则逻辑的统一协调。

Comments 9 pages, 2 figures. Work in progress. Yuhang Huang and Chenmiao Li contributed equall

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23660 2026-08-26 cs.LG cs.AI stat.ME 新提交 91%

From Causal Plausibility to Causal Reliability: Evaluating LLMs as Calibrated Direct Causal-Edge Classifiers

从因果合理性到因果可靠性:评估大型语言模型(LLM)作为校准的直接因果边分类器

Amit Kumar, Elnur Adl Zarabi, Suranjana Trivedy, Zhiqian Chen, Lei Zhang, Kaiqun Fu, Taoran Ji

机构 * Texas A&M University-Corpus Christi(德克萨斯农工大学科珀斯克里斯蒂分校) BITS Pilani Goa(戈亚斯 pilani Bits 大学) Mississippi State University(密西西比州立大学) Northern Illinois University(北伊利诺伊大学) Texas Christian University(得克萨斯基督教大学)

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究评估12个指令微调开放权重LLM作为直接因果边分类器的可靠性,发现其判断过度预测、置信度不可靠,仅跨提示/模型一致性更优,建议将其作为软因果先验来源而非因果结构直接证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10692 2026-08-12 cs.CL cs.AI 新提交 91%

SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information

SPIEval:评估大型语言模型作为处理分散个人信息的移动助手的能力

Junjie Ye, Zhuohui Sheng, Shaofan Liu, Yulun Zhu, Wenjie Fu, Dingwei Zhu, Ming Zhang, Yujiong Shen, Weichao Wang, Xin Zhao, Shihan Dou, Tao Gui, Qi Zhang, Xuanjing Huang, Pluto Zhou

机构 * Fudan University(复旦大学) Tencent Hunyuan Team(腾讯混元团队)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究推出基于五种认知能力的人工策划基准SPIEval,评估9种LLMs作为移动助手处理分散个人信息的能力,发现其准确率最高仅57.3%,存在信息定位等显著局限。

详情

展开后加载摘要…

URL PDF HTML 收藏