arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12698 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2145 篇

2607.21600 2026-07-27 cs.AI 新提交 70%

Securing Multimodal AI through Internal Information Decomposition

通过内部信息分解保护多模态人工智能

Jehyeok Yeon, Hyeonjeong Ha, Qiusi Zhan, Heng Ji

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多模态大语言模型的攻击问题,提出FlowGuard框架,通过监测内部多模态一致性检测有害输入,受部分信息分解启发得出FlowVectors量化相关指标,有效降低攻击成功率且减少效用损失和延迟,为多模态推理提供有效防御。

Comments Accepted as Spotlight Paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21063 2026-07-24 cs.CL cs.CY cs.HC 新提交 70%

QuantiBias: Benchmarking Quantization-Induced Bias in LLMs

QuantiBias:量化大语言模型中量化诱导偏差的基准测试

Emilio Ferrara

机构 * University of Southern California(南加州大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究大语言模型量化中的偏差问题,提出QuantiBias基准测试,通过结合多种控制和对比有无推理的构建来评估偏差,发现量化器按无偏差预防信号的数据分配精度,推理对部分偏差有减半效果,强调需重新评估量化模型的开放式偏差。

Comments Benchmark protocol on Hugging Face: https://huggingface.co/datasets/emilioferrara/quantibias

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20981 2026-07-24 cs.AI 新提交 70%

Beyond Independent Optimization: Compression, MoE Routing, and Quantization Interactions in Multimodal Edge Intelligence

超越独立优化:多模态边缘智能中的压缩、混合专家路由和量化交互

Jay Gor, Karm Dave, Akshita Abrol, Rajesh Gupta, Sudeep Tanwar, Zhengkui Wang

机构 * Nirma University(尼玛大学) Singapore Institute of Technology(新加坡理工学院) Marwadi University(马尔瓦迪大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多模态边缘智能中高效推理受多种因素限制,回顾相关模型进展,指出技术间相互影响不能独立优化,介绍关键设计权衡,引入视频MoE模型诊断方法,强调多方面开放研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20451 2026-07-24 cs.CL 新提交 70%

Semantic Field Theory: Historical Origin, Higher-Order Interaction, and Stabilized Semantic Inference

语义场理论:历史起源、高阶交互与稳定语义推理

Dimitris Vartziotis

机构 * NIKI – Digital Engineering(尼基数字工程公司) TWT Science & Innovation(TWT科学与创新公司)

专题命中 效率与部署 :SFT(abstract,abstract_cn);分类 cs.CL

AI总结 本文围绕语义场理论展开,重构其演变并赋予清晰数学核心。核心方法是通过词汇表征等建模语言组织层次,贡献五个形式元素。主要贡献是为计算语言学等提供了可评估的模型及相关理论元素,虽非完整理论,但有重要意义。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19539 2026-07-23 cs.DC cs.AI 新提交 70%

Fine-grained Computation-Communication Overlap via Tile-level Signaling and Scheduling for Mixture-of-Experts

基于瓦片级信号与调度的专家混合模型细粒度计算-通信重叠

Minyu Cui, Anna Wingkvist, Morgan Ericsson

机构 * Linnaeus University(林纳大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对专家混合模型在多GPU系统中通信延迟问题,提出通过瓦片级信号与调度实现细粒度计算-通信重叠的方法,结合生产者-消费者协同设计,在4个A100 GPU平台评估中取得加速效果,提升了不同场景下的性能。

Comments To appear at the 55th International Conference on Parallel Processing (ICPP 26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20205 2026-07-23 stat.ML cs.LG math.ST stat.TH 新提交 70%

Statistical Inference for Rank Allocation in Low-Rank Adaptation

低秩适应中秩分配的统计推断

Yihang Gao, Vincent Y. F. Tan

机构 * Department of Mathematics, National University of Singapore(数学系,新加坡国立大学) Department of Mathematics and Department of Electrical and Computer Engineering, National University of Singapore(数学系和电气与计算机工程系,新加坡国立大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究低秩适应中在固定参数预算下分配秩资源的问题,提出StatLoRA方法,将其表述为统计假设检验问题,通过检验统计量和p值确定组件取舍,实验表明该方法在匹配秩预算下性能良好,支持了分配规则稳定性及渐近理论。

Comments 77 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18267 2026-07-22 cs.NI cs.AI 新提交 70%

The Economics of Autonomy: Real-Time Risk Indexing for Insurable AI-Driven 6G Systems

自主性经济学:适用于可保险的人工智能驱动的6G系统的实时风险索引

Anthony Kiggundu, Michael Zentarra, Christoph Lipps, Hans D. Schotten

机构 * German Research Center for Artificial Intelligence (DFKI), Germany(德国人工智能研究中心(DFKI)) RPTU University of Kaiserslautern-Landau, Germany(莱茵-威斯伐尔大学科堡分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究6G网络中传统治理框架在风险管理上的不足,提出GIRAF框架,通过机器可读运行时信号得出总风险指数,形式化验证陈旧性权衡,经模拟验证该框架能保持操作完整性并为多利益相关者责任归属等提供精算基线。

Comments Accepted at the IEEE 104th Vehicular Technology Conference - VTC2026-Fall

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17774 2026-07-21 cs.SE cs.AI cs.HC 新提交 70%

Persona-as-Configuration: Generative Stakeholder Reporting for Agricultural Floods

作为配置的角色:农业洪水的生成式利益相关者报告

Oliver Aleksander Larsen, Tiziano Santilli, Francesco Daghero, Mahyar T. Moghaddam

机构 * University of Southern Denmark(南丹麦大学) Maersk Mc-Kinney Moller Institute(马士基麦肯尼·莫勒研究所)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究网络物理系统决策日志解读问题,提出基于单向消费和角色即配置的架构模式,实例化为上下文感知仪表板层,经专家评审在多质量维度获好评,为后续农业利益相关者最终用户评估奠定基础。

Comments Accepted at CASA 2026 (9th Workshop on Context-Aware, Autonomous and Smart Architectures), co-located with ECSA 2026. 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17558 2026-07-21 cs.AI 新提交 70%

Why Does Feedback-Augmented Self-Distillation Fail to Improve Retrieval-Interleaved Search Agents?

为什么反馈增强的自蒸馏不能改进检索交织搜索智能体?

Fan Yang, Rui Meng, Yuxin Wen

机构 * Chapman University(查普曼大学) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究反馈增强的自蒸馏在智能体搜索中失效的原因,发现模型存在解码崩溃现象,因监督信号不一致致学习不稳定,将其分解为模型和提示不一致,引入EMA教师减轻不一致,最终提高模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17166 2026-07-21 cs.LG 新提交 70%

Explaining and Tuning Transformer-based LLMs in Arithmetic Tasks with Human Strategies

用人类策略解释和调整基于Transformer的语言模型在算术任务中的表现

Luyu Qiu, Jianing Li, Hwanhee Kim, Xiaoyong Wei, Yueyuan Zheng, Janet Hsiao, Lei Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong Polytechnic University(香港理工大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究基于Transformer的语言模型在算术任务中的表现,通过分解任务、分析损失收敛等,应用人类策略和方法提升其性能,并经多种验证展示有效性,探索其与人类学习者相似性以增强关键应用中的信任。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15810 2026-07-20 cs.LG 新提交 70%

QUADS: Stabilizing NVFP4 Reinforcement Learning for MoE via QUantization-error Alignment across Dual Sides

QUADS:通过双边量化误差对齐稳定用于专家混合模型的NVFP4强化学习

Zhengyang Zhuge, Hao Yu, Xin Wang, Zheng Li, Yizhong Cao, Dayiheng Liu, Jianwei Zhang

机构 * Alibaba Inc(阿里巴巴公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对MoE大语言模型RL中展开生成瓶颈,提出QUADS方法。通过训练 - 推理误差分析确定激活误差是FP4 RL不稳定主因,在训练器和展开侧分别采取措施,实现BF16精度,提升指标并提高展开吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15621 2026-07-20 cs.RO cs.AI 新提交 70%

Think at 5 Hz, Act at 20 Hz: Asynchronous Fast-Slow Vision-Language-Action Inference for Closed-Loop Driving

以5Hz思考,20Hz行动:用于闭环驾驶的异步快慢视觉-语言-动作推理

Yun Li, Jiachen Gong, Simon Thompson, Ehsan Javanmardi, Qunli Zhang, Zifan Zeng, Shiming Liu, Peng Wang, Zixuan Guo, Manabu Tsukada

机构 * The University of Tokyo(东京大学) TIER IV, Inc.(TIER IV公司) Huawei(华为)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型用于闭环驾驶时推理延迟与车辆控制速率冲突的问题,提出快慢架构,慢系统用冻结主干处理历史,快专家基于缓存和当前帧回归航路点,经训练在CARLA上提升路线完成率,降低误差且可零样本转移。

Comments 13 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15467 2026-07-20 cs.LG cs.CR 新提交 70%

ADS-C: Antidistillation Sampling for Classification

ADS-C:用于分类的反蒸馏采样

Khawaja Abaid Ullah, Mohammad Javad Khojasteh

机构 * Rochester Institute of Technology(罗彻斯特理工学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对知识蒸馏中对手复制专有分类器的问题,提出ADS-C方法,通过在闭式的每个输入边际预算下构成扰动,保留服务的top-1预测,使防御后教师模型准确率不变,且效用成本为零,有效抵御对手蒸馏,降低学生模型性能损失。

Comments 20 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14777 2026-07-17 cs.CL 新提交 70%

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning

SEED:用于智能体强化学习的自进化在线策略蒸馏

Jinyang Wu, Shuo Yang, Zhengxi Lu, Fan Zhang, Yuhao Shen, Lang Feng, Haoran Luo, Zheng Lian, Shuai Zhang, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) Tongji University(同济大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对基于结果的强化学习中间决策指导有限的问题,提出SEED框架。它将在线策略轨迹转化为训练技能并提炼回策略模型,通过微调策略生成技能,重新评分动作转化蒸馏信号,联合优化提升性能与样本效率及泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14557 2026-07-17 cs.AI 新提交 70%

Seeing the End at Step Zero: Accelerating Diffusion MLLMs via MLP Sparsity-Aware Truncation

从零步洞察终点:通过MLP稀疏感知截断加速扩散多模态大语言模型

Qicheng Zhao, Qi Sun, Zheyu Yan

机构 * Zhejiang University(浙江大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对扩散多模态大语言模型推理效率受固定长度生成约束影响的问题,提出Seer框架,利用MLP激活稀疏性变化检测有效语义边界,进行冗余截断及采用混合执行策略,实验表明其可加速吞吐量并维持性能甚至提升复杂视觉任务准确性。

Comments Accepted to ACM Multimedia (ACM MM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14456 2026-07-17 cs.SE cs.AI 新提交 70%

Beyond Generalist LLMs: Specialist Agentic Systems for Structured Code Workflow Execution

超越通用语言模型:用于结构化代码工作流执行的专业代理系统

Harris Borman, Herman Wandabwa, Fusun Yu, Sandeepa Kannangara, Justin Liu, Anna Leontjeva, Ritchie Ng

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究在业务流程自动化中,将BPMN图转换为可执行代理工作流时,专业代理是否值得额外开发。引入专业工作流并与通用代理比较,结果显示专业代理在多方面表现更优,通用代理代码生成不一致,不适用于工业环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13770 2026-07-16 cs.AR cs.AI 新提交 70%

Kaleido: Algorithm-Hardware Co-Design for Video Diffusion Transformers by Exploiting Latent Space Correlations

Kaleido:通过利用潜在空间相关性对视频扩散变压器进行算法-硬件协同设计

Wenxuan Miao, Haosong Liu, Weiming Hu, Zihan Liu, Aiyue Chen, Jianlin Yu, Yiwu Yao, Yiming Gan, Jieru Zhao, Jingwen Leng, Minyi Guo, Yu Feng

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Jiao Tong University, Shanghai Qi Zhi Institute(上海交通大学、上海颀智研究所) Huawei Technologies(华为技术有限公司) ICT, Chinese Academy of Sciences(信息科技研究所、中国科学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对视频扩散变压器计算成本高的问题,提出Kaleido算法-硬件协同设计,利用潜在空间通道级时空相关性加速操作,有轻量级重用算法,设计了加速器,实验表明其相比现有加速器有显著加速和节能效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13088 2026-07-16 cs.CR cs.LG 新提交 70%

Securing LLMs in the Wild: Privacy and Security Challenges at the Edge

保障野外大语言模型安全:边缘环境下的隐私与安全挑战

Ren-Yi Huang, Mingchen Li, Dumindu Samaraweera, Morris Chang

机构 * Department of Electrical and Computer Engineering, University of South Florida(电子与计算机工程系,佛罗里达州立大学) Department of Mathematics, Embry-Riddle Aeronautical University(数学系,埃默里-瑞德航空大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究边缘大语言模型安全隐私挑战,围绕内存墙等架构约束引入分类法,得出统一约束模型,提出安全操作效率得分,给出决策程序和缓解措施,为联合评估安全、隐私和效率提供框架,保障边缘原生智能系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11423 2026-07-14 cs.CL 新提交 70%

ToFu: A White-Box, Token-Efficient Agent Harness for Researchers

ToFu:面向研究人员的白盒、令牌高效代理工具包

Junhao Ruan, Yuan Ge, Bei Li, Yongjing Yin, Yuchun Fan, Xin Chen, Jingang Wang, Chenglong Wang, Jingbo Zhu, Tong Xiao

机构 * Northeastern University(东北大学) LongCat RSI, Meituan(美团龙猫RSI) NiuTrans Research(小牛翻译研究院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究提出ToFu这一代理工具包,作为研究助手,以高令牌效率等支持实际研究流程,且能本地部署;作为研究对象,提供白盒工具包供研究人员检查、修改和评估,兼具强大性能与用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10811 2026-07-14 cs.MA cs.AI 新提交 70%

Distributed Agent System: Fault-Tolerant Collaboration Among Embodied Agents

分布式智能体系统:具身智能体间的容错协作

Kai Yu, Lu Chen, Hanqi Li

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对人工智能工程中智能体驱动任务执行面临的可靠性挑战,提出分布式智能体系统(DAS)框架,重新定义智能体可靠性,构建两层容错架构,为工业场景中异构具身智能体可靠协作提供实用工程途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10610 2026-07-14 cs.CV cs.AI 新提交 70%

WasteAssistant: Regulation-Guided Visual Question Answering Framework for Intelligent Waste Segregation and Sustainable Managemen

WasteAssistant:用于智能垃圾分类与可持续管理的监管引导视觉问答框架

Khush Kataruka, Harshit Maurya, Anuja Vats, Murari Mandal, Kiran Raja, Praveen Kumar Chandaliya

机构 * SVNIT(萨达尔·瓦拉巴伊·国家理工学院) NTNU(挪威科技大学) KIIT(卡林加工业技术学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对现有智能垃圾分类系统的不足,提出集成视觉语言模型和多模态大语言模型的框架,构建新数据集,经实验验证基于BLIP的模型效果更佳,提升了分类准确率,确保监管合规,推动多模态AI在垃圾管理中的应用。

Comments 12 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09385 2026-07-13 cs.DC cs.AI cs.PF 新提交 70%

STEEL: Sparsity-Aware Fused Attention for Energy-Efficient Long-Sequence Inference on AMD's XDNA NPU

STEEL:用于在AMD的XDNA NPU上进行节能长序列推理的稀疏感知融合注意力

Victor J. B. Jung, Gagandeep Singh, Joseph Melber, Kristof Denolf, Francesco Conti, Luca Benini

机构 * AMD Research and Advanced Development (RAD)(AMD研究与先进开发) Integrated Systems Laboratory (IIS)(集成系统实验室) ETH Zürich(苏黎世联邦理工学院) Department of Electrical, Electronic and Information Engineering (DEI)(电气电子信息工程系) University of Bologna(博洛尼亚大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对笔记本级SoC上节能推理,提出STEEL这一针对类似XDNA的NPU的FlashAttention开源实现,通过引入预填充注意力数据流公式化及稀疏感知流水线布局,降低能耗与延迟,相比CPU和GPU有显著性能提升。

Comments Accepted at IEEE COINS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08029 2026-07-10 cs.LG 新提交 70%

Rethinking Small VLM Quantization: From Component-Wise Analysis to Hardware-Aware Edge Deployment

重新思考小型视觉语言模型量化:从组件级分析到硬件感知边缘部署

Hyeju Shin, Chorwon Kim, Ryangsoo Kim, Hark Yoo, Jaein Kim

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文针对小型视觉语言模型量化,提出系统评估框架,在特定硬件上验证五个假设,分离相关组件得出结论,包括量化敏感性受结构范式影响、SigLIP编码器延迟情况、大语言模型INT4量化利弊、复合量化误差特点及不同平台每焦耳智能差异。

Comments 14 pages. Accepted at the ICML 2026 Workshop on Hypothesis Testing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07862 2026-07-10 cs.DC cs.LG 新提交 70%

CTA-Pipelining: A Latency-Oriented Spatial Scaling Method for Multi-GPU Systems

CTA流水线:一种面向延迟的多GPU系统空间缩放方法

Tingkai Liu, Muralidhar Andoorveedu, Sanjoy Das, Sanjay Patel, Volodymyr Kindratenko

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对多GPU系统,在延迟约束下服务大语言模型需求,提出CTA流水线执行范式,利用共享内存多GPU系统,通过协作线程阵列级依赖性实现跨GPU并发执行相关内核,降低延迟并可与TP结合推动延迟边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07766 2026-07-10 cs.AI 新提交 70%

Alignment Plausibility: A New Standard for Assuring AI in Healthcare

对齐合理性:确保医疗保健领域人工智能的新标准

Gwydion Williams, Sara Zannone, Bilal A Mateen

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨大语言模型在医疗保健领域的安全问题,提出需在价值规范、训练、监督三层面进行对齐以实现结构安全,进而产生对齐合理性这一监管结构,为论证AI与健康结果的关系提供方式。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07548 2026-07-09 cs.CL 新提交 70%

Think Big, Search Small: Where Capacity Matters in Hierarchical Search Agents?

想得大,搜得小:分层搜索智能体中容量的关键所在?

Qinnan Cai, Yibo Zhao, Xiang Li

机构 * School of Data Science and Engineering(数据科学与工程学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究基于大语言模型的分层搜索智能体中模型容量分配问题,通过角色分解和受控容量扫描实验,发现容量敏感性不对称,分解是瓶颈,还给出了集中容量于委托、缩减执行容量且不牺牲精度的构建分层搜索智能体方法。

Comments 21pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06306 2026-07-08 cs.SE cs.AI cs.CV 新提交 70%

UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation

UI2App:可执行Web应用程序生成中视觉交互推理的基准测试

Grace Man Chen, Litao Guo, Yifan Wu, Yiyu Chen, Yenchi Tseng, Sicheng Liu, Yuyu Luo, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对现有网页生成基准测试对交互能力评估不足的问题,引入UI2App基准测试,通过设计端到端管道沿四个维度评估工件,实验发现视觉与交互能力不匹配,复杂交互是瓶颈,为相关研究提供了参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05113 2026-07-07 cs.CL cs.CY cs.HC 新提交 70%

Rating the Pitch, Not the Product: User Evaluations of LLMs Reflect Expectations More Than Performance

评价的是宣传话术,而非产品本身:用户对大语言模型的评估更多反映期望而非性能

Robert Morabito, Tyler McDonald, Charitra Viswanath, Angel Hsing-Chi Hwang, Susanne Gaube, Jad Kabbara, Ali Emami

机构 * Brock University(布鲁克大学) Emory University(埃默里大学) University of Southern California(南加州大学) University College London(伦敦大学学院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 效率与部署 :LLM(abstract);prompting(abstract);分类 cs.CL

AI总结 研究通过控制实验,让参与者使用不同宣传话术下的六种大语言模型完成任务,发现宣传话术影响用户评价和交互行为,任务表现未变,用户评价更多反映期望管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04534 2026-07-07 cs.CL 新提交 70%

Mechanism-level routing failure in LLMs over Lean-verified algebraic structures

基于精益验证代数结构的大语言模型中的机制级路由失败

Manuel Israel Cázares, Wenlin Zhang, Haobo Ma

机构 * Bytepro AI(字节宝人工智能公司) National University of Singapore(新加坡国立大学) Omega Institute(欧米茄研究所) ChronoAI(chrono人工智能公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究大语言模型在形式验证代数语料库中的结构路由失败,通过在固定模板集选正确证明机制标签任务,发现机制级路由上限,揭示主导失败类型及模型差异,扩展了路由器假设。

Comments Code, data, and evaluation pipeline available at https://github.com/bytepro-ai/fiber-routing-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04240 2026-07-07 cs.AI q-bio.CB 新提交 70%

Biological Motifs for Agentic Control

用于智能体控制的生物基序

Bogdan Banu

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型向自主智能体转变带来的可靠性等挑战,通过基因调控网络与智能体软件系统的类型化接口对应,映射生物基序到软件设计模式,给出智能体操作数等核心贡献并具实践可行性。

Comments 80 pages. Preprint; feedback welcome

详情

展开后加载摘要…

URL PDF HTML 收藏