arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-21 至 2026-08-21 共收录 252 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 49 篇

2608.18521 2026-08-21 cs.AI cs.LG 版本更新 73%

Which Negatives Matter? Ask Your Text Encoder: Adaptive Similarity Margins for Dense-Caption Retrieval

哪些负样本重要?询问你的文本编码器:用于密集字幕检索的自适应相似度间隔

Haoyue Liu, Ye Chen, Zhichao Wang, Xiaoying Tang

机构 * Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来智能网络研究院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究针对密集字幕检索中InfoNCE目标函数过早饱和的问题,提出HN-CLIP方法,通过文本编码器的文本-文本几何构建自适应相似度间隔,在四个基准上提升R@1,且训练速度更快,仅用20%数据即可达最强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20316 2026-08-21 cs.AI 新提交 70%

Pandora's AI Model Routing Box: Efficient Allocation with Costly Value Estimation

潘多拉的AI模型路由盒:带代价价值估计的高效分配

Adam Fisch, Shubhendu Trivedi, Fantine Huot, William W. Cohen, Michael Kaisers, Mirella Lapata, Kate Larson, Jacob Eisenstein

机构 * Google DeepMind(谷歌DeepMind)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对异构AI系统的查询路由问题,提出带代价价值估计的Pandora's Router集中式策略及Pandora's Bidder去中心化策略,可在保证路由质量的同时减少高成本估计器的使用,还能在不同场景优化分配效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19285 2026-08-21 cs.CV cs.LG 新提交 70%

Clustering and Token Denoising for Faster and More Robust VLMs

用于更快、更鲁棒的视觉语言模型(VLM)的聚类与令牌去噪

Baptiste Rossigneux, Inna Kucher, Vincent Lorrain, Emmanuel Casseau

机构 * Université Paris-Saclay(巴黎-萨克雷大学) Univ. Rennes(雷恩大学) Vsora(沃索拉公司)

专题命中 效率与部署 :LLM(abstract_cn);language model(abstract);分类 cs.LG

AI总结 本研究提出无需训练的ClustRS算法,通过聚类与残差收缩剪枝VLM的视觉令牌,在基准测试中实现显著性能提升,为高效抗噪VLM部署提供新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20061 2026-08-21 cs.LG cs.AI cs.CL 新提交 67%

Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts

逐步扩展:面向大规模混合专家模型的计算高效超参数迁移

Nayeon Kim, Hojin Lee, Yunju Bak, Jaesun Park, Boseop Kim

机构 * Kakao Corp.(Kakao公司) Upstage AI(Upstage人工智能公司)

专题命中 效率与部署 :foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出两步超参数迁移框架,利用小型代理模型外推大规模混合专家模型的最优学习率,仅需极低成本即可准确预测全规模模型的最优配置。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19202 2026-08-21 cs.AI cs.CL cs.LG 新提交 67%

Active Inference as Context Acquisition for AI Agents

主动推理作为AI智能体的上下文获取机制

Sanchayan Dutta, Sai Niranjan Ramachandran, Suvrit Sra

机构 * University of California, Davis(加利福尼亚大学戴维斯分校) Technical University of Munich(慕尼黑工业大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究将AI智能体的上下文获取权衡形式化为主动推理,在最优提问框架中验证其有效性,为智能体上下文获取层提供模型无关的设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05383 2026-08-21 cs.CR cs.SE 版本更新 67%

Evolution of Log-Based Detection Rules in Public Repositories

基于日志的检测规则在公共仓库中的演变

Minjun Long, David Evans

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文研究了公共仓库中基于日志的检测规则的演变,通过分析Sigma和Splunk Security Content两个项目中的6859条规则历史,发现约56%的规则至少经过一次修订,且规则生命周期内演变非单调,经常出现回退,表明规则变化并非持续积累,而是存在操作上的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19739 2026-08-21 cs.CV cs.AI cs.LG 新提交 62%

Question-Guided Evidence Acquisition for Multimodal Visual Question Answering

面向多模态视觉问答的问题引导式证据获取

Alin-Ionut Popa

机构 * Amazon Inc.(亚马逊公司)

专题命中 效率与部署 :prompting(abstract);分类 cs.AI、cs.LG

AI总结 针对多模态视觉问答中模型读取文档不可靠的问题,提出Q-Guide智能体引导感知,在两个数据集上优于基线方法,且增益来自精准感知引导而非复杂控制逻辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20123 2026-08-21 stat.ML cs.LG 新提交 57%

Discrete Diffusion Inference-Time Control with Nested Sequential Monte Carlo

基于嵌套序贯蒙特卡洛的离散扩散推理时控制

Lohithsai Yadala Chanchu, Hany Abdulsamad, Christian A. Naesseth

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 该研究针对离散扩散语言模型文本生成的推理时控制问题,提出NSMC与FA-NSMC方法,修正了现有粒子方法的缺陷,在毒性和流畅度引导任务上表现优于n-best采样与bootstrap SMC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20026 2026-08-21 cs.CV cs.LG 新提交 57%

From Street View Imagery to Street Quality Indicators: Vision Language Inference for the Suburban 15-minute City

从街景图像到街道质量指标:面向郊区15分钟城市的视觉语言推理

Joan Perez, Giovanni Fusco

专题命中 效率与部署 :language model(abstract);分类 cs.LG

AI总结 本文以法国尼斯东北部郊区为研究对象,采用开源的SAGAI工作流,利用视觉语言模型从街景图像评估街景质量,发现理想街景仅存在于部分郊区区域,证明了VLM可支持郊区城市诊断,助力循证规划。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19891 2026-08-21 cs.AI 新提交 57%

EXIMO: VLM Guided Exploration of VLA Policies

EXIMO:基于视觉语言模型引导的视觉语言动作策略探索

Bhavya Sukhija, Oliver Groth, Mohit Shridhar, Tim Hertweck, Michael Bloesch, Markus Wulfmeier, Abbas Abdolmaleki, Martin Riedmiller

机构 * Google DeepMind(谷歌DeepMind)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 本研究提出EXIMO算法,通过VLM引导的探索、模仿、优化三阶段微调VLA策略,解决了VLA策略微调样本效率低的问题,性能显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19536 2026-08-21 cs.CV cs.AI cs.RO 新提交 57%

CVSD-Reg: Cross-Modal Visual Semantic Prior Distillation for Robust LiDAR Registration

CVSD-Reg:用于鲁棒激光雷达配准的跨模态视觉语义先验蒸馏

Eunsoo Im, Junghun Suh, Gyeonggwan Lee, Seunghwan Hong

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI

AI总结 本文提出CVSD-Reg框架,通过蒸馏视觉基础模型的语义先验提升激光雷达配准的鲁棒性,在多数据集上的成功率优于现有方法,且无需相机输入或事后ICP精修。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18853 2026-08-21 eess.SY cs.LG cs.SY 版本更新 57%

Learn for Variation: Efficient AAV Trajectory Learning through a Differentiable Wireless World Model

为变化学习:在可微环境中变分引导的AAV轨迹学习

Xiucheng Wang, Zhenye Chen, Nan Cheng, Zhisheng Yin, Xuemin Shen

机构 * State Key Laboratory of ISN and School of Telecommunications Engineering, Xidian University(信息与通信工程国家重点实验室和西安电子科技大学电信工程学院) School of Aerospace Science and Technology, Xidian University(航天学院) Department of Electrical and Computer Engineering, University of Waterloo(滑铁卢大学电气与计算机工程系)

专题命中 效率与部署 :pretraining(abstract);分类 cs.LG

AI总结 本文提出L4V框架,通过变分引导解决AAV轨迹规划中的奖励驱动强化学习问题,利用密集政策梯度提升任务完成效率和传输速率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19997 2026-08-21 cs.CL 版本更新 57%

When Contextual Inference Fails: Cancelability in Interactive Instruction Following

当情境推理失效时:交互指令跟随中的可取消性

Natalia Bila, Kata Naszádi, Alexandra Mayn, Christof Monz

机构 * Language Technology Lab, University of Amsterdam(阿姆斯特丹大学语言技术实验室) Department of Language Science and Technology, Saarland University(萨尔兰大学语言科学与技术系)

专题命中 效率与部署 :LLM(abstract_cn);分类 cs.CL

AI总结 研究探讨了在协作积木构建任务中,如何区分字面解释与情境推理,引入了交互基准测试BWIM,发现模型在判断与行动间存在脱节,未能有效利用信息进行澄清。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19590 2026-08-21 eess.IV 新提交 50%

Loss-Resilient Semantic Communication over Packet-Loss Networks at Extreme-Low Bandwidth

极端低带宽丢包网络下的抗丢包语义通信

Shengshi Yao, Jincheng Dai, Sixian Wang, Guo Lu, Kai Niu, Wenjun Xu, Wenjun Zhang, Ping Zhang

专题命中 效率与部署 :language model(abstract)

AI总结 针对极端低带宽丢包网络的语义通信问题,提出ResiGLC框架,结合语言模型上下文预测与掩码学习,通过渐进式解码提升抗丢包性,可在低带宽下改善通信的感知质量。

Comments Accepted to appear in IEEE TMC. 14 pages, 15 figures, and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20208 2026-08-21 cs.CV 新提交 50%

RoMAN-Flow: Taming Autoregressive Normalizing Flows for Offline Reinforcement Learning in Robotic Manipulation

RoMAN-Flow:驯服自回归归一化流用于机器人操作中的离线强化学习

Shaoxuan Wang, Guangting Zheng, Rui Huang, Zhipeng Tang, Sha Zhang, Jiajun Deng, Yanyong Zhang

专题命中 效率与部署 :post-training(abstract)

AI总结 该研究针对机器人操作离线强化学习中AR-NFs采样开销大的问题,提出RoMAN-Flow框架,通过无采样的优势加权似然目标和策略蒸馏方法,在保证性能的同时大幅降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20069 2026-08-21 cs.CV 新提交 50%

V-REX: Efficient Specialist VLM Training for Veterinary X-Rays

V-REX:面向兽医X光片的高效专用视觉语言模型(VLM)训练

Tim Elsner, Nicole McNally, Andre Dourson, Michael Fitzke

机构 * Vyyo AI Mars Petcare(玛氏宠物护理)

专题命中 效率与部署 :foundation model(abstract)

AI总结 该研究针对兽医X光片领域,提出高效专用VLM训练方案,无需依赖额外数据,用更少资源开发出能生成兽医X光诊断报告的模型,性能远超同类开源基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19871 2026-08-21 cs.CV 新提交 50%

DIFFCZSL: Compositional Zero-Shot Learning Regularized by Diffusion Representations

DIFFCZSL:基于扩散表示正则化的组合零样本学习

Hangyu Tian, Zhenqi He, Yanghao Wang, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与部署 :language model(abstract)

AI总结 DIFFCZSL将预训练扩散模型的生成先验注入基于CLIP的组合零样本学习流程,通过对比对齐提升性能,在两类设置下均优于强基线,凸显了扩散表示与视觉-语言模型的互补优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19837 2026-08-21 cs.AR 新提交 50%

Energy-Efficient Visual Inspection with FFT-Based CNNs and Adaptive Floating-Point Quantization

基于FFT的卷积神经网络与自适应浮点量化的节能视觉检测

Lukas Krupp, Marco Groß, Michael Graichen, Kim Ulrich, Norbert Wehn

专题命中 效率与部署 :post-training(abstract)

AI总结 该研究针对工业CPU-FPGA平台,结合FFT卷积与自适应FP8量化优化LeNet-5加速器,实现故障检测准确率提升与能效增强。

Comments Accepted for presentation at the 23rd International SoC Design Conference (ISOCC 2026). Proceedings to be included in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19589 2026-08-21 cs.RO cs.CV 新提交 50%

OrthoSkillVLA: Continual Skill Learning via Gradient-Informed Skill Subspace Adaptation

OrthoSkillVLA:通过梯度感知技能子空间自适应实现持续技能学习

Jiaqi Wang, Zhou Fang, Qiongfeng Shi, Yi Zhou

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Electronic Science and Engineering, Southeast University(东南大学电子科学与工程学院)

专题命中 效率与部署 :language model(abstract_cn)

AI总结 OrthoSkillVLA是一种参数高效的持续技能学习框架,通过对VLM和ActionHead施加独立子空间约束、引入特征感知MoE解码器,实现预训练VLA模型的技能学习,可缓解灾难性遗忘。

Comments Accepted by PRCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19553 2026-08-21 cs.CV 新提交 50%

Where Grounding Accuracy Lives on the IoU Curve: Label-Free Inference-Time Boundary Refinement

IoU曲线上定位精度的核心所在:无标注推理时的边界优化

Bo Ma

机构 * Auckland University of Technology(奥克兰理工大学)

专题命中 效率与部署 :language model(abstract)

AI总结 本文提出无标注推理时的边界优化(LFPR)方法,在多个视觉-语言定位数据集上提升了IoU曲线各精度指标,证明指代选择与边界精度部分可分离,为定位精度优化提供了新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11716 2026-08-21 cs.AR 版本更新 50%

A Fast Locality Simulator for GEMM Design-Space Exploration on Multi-Chiplet GPUs

面向多芯片GPU的GEMM设计空间探索的快速局部性模拟器

Euijun Chung, Hyesoon Kim

专题命中 效率与部署 :LLM(abstract_cn)

AI总结 提出一种快速、功能级、瓦片级局部性模拟器,用于评估多芯片GPU上GEMM的内核选择对片间流量影响,发现远程流量变化可达90倍,并揭示2D块交织CTA遍历可减少远程流量达5.1倍。

Comments Poster presentation at the Workshop on Modeling & Simulation of Systems and Applications (MODSIM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02419 2026-08-21 physics.chem-ph cond-mat.mtrl-sci physics.comp-ph 版本更新 50%

DPA4: Pushing the Accuracy-Cost Frontier of Interatomic Potentials with EMFA SO(2) Convolution

DPA4: 利用EMFA SO(2)卷积推动原子间势的精度-成本前沿

Tiancheng Li, Wentao Li, Anyang Peng, Jianming Xue, Linfeng Zhang, Duo Zhang, Han Wang

专题命中 效率与部署 :pretraining(abstract)

AI总结 本文提出DPA4架构,通过EMFA SO(2)等变卷积和编译器友好的训练路径,在降低参数和训练成本的同时,在Matbench Discovery等基准上达到最优精度-成本平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07761 2026-08-21 cs.CV 版本更新 50%

Video Evidence to Reasoning Efficient Video Understanding via Explicit Evidence Grounding

视频证据推理:通过显式证据接地实现高效的视频理解

Yanxiang Huang, Guohua Gao, Zhaoyang Wei

机构 * Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学)

专题命中 效率与部署 :language model(abstract)

AI总结 本文提出CoE框架,通过显式证据接地模块和强化学习优化的锚定协议,提升视频推理的准确性和可靠性。

Comments 6 pages

Journal ref ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 领域大模型 23 篇

2608.19665 2026-08-21 cs.IR 新提交 91%

Training-Free LLM-Based Recommendation with Post-LLM Item Refinement Using Collaborative Signals

基于LLM的无训练推荐:利用协同信号的后LLM物品优化

Kyungho Kim, Sunwoo Kim, Geon Lee, Shinhwan Kang, Sojeong Kim, Liam Collins, Bhuvesh Kumar, Donald Loveland, Kijung Shin

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出后LLM范式的无训练推荐框架CoRRe,通过协同信号优化物品嵌入,在真实数据集上性能优于现有无训练方法,接近或超过有训练方法。

Comments Published as a conference paper at CIKM 2026 (short)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02910 2026-08-21 cs.HC cs.AI cs.CY 版本更新 91%

The Basic B*** Effect: The Use of LLM-based Agents Reduces the Distinctiveness and Diversity of People's Choices

基本B效应:基于大语言模型(LLM)的智能体的使用会降低人们选择的独特性与多样性

Sandra C. Matz, Kimberly Klugescheid, C. Blaine Horton, Sofie Goethals

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究通过实地研究和对照实验发现,使用基于LLM的智能体会降低人们选择的独特性与多样性,且顺序选择、智能体个性化会放大该效应,相关发现对设计维护人类多样性的AI系统具有重要意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19529 2026-08-21 cs.CL cs.AI 新提交 90%

When Machines Speak: A Unified Generative Framework for Integrating Machine-Native Symbols into Pretrained Large Language Models

当机器说话:将机器原生符号整合到预训练大语言模型的统一生成框架

Su Yan, Rakesh Iyer

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI

AI总结 研究针对预训练大语言模型无法处理机器原生符号的问题,提出UniLang框架将机器原生符号与自然语言 token 同等建模,在序列推荐、法律先例预测任务上均优于基线,拓展了LLMs的应用范围。

Comments Code: https://github.com/Stella-S-Yan/llm-internalization

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19008 2026-08-21 cs.AI 版本更新 90%

Computational Phenomenology of Borderline Personality Disorder: A Comparative Evaluation of LLM-Simulated Expert Personas and Human Clinical Experts

边缘型人格障碍的计算现象学:对LLM模拟专家人设与人类临床专家的比较评估

Marcin Moskalewicz, Anna Sterna, Karolina Drożdż, Kacper Dudzic, Marek Pokropski, Paula Flores

机构 * IDEAS Research Institute(IDEAS研究机构) Adam Mickiewicz University(亚当·密茨凯维奇大学) AMU Center for Artificial Intelligence(AMU人工智能中心) Poznań University of Medical Sciences(波兹南医科大学) Maria Curie-Skłodowska University(玛丽·居里-斯洛多夫斯卡大学) University of Warsaw(华沙大学)

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究比较了LLM模拟专家与人类专家在边缘型人格障碍定性分析中的表现,发现模型在某些方面与人类难以区分,并能识别人类遗漏的主题,展示了AI增强分析的潜力。

Comments 28 pages, 8 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20153 2026-08-21 cs.CL 新提交 88%

FormalTCS: Benchmarking End-to-End Frontier Formal Theoretical Computer Science Research of Large Language Models

FormalTCS:评估大型语言模型端到端前沿形式理论计算机科学研究的基准

Dingzirui Wang, Xuanliang Zhang, Keyan Xu, Qingfu Zhu, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 FormalTCS基准评估发现,当前大型语言模型完成端到端前沿TCS研究的能力不足,形式化是核心瓶颈,且研究品味限制了自主TCS研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20220 2026-08-21 cs.AI 新提交 87%

InsufficiencyBench: Evaluating LLM legal advice on underspecified user queries

InsufficiencyBench:评估大型语言模型(LLM)在信息不足的用户查询下的法律建议

Samuel J. Vincent, Daniel Calloway, Fangyi Yu, Andrew M. Bean, Nabeel Seedat

机构 * Thomson Reuters Foundational Research(汤姆森路透基础研究机构) Imperial College London(帝国理工学院)

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究构建了首个针对查询端信息不足的法律基准InsufficiencyBench,评估前沿LLM在信息不足的法律查询中识别缺失要素、避免过早结论的能力,发现现有模型表现不佳。

Comments 10 pages, Best Paper Honorable Mention at ICML AI4Law 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19206 2026-08-21 cs.CL cs.AI cs.MA 新提交 87%

Hallucination as a Feature, not a Defect: Evaluating a multi-agent architecture to transform speculative language-model outputs into testable scientific hypotheses

幻觉作为特征而非缺陷:评估一种将推测性语言模型输出转化为可检验科学假说的多智能体架构

Nicolas Rodriguez-Alvarez

机构 * IES Parquesol(帕尔奎索尔学院)

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究提出基于Rust的多智能体架构,通过生成与评估智能体的认识论摩擦循环将LLM的推测性输出转化为可检验假说,实验显示该架构在需经受严格约束时更具优势,且各架构在原创性等维度的平衡表现不同。

Comments 25 pages. Bilingual: full English version followed by the complete Spanish version. Includes an exploratory paired baseline and ablation study (6 conditions). Code and data: https://doi.org/10.5281/zenodo.20649714

详情

展开后加载摘要…

URL PDF HTML 收藏