arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-27 至 2026-07-27 共收录 215 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 54 篇

2607.22293 2026-07-27 cs.CV 新提交 67%

RadSight: Towards Perceptually Reliable Multimodal Radiology Image Understanding

RadSight:迈向感知可靠的多模态放射学图像理解

Jianqin Liu, Weiwei Cao, Wanxing Chang, Ruifeng Yuan, Bowen Shi, Zhilin Zheng, Xianjie Zhang, Ling Zhang, Peng Wang, Jianpeng Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(湖畔实验室) University of Electronic Science and Technology of China(电子科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究针对医学多模态大语言模型视觉解释可靠性低的问题,引入Perception-Bench基准分析问题。提出基于双2D/3D编码器架构的RadSight模型,经渐进课程学习训练,在多维度评估中优于现有模型,凸显低级视觉感知对可靠临床理解的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20803 2026-07-27 cs.CL cs.AI cs.LG 版本更新 67%

The Geometry of Personality: Activation Steering with Jungian Cognitive Functions

人格的几何学:用荣格认知功能进行激活引导

Liu Zai, Yumeng Wang, Junchen Fu, Joemon M. Jose

机构 * University of Glasgow(格拉斯哥大学) Leiden University(莱顿大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究能否用荣格认知功能将人格表示为认知过程并控制,引入含评估协议和数据集的框架,通过实验表明可有效控制,还揭示人格信息所在层、引导向量关系等,为大语言模型人格表示提供新见解并建立研究框架。

Comments There is an error uploading files causing a private work unindended for publication being submitted. The title, abstract, fig 2, 3, 5 and a few other places contain errors misinterpreting the data

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21608 2026-07-27 cs.SE cs.AI cs.CL cs.CY 新提交 62%

From Obligation to Specification: A Survey on Validating EU AI Act Requirements in RE

从义务到规范:关于在需求工程中验证欧盟人工智能法案要求的调查

T. Y. Emmy Lai, Sven Giesselbach, Matthias Koch, Héctor Allende-Cid

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究围绕欧盟人工智能法案生效后组织面临的新义务,通过混合方法探索性研究,评估组织准备及对大语言模型智能验证工具的看法,发现虽法案相关但结构化机制缺失,该工具在映射义务等方面有前景但需保障措施,还概述了闭环方法最低要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21143 2026-07-27 cs.CL cs.AI 版本更新 62%

One More Turn, Less Regret: A Regret-Based Multi-Turn Benchmark for LLMs' Clarification Policies

再转一圈,遗憾更少:基于遗憾的大语言模型澄清策略多轮基准测试

Minh Ngoc Ta, My Anh Tran Nguyen, Duong D. Nguyen, Yuxia Wang, Preslav Nakov

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) BKAI Research Center, Hanoi University of Science and Technology(河内科技大学BKAI研究中心) INSAIT, Sofia University "St. Kliment Ohridski"(索非亚大学“圣克莱门特·奥赫里德斯基”INSAIT)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究对话式大语言模型助手在模糊用户请求下的澄清决策问题,核心方法是引入RegretBench基准测试,贡献为揭示模型澄清的有效性和效率,表明有效澄清需在正确时间问对问题并适时停止。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24668 2026-07-27 cs.CL cs.AI 版本更新 62%

InteractComp: Evaluating Search Agents With Ambiguous Queries

InteractComp:使用模糊查询评估搜索代理

Mingyi Deng, Lijun Huang, Yani Fan, Fanqi Kong, Jiayi Zhang, Fashen Ren, Jinyi Bai, Fuzhen Yang, Dayi Miao, Zhaoyang Yu, Yifan Wu, Yanfei Zhang, Fengwei Teng, Yingjia Wan, Song Hu, Yude Li, Xin Jin, Conghao Hu, Haoyu Li, Qirui Fu, Tai Zhong, Xinyu Wang, Xiangru Tang, Nan Tang, Chenglin Wu, Yuyu Luo

机构 * DeepWisdom(深智科技) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Renmin University of China(中国人民大学) University of California, Los Angeles(加州大学洛杉矶分校) Agent Universe(智能体宇宙) McGill University(麦吉尔大学) Yale University(耶鲁大学)

专题命中 评测与基准 :language agent(abstract);分类 cs.CL、cs.AI

AI总结 研究针对搜索代理缺乏处理模糊查询及交互能力的问题,引入InteractComp基准,通过目标-干扰物方法构建问题评估17个模型,发现模型存在过度自信问题,强制交互有提升,揭示交互能力停滞,该基准对评估和训练搜索代理交互能力有重要价值。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026), Seoul, South Korea. 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22445 2026-07-27 cs.AI cs.CR 新提交 57%

Dynamic Capability Scoping for Enterprise AI Agents: A Synthetic Dataset and Three-Source Permission Architecture

企业人工智能代理的动态能力范围界定:一个合成数据集和三源权限架构

Halil Burak Noyan

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究企业人工智能代理动态能力范围界定问题,提出三源权限架构,包括基于角色的上限等,贡献含600个企业任务提示的合成数据集,经验证可推动策略优化,还发布相关内容支持对动态范围界定机制的评估。

Comments Published at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22393 2026-07-27 cs.AI cs.CV 新提交 57%

SceneActBench: Can Agents Act on the 3D Scenes They See?

SceneActBench:智能体能否对其所看到的3D场景采取行动?

Yifei Zhao, Xiangxin Zhou, Wenhao Yang, Jiaqi Tang, Pu Jian, Huanjin Yao, Jiarui Yao, Haowei Lin, Chunchao Guo, Zhuo Chen, Wenkai Lyu, Jianzhu Ma, Xueqian Wang, Wenxi Zhu

机构 * Tencent Hunyuan(腾讯混元) THU(清华大学) NJU(南京大学) HKUST(香港科技大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) PKU(北京大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究视觉语言模型智能体在3D场景行动能力,提出SceneActBench基准测试,涵盖五个3D任务,通过特定指标评估智能体输出,分析不同配置得分及失败情况,为评估智能体在多对象3D场景行动提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22136 2026-07-27 cs.CL 新提交 57%

Dynamic Commonsense Coordination for Empathetic Response Generation

用于移情响应生成的动态常识协调

Zhengyu Qi

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 研究移情响应生成问题,提出含三个互补模块的动态常识协调框架DCC,能整合常识表示、过滤低相关性关系及动态检索记忆,实验表明其可提升情绪分类准确率、响应多样性等,生成更好的响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22115 2026-07-27 cs.DB cs.AI 新提交 57%

Benchmarking Text-to-SQL under Role-Based Access Control

基于角色的访问控制下的文本到SQL基准测试

Yang Fei, Yangfan Jiang, Yin Yang, Xiaokui Xiao

机构 * National University of Singapore(新加坡国立大学) Hamad Bin Khalifa University(哈马德·本·卡西姆大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究基于角色的访问控制下文本到SQL的基准测试问题,提出含现实RBAC约束的综合基准测试框架,通过大语言模型辅助工作流程及人工审核等增强基准,应用该框架研究发现部分高分系统在有访问约束时性能因RBAC违规而大幅下降。

Comments Accepted at ACM SIGMOD 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21962 2026-07-27 cs.CL 新提交 57%

Ground Truth First: A Longitudinal Evaluation Instrument for Agent Memory, and the Tenure Crossover in Memory-Architecture Rankings

真实优先:智能体记忆的纵向评估工具及记忆架构排名中的任期交叉

Quentin Spencer

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 研究大型语言模型智能体记忆基准问题,提出颠倒流程的评估方法,通过合成虚构语料库嵌入新特征,对五种记忆架构基准测试,发现排名随历史长度反转,分层架构表现最佳,发布开源库Veracium。

Comments 25 pages, 2 figures. Code: https://github.com/veracium-ai/Veracium

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15781 2026-07-27 cs.AI cs.ET cs.MA 版本更新 57%

AgentFAIR: A Multi-Agent Collaborative Framework for FAIRness Evaluation of Geospatial Datasets

AgentFAIR:用于地理空间数据集公平性评估的多智能体协作框架

Ming Chen, Pranav Pai

机构 * The University of Melbourne(墨尔本大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究地理空间数据集公平性评估难题,提出AgentFAIR多智能体框架,结合结构化元数据提取与特定子原则语言模型评估器,给出各项评估结果,支持可审计性与可行性,不过受限于多种因素对准确性和泛化性声明有约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03159 2026-07-27 cs.CV cs.AI cs.RO 版本更新 57%

NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation

NVIDIA OmniDreams:用于闭环自动驾驶仿真的实时生成式世界模型

NVIDIA, :, Aarti Basant, Amlan Kar, Despoina Paschalidou, Fangyin Wei, Francesco Ferroni, Guillermo Garcia Cobo, Haithem Turki, Huan Ling, Jaewoo Seo, James Lucas, Jay Zhangjie Wu, Jialiang Wang, Jonathan Lorraine, Jun Gao, Kai He, Katarina Tothova, Kevin Xie, Michał Tyszkiewicz, Qi Wu, Riccardo de Lutio, Ruilong Li, Sanja Fidler, Seung Wook Kim, Tianchang Shen, Tianshi Cao, Tobias Pfaff, William Lew, Xindi Wu, Xuanchi Ren, Yifan Lu, Yuxuan Zhang, Zan Gojcic, Zian Wang

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 提出OmniDreams,一个基于Cosmos扩散模型训练的基础生成式世界模型,通过自回归生成动作条件视频,实现闭环仿真中复杂长尾场景的实时合成,并验证其在策略模型训练中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18119 2026-07-27 cs.AI 版本更新 57%

Beyond Text-to-SQL: Can LLMs Really Debug Enterprise ETL SQL?

超越文本到SQL:LLMs真的能调试企业级ETL SQL吗?

Jing Ye, Yiwen Duan, Yonghong Yu, Victor Ma, Yang Gao, Xing Chen

机构 * ByteDance Inc.(字节跳动公司)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 本文提出OurBench基准测试,用于评估LLMs在企业级SQL推理和调试中的性能,发现现有模型在复杂SQL错误检测上表现有限,需进一步改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22071 2026-07-27 cs.CV 新提交 50%

ReCowGnition: A Realistic Biometric Benchmark for Cow Face Recognition

ReCowGnition:用于奶牛面部识别的真实生物识别基准

Marco Huber, Marco Kiesewalter, Judith Louise Pieper, Bastian Kubsch, Naser Damer

机构 * Fraunhofer Institute for Computer Graphics Research IGD(弗劳恩霍夫计算机图形研究所IGD) Technische Universität Darmstadt(达姆施塔特工业大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对奶牛面部识别,构建了含6838张图像的公开基准数据集,定义了评估协议,给出六个基准模型的评估结果,为奶牛面部识别研究提供数据支持与评估标准,推动该领域可比研究。

Comments Accepted at ICPR 2026 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21738 2026-07-27 cs.SE 新提交 50%

When Model Release Meets Model Reuse: Producer-Consumer Misalignment in Hugging Face

当模型发布遇到模型重用:Hugging Face 中的生产者 - 消费者错位

Adekunle Ajibode, Oussama Ben Sghaier, Bram Adams, Ahmed E. Hassan

专题命中 评测与基准 :language model(abstract)

AI总结 研究预训练语言模型供应链中生产者与消费者的错位问题,通过对50位Hugging Face生产者和95位GitHub消费者的双视角调查,发现双方在模型发现、文档实践、谱系追踪和模型治理采用上存在差异,为改进供应链相关方面提供了机会。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12291 2026-07-27 cs.RO cs.CV 版本更新 50%

OpenNavMap: Multi-Session Appearance-Based Topometric Mapping for Scalable Visual Navigation

OpenNavMap: 无需结构的拓扑制图通过大规模协作定位

Jianhao Jiao, Changkun Liu, Jingwen Yu, Boyi Liu, Qianyi Zhang, Yue Wang, Dimitrios Kanoulas

机构 * Robot Perception and Learning Lab, Intelligent Robotics, Department of Computer Science, University College London(机器人感知与学习实验室,智能机器人,计算机科学系,伦敦大学学院) Department of Computer Science and Engineering, Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Department of Electronic and Computer Engineering, Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) Institute of Robotics and Automatic Information System, Nankai University(机器人与自动信息系统研究所,南开大学) College of control science and engineering, Zhejiang University(控制科学与工程学院,浙江大学) AI Centre, Department of Computer Science, University College London(人工智能中心,计算机科学系,伦敦大学学院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 OpenNavMap通过大规模协作定位实现无需结构的拓扑制图,利用3D几何模型进行按需重建,实现高精度的子图对齐和全局一致性。

Comments 21 pages, 20 figures, https://rpl-cs-ucl.github.io/OpenNavMap_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00713 2026-07-27 cs.CV 版本更新 50%

RAD: A Dataset and Benchmark for Real-Life Anomaly Detection with Robotic Observations

RAD:面向机器人观测的真实异常检测数据集与基准

Kaichen Zhou, Xinhai Chang, Taewhan Kim, Jiadong Zhang, Yang Cao, Chufei Peng, Fangneng Zhan, Hao Zhao, Hao Dong, Kai Ming Ting, Ye Zhu

机构 * Massachusetts Institute of Technology(麻省理工学院) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Great Bay University(大湾大学) Harvard University(哈佛大学) Tsinghua University(清华大学) Nanjing University(南京大学) Deakin University(德克萨斯大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出RAD数据集,包含13类日常物体和4种缺陷,从60多个机器人视角在非受控光照下采集,用于评估2D特征、3D重建和视觉语言模型在姿态无关的异常检测中的表现,发现2D方法优于3D和VLM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 35 篇

2604.25774 2026-07-27 cs.CL cs.AI 92%

CGU-ILALab at FoodBench-QA 2026: Comparing Traditional and LLM-based Approaches for Recipe Nutrient Estimation

CGU-ILALab 在 FoodBench-QA 2026 中:比较传统方法与基于 LLM 的方法在食谱营养估算中的表现

Wei-Chun Chen, Yu-Xuan Chen, I-Fang Chung, Ying-Jia Lin

机构 * CGU-ILALab

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文比较了传统方法与基于 LLM 的方法在食谱营养估算中的性能,发现 LLM 能有效处理模糊术语和非标准单位,但计算效率较低。

Comments Accepted by the Third Workshop on Patient-oriented Language Processing (CL4Health) at LREC 2026

Journal ref https://lrec.elra.info/lrec2026-ws-cl4health-31

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12311 2026-07-27 cs.NI cs.CR cs.HC cs.LG 版本更新 90%

Cross-reality location privacy protection in 6G-enabled vehicular metaverses: an LLM-enhanced hybrid generative diffusion model-based approach

6G赋能车联网元宇宙中的跨现实位置隐私保护:一种基于LLM增强混合生成扩散模型的方法

Xiaofeng Luo, Jiayi He, Jiawen Kang, Ruichen Zhang, Zhaoshui He, Ekram Hossain, Dong In Kim

机构 * School of Automation, Guangdong University of Technology(自动化学院,广东技术大学) School of Computer Science and Engineering, Nanyang Technological University(计算机科学与工程学院,南洋理工大学) Department of Electrical and Computer Engineering, University of Manitoba(电气与计算机工程系,曼尼托巴大学) Department of Electrical and Computer Engineering, Sungkyunkwan University(电气与计算机工程系,成均馆大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出了一种基于LLM增强混合生成扩散模型的方法,用于6G赋能车联网元宇宙中的跨现实位置隐私保护,通过混合动作优化平衡隐私保护、延迟降低和服务质量维护。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00368 2026-07-27 cs.DC 版本更新 89%

TENT: A Declarative Slice Spraying Engine for Performant and Resilient Data Movement in Disaggregated LLM Serving

TENT:一种用于高性能和容错数据移动的声明式切片喷射引擎

Feng Ren, Ruoyu Qin, Teng Ma, Shangming Cai, Zheng Liu, Chao Lei, Dejiang Zhu, Ke Yang, Zheming Li, Jialei Cui, Weixiao Huang, Yikai Zhao, Yineng Zhang, Hao Wu, Xiang Gao, Yuhao Fu, Jinlei Jiang, Yongwei Wu, Mingxing Zhang

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 TENT通过解耦传输意图与物理执行,统一异构互连技术为动态资源池,实现高效、容错的数据传输,提升LLM推理和RL流水线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22226 2026-07-27 cs.RO 新提交 88%

Offline Vision-Language Navigation with Geometric Goal Localization for Outdoor Environments

用于户外环境的基于几何目标定位的离线视觉语言导航

Ali Salmasi, Xianjia Yu, Tomi Westerlund

专题命中 效率与部署 :SLM(summary_cn,abstract);language model(abstract);foundation model(abstract);small language model(abstract)

AI总结 研究针对户外环境下的离线视觉语言导航,通过对17个可边缘部署的SLM与4个在线API进行基准测试,提出轻量级混合语义几何目标定位框架并集成到Edge-BehAV中,提升了性能,降低目标距离误差,实现无网络连接下的有效导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21958 2026-07-27 stat.ML cs.LG 新提交 87%

Efficient Online LLM Watermark Detection via Rao-Blackwellized E-Processes

通过Rao-Blackwellized E过程实现高效在线大语言模型水印检测

Lu Luo, Dandan Mo, Chengdong Xu, Ting Li, Jinhan Xie, Huiqiong Li, Niansheng Tang

机构 * Yunnan Key Laboratory of Statistical Modeling and Data Analysis(云南统计建模与数据分析重点实验室) Yunnan University(云南大学) School of Statistics and Management(统计与管理学院) Shanghai University of Finance and Economics(上海财经大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究如何在大语言模型中高效检测水印,基于Rao-Blackwellized e过程开发在线检测框架,针对Gumbel-max水印实例化,能随时有效推理、递归更新证据,理论证明其有效性,模拟和实验验证了高效在线检测。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16763 2026-07-27 cs.LG 版本更新 87%

LLM-Extracted Covariates for Clinical Causal Inference: Rethinking Integration Strategies

基于大语言模型的协变量用于临床因果推断:重新思考整合策略

Lei Liu, Jialin Chen, Kathy Macropol

机构 * Department of Computer Science and Mathematics(计算机科学与数学系) Arcadia University(阿卡迪亚大学) Department of Computer Science(计算机科学系) Yale University(耶鲁大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究如何利用大语言模型提取的协变量提升临床因果推断效果,通过比较七种整合策略,发现直接增强倾向分数模型的性能最佳,且在真实数据中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21602 2026-07-27 cs.AI 新提交 85%

Transferable Latency Prediction for Fast LLM Screening on Heterogeneous Edge Devices

用于异构边缘设备上快速大语言模型筛选的可迁移延迟预测

Xiaolong Tu, Vinod K. Mishra, Venkat R. Dasari, Anu G. Bourgeois, Haoxin Wang

机构 * Georgia State University(佐治亚州立大学) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对异构边缘设备上大语言模型的延迟预测问题,提出运行时感知延迟预测框架,将推理请求配置化,分阶段处理并融合数据,经实验验证该框架能降低分析成本,支持跨平台部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20757 2026-07-27 cs.LG cs.CL 版本更新 84%

GaugeQuant: Online Learning of Quantization-Optimal Bases from LLM Symmetries

规范量化:从语言模型对称性中在线学习量化最优基

Miguel P. Bento, João F. Seabra

专题命中 效率与部署 :LLM(title);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 研究利用Transformer内部连续对称性,通过在损失中引入LogSumExp项破坏对称性,在线学习量化最优基,无需校准数据和量化模拟,训练开销小,在不同量化设置下降低了LLaMA - 2 7B模型的困惑度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21983 2026-07-27 cs.CR 新提交 82%

Ethereum NFT Smart Contracts: Knowledge-Guided Vulnerability Detection with LLM and Code Slicing

以太坊非同质化代币智能合约:基于大语言模型和代码切片的知识引导漏洞检测

Deyu Yang, Rundong Wei, Xiaoqi Li

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 研究以太坊NFT智能合约漏洞检测,结合漏洞聚焦代码切片、ERC-721知识库及受限DeepSeek分析,正则表达式定位候选语句,提取代码切片分析,结果显示聚焦代码上下文和领域约束影响检测器输出,提升阳性标签率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22400 2026-07-27 cs.NI cs.AI 新提交 81%

A Self-Calibrating Agentic AI Framework for Autonomous Edge Resource Allocation

一种用于自主边缘资源分配的自校准智能体人工智能框架

Fin Gentzen, Marla Grunewald, Iulisloi Zacarias, Mounir Bensalem, Admela Jukan

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型驱动系统运行可靠性受挑战的问题,提出自校准智能体人工智能框架,设计自校准机制,应用于边缘计算网络零知识工作负载资源分析,提高预测准确率和速度,为自主人工智能部署奠定基础,且生成基本事实速度更快。

Comments This work has been submitted to the IEEE Transactions on Network and Service Management for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07025 2026-07-27 cs.CL 版本更新 81%

Language-Aware Distillation for Multilingual Instruction-Following Speech LLMs with ASR-Only Supervision

面向多语言指令遵循语音大语言模型的语言感知蒸馏:仅使用ASR监督

Shreyas Gopal, Donghang Wu, Ashutosh Anshul, Yeo Yue Heng, Yizhou Peng, Haoyang Li, Hexin Liu, Eng Siong Chng

机构 * College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学) AI Singapore(AI新加坡) National University of Singapore(新加坡国立大学) Institute for Infocomm Research (I$^2$R)(信息通信研究所) A$^{*}$STAR(A*星)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种语言感知蒸馏方法,通过查询库和门控网络提升多语言指令遵循语音大语言模型的性能,实现在Audio-MLQA基准上比现有基线提升32%。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19686 2026-07-27 cs.CL cs.LG 版本更新 81%

Multi-Mask Diffusion Language Models for Few-Step Generation

用于少步生成的多掩码扩散语言模型

Sijin Chen, Yinuo Ren, Heyang Zhao, Ziheng Cheng, Quanquan Gu, Lexing Ying

机构 * ByteDance Seed(字节跳动种子) Princeton University(普林斯顿大学) Stanford University(斯坦福大学) UCLA(加州大学洛杉矶分校) UC Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :language model(title);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究针对掩码扩散模型少步生成难的问题,提出多掩码扩散模型MultiMDM,通过特定前向过程使反向过程有起草能力,推导训练目标并制定蒸馏方案,经实验验证其为少步生成提供了有效基础。

Comments Needs corporate approval

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05148 2026-07-27 cs.CV cs.AI cs.LG 版本更新 81%

Atlas 2 -- Foundation models for clinical deployment

Atlas 2 -- 临床应用的基础模型

Maximilian Alber, Timo Milbich, Alexandra Carpen-Amarie, Stephan Tietz, Jonas Dippel, Lukas Muttenthaler, Beatriz Perez Cancer, Alessandro Benetti, Panos Korfiatis, Elias Eulig, Jérôme Lüscher, Jiasen Wu, Sayed Abid Hashimi, Gabriel Dernbach, Simon Schallenberg, Neelay Shah, Moritz Krügener, Aniruddh Jammoria, Jake Matras, Patrick Duffy, Matt Redlon, Philipp Jurmeister, David Horst, Lukas Ruff, Klaus-Robert Müller, Frederick Klauschen, Andrew Norgan

机构 * Aignostics, Germany(德国Aignostics公司) Department of Laboratory Medicine and Pathology, Mayo Clinic, Rochester, MN, US(美国梅奥诊所实验室医学与病理学部门) Department of Radiology, Mayo Clinic, Rochester MN, US(美国梅奥诊所放射学部门) Department of Information Technology, Mayo Clinic, Rochester MN, US(美国梅奥诊所信息技术部门) Mayo Clinic, Rochester MN, US(美国梅奥诊所) Digital Pathology, Mayo Clinic, Rochester MN, US(美国梅奥诊所数字病理学部门) Machine Learning Group, Technische Universität Berlin, Germany(德国柏林技术大学机器学习小组) BIFOLD – Berlin Institute for the Foundations of Learning and Data, Germany(德国柏林学习与数据基础研究所) Department of Artificial Intelligence, Korea University, Republic of Korea(韩国韩国大学人工智能系) Max-Planck Institute for Informatics, Germany(德国马克斯·普朗克信息研究所) German Cancer Research Center (DKFZ) & German Cancer Consortium (DKTK), Berlin & Munich Partner Sites, Germany(德国癌症研究中心(DKFZ)及德国癌症联盟(DKTK)柏林与慕尼黑合作站点) Institute of Pathology, Ludwig-Maximilians-Universität München, Germany(德国慕尼黑路德维希-马克西米利安大学病理学研究所) Institute of Pathology, Charité – Universitätsmedizin Berlin, Germany(德国柏林夏里特大学医学中心病理学研究所) Bavarian Cancer Research Center (BZKF), Germany(德国巴伐利亚癌症研究中心(BZKF)) Helmholtz Munich, Germany(德国海德堡-慕尼黑亥姆霍兹中心) Technical University Munich, Germany(德国慕尼黑技术大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 Atlas 2系列通过在80个公开基准测试中展现卓越的预测性能、鲁棒性和资源效率,为临床应用提供了先进的病理视觉基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏