arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11785 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2848 篇

2607.22006 2026-07-27 cs.CY econ.GN q-fin.EC stat.AP 新提交 71%

Unfit for stranding assessment: a panel-scale multimodal-LLM audit of building-decarbonisation disclosure (BeDA)

不适用于搁浅评估:建筑脱碳披露(BeDA)的面板规模多模态大语言模型审计

Jingyi Xu, Minghui Cheng, Anchen Sun

专题命中 评测与基准 :LLM(title)

AI总结 研究建筑脱碳披露情况,引入多模态大语言模型工具BeDA审计全球公司面板。发现多数披露不适用,存在报告差距,BeDA分数可靠,可监测该差距,为可执行的建筑搁浅法规提供支持,是筛选工具非预测工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21072 2026-07-24 cs.CV 新提交 71%

Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text

展示而非讲述:在生成像素而非语言模型文本中评估空间认知

Xu Wang, Kaixiang Yao, Miao Pan, Xiaohe Zhou, Xuanyu Liu, Wenqi Zhang, Xuhong Zhang

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title)

AI总结 研究图像生成模型空间认知评估问题,提出ProVisE框架及SpatialGen - Bench基准,通过统一设置评估相关模型,发现图像生成模型在像素空间直接外化答案时有竞争力,文本输出语言模型在组合空间推理中有优势,揭示了两者互补优势并建立测试平台。

Comments 36 pages, 14 figures. Project page: https://zju-omniai.github.io/ProVisE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20695 2026-07-24 cs.CY 新提交 71%

Language Models Embody and Amplify Human Cognitive Distortions: What Is to Be Done?

语言模型体现并放大人类认知扭曲:该怎么办?

Arnau Marin-Llobet, Steven A. Lehr, Mahzarin R. Banaji

专题命中 评测与基准 :language model(title)

AI总结 研究指出语言模型存在社会认知偏见,它不仅体现人类偏见,还会放大、加剧并传递偏见,鉴于其对决策影响巨大,提出了从诊断、监管和操作方面应对语言模型偏见问题的对策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09197 2026-07-13 cs.MA 新提交 71%

When is Routing Meaningful? Diversity and Robustness in Language Model Societies

路由何时有意义?语言模型社会中的多样性和鲁棒性

Fantine Huot, Michael Kaisers, Mirella Lapata

专题命中 评测与基准 :language model(title)

AI总结 研究多模型系统路由策略何时有意义,通过适应分层社会熵并引入基于扰动的度量来诊断失败模式,应用于EmbedLLM和RouterBench,发现HSE收益递减,KNN路由器扰动下鲁棒性差,提示路由稳定,揭示准确性与意义可能背离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08885 2026-07-13 cs.SE 新提交 71%

Programmers Are Poor and Overconfident Judges of LLM-Generated Assertions

程序员是大型语言模型生成断言的糟糕且过度自信的评判者

Zhanna Kaufman, Yuriy Brun, Adithya Murali, Madeline Endres

专题命中 评测与基准 :LLM(title)

AI总结 研究程序员评估大型语言模型生成断言的能力,通过实验发现程序员判断正确断言较准,判断错误断言较差,自然语言解释未带来整体益处,凸显帮助开发者评估机器生成可靠性工件的重要性。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27646 2026-07-09 cs.CV physics.optics 新提交 71%

VLM-Aware Meta-Optic Front-End Design for Frozen Vision-Language Models

面向冻结视觉语言模型的VLM感知元光学前端设计

Chanik Kang, Raphaël Pestourie, Haejun Chung

机构 * Department of Artificial Intelligence, Hanyang University(汉阳大学人工智能系) School of Computational Science and Engineering, Georgia Institute of Technology(佐治亚理工学院计算科学与工程学院) Department of Electronic Engineering, Hanyang University(汉阳大学电子工程系)

专题命中 评测与基准 :language model(title)

AI总结 提出CODA框架,通过可微成像和伴随梯度更新优化连续密度元光学前端,直接优化冻结CLIP分类器的交叉熵损失,在ImageNet-100上将零样本准确率从53.75%提升至65.41%,并跨模型和数据集泛化。

Comments 18 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00020 2026-07-02 cs.RO 新提交 71%

EmbodimentSemantic: A Spatial Scene-Graph Dataset and Benchmark for Vision-Language Models on Embodied Manipulation Trajectories

EmbodimentSemantic:面向具身操作轨迹的空间场景图数据集与视觉语言模型基准

Hassan Jaber, Refinath S N, Luca Cagliero, Christopher E. Mower, Haitham Bou-Ammar

机构 * Politecnico di Torino(都灵理工大学) University College London(伦敦大学学院)

专题命中 评测与基准 :language model(title)

AI总结 提出EmbodimentSemantic数据集与基准,通过场景图三元组评估VLM在具身操作中的空间关系理解,发现现有模型在深度感知和视角依赖关系上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27738 2026-06-29 cs.HC 新提交 71%

HandMade: Spatial Prompting for Generative 3D Creation with Part-Labeled VR Sketches

HandMade: 基于部分标注的VR草图的空间提示生成式3D创作

Jialin Huang, Rana Hanocka, Ariel Shamir, Yotam Gingold

专题命中 评测与基准 :prompting(title)

AI总结 提出HandMade工作流,结合VR 3D草图和语言进行开放域3D资产生成,将粗粒度部分标注的3D草图作为空间提示,通过多视图部分引导和结构化提示实现空间布局与语言描述的协同创作。

Comments 15 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07674 2026-06-09 cs.CV q-bio.NC 新提交 71%

Simultaneous hyperkinetic movement disorders phenotyping: a cross-cohort pediatric transfer study using routine videos, markerless pose estimation and a tabular foundation model

同时性多动症表型分析:基于常规视频、无标记姿态估计和表格基础模型的跨队列儿科迁移研究

Laura Cif, Diane Demailly, Zohra Souei, Muhammad Mushhood Ur Rehman, Juan Dario Ortigoza Escobar, Mayté Castro Jiménez, Cécile A. Hubsch, Sophie Huby, Morgan Dornadic, Gun-Marie Hariz, Eduardo M. Moraud, Jocelyne Bloch, Gabriella A. Horvath, Xavier Vasques

机构 * Lausanne University Hospital (CHUV)(洛桑大学医院) University of Lausanne (UNIL)(洛桑大学) Institut du Neurone(神经元研究所) Clinique Beau Soleil(博索莱伊诊所) Institut Mutualiste Montpelliérain(蒙彼利埃互助研究所) Military University Hospital of Sfax(斯法克斯军事大学医院) University of Edinburgh(爱丁堡大学) Hospital Sant Joan de Déu(圣琼德迪乌医院) European Reference Network for Rare Neurological Diseases (ERN-RND)(欧洲罕见神经系统疾病参考网络) Instituto de Salud Carlos III(卡洛斯三世健康研究所) CHU Montpellier(蒙彼利埃大学医院) Umeå University(于默奥大学) University Hospital Lausanne(洛桑大学医院) Ecole Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) British Columbia Children’s Hospital(不列颠哥伦比亚儿童医院)

专题命中 评测与基准 :foundation model(title)

AI总结 提出结合无标记姿态估计、运动学描述符和预训练基础模型的视频框架,在成人数据上训练后迁移至儿科队列,经轻量校准后实现多种多动症现象的同时检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21249 2026-08-24 cs.CL 新提交 70%

Benchmarking Patent Drafting from Inventor-Style Disclosures

从发明人风格的披露文件进行专利撰写的基准测试

Lekang Jiang, Wenjun Sun, Stephan Goetz

机构 * University of Cambridge(剑桥大学) Chinese Academy of Sciences(中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究针对从发明人风格披露文件生成专利申请的现实需求,构建了Dis2Pat数据集,并提出可本地部署的多智能体框架Patent-MAF,实验表明该框架在专利撰写任务上表现优于多数开源模型且可与闭源模型竞争。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21140 2026-08-24 cs.CV cs.AI 新提交 70%

A Modular Agent for Reliable and Auditable Spatial Relation Verification in CT Scans

用于CT扫描中可靠且可审计的空间关系验证的模块化智能体

Simon Vincent Abel, Heiko Hillenhagen, Michael Götz, Timo Ropinski, Ayhan Can Erdur, Daniel Santak Wolf

机构 * Ulm University(乌尔姆大学) Ulm University Hospital(乌尔姆大学医院) Technical University of Munich (TUM)(慕尼黑工业大学(TUM)) TUM University Hospital(慕尼黑工业大学医院) Department of Radiation Oncology, TUM University Hospital(慕尼黑工业大学医院放射肿瘤科)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 针对医学视觉-语言模型空间推理薄弱的问题,提出模块化医学影像智能体,通过分阶段处理实现CT扫描空间关系验证,性能优于端到端基线,可作为未来医学影像智能体的构建块。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21087 2026-08-24 cs.CL 新提交 70%

Jokes Aside: Measuring the Semantic Distance of Double Meanings

玩笑之外:测量双重含义的语义距离

Fabio De Ponte

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究基于词嵌入重新审视现有幽默指标并引入对称性指标,在三个数据集上验证后发现,基于这些指标训练的模型预测幽默评分表现不佳,但对称性指标与高分笑话相关。

Comments The paper was submitted to ISHS (International Society for Humor Studies) conference held in Kraków, Poland on 7-11 July 2025. It was awarded the GSA AWARD and was presented during a special plenary session (see the section Graduate Student Awards, 2006-2025 of the webpage this https URL (https://www.humorstudies.org/ConferCenter.htm) )

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20984 2026-08-24 cs.CV cs.CL cs.CY 新提交 70%

MigrationNarrate: A Dataset for Detection of Migration Narratives in YouTube Videos

MigrationNarrate:用于检测YouTube视频中移民叙事的数据集

Fatima Haouari, Carolina Scarton, Kalina Bontcheva

机构 * University of Sheffield(谢菲尔德大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究推出首个用于检测英国移民叙事的多模态数据集MigrationNarrate,包含1115个YouTube视频字幕,结合预训练编码器与大语言模型开展基准测试,为移民叙事检测研究提供关键资源。

Comments This work was accepted to the main conference of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20786 2026-08-24 cs.AI cs.IR 新提交 70%

Structure for Reading, Prose for Writing: Asymmetric Structural Conditioning in Multi-Agent Document Authoring

阅读用结构,写作用散文:多智能体文档创作中的非对称结构条件作用

Cheng Yu, Nikhil Mathew, Zhengjie Wang

机构 * ML Research Labs(ML研究实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对多智能体文档创作系统,发现结构条件作用存在不对称性,结构利于阅读但不利于写作,还揭示了信息可用性对系统性能的关键影响。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20614 2026-08-24 cs.AI 新提交 70%

Evaluating Skills, Not Just Agents: Agentic Continuous Evaluation of Skills

评估技能,而非仅评估智能体:智能体驱动的技能持续评估

Christopher Kevin, Narendran Raghavan, Jean-Francois Puget, Roshni Malani, Meghana Puvvadi, Moshe Abramovitch, Mohit Gupta, Rama Akkiraju, Subodh Prabhu, Yogesh Dangi, Wei Luo, Seong Hee Lee

机构 * NVIDIA(英伟达)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出ACES框架,通过配对实际 trials等方式评估技能附加价值,实验表明其能发现扫描式审核无法观测的信号,开源实现已在NVIDIA SkillEvaluator中提供。

Comments 15 pages. Extended preprint incorporating versions accepted at Agent Skills '26 (ACM CAIS 2026) and the KDD 2026 Workshop on Enterprise AI Agents: From Prototypes to Production (oral presentation). Open-source implementation: this https URL (https://github.com/NVIDIA/SkillEvaluator)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20485 2026-08-24 cs.AI cs.SE 新提交 70%

Terminal Agents: A Survey of AI Agents in Command-Line Environments

终端智能体:命令行环境下的AI智能体综述

Yi Bin, Xiaoyang Yuan, Haoxi Zeng, Wencheng Ye, Wenqi Shao, Chen Qian, Wei Ye, Yujuan Ding, Zheng Wang, Pengpeng Zeng, Jingkuan Song, Heng Tao Shen

机构 * Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学) Tongji University(同济大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文将终端智能体定义为行动-观察循环由终端介导的系统,通过七维轮廓关联架构等模块,揭示其行为影响因素与评估不均衡问题,为相关研究提供统一框架。

Comments 52 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20024 2026-08-21 cs.LG 新提交 70%

Systematic Evaluation of TabPFN-TS for Zero-Shot Probabilistic Heat Load Forecasting in District Heating Networks

系统评估TabPFN-TS在区域供热网络零样本概率热负荷预测中的应用

Ben Spoek, Karim K. Ben Hicham, Kai Derzsi, Philipp Althaus, Alexander Mitsos, Dirk Müller

机构 * RWTH Aachen University(亚琛工业大学) Process Systems Engineering(过程系统工程) Chair of Energy Efficient Buildings Indoor Climate(节能建筑室内气候主席席位)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本研究系统评估TabPFN-TS用于区域供热网络零样本概率热负荷预测,确定了最优配置,其性能接近Chronos-2且校准更好,相关发现推动了多分辨率残差校正预测器的开发。

Comments 33 pages, 10 figures; supplementary information included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19901 2026-08-21 cs.CR cs.AI 新提交 70%

MaliciousSkillBench: A Comprehensive Benchmark for Malicious Agent Skill Detection

MaliciousSkillBench:用于恶意智能体技能检测的综合基准

Yue Wang, Yi Liu, Gelei Deng, Ying Zhang, Yuekang Li, Zhenyu Chen, Leo Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出MaliciousSkillBench这一综合基准,整合多源恶意技能数据构建含9740个技能的数据集,评估三类检测器后发现现有方法不足,需更广泛跨源覆盖及联合评估攻击检测与良性误报的方案。

Comments Project page: https://protectskills.github.io/MaliciousSkillBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19447 2026-08-21 cs.LG 新提交 70%

Quantifying Event Impacts on Time Series via Multiscale Contrastive Learning

基于多尺度对比学习量化事件对时间序列的影响

Yiming Sun, Shengyu Chen, Zhengzhang Chen, Haoyu Wang, Xiaowei Jia, Haifeng Chen

机构 * Rutgers University(罗格斯大学) NEC Laboratories America(美国NEC实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出多分辨率框架EventTime,结合多维度信息与动态对比目标,在自主构建的SECURE数据集上,实现了对网络安全事件后短期金融异常损失的更精准估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19297 2026-08-21 cs.LG 新提交 70%

Holtercare-Bench: A Multimodal Benchmark for Evaluating Long-Term Dynamic ECG Analysis

Holtercare-Bench:用于评估长期动态心电图分析的多模态基准

Yihan Xie, Hanwen Cui, Runze Ye, Juekai Lin, Haoyang Wang, Jinhao Mao, Bo Zhang, Wenqiao Zhang, Xiaogang Guo, Jun Xiao, Lei Zhang

机构 * Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对现有多模态大语言模型在长期动态心电图分析中的不足,构建了含22980个问答对的Holtercare-23K数据集及Holtercare-Bench基准,评估发现零样本模型处理超长病理序列性能差,微调后提升显著,为长期医疗多模态大语言模型提供基础基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19002 2026-08-20 cs.AI 新提交 70%

A Theory of Post-hoc Debate Judgement

事后辩论评判理论

Xiang Yin, Adam Dejl, Antonio Rago, Lihu Chen, Francesca Toni

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出适用于智能体辩论场景的事后辩论评判理论,探究两种评判方法的属性满足情况,发现辩论语义是辩论驱动型AI原则性评判者的理想候选。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18740 2026-08-20 cs.AI 新提交 70%

A Multi-Agent Platform for Automated Enterprise Analytics and Insight Generation

用于自动化企业分析与洞察生成的多智能体平台

Manoj N M, Vijayakrishna S, Manjunath Srinivas, Rohit Pahan

机构 * Rakuten India Enterprise Private Limited(乐天印度企业私人有限公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出基于CrewAI的多智能体框架,含五个专业智能体,经300个测试用例验证,功能准确率95.3%,较单智能体基线提升显著,可用于自动化企业分析与洞察生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18726 2026-08-20 cs.CL 新提交 70%

Execution-grounded evaluation reveals hidden failures in language-model calculations for environmental science

基于执行的评估揭示语言模型在环境科学计算中的隐藏失败

Maohao Ran, Chendong Ma, Yanting Zhang, Dailing Jiang, Yusen Huang, Meng Gao, Jun Song

机构 * Department of Geography, Hong Kong(香港地理系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究构建了环境科学计算基准AtmosCoder-Bench,发现现有评估未观测计算过程,多项选择格式会虚高准确率,模型多因未一致应用公式失败,前沿模型仍需专家监督。

Comments 29 pages, 4 figures, 2 tables, plus supplementary materials. Maohao Ran and Chendong Ma contributed equally. Corresponding author: Jun Song (junsong@hkbu.edu.hk). Code: https://github.com/acodercat/AtmosCoder-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18719 2026-08-20 cs.AI 新提交 70%

Competence, Not Accuracy: A Diagnostic for Reference-Free Judge Gates in Skill Optimization

能力而非准确率:技能优化中无参考评判门的诊断方法

Chenle Chen, Yangbo Wei, Chao Yao, Shaoqiang Lu, Junhong Qian, Chen Wu, Lei He

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Shanghai Jiao Tong University(上海交通大学) Arizona State University(亚利桑那州立大学) Eastern Institute of Technology(东方理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出技能优化中无参考评判门的预部署诊断方法,发现评判器能力需超1/k才具可用性,其基准准确率高估关键能力,可预测门控错误。

Comments 9 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18586 2026-08-20 cs.CV cs.AI 新提交 70%

OmniHandwritingOCR: A Diagnostic Benchmark for Evaluating Multimodal LLMs in Handwritten OCR Scenarios

OmniHandwritingOCR:用于评估多模态大语言模型在手写OCR场景中表现的诊断基准

Zinuo Guo, Min Zhang, Bo Jiang

机构 * East China Normal University(华东师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究推出OmniHandwritingOCR手写OCR诊断基准,评估13个多模态模型,发现其在复杂公式上表现差且存在幻觉,为诊断模型失效模式提供测试平台。

Comments CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18579 2026-08-20 cs.CV cs.AI 新提交 70%

MR-IQA-2: Faithful Image Quality Reflection via Fine-Grained Credit Assignment

MR-IQA-2:通过细粒度信用分配实现真实的图像质量反映

Yuan li, Youyuan Lin, Chenhui Chu, Shin'ya Nishida

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对现有盲图像质量评估(IQA)中推理真实性不足的问题,提出MR-IQA-2框架,通过解耦推理与评分的细粒度信用分配,在IQA基准上实现了与人类评分的竞争性对齐,还能提供更丰富的视觉理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18072 2026-08-19 cs.CL 新提交 70%

Multi-Agent AI System for Radiology Report Structuring and Quality Assurance with Independent Radiologist Evaluation

用于放射科报告结构化与质量保证的多智能体AI系统:独立放射科医师评估

Iryna Hartsock, Cesar Lam, Christopher Otteni, Aliya Qayyum, Robert Gatenby, Cyrillo Araujo, Ghulam Rasool

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究开发了一款本地部署的多智能体AI系统,可实现放射科报告结构化与质量保证,经独立放射科医师评估,该系统表现良好,或有助于放射科报告标准化。

Comments 14 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17836 2026-08-19 cs.LG 新提交 70%

Leveraging Association Context Retrieval in Knowledge Edit- ing to Build White-Box Attacks on LLMs

利用知识编辑中的关联上下文检索构建针对大语言模型(LLMs)的白盒攻击

Roman Maksimov, Vladimir Aletov, Vladimir Solodkin, Dmitry Bylinkin, Daniil Medyakov, Aleksandr Beznosikov

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对LLMs,提出结合关联上下文检索的知识编辑白盒攻击,提升攻击有效性且不严重损害模型整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17809 2026-08-19 cs.CL 新提交 70%

Whether LLMs Can Navigate Beliefs and Facts Depends on How You Phrase It

大型语言模型(LLMs)能否处理信念与事实取决于表述方式

Quang Minh Nguyen, Luis Frentzen Salim

机构 * KAIST(韩国科学技术院) National Taiwan University of Science and Technology(台湾科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对10个LLMs,发现其处理信念与事实的缺陷程度取决于表达信念的动词,源于任务混淆,一条指令可扭转该失败,解码时抑制注意力仅能部分恢复准确率。

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17659 2026-08-19 cs.CR cs.AI 新提交 70%

MobileWorldSafety: Benchmarking GUI Agent Safety Against Environmental Injection Attacks in Android Apps

MobileWorldSafety:针对安卓应用中环境注入攻击的GUI智能体安全基准

Sujin Chen, Lijun Li, Tianyi Du, Jing Shao

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究推出MobileWorldSafety基准,基于142个真实安卓应用风险任务评估6种GUI智能体,发现其对环境注入攻击的成功率达40.4%-66.9%,为相关研究奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏