arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32411 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32411 篇

2604.24621 2026-04-28 cs.SE 87%

Evaluation of LLM-Based Software Engineering Tools: Practices, Challenges, and Future Directions

评估基于大语言模型的软件工程工具:实践、挑战与未来方向

Utku Boran Torun, Veli Karakaya, Ali Babar, Eray Tüzün

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文探讨了基于大语言模型的软件工程工具的评估问题,分析了现有评估方法的局限性,并提出了未来研究方向以提升评估的可靠性与可扩展性。

Comments Accepted to EASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21125 2026-04-24 cs.DC 87%

A Cloud-Native Architecture for Human-in-Control LLM-Assisted OpenSearch in Investigative Settings

面向调查场景的云原生架构:人类控制的LLM辅助OpenSearch

Benjamin Puhani, Kai Brehmer, Malte Prieß

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一种云原生微服务架构,用于在私有云环境中处理复杂犯罪调查中的非结构化证据和语言与技术搜索逻辑间的语义鸿沟,通过整合大语言模型实现自然语言查询到OpenSearch领域特定语言的转换,结合BM25和语义向量嵌入进行混合检索,建立系统基础架构以支持未来评估。

Journal ref Proceedings of the 17th International Conference on Cloud Computing, GRIDs, and Virtualization (CLOUD COMPUTING 2026), p. 62-65, Lisbon, Portugal, April 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07192 2026-04-23 cs.SE 87%

Compact Constraint Encoding for LLM Code Generation: An Empirical Study of Token Economics and Constraint Compliance

紧凑约束编码用于LLM代码生成:关于令牌经济学和约束合规性的实证研究

Hanzhang Tang

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文通过实验证明紧凑约束头可减少令牌消耗而不影响约束合规性,发现编码形式和传播模式对合规率无显著影响,但约束类型和任务领域对合规性有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18787 2026-04-23 cs.SE 87%

Characterizing Datasets for LLM-based Requirements Engineering: A Systematic Mapping Study

对基于大语言模型的需求工程数据集进行表征:一项系统映射研究

Quim Motger, Carlota Catot, Xavier Franch

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过系统映射研究45项研究,分析62个公开数据集,揭示需求工程领域数据集在表征、任务支持和多样性方面的不平衡问题,为数据集选择与重用提供指导。

Comments Accepted at the 30th International Conference on Evaluation and Assessment in Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16342 2026-04-21 cs.HC 87%

SAGE: Sensor-Augmented Grounding Engine for LLM-Powered Sleep Care Agent

SAGE:基于传感器的地面引擎用于LLM驱动的睡眠护理代理

Hansoo Lee, Yoonjae Cho, Sonya S. Kwak, Rafael A. Calvo

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 SAGE通过整合传感器数据,解决睡眠护理中数据与行动之间的鸿沟问题,提升个性化和信任度。

Comments Accepted to the Extended Abstracts of the 2026 CHI Conference on Human Factors in Computing Systems (CHI EA '26). 6 pages

Journal ref Extended Abstracts of the 2026 CHI Conference on Human Factors in Computing Systems (CHI EA '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16321 2026-04-21 cs.SE 87%

LLM-Based Multi-Agent Systems for Code Generation: A Multi-Vocal Literature Review

基于大语言模型的多智能体系统用于代码生成:多声调文献综述

Zeeshan Rasheeda, Muhammad Waseema, Kai-Kristian Kemella, Mika Saari, Pekka Abrahamsson

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过多声调文献综述分析了大语言模型多智能体系统在代码生成中的应用,总结了其动机、模型、挑战及未来方向。

Comments 34 pages, 2 Figures, Table 11

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16115 2026-04-20 cs.CV 87%

From Articles to Canopies: Knowledge-Driven Pseudo-Labelling for Tree Species Classification using LLM Experts

从文章到树冠:基于知识的伪标注用于利用LLM专家的树种分类

Michał Romaszewski, Dominik Kopeć, Michał Cholewa, Katarzyna Kołodziej, Przemysław Głomb, Jan Niedzielko, Jakub Charyton, Justyna Wylazłowska, Anna Jarocińska

机构 * Institute of Theoretical and Applied Informatics, Polish Academy of Sciences(波兰科学院理论与应用信息学研究所) University of Lodz(卢布林大学) University of Warsaw, Faculty of Geography and Regional Studies, Department of Geoinformatics, Cartography and Remote Sensing(华沙大学地理与区域研究学院,地理信息学、制图与遥感系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一种结合多传感器地球观测数据和生态知识的半监督深度学习方法,通过生物启发的伪标注提升树种分类精度,实验显示比最佳参考方法提升5.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13298 2026-04-16 cs.CR 87%

Can Agents Secure Hardware? Evaluating Agentic LLM-Driven Obfuscation for IP Protection

代理能保障硬件吗?评估基于大语言模型的代理式硬件网表混淆用于知识产权保护

Sujan Ghimire, Parsa Mirfasihi, Muhtasim Alam Chowdhury, Veeramani Pugazhenthi, Harish Kumar Dharavath, Farshad Firouzi, Rozhin Yasaei, Pratik Satam, Soheil Salehi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于大语言模型的代理式硬件网表混淆框架,通过分阶段任务处理电路分析、综合、验证和攻击评估,验证了其在ISCAS-85基准上的有效性,展示了混淆技术的潜力与局限。

Comments 5 pages, 3 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11767 2026-04-15 cs.PL cs.MA cs.SE 87%

$λ_A$: A Typed Lambda Calculus for LLM Agent Composition

$λ_A$: 一种用于LLM代理组合的类型lambda演算

Qin Liu

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出$λ_A$类型lambda演算,通过引入oracle调用、有界固定点、概率选择和可变环境扩展简单类型lambda演算,证明类型安全性和终止性,并展示其在代理配置检测中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23200 2026-04-15 cs.CR cs.HC 87%

From Coordinates to Context: An LLM-Bootstrapped Semantic Encoding Framework for Privacy-Preserving Mobile Sensing Stress Recognition

从坐标到语境:一种基于大语言模型的语义编码框架,用于隐私保护的移动传感压力识别

Hoang Khang Phan, Nhat Tan Le

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 本文提出一种隐私增强的语义位置编码框架,利用自托管的OSM引擎和LLM引导的静态地图进行人友好的特征提取,解决隐私保护和可解释性问题,通过实验验证其在压力识别中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10277 2026-04-13 physics.comp-ph physics.optics 87%

MCP-Enabled LLM for Meta-optics Inverse Design: Leveraging Differentiable Solver without LLM Expertise

基于MCP的LLM用于元光学逆向设计:无需LLM专业知识即可利用可微求解器

Yi Huang, Bowen Zheng, Yunxi Dong, Hong Tang, Huan Zhao, S. M. Rakibul Hasan Shawon, Sensong An, Hualiang Zhang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出MCP框架,利用LLM生成逆向设计代码,通过动态访问验证代码模板和文档提升设计质量与效率,展示如何使复杂工具对非编程专家可用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02711 2026-04-10 eess.SP 87%

Foundation Models Defining A New Era In Sensor-based Human Activity Recognition: A Survey And Outlook

基于传感器的人类活动识别的基石模型:一种综述与展望

Sizhen Bian, Mengxi Liu, Lala Shakti Swarup Ray, Bo Zhou, Bin Guo, Zhiwen Yu, Thomas Ploetz, Paul Lukowicz, Siyu Yuan, Vitor Fortes Rey

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文综述了基于传感器的人类活动识别中的基石模型,分析了九种技术轴上的设计模式与权衡,并探讨了数据整理、多模态对齐、个性化、隐私和负责任部署等开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05083 2026-04-08 cs.CL cs.AI cs.LG 87%

Beyond LLM-as-a-Judge: Deterministic Metrics for Multilingual Generative Text Evaluation

超越LLM作为裁判:多语言生成文本评估的确定性度量

Firoj Alam, Gagan Bhatia, Sahinur Rahman Laskar, Shammur Absar Chowdhury

机构 * Qatar Computing Research Institute, HBKU, Qatar(卡塔尔哈马德·本·哈利法大学卡塔尔计算研究所) UPES, India(印度UPES大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出OmniScore,一种基于小参数模型的确定性度量,用于多语言生成文本评估,提供低延迟和一致性的评分方法,通过大规模合成监督训练,验证了其在问答、翻译和总结任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04997 2026-04-08 cs.IR cs.AI cs.CL cs.CV cs.LG 87%

Evaluation of Embedding-Based and Generative Methods for LLM-Driven Document Classification: Opportunities and Challenges

嵌入式与生成方法在LLM驱动文档分类中的评估:机遇与挑战

Rong Lu, Hao Liu, Song Hou

专题命中 评测与基准 :LLM(title);language model(abstract);SFT(abstract);prompting(abstract)

AI总结 本文比较了基于嵌入和生成模型在地学技术文档分类中的表现,发现增强的生成视觉-语言模型在零样本准确率上表现更优,但监督微调对训练数据不平衡敏感。

Comments Accepted at the IMAGE'25 Workshop (PCW-11), Society of Exploration Geophysicists (SEG). Published version available at https://doi.org/10.1190/image2025-w11-03.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25302 2026-04-02 cs.AI cs.CL cs.LG cs.MA 87%

Dive into the Agent Matrix: A Realistic Evaluation of Self-Replication Risk in LLM Agents

深入代理矩阵:对LLM代理自复制风险的现实评估

Boxuan Zhang, Yi Yu, Jiaxuan Guo, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过构建真实环境评估LLM代理自复制风险,引入OR和AOC指标,发现超过50%的模型在压力下表现出不受控的自复制倾向,强调了对风险评估和安全措施的迫切需求。

Comments 26 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03131 2026-04-02 cs.AI cs.CL cs.LG 87%

Code Comprehension then Auditing for Unsupervised LLM Evaluation

代码理解后审计用于无监督LLM评估

Bhrij Patel, Souradip Chakraborty, Mengdi Wang, Dinesh Manocha, Amrit Singh Bedi

机构 * University of Maryland, College Park(马里兰大学帕克分校) Princeton University(普林斯顿大学) University of Central Florida(中佛罗里达大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CoCoA框架,通过先理解代码功能再评估任务对齐,提升无监督LLM评估的准确性与F1分数。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08121 2026-03-25 cs.LG cs.AI cs.CL 87%

Balanced Accuracy: The Right Metric for Evaluating LLM Judges -- Explained through Youden's J statistic

平衡准确率:评估大语言模型判官的正确指标——通过Youden的J统计量解释

Stephane Collot, Colin Fraser, Justin Zhao, William F. Shen, Timon Willi, Ilias Leontiadis

机构 * Meta Superintelligence Labs(Meta超智能实验室) Meta University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过Youden的J统计量证明平衡准确率是评估LLM判官的更优指标,通过分析和实验展示其在选择判官时提升分类器鲁棒性的效果。

Comments 10 pages, 5 figures

Journal ref In Proceedings of the 19th Conference of the European Chapter of the Association for Computational Linguistics (Volume 5: Industry Track), pages 927-936, Rabat, Morocco, March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18530 2026-03-20 cs.CL cs.AI cs.CY cs.LG 87%

When Names Change Verdicts: Intervention Consistency Reveals Systematic Bias in LLM Decision-Making

当名称改变裁决:干预一致性揭示LLM决策中的系统性偏差

Abhinaba Basu, Pavan Chakraborty

机构 * Indian Institute of Information Technology, Allahabad (IIITA)(印度阿勒颇理工学院,阿勒颇(IIITA)) National Institute of Electronics and Information Technology (NIELIT)(国家电子与信息技术研究所(NIELIT))

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过干预一致性测试检测LLM对虚假特征的依赖,发现权威偏见和框架偏见显著高于人口偏见,并展示结构化分解方法可大幅降低偏差,通过迭代提示修复实现78%的偏见减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17217 2026-03-19 cs.CL cs.AI cs.LG 87%

Anonymous-by-Construction: An LLM-Driven Framework for Privacy-Preserving Text

匿名由设计:一个基于LLM的隐私保护文本框架

Federico Albanese, Pablo Ronco, Nicolás D'Ippolito

机构 * Veritran University of Buenos Aires(布宜诺斯艾利斯大学) University of San Andrés(圣安德烈斯大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于LLM的匿名化框架,通过本地LLM实现文本隐私保护,同时保持语义和任务相关性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09217 2026-03-16 cs.CV 87%

TubeMLLM: A Foundation Model for Topology Knowledge Exploration in Vessel-like Anatomy

TubeMLLM:一种用于血管状解剖拓扑知识探索的基础模型

Yaoyu Liu, Minghui Zhang, Xin You, Hanxiao Zhang, Yun Gu

机构 * Institute of Medical Robotics, Shanghai Jiao Tong University, Shanghai, China(上海交通大学医学机器人研究所) Department of Automation, Shanghai Jiao Tong University, Shanghai, China(上海交通大学自动化系)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出TubeMLLM,结合结构理解与可控生成,提升医学血管状解剖的拓扑感知能力,并通过TubeMData基准和自适应损失策略实现跨模态迁移。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07321 2026-03-05 cs.CL cs.AI cs.LG 87%

ObfusQAte: A Proposed Framework to Evaluate LLM Robustness on Obfuscated Factual Question Answering

ObfusQAte:一种用于评估LLM在模糊事实问答上的鲁棒性的框架

Shubhra Ghosh, Abhilekh Borah, Aditya Kumar Guru, Kripabandhu Ghosh

机构 * Indian Institute of Technology Patna(印度帕纳布理工大学) Manipal University Jaipur(贾伊普尔曼尼帕尔大学) Indian Institute of Science Education and Research Kolkata(印度科学教育与研究学院科利卡塔)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ObfusQAte框架用于评估LLM在模糊事实问答任务中的鲁棒性,通过多级模糊化方法考察LLM在命名实体、干扰项和上下文过载三个维度上的表现。

Comments LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01534 2026-03-05 cs.LG cs.AI cs.CL 87%

Preference Leakage: A Contamination Problem in LLM-as-a-judge

偏好泄露:作为判断者的LLM中的污染问题

Dawei Li, Renliang Sun, Yue Huang, Ming Zhong, Bohan Jiang, Jiawei Han, Xiangliang Zhang, Wei Wang, Huan Liu

机构 * Arizona State University(亚利桑那州立大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Notre Dame(诺丁汉大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出偏好泄露问题,揭示LLM作为判断者时因数据生成器与评估者相关性导致的偏见,并通过实验验证其普遍存在性和检测难度。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01257 2026-03-03 cs.CR cs.SE 87%

A Systematic Study of LLM-Based Architectures for Automated Patching

对基于大语言模型的自动补丁架构的系统研究

Qingxiao Xu, Ze Sheng, Zhicheng Chen, Jeff Huang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文系统研究了基于LLM的自动补丁架构,通过统一基准评估四种范式,揭示了不同架构在效率、灵活性和泛化能力上的权衡,发现通用代码代理在性能上表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11915 2026-02-24 cs.CL cs.AI cs.LG 87%

CORE: Measuring Multi-Agent LLM Interaction Quality under Game-Theoretic Pressures

CORE: 在博弈论压力下评估多智能体大语言模型交互质量

Punya Syon Pandey, Yongjin Yang, Jiarui Liu, Zhijing Jin

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CORE通过量化多智能体LLM在不同博弈压力下的语言使用效果,揭示社会激励对语言适应的影响,并提供评估对话鲁棒性的指标。

Comments EACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10881 2026-02-12 cs.CL cs.AI cs.LG 87%

Diagnosing Structural Failures in LLM-Based Evidence Extraction for Meta-Analysis

诊断基于大型语言模型的证据提取在元分析中的结构性故障

Zhiyin Tan, Jennifer D'Souza

机构 * L3S Research Center, Leibniz University Hannover(莱比锡大学汉诺威分校L3S研究中心) TIB Leibniz Information Centre for Science(莱比锡信息中心科学与技术研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现当前LLM在元分析中存在结构性缺陷,导致关联元组提取不可靠,需改进结构性和数值基础。

Comments Accepted at the 22nd Conference on Information and Research Science Connecting to Digital and Library Science (IRCDL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08145 2026-02-10 cs.LG cs.AI cs.CL cs.CV cs.CY 87%

Reliable and Responsible Foundation Models: A Comprehensive Survey

可靠且负责任的基础模型:全面综述

Xinyu Yang, Junlin Han, Rishi Bommasani, Jinqi Luo, Wenjie Qu, Wangchunshu Zhou, Adel Bibi, Xiyao Wang, Jaehong Yoon, Elias Stengel-Eskin, Shengbang Tong, Lingfeng Shen, Rafael Rafailov, Runjia Li, Zhaoyang Wang, Yiyang Zhou, Chenhang Cui, Yu Wang, Wenhao Zheng, Huichi Zhou, Jindong Gu, Zhaorun Chen, Peng Xia, Tony Lee, Thomas Zollo, Vikash Sehwag, Jixuan Leng, Jiuhai Chen, Yuxin Wen, Huan Zhang, Zhun Deng, Linjun Zhang, Pavel Izmailov, Pang Wei Koh, Yulia Tsvetkov, Andrew Wilson, Jiaheng Zhang, James Zou, Cihang Xie, Hao Wang, Philip Torr, Julian McAuley, David Alvarez-Melis, Florian Tramèr, Kaidi Xu, Suman Jana, Chris Callison-Burch, Rene Vidal, Filippos Kokkinos, Mohit Bansal, Beidi Chen, Huaxiu Yao

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了基础模型的可靠和负责任发展,探讨了偏见、安全、不确定性等关键问题,并提出了未来研究方向。

Comments TMLR camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07275 2026-02-10 cs.NE 87%

Evolving LLM-Derived Control Policies for Residential EV Charging and Vehicle-to-Grid Energy Optimization

进化LLM衍生的控制策略用于住宅电动车充电和车辆到电网能源优化

Vishesh Purnananda, Benjamin John Wruck, Mingyu Guo

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究利用LLM驱动的进化计算生成透明且可检查的电动车充电控制策略,通过混合提示策略实现118%的利润提升,发现复杂行为如前瞻性套利。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20162 2026-02-10 cs.AI cs.CL cs.CR cs.LG 87%

Capability-Based Scaling Trends for LLM-Based Red-Teaming

基于能力的LLM红队测试规模趋势

Alexander Panfilov, Paul Kassianik, Maksym Andriushchenko, Jonas Geiping

机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Tübingen AI Center(图宾根人工智能中心) Foundation AI – Cisco Systems Inc.(AI基础研究机构——思科系统公司) EPFL(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过分析攻击者与目标模型能力差距,揭示了红队测试中攻击成功率随模型能力变化的趋势,提出jailbreaking scaling曲线以预测攻击效果。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04715 2026-01-29 cs.CL cs.AI cs.LG 87%

First is Not Really Better Than Last: Evaluating Layer Choice and Aggregation Strategies in Language Model Data Influence Estimation

首先并非真的优于最后:评估语言模型数据影响估计中的层数选择和聚合策略

Dmytro Vitel, Anshuman Chhabra

机构 * Bellini College of Artificial Intelligence, Cybersecurity, and Computing(人工智能、网络安全与计算学院)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过理论和实证分析,证明中间注意力层比第一层更有效,提出新的噪声检测率度量标准,挑战传统影响估计方法。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01129 2026-01-22 cs.SE cs.AI cs.CL cs.LG 87%

RovoDev Code Reviewer: A Large-Scale Online Evaluation of LLM-based Code Review Automation at Atlassian

RovoDev Code Reviewer: 一个大规模在线评估Atlassian中基于LLM的代码审查自动化工具

Kla Tantithamthavorn, Yaotian Zou, Andy Wong, Michael Gupta, Zhe Wang, Mike Buller, Ryan Jiang, Matthew Watson, Minwoo Jeong, Kun Chen, Ming Wu

机构 * Monash University \& Atlassian Australia. Monash University \& Atlassian

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RovoDev Code Reviewer通过大规模评估展示了基于LLM的代码审查自动化在提升效率和质量方面的效果

Comments Accepted at the 48th International Conference on Software Engineering (ICSE'26), SEIP Track. 12 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏