arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32411 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32411 篇

2606.13310 2026-06-12 cs.CL cs.HC 新提交 86%

RogueAI: A Reverse Turing Test for Detecting Licensed AI Deception in Dialogue

RogueAI: 一种用于检测对话中授权AI欺骗的逆向图灵测试

Sara Candussio, Emanuele Ballarin, Lorenzo Bonin, Sandro Junior Della Rovere, Luca Bortolussi

机构 * AILab, MIGe, University of Trieste(的里雅斯特大学) Computational Statistics and Machine Learning, Istituto Italiano di Tecnologia(意大利理工学院) DIA, University of Trieste(的里雅斯特大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出RogueAI,一种通过玩家与两个LLM代理的对话游戏来检测授权欺骗的逆向图灵测试,并引入AutoRogueAI扩展。实验发现简单启发式方法准确率75.6%,而人类仅56.6%,表明人类忽略关键信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12747 2026-06-12 cs.AI 新提交 86%

Prefill Awareness in Large Language Models

大型语言模型中的预填充感知

Andy Wang, Parv Mahajan, David Demitri Africa, Alexandra Souly, Jordan Taylor, Robert Kirk

机构 * Constellation University of Wisconsin-Madison(威斯康星大学麦迪逊分校星座研究所) Constellation Georgia Institute of Technology(佐治亚理工学院星座研究所) UK AI Security Institute(英国人工智能安全研究所)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.AI

AI总结 研究大型语言模型能否识别并响应其助手消息被预填充或篡改,发现前沿模型具有显著预填充感知能力,可能影响安全评估方法。

Comments Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12385 2026-06-11 cs.CL 新提交 86%

Which Models Are Our Models Built On? Auditing Invisible Dependencies in Modern LLMs

我们的模型建立在哪些模型之上?审计现代LLM中的隐形依赖

Sanjay Adhikesaven, Haoxiang Sun, Sewon Min

机构 * University of California, Berkeley(加州大学伯克利分校) Allen Institute for AI(艾伦人工智能研究所)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 本文提出ModSleuth系统,通过递归重建LLM依赖图,揭示多跳许可义务、训练-评估耦合等隐藏依赖问题,并发布工具和依赖图以支持透明分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12106 2026-06-11 cs.CV cs.AI 新提交 86%

MSUE: Multi-Modal Soccer Understanding Expert

MSUE:多模态足球理解专家

Litao Li, Yibo Yu, Yufeng Hu, Zhuo Yang, Jiali Wen, Yixin Chen, Yixi Zhou

机构 * South China University of Technology(华南理工大学) Johns Hopkins University(约翰霍普金斯大学) Peking University(北京大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MSUE多专家问答架构,结合VLM数据合成管道与LLM动态调度文本、图像、视频专家,在SoccerNet VQA挑战中达到0.95准确率,获第三名。

Comments 6 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22638 2026-06-11 cs.AI 版本更新 86%

MobilityBench: A Benchmark for Evaluating Route-Planning Agents in Real-World Mobility Scenarios

MobilityBench:用于评估真实世界移动场景中路径规划智能体的基准

Zhiheng Song, Jingshuai Zhang, Chuan Qin, Chao Wang, Chao Chen, Longfei Xu, Kaikui Liu, Xiangxiang Chu, Hengshu Zhu

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) AMAP, Alibaba Group(阿里集团AMAP) Alibaba Group(阿里集团)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MobilityBench基准,通过确定性API重放沙箱和多维评估协议,系统评估基于LLM的路径规划智能体,发现现有模型在偏好约束路径规划上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11150 2026-06-10 cs.AI cs.CY 新提交 86%

ABC-Bench: An Agentic Bio-Capabilities Benchmark for Biosecurity

ABC-Bench:生物安全的主体生物能力基准

Andrew Bo Liu, Samira Nedungadi, Bryce Cai, Alex Kleinman, Harmon Bhasin, Seth Donoughe

机构 * Andrew Bo Liu(安德鲁·刘) Samira Nedungadi(萨米拉·纳杜加迪) Bryce Cai(布莱斯·凯) Alex Kleinman(亚历克斯·克莱因曼) Harmon Bhasin(哈蒙·巴辛) Seth Donoughe(塞斯·多诺赫)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ABC-Bench基准,评估LLM主体在生物安全相关任务上的能力,包括液体处理机器人编程、DNA片段设计和合成筛选规避,所有测试主体均优于人类专家基线。

Comments 18 pages. To be published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10281 2026-06-10 cs.CR cs.CL 新提交 86%

Benchmarking and Exploring the Capabilities of LLMs for Attack Investigations

基准测试与探索LLM在攻击调查中的能力

Aniket Anand, Yiwei Hou, Daniel Fields, Alex Kantchelian, David Tao, Kurt Thomas, Grant Ho

机构 * University of Chicago(芝加哥大学) University of California, Berkeley(加州大学伯克利分校) Google(谷歌)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 提出AuditBench基准数据集,评估LLM在安全审计日志分析中的性能,涵盖四种常见调查任务,揭示模型在不同设计选择下的表现差异与错误类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09908 2026-06-10 cs.CR cs.AI 新提交 86%

IDP-Bench: Benchmarking ability of LLMs to protect personal information in interdependent privacy contexts

IDP-Bench:评估大语言模型在相互依赖隐私上下文中保护个人信息能力的基准

Ayana Hussain, Soumya Sharma, Golnoosh Farnadi, Nicholas Vincent, Héber Hwang Arcolezi, Ulrich Aïvodji

机构 * Simon Fraser University(西蒙弗雷泽大学) McGill University(麦吉尔大学) Mila(Mila研究所) ÉTS

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出IDP-Bench,首个基于情境完整性框架的LLM相互依赖隐私基准,评估8个开源模型在三个推理层次上的表现,发现模型在识别CI参数和IDP特定参数方面存在弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16061 2026-06-09 stat.ML cs.LG econ.EM stat.ME 版本更新 86%

Partial Identification under Missing Data Using Weak Shadow Variables from Pretrained Models

利用预训练模型中的弱影子变量在缺失数据下的部分识别

Hongyu Chen, David Simchi-Levi, Ruoxuan Xiong

机构 * Massachusetts Institute of Technology, Cambridge, MA 02139(麻省理工学院) Emory University, Atlanta, GA 30322(埃默里大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对缺失非随机(MNAR)导致的估计偏差,提出部分识别框架,通过线性规划结合预训练模型(如LLM)的预测作为弱影子变量收紧边界,并设计集合扩张估计器保证覆盖,实验显示识别区间缩小75-83%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06779 2026-06-08 cs.IR cs.AI 新提交 86%

Mind the Gap: Bridging Behavioral Silos with LLMs in Multi-Vertical Recommendations

注意差距:用LLM弥合多垂直领域推荐中的行为孤岛

Nimesh Sinha, Raghav Saboo, Martin Wang, Sudeep Das

机构 * DoorDash Inc.(DoorDash公司)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出利用LLM从数据丰富垂直领域(如餐厅)向稀疏领域(如杂货)迁移知识的框架,通过分层RAG生成多级特征,集成到MTL排序模型,显著提升新兴业务个性化与参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17948 2026-06-08 cs.CR cs.AI cs.MA 版本更新 86%

RAVEN: Retrieval-Augmented Vulnerability Exploration Network for Memory Corruption Analysis in User Code and Binary Programs

RAVEN: 用于用户代码和二进制程序中内存损坏分析的检索增强漏洞探索网络

Parteek Jamwal, Minghao Shao, Boyuan Chen, Achyuta Muthuvelan, Asini Subanya, Boubacar Ballo, Kashish Satija, Mariam Shafey, Mohamed Mahmoud, Moncif Dahaji Bouffi, Pasindu Wickramasinghe, Siyona Goel, Yaakulya Sabbani, Hakim Hacid, Mthandazo Ndhlovu, Eleanna Kafeza, Sanjay Rawat, Muhammad Shafique

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出RAVEN框架,结合LLM代理与检索增强生成,自动生成遵循Google Project Zero模板的漏洞分析报告,在105个样本上平均质量得分54.21%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06271 2026-06-05 cs.CL cs.HC 86%

FOXGLOVE: Understanding Goal-Oriented and Anchored Writing Feedback from Experts and LLMs on Argumentative Essays

FOXGLOVE: 理解专家与LLM在议论文中的目标导向和锚定写作反馈

Yijun Liu, Yifan Song, John Gallagher, Sarah Sterman, Tal August

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过构建FOXGLOVE数据集,系统比较了写作专家和大型语言模型在议论文反馈中的目标导向、锚定性和优先级,发现两者在反馈目标和位置分布上相似,但在具体句子选择和反馈复杂度上存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18937 2026-06-05 cs.AI 86%

Evaluating the Utility of Personal Health Records in Personalized Health AI

评估个人健康记录在个性化健康AI中的效用

Rory Sayres, Kejia Chen, Ayush Jain, Matthew Thompson, Jonathan Richina, Xiang Yin, Jimmy Hu, Fan Zhang, Bob Lou, Mike Sanchez, Ines Mezerreg, Meredith Schreier, Hamsa Subramaniam, I-Ching Lee, Yugang Jia, Daniel Mcduff, Yossi Matias, Avinatan Hassidim, Dale Webster, Yun Liu, Jackie Barr, Quang Duong

机构 * Google Research(谷歌研究)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了利用个人健康记录(PHR)中的临床数据通过大语言模型(LLM)回答用户健康问题的效用,发现提供PHR上下文能显著提高回答的有用性、安全性和个性化水平,并揭示了LLM在理解复杂PHR方面的不足。

Comments 35 pages, 3 figures, 10 tables [bugfix / minor numerical update]

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05122 2026-06-04 cs.CL 86%

Self-Evaluation Is Already There: Eliciting Latent Judge Calibration in Base LLMs with Minimal Data

自我评估已然存在:用最少数据激发基础LLM中的潜在评判校准

XiuYu Zhang, Yi Shan, Junfeng Fang, Zhenkai Liang

机构 * National University of Singapore(新加坡国立大学) Beijing University of Technology(北京理工大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出自我评估激发(SEE)方法,通过少量数据(160个示例)结合校准耦合强化学习和掩码蒸馏,激发基础LLM中已有的预测外部评判者评分能力,在保持答案质量的同时显著提升校准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04867 2026-06-04 cs.AI 86%

AICompanionBench: Benchmarking LLMs-as-Judges for AI Companion Safety

AICompanionBench: 以LLM为评判标准的AI伴侣安全基准测试

Yanjing Ren, Reza Ebrahimi, TengTeng Ma

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 本文提出AICompanionBench,首个公开的细粒度安全风险标注的人机伴侣对话基准数据集,并评估20个LLM在检测不安全交互中的表现,发现强模型在显式有害内容上准确率高,但难以识别隐式不安全交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04483 2026-06-04 cs.CL 86%

Off-Distribution Voices: Fanfiction Subgenres as Universal Vernacular Jailbreaks for Aligned LLMs

分布外声音:同人小说子类型作为对齐LLM的通用白话越狱

Zhongze Luo, Ruihe Shi, Zhenshuai Yin, Haoyue Liu, Weixuan Wan, Xiaoying Tang

机构 * School of Science and Engineering, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)科学与工程学院) The Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来网络智能研究院) The Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来网络智能重点实验室) School of Microelectronics, Xi’an Jiaotong University(西安交通大学微电子学院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 本文发现安全训练覆盖不足的自然人类写作语域是对齐LLM的真正失败模式,并提出首个利用真实同人小说子类型作为通用攻击载体的越狱方法,显著提升攻击成功率。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03116 2026-06-03 eess.AS cs.AI cs.SD 86%

AnyAudio-Judge: A Dynamic Rubric-Based Benchmark and Evaluator for Audio Instruction Following

AnyAudio-Judge:基于动态评分标准的音频指令跟随基准与评估器

Haitao Li, Tian Tan, Yuguang Yang, Shan Yang, Xie Chen

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan(腾讯文脉)

专题命中 评测与基准 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对指令引导音频生成中复杂指令解耦困难、评估缺乏可解释性和细粒度属性匹配的问题,提出基于动态评分标准的评估范式,通过自适应分解音频描述为可验证的二元评分项,并构建包含7920个样本的双语基准和105K训练语料,结合SFT与GRPO训练专用评估器,在零样本对齐检测和下游强化学习指令对齐中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02282 2026-06-02 cs.AI 86%

POIROT: Interrogating Agents for Failure Detection in Multi-Agent Systems

POIROT: 在多智能体系统中审讯智能体以进行故障检测

Iñaki Dellibarda Varela, R. Sendra-Arranz, Pablo Romero-Sorozabal, J. M. Valverde-García, Annemarie F. Laudanski, Álvaro Gutiérrez, Eduardo Rocon, Manuel Cebrian

机构 * Center for Automation and Robotics, Spanish National Research Council (CSIC-UPM)(自动化研究中心,西班牙国家科研 council (CSIC-UPM))

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出POIROT协议,利用多智能体系统自身的智能体作为诊断层进行故障检测,在复杂问题、多智能体和复合故障条件下优于单LLM评估基线。

Comments 44 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30329 2026-05-29 cs.LG 86%

SoundnessBench: Can Your AI Scientist Really Tell Good Research Ideas from Bad Ones?

SoundnessBench:你的AI科学家真的能区分好的研究想法和坏的吗?

Sy-Tuyen Ho, Minghui Liu, Huy Nghiem, Furong Huang

机构 * University of Maryland College Park(马里兰大学College Park分校)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出SoundnessBench基准,通过ICLR提交的1099个机器学习研究提案评估LLM判断研究想法方法论合理性的能力,发现当前LLM存在普遍乐观偏差,无法可靠作为科学严谨性的独立初筛评估者。

Comments Project Page: https://hosytuyen.github.io/projects/SoundnessBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06322 2026-05-29 cs.LG 86%

SMolLM: Small Language Models Learn Small Molecular Grammar

SMolLM: 小型语言模型学习小型分子语法

Akhil Jindal, Harang Ju

机构 * Carey Business School Johns Hopkins University(约翰霍普金斯大学Carey商学院)

专题命中 评测与基准 :language model(title,abstract);small language model(title);分类 cs.LG

AI总结 本文提出SMolLM,一个53K参数的小型权重共享Transformer,通过固定层次结构学习SMILES语法,在ZINC-250K数据集上以95%的有效性生成分子,优于参数多10倍的GPT模型。

Comments 19 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17943 2026-05-28 cs.CL 86%

A Benchmark Construction and Evaluation Framework for Specialist Domains: Case Study on Defense-related Documents

专业领域基准构建与评估框架:以国防相关文档为例

Bao Gia Doan, Aditya Joshi, Pantelis Elinas, Aarya Bodhankar, Oscar Leslie, Tom Marchant, Flora Salim

机构 * UNSW Sydney(新南威尔士大学悉尼分校) Cyndr AI

专题命中 评测与基准 :LLM(summary_cn,abstract);post-training(abstract);prompting(abstract);分类 cs.CL

AI总结 提出DoRA框架,通过合成数据生成和双LLM流水线解决专业领域RAG问答的冷启动问题,在国防文档上显著减少幻觉并提升覆盖率和忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26940 2026-05-27 cs.CL 86%

Accountable Human-AI Deliberation with LLMs: Scaling Collective Intelligence through Symbiotic Scaffolding

负责任的基于LLM的人机协商:通过共生脚手架扩展集体智能

Wajdi Zaghouani

机构 * Northwestern University in Qatar(卡塔尔西北大学)

专题命中 评测与基准 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一个三层共生人机框架,通过多样性放大、条款级溯源和人类主导批准,在扩展集体智能的同时保持主体性和合法性。

Comments Accepted at the LREC 2026 / 2nd Workshop on Language-driven Deliberation Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26322 2026-05-27 cs.AI 86%

OmniToM: Benchmarking Theory of Mind in LLMs via Explicit Belief Modeling

OmniToM:通过显式信念建模评估大语言模型的心智理论

Adam Bawatneh, Sagar Sapkota, Amrit Singh Bedi, Santu Karmaker, Mubarak Shah

机构 * University of Central Florida(佛罗里达大学中央分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出OmniToM基准,通过显式信念结构(包括信念提取和标签化两阶段)评估LLM在叙事中追踪不同角色心智状态的能力,揭示其在知识获取和表征决策上的瓶颈。

Comments 30 pages, 8 figures, 19 tables; includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22175 2026-05-22 cs.SE cs.AI 86%

SWE-Mutation: Can LLMs Generate Reliable Test Suites in Software Engineering?

SWE-Mutation:LLMs能否在软件工程中生成可靠的测试套件?

Yuxuan Sun, Yuze Zhao, Yufeng Wang, Yao Du, Zhiyuan Ma, Jinbo Wang, Mengdi Zhang, Kai Zhang, Zhenya Huang

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) Beihang University(北航) School of Mathematical Sciences, Peking University(北京大学数学科学学院) NeoShell AI Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SWE-Mutation基准,用于评估LLM生成的测试套件质量,通过系统性地变异解决方案来测试测试套件的可靠性,并发现当前LLM在生成可靠且具有判别力的测试套件方面存在不足。

Comments 24 pages, 8 figures

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13910 2026-05-22 cs.CL 86%

RAGCap-Bench: Benchmarking Capabilities of LLMs in Agentic Retrieval Augmented Generation Systems

RAGCap-Bench: 评估代理检索增强生成系统中LLM能力的基准测试

Jingru Lin, Chen Zhang, Stephen Y. Liu, Haizhou Li

机构 * National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出RAGCap-Bench,用于评估代理检索增强生成系统中中间任务的细粒度能力,通过分析现有系统输出识别常见任务和核心能力,设计针对性评估问题,实验表明增强中间能力的模型能获得更好的整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12138 2026-05-22 cs.SE cs.AI 86%

Exploring Code Analysis: Zero-Shot Insights on Syntax and Semantics with LLMs

探索代码分析:利用大语言模型进行语法和语义的零样本洞察

Wei Ma, Zhihao Lin, Shangqing Liu, Qiang Hu, Ye Liu, Wenhan Wang, Cen Zhang, Liming Nie, Li Li, Yang Liu, Lingxiao Jiang

机构 * Singapore Management University(新加坡国立大学) Blekinge Institute of Technology(布莱金厄学院) Beihang University(北航) State Key Laboratory of Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室) The University of Tokyo(东京大学) University of Alberta(阿尔伯塔大学) Nanyang Technological University(南洋理工大学) Shenzhen Technology University(深圳技术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了大语言模型在代码分析中的应用,通过评估21种最先进的LLM在四种语言中的九项任务,揭示了LLM在语法解析、静态语义推断和动态推理方面的性能,发现其在跨语言泛化方面有优势,但动态推理仍有限,提出了一个经过验证的评估框架。

Comments Accepted at ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20368 2026-05-21 cs.CR cs.AI 86%

Security Document Classification with a Fine-Tuned Local Large Language Model: Benchmark Data and an Open-Source System

使用微调的本地大语言模型进行安全文档分类:基准数据和开源系统

Ivan Dobrovolskyi

机构 * MS in AI & ML Engineering, Independent Researcher, Sunnyvale, CA, USA(人工智能与机器学习工程硕士,独立研究员,美国加利福尼亚州圣何塞)

专题命中 评测与基准 :large language model(title);language model(title);prompting(abstract);分类 cs.AI

AI总结 本研究提出TorchSight开源系统,利用微调后的Qwen 3.5 27B模型对安全文档进行分类,展示了其在78,358个样本和GPT-4合成数据上的高分类准确率,并验证了本地模型在安全文档分类中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18144 2026-05-19 cs.AI 86%

Evidence-Grounded Frontier Mapping and Agentic Hypothesis Generation in Nanomedicine

基于证据的前沿映射与代理假设生成在纳米医学中

Christiaan G. A. Viviers, Koen de Bruin, Mirre M. Trines, Ayla M. Hokke, Roy van der Meel, Avi Schroeder, Twan Lammers, Willem J. M. Mulder, Fons van der Sommen

机构 * ARIA Lab, Signal Processing Systems, Department of Electrical Engineering, Eindhoven University of Technology(ARIA实验室,信号处理系统,电气工程系,埃因霍温理工大学) Laboratory of Chemical Biology, Department of Biomedical Engineering, Eindhoven University of Technology(化学生物学实验室,生物医学工程系,埃因霍温理工大学) The Louis Family Laboratory for Targeted Drug Delivery and Personalized Medicine Technologies, Department of Chemical Engineering, Technion - Israel Institute of Technology(定向药物输送与个性化医学技术实验室,化学工程系,技术离子-以色列理工学院) Department of Nanomedicine and Theranostics, Institute for Experimental Molecular Imaging (ExMI), RWTH Aachen University Hospital(纳米医学与诊疗学系,实验分子成像研究所(ExMI),亚琛工业大学医院) Department of Internal Medicine and Radboud Center for Infectious Diseases (RCI), Radboud University Medical Center(内科学系和Radboud感染疾病中心(RCI),Radboud大学医学中心)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出了一种结合文章嵌入、相似性图分析、稀疏前沿提取、结构化证据包检索和审计过的大型语言模型(LLM)工作流的系统pArticleMap,用于支持纳米医学研究方向的选择和假设生成,通过生成和评分基于引用的假设,实现了证据导向的研究辅助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16881 2026-05-19 cs.CL 86%

PaliBench: A Multi-Reference Blueprint for Classical Language Translation Benchmarks

PaliBench: 一种多参考框架用于经典语言翻译基准测试

Máté Metzger, Nadnapang Phophichit

机构 * Independent Researcher(独立研究者) International Buddhist Studies College(国际佛教研究学院) Mahachulalongkornrajavidyalaya University(玛哈切通拉翁皇家师范大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出PaliBench,一种用于巴利语到英语翻译的基准测试,以及构建多参考翻译基准测试的方法,通过结合LLM辅助对齐、自动化验证、质量过滤、去重和多指标评估,生成包含1700段文本、8389个段落和约345,000个token的基准测试数据集,评估了十个现代大语言模型的性能。

Comments Preprint. This manuscript has not yet been peer reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03707 2026-05-18 cs.CL 86%

AirNav: A Large-Scale UAV Vision-and-Language Navigation Dataset with Natural and Diverse Instructions

AirNav: 一个大规模无人机视觉与语言导航数据集,包含自然且多样的指令

Hengxing Cai, Yijie Rao, Ligang Huang, Zanyang Zhong, Jinhan Dong, Jingjun Tan, Changhao Nai, Jue Hou, Wenhao Lu, Renxin Zhong

机构 * School of Intelligent Systems Engineering, Sun Yat-Sen University(中山大学智能系统工程学院) Beihang University(北京航空航天大学) Peking University(北京大学) Beijing University Of Posts and Telecommunications(北京邮电大学) Harbin Institute of Technology(哈尔滨工业大学) Xiamen University(厦门大学) National University of Defense Technology(国防科技大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出AirNav数据集,包含137K自然多样指令的导航样本,评估了多种方法,提出AirVLN-R1模型在测试中取得51.82%的成功率,并通过实际无人机实验验证了仿真到现实的迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏