arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2848 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2848 篇

2607.00041 2026-07-02 cs.SE cs.AI 新提交 81%

ATM: CID-Brokered Pre-Write Admission for Multi-Agent Code Co-Synthesis

ATM:基于CID的预写准入机制用于多智能体代码协同合成

Eagl Huang

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出ATM框架,通过CID代理和适配器引导的原子化,解决多智能体LLM系统中并发写意图的准入、组合与序列化问题,支持可审计性和有限恢复能力。

Comments 40 pages, 8 figures. Source code and supplementary artifact links are described in the manuscript appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00968 2026-07-02 cs.CL cs.HC 新提交 81%

Quantifying the Affective Gap: A Zero-Shot Evaluation of LLMs on Fine-Grained Emotion Taxonomies

量化情感差距:大型语言模型在细粒度情感分类上的零样本评估

Lawrence Obiuwevwi, Krzysztof J. Rechowicz, Jessica M. Johnson, Vikas Ashok, Sachin Shetty, Sampath Jayarathna

机构 * Old Dominion University(欧道明大学)

专题命中 评测与基准 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究对Claude、ChatGPT和Gemini三种商业LLM进行零样本细粒度13类情感分类评估,发现最高准确率仅39.9%,模型在爱情、困惑等情感上表现差,且无显著差异,揭示当前前沿AI在零样本情感分类中的局限性。

Comments in Proc. 27th IEEE Int. Conf. (IRI'2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00664 2026-07-02 cs.CL 新提交 81%

YOMI-Bench: A Benchmark for Evaluating Kanji Reading and Phonological Understanding of LLMs for Japanese

YOMI-Bench:评估日语大语言模型汉字读音与音韵理解的基准

Ryota Mibayashi, Hiroya Takamura, Hitomi Yanaka

机构 * Kobe University(神户大学) National Institute of Advanced Industrial Science and Technology (AIST)(国立研究开发法人产业技术综合研究所(AIST)) The University of Tokyo(东京大学) RIKEN(理化学研究所) Tohoku University(东北大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出YOMI-Bench基准,通过四个任务评估大语言模型在日语汉字读音上的表现,发现专用模型和商业模型均表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00139 2026-07-02 cs.CL 新提交 81%

Benchmarking Frontier LLMs on Arabic Cultural and Sociolinguistic Knowledge: A Cross-Evaluation Framework with Human SME Ground Truth

前沿大语言模型在阿拉伯文化与社会语言学知识上的基准测试:基于人类专家真实标注的交叉评估框架

Sajjad Abdoli, Ghassan Al-Sumaidaee, Ahmad ElShiekh, Clayton W. Taylor, Ahmed Rashad

机构 * Perle AI

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);language model(abstract);分类 cs.CL

AI总结 提出一个交叉评估框架,通过人类专家标注的103个提示-评分标准对,评估前沿LLM在埃及和伊拉克阿拉伯语文化与社会语言学知识上的表现,发现GPT-5.4是最可靠的自动评判者,文化任务比语言任务更难评分,且模型在埃及提示上表现优于伊拉克提示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31745 2026-07-01 cs.CV cs.AI 新提交 81%

JL1-CC&QA: Extending the JL1-CD Benchmark with Change Captioning and Question Answering

JL1-CC&QA:扩展JL1-CD基准,增加变化描述和问答

Ziyuan Liu, Ruifei Zhu, Ouqiao Ma, Yuantao Gu

机构 * Department of Electronic Engineering, Beijing National Research Center for Information Science and Technology, Tsinghua University(清华大学电子工程系,北京信息科学与技术国家研究中心) Chang Guang Satellite Technology Co., Ltd. (CGSTL)(长光卫星技术股份有限公司) College of Communications Engineering, Army Engineering University of PLA(中国人民解放军陆军工程大学通信工程学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出JL1-CC&QA多任务基准,通过变化描述和问答扩展JL1-CD,利用吉林一号卫星图像和三级标注流程,推动遥感变化理解。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31461 2026-07-01 cs.AI cs.CE 新提交 81%

CSTrader: A Testbed for Language-Grounded Trading in a Community-Driven Virtual Asset Market

CSTrader: 社区驱动虚拟资产市场中基于语言的交易测试平台

Yao Shi, Kingfung Luo, Nan Tang, Yuyu Luo

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出CSTrader多智能体框架,通过集成异构信号、技术分析、流动性、事件和反转情绪等智能体,在CS2皮肤市场实现语言到交易的映射,在波动期取得7.58%累计收益并控制风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30819 2026-07-01 cs.CR cs.AI 新提交 81%

AI-Generated PowerShell Malware: An Experimental Framework and Dataset

AI生成的PowerShell恶意软件:一个实验框架与数据集

Luciano Pianese, Vittorio Orbinato, Pietro Liguori, Roberto Natella

机构 * Gran Sasso Science Institute(格兰萨索科学研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出一个评估LLM生成PowerShell恶意软件的实验框架,包含动态分析沙箱和人工标注的真实恶意软件数据集,发现LLM生成的恶意软件与真实样本在触发OS恶意事件上高度相似。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30814 2026-07-01 cs.CL 新提交 81%

When Calibration Rankings Reverse: Accuracy-Controlled Evaluation for Fair Comparison of LLMs

当校准排名反转:面向LLM公平比较的精度控制评估框架

Zhichao Yang, Caiqi Zhang, Ruihan Yang, Chengzu Li, Nigel Collier, Deqing Yang

机构 * Fudan University(复旦大学) University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对全局校准指标因模型精度差异导致比较不公平的问题,提出ACE精度控制评估框架,通过实例对齐、分布对齐和候选对齐三种视角实现公平比较,发现原始指标下的优势在控制精度后大幅减弱,排名反转频繁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27154 2026-07-01 cs.AI 新提交 81%

OpenRCA 2.0: From Outcome Labels to Causal Process Supervision

OpenRCA 2.0:从结果标签到因果过程监督

Aoyang Fang, Yifan Yang, Jin'ao Shang, Qisheng Lu, Junjielung Xu, Rui Wang, Songhan Zhang, Yuzhong Zhang, Boxi Yu, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对现有根因分析数据集仅标注结果而忽略因果传播路径的问题,提出PAVE协议重建因果路径,构建OpenRCA 2.0基准,发现LLM在根因定位中因果验证不足的缺陷。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28013 2026-06-29 cs.CL 新提交 81%

The Signal-Coverage Matrix: Stratifying Type and Semantic Errors in Statement Autoformalization

信号-覆盖矩阵:对语句自动形式化中的类型错误和语义错误进行分层

Chengxiao Dai, Zhaokun Yan, Zhanhui Lin

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出信号-覆盖矩阵,将LLM自动形式化输出按类型正确性和语义等价性分为四类,揭示类型错误和语义错误的恢复模式,并预测总体正确率变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22902 2026-06-29 cs.AI 新提交 81%

Agent-as-a-Router: Agentic Model Routing for Coding Tasks

Agent-as-a-Router: 面向编码任务的智能体模型路由

Pengfei Zhou, Zhiwei Tang, Yixing Ma, Jiasheng Tang, Yizeng Han, Zhenglin Wan, Fanqing Meng, Wei Wang, Bohan Zhuang, Wangbo Zhao, Yang You

机构 * National University of Singapore(新加坡国立大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) University of California, Berkeley(加州大学伯克利分校) The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Agent-as-a-Router框架,通过C-A-F循环积累执行经验,实现编码任务的动态模型路由,ACRouter在分布内任务上取得最低累积遗憾并泛化到分布外任务。

Comments 39 pages, 21 figures, a living technical report with a living benchmark that continuously updates

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26649 2026-06-26 cs.AI cs.CR 新提交 81%

Autoformalization of Agent Instructions into Policy-as-Code

智能体指令的自动形式化为策略即代码

Adam Mondl, Matthew Maisel, John H. Brock

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出自动形式化流水线,通过LLM生成-批评循环将智能体提示和自然语言策略转化为Cedar策略语言,在MedAgentBench上比手工编码覆盖更多规范。

Comments Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD), ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26458 2026-06-26 cs.AI 新提交 81%

MKG-RAG-Bench: Benchmarking Retrieval in Multimodal Knowledge Graph-Augmented Generation

MKG-RAG-Bench:多模态知识图谱增强生成中的检索基准

Xiaochen Wang, Bao Hoang, Han Liu, Ting Wang, Fenglong Ma

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Michigan State University(密歇根州立大学) Dalian University of Technology(大连理工大学) Stony Brook University(石溪大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MKG-RAG-Bench基准,通过构建跨领域多模态知识图谱和问答数据集,系统评估多模态知识图谱增强生成中的检索性能,揭示检索质量对生成结果的决定性作用。

Comments Accepted by KDD'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26216 2026-06-26 cs.CR cs.AI 新提交 81%

CyberChainBench: Can AI Agents Secure Smart Contracts Against Real-World On-Chain Vulnerabilities?

CyberChainBench: AI代理能否保护智能合约免受真实链上漏洞的攻击?

Jintao Huang, Fengqing Jiang, Radha Poovendran, Zhiqiang Lin

机构 * The Ohio State University(俄亥俄州立大学) University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出CyberChainBench基准,评估基于LLM的代理在智能合约安全中的漏洞检测、利用生成和补丁合成能力,基于541个真实链上攻击事件,发现最佳配置在检测、利用和修补上的得分分别为37.5%、43.7%和23.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26155 2026-06-26 cs.AI 新提交 81%

Detecting and Controlling Sycophancy with Cascading Linear Features

检测和控制级联线性特征中的谄媚行为

Maty Bohacek, Rishub Jain, Nicholas Dufour, Thomas Leung, Chris Bregler, Roma Patel

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 提出迭代数据生成管线,通过级联线性特征分离谄媚行为,实现更优的检测、评分和干预,性能匹配或超越基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19336 2026-06-26 cs.CL 新提交 81%

Learning User Simulators with Turing Rewards

基于图灵奖励的学习用户模拟器

Yingshan Susan Wang, Cedegao E. Zhang, Linlu Qiu, Zexue He, Pengyuan Li, Alex Pentland, Roger P. Levy, Yoon Kim

机构 * Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出Turing-RL方法,利用基于图灵测试的强化学习训练用户模拟器,通过判别性图灵奖励使生成响应与真实用户不可区分,在对话和论坛讨论中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26094 2026-06-25 cs.LG 新提交 81%

RevengeBench: Reverse Engineering Code-Space Policies from Behavioral Experiments

RevengeBench: 从行为实验中逆向工程代码空间策略

Babak Rahmani, Sebastian Dziadzio, Joschka Strüber, Sergio Hernández-Gutiérrez, Matthias Bethge

机构 * Tübingen AI Center(图宾根人工智能中心)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 提出RevengeBench基准,通过行为轨迹和可控实验逆向工程LLM生成的策略代码,验证恢复质量在34-72%之间,并能提升下游对战胜率。

Comments 12 pages, 5 figures, 22 appendix pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26040 2026-06-25 cs.CL 新提交 81%

AI translation of literary texts is "fine", but readers still prefer human translations

AI 翻译文学作品“还行”,但读者仍偏好人工翻译

Yves Ferstler, Adam Podoxin, Ty Brassington, Roman Grundkiewicz, Maite Taboada, Marzena Karpinska

机构 * Simon Fraser University(西蒙菲莎大学) Université du Québec à Montréal(魁北克大学蒙特利尔分校) Microsoft(微软)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过15位读者对15部法、波、日小说的人工翻译与AI翻译的比较实验,发现AI翻译虽可接受,但读者更偏好人工翻译的流畅性、清晰度和沉浸感,且无法可靠区分两者。

Comments 58 pages, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25705 2026-06-25 cs.AI 新提交 81%

GUI agent: Guided Exploration of User-Sensitive Screens

GUI代理:用户敏感屏幕的引导探索

Aradhana Nayak, Mussadiq Nazeer, Wang Peng, Feng Liu

机构 * Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心(慕尼黑)) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出一种探索代理,通过系统性地探索查询空间,识别在GUI环境中执行后会导致用户敏感状态的查询,以提升LLM代理的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25529 2026-06-25 cs.SD cs.AI 新提交 81%

STEB: A Speech-to-Speech Translation Expressiveness Benchmark for Evaluating Beyond Translation Fidelity

STEB:用于评估超越翻译保真度的语音到语音翻译表现力基准

Sitong Cheng, Weizhen Bian, Songjun Cao, Jin Li, Bei Liu, Chunyang Jiang, Yike Zhang, Weihao Wu, Yiming Li, Chi-Min Chan, Long Ma, Wei Xue

机构 * Hong Kong University of Science and Technology(香港科技大学) Tencent Youtu Lab(腾讯优图实验室) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出STEB基准,通过描述-总结框架评估语音到语音翻译在情感、场景风格和非语言发声方面的表现力,发现现有系统在语义保真度上表现良好但表现力保留不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25445 2026-06-25 cs.CV cs.AI 新提交 81%

C3-Bench: A Context-Aware Change Captioning Benchmark

C3-Bench:一种上下文感知的变化描述基准

Jae-Woo Kim, Hyeongbeom Kim, Ue-Hwan Kim

机构 * Gwangju Institute of Science and Technology(光州科学技术院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出C3-Bench基准,包含51种真实变化场景的4996对图像,并首次引入LLM-as-Judge评估框架,揭示现有模型在非训练分布场景下的系统性盲点。

Comments ECCV 2026 Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25102 2026-06-25 cs.CL 新提交 81%

Dream at SemEval-2026 Task 13: SALSA for Single-Pass Machine-Generated Code Detection

Dream at SemEval-2026 Task 13: SALSA用于单遍机器生成代码检测

Ruslan Berdichevsky, Shai Nahum-Gefen, Elad Ben-Zaken

机构 * Dream Security Ltd.(Dream Security有限公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出SALSA方法,通过自回归语言模型单遍结构化分类,将每个类别映射到专用输出token,结合平衡采样和参数高效微调,在机器生成代码检测任务上达到F1=0.789,远超CodeBERT基线。

Comments Accepted to SemEval-2026, ACL 2026 workshop proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24779 2026-06-24 q-bio.GN cs.AI 新提交 81%

DeepBD: A Grounded Agentic Workflow for Variant Prioritization and Diagnosis of Genetic Birth Defects

DeepBD:一种用于遗传性出生缺陷变异优先级排序和诊断的基于实体的智能体工作流

Shiyu Li, Ziqi Yan, Zhihao Wu, Jielong Lu, Weiran Liao, Jiajun Yu, Genjie Li, Zeyu Chu, Jiajun Bu, Haishuai Wang

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院,杭州,中国)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出DeepBD,一种结合LLM、预训练证据引擎和专家模块的智能体工作流,用于遗传性出生缺陷的变异优先级排序和诊断,在内部基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24820 2026-06-24 cs.CL 新提交 81%

SHERLOC: Structured Diagnostic Localization for Code Repair Agents

SHERLOC: 代码修复智能体的结构化诊断定位

Hovhannes Tamoyan, Sean Narenthiran, Erik Arakelyan, Mira Mezini, Boris Ginsburg

机构 * NVIDIA(英伟达) Santa Clara, CA 95051, USA(美国加利福尼亚州圣克拉拉) TU Darmstadt(达姆施塔特工业大学) National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心 ATHENE)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出SHERLOC框架,通过推理LLM与紧凑仓库工具及自恢复机制,实现无需微调的结构化诊断定位,在SWE-Bench上达到最优定位精度,并提升修复率、降低令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24619 2026-06-24 cs.AI 新提交 81%

When CQs Go Wrong: Challenges in CQ Verification with OE-Assist

当CQ出错时:OE辅助下CQ验证中的挑战

Anna Sofia Lippolis, Mohammad Javad Saeedizade, Robin Keskisärkkä, Aldo Gangemi, Eva Blomqvist, Andrea Giovanni Nuzzolese

机构 * University of Bologna(博洛尼亚大学) ISTC-CNR(意大利国家研究委员会认知科学与技术研究所) Linköping University(林雪平大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究能力问题(CQ)验证中的挑战,通过19名参与者使用LLM助手进行20项任务的实验,发现CQ的歧义和复杂性导致验证困难,提出需在发布前优化CQ以避免问题。

Comments Acceted poster at accepted-papers/poster-demo/" target="_blank" rel="noopener">https://2026.eswc-conferences.org/program/accepted-papers/poster-demo/ 23rd European Semantic Web Conference (Satellite Event)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23927 2026-06-24 cs.AI 新提交 81%

RIFT-Bench: Dynamic Red-teaming For Agentic AI Systems

RIFT-Bench:面向智能体AI系统的动态红队测试

Yarin Yerushalmi Levi, Roy Betser, Amit Giloni, Lidor Erez, Itay Gershon, Oren Rachmil, Sindhu Padakandla, Roman Vainshtein

机构 * Fujitsu Research of Europe (FRE)(富士通欧洲研究院) Fujitsu Research of India Pvt. Ltd. (FRIPL)(富士通印度私人研究有限公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出RIFT-Bench,一种基于图表示的动态红队测试方法,用于统一评估异构智能体AI系统的安全性,通过自动发现系统结构并部署自适应对抗攻击。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19416 2026-06-24 cs.LG 新提交 81%

MortarBench: Evaluating Mortgage Loan Origination Agents

MortarBench: 评估抵押贷款发起代理

Matthew Toles, Yunan Lu, Manav Munjal, Bojun Liu, Yuanhao Deng, Stephanie Selig, Derek Rindner, Cheng Li, Zhou Yu

机构 * Columbia University(哥伦比亚大学) Tidalwave

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出MortarBench基准,通过金融数据合成与变异管道生成覆盖边缘案例的示例,评估大语言模型在贷款发起任务中的表现,发现模型准确率低且存在偏见,并引入CRIT校准框架提升准确率至80.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23416 2026-06-23 cs.CR cs.AI 新提交 81%

Detecting Malicious Agent Skills in the Wild using Attention

利用注意力机制检测野外恶意智能体技能

Bacem Etteib, Daniele Lunghi, Tégawendé F. Bissyandé

机构 * University of Luxembourg(卢森堡大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对LLM技能市场中的恶意技能注入攻击,提出Locate-and-Judge两阶段检测器,通过注意力定位和审查实现高效全市场扫描,大幅降低成本并保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22613 2026-06-23 cs.AI 新提交 81%

SkillAudit: From Fixed-Suite Benchmarking to Skill-Centered Assessment

SkillAudit:从固定套件基准测试到以技能为中心的评估

Dexu Yu, Youhua Li, Zhaoyang Guan, Xianhao Lin, Jining Luan, Zihao Rao, Xuanqi Lan, Yang Ran, Bo Lan, Nai-Xin Zhai, Hanwen Du, Junchen Fu, Wenhao Deng, Yongxin Ni, Chunxiao Li

机构 * Northeastern University(东北大学) City University of Hong Kong(香港城市大学) Northwestern University(西北大学) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Santa Clara University(圣克拉拉大学) Fenz AI Ohio State University(俄亥俄州立大学) University of Glasgow(格拉斯哥大学) National University of Singapore(新加坡国立大学) DeciLix Lab(DeciLix实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SkillAudit框架,自动生成技能的多维度评估报告,涵盖效用、效率/成本和安全性,通过基线比较和两阶段检测解决固定套件评估的不足。

Comments Preprint. Project page: https://skillaudit.github.io/. Code and evaluation artifacts: https://github.com/SkillAudit/skillaudit

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22610 2026-06-23 cs.AI 新提交 81%

PaperClaw: Harnessing Agents for Autonomous Research and Human-in-the-Loop Refinement

PaperClaw:利用智能体实现自主研究与人在回路精炼

Weiwei Ye, Hangchen Liu, Dongyuan Li, Renhe Jiang

机构 * Open scholarly indexes(开放学术索引) Priem et al.(Priem 等) Lo et al.(Lo 等) Si et al.(Si 等) Baek et al.(Baek 等) Wang et al.(Wang 等) Yang et al.(Yang 等) Wei et al.(Wei 等) Yao et al.(Yao 等) Shinn et al.(Shinn 等) Madaan et al.(Madaan 等) Packer et al.(Packer 等) Park et al.(Park 等) Zhong et al.(Zhong 等) Huang et al.(Huang 等) Ji et al.(Ji 等) Min et al.(Min 等)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出PAPERCLAW多智能体系统,从研究领域到论文完成全自主,支持人在回路精炼,通过迭代假设验证生成可检验论文。

详情

展开后加载摘要…

URL PDF HTML 收藏