arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-25 至 2026-08-25 共收录 706 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 177 篇

2608.23095 2026-08-25 cs.CL 新提交 81%

Definitional Sensitivity in Media Bias Detection: A Multi-Definition Dataset and Benchmark

媒体偏见检测中的定义敏感性:多定义数据集与基准

Martin Wessel, Timo Spinde, Jürgen Pfeffer, Gianluca Demartini

机构 * Technical University of Munich(慕尼黑工业大学) National Institute of Informatics(信息学研究所) University of Queensland(昆士兰大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 该研究针对媒体偏见检测中定义差异被忽视的问题,通过含354名参与者的实验和四个LLM评估,发现概念框架影响标注,发布了多定义偏见检测数据集MUDD。

Comments To appear in Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23035 2026-08-25 cs.AI 新提交 81%

MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks

MobilePA-Bench:面向复杂真实世界任务的移动规划智能体基准测试

Yi Zhu, Xiongwei Wu, Qiyi Wang, Tingyu Qu, Jiajun Liu, Sihan Cao, Long Chen, Weigao Sun, Feida Zhu, Yiran Zhong, Steven Hoi

机构 * Alibaba(阿里巴巴)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究提出 MobilePA-Bench 基准,针对现有移动智能体评估基准的盲区,从多维度测试移动规划智能体,发现前沿 LLM 在移动场景中存在可靠性问题,该基准可用于诊断与加速可靠移动智能体开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22770 2026-08-25 cs.CL 新提交 81%

DelistBench: Evaluating Search-Enabled LLMs for Auditable Corporate-Event Database Completion

DelistBench:评估支持搜索的大型语言模型用于可审计的公司事件数据库补全

Xuan Yao, Li Shuping, Dai Yang, Zhou Yi, Ke-Wei Huang

机构 * Asian Institute of Digital Finance, National University of Singapore(新加坡国立大学亚洲数字金融研究院)

专题命中 评测与基准 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究提出Search-to-Record任务与DelistBench基准,评估支持搜索的LLM在公司事件数据库补全中的表现,发现网络检索可显著提升准确率,低成本系统也能接近最优效果,并给出部署指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22610 2026-08-25 cs.AI 新提交 81%

Coalition-Aware Skill Reliability for Self-Evolving Agents

面向自进化智能体的联盟感知技能可靠性

Qiyan Zhao, Xiaofeng Zhang, Bo Liu, Minda Chen, Wei Xiong, Jingyang Chen, Guanting Ye, Wenhao Yu, Xiaosong Yuan, Shijie Han, Da-Han Wang, Jianmin Ji, Fei Huang, Xu-Yao Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对自进化智能体技能库的可靠性问题,提出CASS与u-SMCO两类干预措施,在多数据集上提升了任务性能与跨域泛化能力,还降低了强化学习对噪声奖励的敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22251 2026-08-25 cs.HC cs.CL 新提交 81%

CAIA in Practice: Field Evaluation of an AI-Assisted Support System for Text-Based Online Counselling

CAIA实践:AI辅助文本在线咨询支持系统的实地评估

Philipp Steigerwald, Nico Bienlein, Jennifer Burghardt, Mara Stieler, Robert Lehmann, Jens Albrecht

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 该研究通过实地评估验证了协同设计的AI辅助文本在线咨询工具CAIA,其7个LLM驱动功能经检索增强生成优化,获34名专业咨询师广泛采用,核心是保障专业自主权与信息准确性,助力心理咨询实践。

Comments Accepted at IEEE ICTAI 2025

Journal ref 2025 IEEE 37th International Conference on Tools with Artificial Intelligence (ICTAI), pp. 1476-1483

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21964 2026-08-25 cs.AI cs.SE 新提交 81%

Repo2Skill-Evo: Repository Skills Go Stale in Silence

Repo2Skill-Evo:仓库技能在静默中过时

Chenyuan Duan, Ge Shi, Zineng Mao, Ge Zhang, Hao Liang, Yinzhu Piao, Yuchen Wu, Zhixin Yao, Kaiyu Huang, Wenhao Huang, Linzhuang Sun, Shen Yan, Wentao Zhang

机构 * ByteDance(字节跳动) Peking University(北京大学) Beijing Jiaotong University(北京交通大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Repo2Skill-Evo研究发现,在57个真实仓库的105次版本转换中,前沿智能体难以可靠维护仓库技能,其平均@3 macro F1仅29.9%-69.7%,仓库技能会在无明确信号的情况下静默过时。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21529 2026-08-25 cs.CV cs.CL cs.IR 新提交 81%

DamageScope: Vision-Language Retrieval at Scale for Disaster Damage Assessment from Satellite Imagery

DamageScope:面向卫星图像灾害损失评估的大规模视觉-语言检索方法

Ravi K. Rajendran, Biplob Debnath, Murugan Sankaradas, Srimat T. Chakradhar

机构 * NEC Laboratories America(美国 NEC 实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DamageScope是一种结合VLMs与LLMs的检索增强框架,通过多向量嵌入聚类和双存储架构,实现了卫星图像灾害损失评估的高效自动化,可扩展性与运营效率优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21401 2026-08-25 cs.CY cs.CL 新提交 81%

Generative Gap Filling

生成式缺口填补

Yonathan A. Arbel, David A. Hoffman

专题命中 评测与基准 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL

AI总结 该研究通过实验发现合同缺失条款可被普通受访者、法学从业者及大型语言模型准确预测,提出真正的合同缺口比假设更少,法院可将模型预测作为证据,当事人可通过「模型选择」条款规范实践。

Comments 73 pages, 13 figures, 1 table. Includes a 119-contract benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09289 2026-08-25 cs.CL 版本更新 81%

Accurate but Natural? Diagnosing Grammatical and Idiomatic Gaps in Japanese EFL Writing

准确但自然?诊断日本英语作为外语写作中的语法与习语差距

Steve Woollaston, Brendan Flanagan, Hiroaki Ogata

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本研究提出分层LLM修正流水线,结合CEFR-J语法提取器,诊断日本初中生英语写作的语法准确性与习语性差距,为个性化教学反馈提供循证支持。

Comments APCLC submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22586 2026-08-25 cs.CV cs.AI cs.CL 新提交 81%

Vision-Language Models for Occupational Physical Exposure Assessment: Estimating External Hand Forces in Manual Material Handling Tasks from RGB Video

用于职业体力暴露评估的视觉-语言模型:从RGB视频估算手工物料搬运任务中的外部手力

Mohammad Sadra Rajabi, Aanuoluwapo Ojelade, Sunwook Kim, Maury A. Nussbaum

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出基于视觉-语言模型的流程,结合文本线索、视觉特征与已知负载质量,从RGB视频估算手工物料搬运的手力,验证了该方法的可行性及不同相机条件的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04931 2026-08-25 cs.AI cs.CL cs.HC 版本更新 81%

A Survey on Human-AI Collaboration with Large Foundation Models

大型基础模型下的人机协作研究综述

Vanshika Vats, Marzia Binta Nizam, Minghao Liu, Ziyuan Wang, Richard Ho, Mohnish Sai Prasad, Vincent Titterton, Sai Venkat Malreddy, Riya Aggarwal, Yanwen Xu, Lei Ding, Jay Mehta, Nathan Grinnell, Li Liu, Sijia Zhong, Devanathan Nallur Gandamani, Xinyi Tang, Rohan Ghosalkar, Celeste Shen, Rachel Shen, Nafisa Hussain, Kesav Ravichandran, James Davis

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.AI

AI总结 该综述围绕人类引导模型开发等四方面,分析大型基础模型(LFMs)与人机协作(HAI)的机遇、风险与挑战,指出成功的HAI系统需以人为本设计,助力将LFMs力量转化为可靠的人机伙伴关系。

Comments Accepted in ACM Transactions on Intelligent Systems and Technology (ACM-TIST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23503 2026-08-25 cs.CV 新提交 80%

Action-Aligned Retrieval with Pairwise Multimodal Reranking for Text-Based Person Anomaly Search

用于基于文本的人员异常搜索的动作对齐检索与成对多模态重排序

Thanh-Khoi Nguyen, Thanh-Nhan Vo, Trong-Thuan Nguyen, Minh-Triet Tran

机构 * University of Science, VNU-HCM(胡志明市国家大学科学大学) Vietnam National University, Ho Chi Minh City(胡志明市越南国家大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对基于文本的人员异常搜索中现有方法的局限,提出ActPair三阶段由粗到细框架,结合动作对齐检索与成对多模态重排序,在PAB测试集取得最优结果且可有效迁移至新数据集。

Comments Accepted to the AI City workshop @ ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22812 2026-08-25 cs.NI 新提交 80%

The Surprising Effectiveness of LLMs in BGP Security: Mining An Unprecedented Amount of Incidents and Boosting Anomaly Detection

大语言模型在BGP安全中的惊人有效性:挖掘前所未有的事件量并提升异常检测

Libin Liu, Wenzhou Yang, Li Chen, Dan Li, Xiuting Xu

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 该研究针对BGP安全领域公开路由异常数据集稀缺的问题,开发LLM辅助提取流水线构建了11.89倍于现有规模的基准,设计ROUTELLM检测器并实现远超基线的检测性能,相关资源已开源。

Comments Accepted by IEEE ICNP 2026, 10 pages in main body, 20 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22202 2026-08-25 cs.CR cs.ET 新提交 80%

Lessons from the Hardware Hacking Competitions: Verification Techniques, Findings, and Insights

硬件黑客竞赛的启示:验证技术、发现与见解

Sudipta Paria, Aritra Dasgupta, Raghul Saravanan, Jayanth Thangellamudi, Sai Manoj P D, Swarup Bhunia

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文基于硬件黑客竞赛开展SoC安全验证系统研究,提出多策略漏洞分析方法,结合多种技术分析漏洞,推导验证启示,探讨竞赛基准对硬件安全技术评估及EDA研究的支持作用。

Comments 11 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17177 2026-08-25 cs.SE 版本更新 80%

Grounding AI Agents in Contracts: An Empirical Evaluation of Spec-Driven Test Generation

将AI智能体建立在契约基础上:对规范驱动测试生成的实证评估

Michele Tufano, James McClure, José Cambronero, Runxiang Cheng, Sherry Y. Shi, Renyao Wei, Dorothy Chen, Franjo Ivančić, Livio Dalloro, Pat Rondon

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本研究针对LLM智能体生成测试时易遗漏契约相关边界的问题,提出规范驱动测试生成方法,经Google生产缺陷评估,其缺陷检测率、分支覆盖率均优于基线,测试套件质量也显著更高。

Comments To appear in Proceedings of the 1st International Workshop on Specification-Driven Development Life Cycle (SpecOps 2026), co-located with SPLASH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10645 2026-08-25 eess.SY cs.SY 版本更新 80%

AIDC Microgrid Vulnerability Assessment Under Computing-Power Coordinated Attacks

算力-电力协同攻击下的AI数据中心(AIDC)微电网脆弱性评估

Ze Yu, Hongwei Zhen, Chao Shen, Mingyang Sun

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文针对低碳AI数据中心(AIDC)微电网的算力-电力协同攻击问题,提出不确定性感知脆弱性评估框架,经案例验证可识别脆弱时段,协同攻击危害大于单一攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23772 2026-08-25 cs.HC 版本更新 80%

PageGuide: Browser extension to assist users in navigating a webpage and locating information

PageGuide: 一款辅助用户在网页上导航和查找信息的浏览器扩展

Tin Nguyen, Thang T. Truong, Runtao Zhou, Trung Bui, Chirag Agarwal, Anh Totti Nguyen

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 PageGuide通过视觉叠加将LLM回答与HTML DOM结合,帮助用户快速定位信息、逐步指导操作并隐藏干扰内容,提升浏览效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23313 2026-08-25 cs.AI 新提交 79%

EviSafe: Evidence-Grounded Safety Evaluation for Vision-Language Models

EviSafe:基于证据的视觉语言模型安全性评估

Xuetong Li, Gaofeng Liu

机构 * Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本研究提出基于证据的VLM安全性评估框架EviSafe及对应基准EviSafeBench,通过三探针协议评估11个VLMs,发现其未因正确多模态原因可靠安全,需开展超越拒绝次数的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22236 2026-08-25 cs.SD cs.LG eess.AS 新提交 79%

MRMAD: A Multi-Round Multi-Audio Benchmark for Evaluating Acoustic Degradation Perception in Large Audio-Language Models

MRMAD:用于评估大型音频语言模型中声学降级感知的多轮多音频基准

Yize Li, Ningyuan Yang, Sile Yin, Sindhuja Thogarrati, Sung-En Chang, Andrew C. Singer, Xue Lin, Chuan-Che Huang, Shuo Zhang

机构 * Northeastern University(东北大学) Bose Corporation(博士公司) Stony Brook University(石溪大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 该研究提出MRMAD多轮多音频基准,评估18种LALMs的音频降级感知,发现现有模型难可靠推理降级,为构建鲁棒LALMs提供基础。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22124 2026-08-25 cs.CL 新提交 79%

LLM assisted writing deserves empirical evaluation

大语言模型辅助写作值得实证评估

Xuan Zhong Feng, Yi Lin, Yiye Zhang, Chunhua Weng, Yifan Peng

机构 * Weill Cornell Medicine(威尔康奈尔医学院) Columbia University(哥伦比亚大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 该研究针对常被当作检测问题的大语言模型辅助写作,分析69209篇健康信息学论文发现其关联更聚焦呈现等特征,主张应从学术质量而非工具使用角度评估手稿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19261 2026-08-25 cs.CV cs.AI 版本更新 79%

PathAgentBench: Benchmarking Evidence-Seeking Vision-Language Models on Whole-Slide Pathology Image

PathAgentBench:在全切片病理图像上对寻求证据的视觉语言模型进行基准测试

Dankai Liao, Tianyi Zhang, Yufeng Wu, Xinyue Zhang, Qiaochu Xue, Zeyu Liu, Dachun Zhao, Linghan Cai, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) Peking Union Medical College Hospital(北京协和医院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究针对全切片病理图像诊断中证据获取与整合问题,引入PathAgentBench基准,评估视觉语言模型的四项互补能力,包含多模型评估结果,揭示了证据推理与获取间的差距,为改进病理模型提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17904 2026-08-25 cs.AI 版本更新 79%

DiagFlowBench: Evaluating How Language Models Handle Off-Procedure Inputs in Grounded Diagnostic Dialogue

DiagFlowBench:评估语言模型在基于规程的诊断对话中如何处理偏离规程输入

Guillermo Gil de Avalle, Laura Maruster, Shaina Raza, Christos Emmanouilidis

机构 * University of Groningen(格罗宁根大学) Vector Institute for Artificial Intelligence(向量人工智能研究所)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 提出DiagFlowBench基准,包含50个工业诊断流程图转化的1676轮对话,评估10个模型在识别偏离规程输入时的表现,发现模型常选择真实但不恰当的步骤而非捏造事实。

Comments Accepted to the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026) Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03302 2026-08-25 cs.CV cs.AI 79%

Full end-to-end diagnostic workflow automation of 3D OCT via foundation model-driven AI for retinal diseases

通过基于基础模型的AI实现3D OCT的全流程诊断工作流程自动化用于视网膜疾病

Jinze Zhang, Jian Zhong, Li Lin, Jiaxiong Li, Ke Ma, Naiyang Li, Meng Li, Yuan Pan, Zeyu Meng, Mengyun Zhou, Shang Huang, Shilong Yu, Zhengyu Duan, Sutong Li, Honghui Xia, Juping Liu, Dan Liang, Yantao Wei, Xiaoying Tang, Jin Yuan, Peng Xiao

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 FOCUS通过基于基础模型的AI实现3D OCT视网膜疾病诊断的端到端自动化,提高了诊断效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21833 2026-08-25 cs.AI cs.CL 新提交 79%

GameXpert-Bench: How Far Are Coding Agents from Expert Game Development?

GameXpert-Bench:编码智能体距离专家级游戏开发还有多远?

Kun Chen, Haorong Hong, Peizhong Gao, Jianfeng Lin, Tongxu Luo, Yuxuan Xie, Chenxu Liu, Jieling He, Zhongyuan Liu, Zeno Zeng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Lightspeed Studios, Tencent(腾讯光速工作室)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 GameXpert-Bench是覆盖游戏开发全生命周期的基准,含三个赛道,测评显示当前编码智能体在生成可玩游戏基础上表现较好,在缺陷发现等方面仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22659 2026-08-25 stat.ME stat.AP 新提交 78%

Statistical Methods for Multiple Language Model Comparison on a Shared Evaluation

用于共享评估下多语言模型比较的统计方法

Juan Francisco Mandujano Reyes

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出适用于共享评估的多语言模型比较统计方法,构建含模型固定效应、问题随机效应的随机效应模型,经模拟与真实数据验证,为多模型评估结果报告提供建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21916 2026-08-25 cs.CE 新提交 78%

GenomeHarness: Harnessing Al Agents for Reliable Adaptation of Genome Language Models

GenomeHarness:利用AI智能体实现基因组语言模型的可靠适配

Weicai Long, Yusen Hou, Houcheng Su, Junning Feng, Yanlin Zhang

专题命中 评测与基准 :language model(title,abstract)

AI总结 GenomeHarness是一种智能体式工具,通过受控搜索微调方案适配基因组语言模型,在52个模型-任务设置中多数提升了测试MCC,使下游适配更可靠可审计。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21837 2026-08-25 cs.CV cs.MM 新提交 78%

Towards Bitstream-corrupted Harsh Visual Understanding: Through Bitstream Language Modeling as Robust Semantic Priors

面向比特流损坏的恶劣视觉理解:以比特流语言建模作为鲁棒语义先验

Chaoran Huang, Fangcheng Li, Tianyi Liu, Wenyang Liu, Kejun Wu

专题命中 评测与基准 :language model(title,abstract)

AI总结 针对比特流损坏的恶劣视觉理解问题,提出BLMSP框架,构建CHP数据集,通过VBBM提取比特流语义先验注入视觉模型,显著提升视频恢复、字幕及姿态估计性能。

Comments 9 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23045 2026-08-25 cs.AI 新提交 77%

From Inertia to Objectivity: Improving Deep Research Agents with Noise Isolation

从惯性到客观性:通过噪声隔离改进深度研究智能体

Xiangxin Zhang, Zhanwei Zhang, Zhihang Fu, Binbin Lin, Wenxiao Wang

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对深度研究智能体存在的惯性偏差问题,提出NIS-Agent方法,在网页分类和最终答案验证环节应用上下文隔离,降低33%的token成本,训练的8B模型性能可与GPT-4o相当。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22103 2026-08-25 cs.AI 新提交 77%

Hack-Verifiable Terminal Bench: Evaluating Reward Hacking in Terminal Tasks

可验证黑客终端基准:评估终端任务中的奖励黑客行为

Amit Roth, Ivan Bercovich, Yonathan Efroni

机构 * Tel Aviv University(特拉维夫大学) University of California Santa Barbara(加州大学圣巴巴拉分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 本研究提出可验证黑客终端基准(HVTB),将可验证黑客环境(HVE)适配至终端基准,用于测量前沿模型的奖励黑客率,并探究提示能否缓解该行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22014 2026-08-25 cs.AI 新提交 77%

DynaContext: Self-Improving Dynamic Contextualization of Optimized Prompts for Heterogeneous Parameter Extraction

DynaContext:面向异构参数提取的优化提示的自改进动态上下文化

Joe Yu, Shibin Thomas Stanley Paul, Sven Mayer

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 DynaContext框架结合离线优化提取核心与推理时上下文适配及验证门控自改进,在异构参数提取任务中,较静态提示管道显著提升了准确率与F1值。

Comments 9 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏