arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-04 至 2026-08-04 共收录 713 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 173 篇

2608.00895 2026-08-04 cs.CR 新提交 85%

Multi-LLM Consensus Framework for Evaluating Banking-Sector NIDS Dataset Coverage of MITRE ATT&CK Techniques

用于评估银行领域NIDS数据集对MITRE ATT&CK技术覆盖度的多大型语言模型(Multi-LLM)共识框架

Sanjida Khanom, Sadia Afrin Khan, Adrita Rahman Tory, Md. Ahsan Habib, Khondokar Fida Hasan

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 该研究提出多大型语言模型共识框架,评估NIDS基准数据集对银行领域MITRE ATT&CK技术的覆盖度,发现UNSW-NB15覆盖得分最高、CIC-DDoS2019盲区大,为行业化NIDS评估奠定基础并推动银行原生数据集研发。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00991 2026-08-04 cs.AI cs.CL 新提交 84%

SCHEDBench: A Benchmark for Evaluating LLM Constraint Faithfulness in Natural-Language Combinatorial Scheduling

SCHEDBench:评估大语言模型在自然语言组合调度中约束忠实度的基准

Shrenil Shaun Sharma, Avi Sharma

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SCHEDBench基准针对13个LLMs的测试表明,模型对同一调度问题的语义等价表述缺乏不变性,约束重排序引发的敏感性最为突出。

Comments 19 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00561 2026-08-04 cs.AI cs.CL cs.CV 新提交 84%

Through the LENS: Local Geometric Decomposition of Vision-Language Model Representations

通过LENS:视觉语言模型表示的局部几何分解

Shalom Kachko, Raz Lapid, Margarita Vald, Almog Dubin, Moshe Sipper

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出LENS方法,将VLM激活分解为局部低秩高斯邻域,揭示LLaVA与Qwen3-VL的不同模态融合轨迹,该方法可实现因果生成干预并提升多模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22774 2026-08-04 cs.LG cs.AI cs.HC 版本更新 84%

CogAdapt: Adapting Clinical ECG Foundation Models for Wearable Cognitive Load Assessment

CogAdapt: 通过导联适应将临床心电图基础模型迁移至可穿戴认知负荷评估

Amir Mousavi, Erfan Nourbakhsh, Mohammad Sadegh Sirjani, Mimi Xie, Rocky Slavin, Leslie Neely, John Davis, John Quarles

机构 * Department of Computer Science, College of AI, Cyber and Computing, The University of Texas at San Antonio(计算机科学系,人工智能、网络与计算学院,德克萨斯大学圣安东尼奥分校) Department of Educational Psychology, College of Education and Human Development, The University of Texas at San Antonio(教育心理学系,教育与人类发展学院,德克萨斯大学圣安东尼奥分校)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出CogAdapt框架,通过可学习适配器LeadBridge将3导联可穿戴信号转换为12导联表示,并结合渐进微调策略ProFine,实现临床心电图基础模型向可穿戴认知负荷评估的迁移,在跨受试者验证中显著优于从头训练的基线模型。

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03356 2026-08-04 cs.SE 83%

POSTCONDBENCH: Benchmarking Correctness and Completeness in Formal Postcondition Inference

POSTCONDBENCH:形式化后置条件推理中的正确性与完备性基准测试

Gehao Zhang, Juan Zhai

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出POSTCONDBENCH多语言基准,用于评估LLM生成方法级后置条件的能力,发现正确性与完备性差距显著,仓库级依赖及方法复杂性会加剧该差距。

Journal ref In Findings of the Association for Computational Linguistics: ACL 2026, pages 35478-35507, San Diego, California, United States. Association for Computational Linguistics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01717 2026-08-04 cs.LG 新提交 83%

Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models

超越在线策略探索:将外部策略 rollout 整合用于扩散语言模型中的强化学习

Wonseok Lee, Jimyeong Kim, Jungmin Ko, Wonjong Rhee

机构 * Seoul National University(首尔大学) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔大学人工智能交叉项目) Artificial Intelligence Institute, Seoul National University(首尔大学人工智能研究院) Department of Intelligence and Information, Seoul National University(首尔大学智能与信息系)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 该研究针对扩散大语言模型强化学习中在线策略 rollout 稀缺的问题,提出 ERILS 方法整合外部策略 rollout,在数独等任务上显著提升性能,验证了 rollout 构建与奖励处理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06857 2026-08-04 cs.CL 83%

What is the Role of Small Models in the LLM Era: A Survey

在大语言模型时代,小型模型的作用是什么:一项调查

Lihu Chen, Gaël Varoquaux

机构 * Imperial College London, UK(伦敦帝国学院) Inria Saclay, France(法国萨克利研究所)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过系统分析LLMs与SMs的协作与竞争关系,探讨小型模型在大语言模型时代的作用,旨在为实践者提供深入理解与高效资源利用的参考。

Comments a survey paper of small models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01794 2026-08-04 cs.CV cs.AI cs.CL 新提交 82%

Illuminating Visual Identity in Universal Multimodal Embeddings

揭示通用多模态嵌入中的视觉身份

Jiawei Cao, Junyi Feng, Jiashen Hua, Ziheng Huang, Bing Deng, Kaijie Wu, Chaochen Gu, Jieping Ye

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究针对通用多模态嵌入缺乏视觉身份判别能力的问题,提出视觉身份判别统一形式化,构建MVEB基准,设计身份感知采样的学习框架,提升了UMEs的身份判别能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01423 2026-08-04 cs.AI cs.GT cs.LG 新提交 82%

Scoring Rules! Statistical and Strategic Alignment for Text Evaluation Metrics

评分规则!文本评估指标的统计对齐与策略对齐

Shengwei Xu, Yuxuan Lu, Yifan Wu, Jason Hartline, Grant Schoenebeck

机构 * University of Michigan(密歇根大学) Peking University(北京大学) Microsoft Research(微软研究院) Northwestern University(西北大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 该研究针对文本评估指标,提出统计与策略对齐概念及三项测试原则,开发基于互信息的指标设计框架,发现 LLM-as-a-Judge 相关性高但易操纵,新指标鲁棒性强且相关性具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00005 2026-08-04 cs.CL cs.AI 新提交 82%

RubricReviewer: From Direct Critique to Objective and Comprehensive Rubric-Driven Peer Review

RubricReviewer:从直接批评到客观全面的基于评分规则的同行评审

Shuyu Guo, Wenxiang Hu, Yuyue Zhao, Yougang Lyu, Xiaohui Yan

机构 * Shandong University(山东大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 RubricReviewer是一种基于评分规则驱动的框架,通过将评分规则生成为中间步骤,并结合Scout与Aligner模型,生成更全面、具判别性且抗攻击的评审意见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22660 2026-08-04 cs.CL cs.AI 版本更新 82%

Moral Semantics Survive Machine Translation: Cross-Lingual Evidence from Moral Foundations Corpora

道德语义在机器翻译中得以保留:来自道德基础语料库的跨语言证据

Maciej Skorski

机构 * University of Luxembourg(卢森堡大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了基于LLM的翻译是否能弥合道德价值观分类中语言特定标注语料库的差距,通过波兰语案例展示直接翻译能有效保留微妙的道德线索,为资源匮乏语言的道德研究提供了可行路径。

Comments Accepted to GoodIT'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28394 2026-08-04 cs.CV 版本更新 82%

Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer

大基础模型时代的手物交互:重建、生成与具身迁移

Weiquan Lin, Yu Deng, Shiyang Liu, Luping Xiao, Xu Tang, Junzhi Yu, Jiaolong Yang, Lei Zhang, Xingyu Chen

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract)

AI总结 本综述系统梳理大基础模型在手物交互(HOI)领域的应用,建立基础模型子先验分类,分析其在HOI任务与机器人学习中的作用,总结数据集与评估协议并展望未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20266 2026-08-04 cs.SD 版本更新 82%

A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook

大型音频语言模型综述:通用性、可信度与展望

Kaiwen Luo, Zhenhong Zhou, Leyan Wang, Liang Lin, Tianyu Shao, Yuanhe Zhang, Yang Xiao, Yuxuan Li, Miao Yu, Kailin Lyu, Jiaming Zhang, Li Sun, Songze Li, Yueming Wu, Ting Dang, Xiaojun Jia, Dongrui Liu, Kai Li, Rohan Kumar Das, Siyuan Liang, Xinfeng Li, Qiankun Li, Jing Chen, Xingjun Ma, Kun Wang, Junhao Dong, Deqing Zou, Yu Cheng, Xia Hu, Zhigang Zeng, Sen Su, Yang Liu, Yu-Gang Jiang, Philip S. Yu, Yew-Soon Ong

机构 * Nanyang Technological University(南洋理工大学) Independent Researcher(独立研究者) The University of Melbourne(墨尔本大学) North China Electric Power University(华北电力大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) Fortemedia Singapore(富媒体新加坡) Tencent(腾讯) Fudan University(复旦大学) Wuhan University(武汉大学) Chinese University of Hong Kong(香港中文大学) Chongqing University of Posts and Telecommunications(重庆邮电大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract)

AI总结 本文综述了大型音频语言模型的通用性、可信度及未来发展方向,探讨了其架构创新、对齐算法及安全风险,并提出了防御深入、因果音频世界建模等策略以提升音频智能的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29122 2026-08-04 cs.SE 版本更新 82%

ReLog: Execution-Aware Logging with Runtime Feedback for LLM-Oriented Debugging

为LLMs实现人类级日志记录:通过执行和运行时反馈重新思考日志记录

Xin Wang, Yang Feng, Xiaoqian Jiao, Yang Zhang, Zhenhao Li, Zishuo Ding

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文提出ReLog框架,通过运行时反馈迭代生成日志,提升日志在下游任务中的实用性,实验表明其在缺陷定位和修复任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01805 2026-08-04 cs.AI 新提交 81%

CockpitHAT: Dependency-Graph-Driven Hierarchical Attribution for Embodied Multi-Agent Cockpits

CockpitHAT:面向具身多智能体座舱的依赖图驱动分层归因方法

Wei Wang, Shuanghe Liu, Zhu Zhuo, Jiaqi Zhong, Xiaozhao Zhao, Xiaojie Zuo, Jie Su

机构 * ByteDance(字节跳动)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究针对LLM多智能体系统的“正确性崩溃”问题,提出CockpitHAT分层归因框架,发布含212条轨迹的CockpitBench基准,在相关基准上超越现有方法,实现可靠故障诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01233 2026-08-04 cs.AI 新提交 81%

CT-PrepAgent: Bounded Policy and Controlled Execution for Adaptive CT Data Preparation

CT-PrepAgent:用于自适应CT数据准备的有界策略与受控执行

Xiaolin Fan, Yue Pei, Yingying Zhang, Haogang Zhu

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对CT数据准备的可迁移性问题,提出CT-PrepAgent模型,通过有界策略与受控执行实现自适应处理,在公开分割任务与私有DICOM队列中均取得了良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01204 2026-08-04 cs.CL 新提交 81%

ShiJianBench: From Dialogue to Decision for Long-Horizon Evaluation of Investment Advisors

ShiJianBench:面向投资顾问长周期评估的从对话到决策基准

Jie Gong, Maowei Jiang, Zhiwei Liu, Yang Qiao, Wenxi Wu, Mengxi Xiao, Enze Zhang, Ziyan Kuang, Yankai Chen, Caishuang Huang, Meng Zhou, Xiku Du, Xue Liu, Guojun Xiong, Min Peng, Qianqian Xie, Sophia Ananiadou

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 该研究推出ShiJianBench离线框架,用多智能体投资者模拟器评估对话式投资顾问,发现LLM顾问在个性化内容与投资者轨迹上表现更优,凸显需开展轨迹感知评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00764 2026-08-04 cs.AI 新提交 81%

FinDeepIndicator: Benchmarking Deep Research Agents in End-to-End Financial Indicator Construction

FinDeepIndicator:端到端金融指标构建中深度研究智能体的基准测试

Chaoqun Yang, Fengbin Zhu, Xinyu Lin, Long Bai, Xiaoluan Liu, Ke-Wei Huang, Roger Zimmermann, Tat-Seng Chua

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) China Economics and Management Academy, Central University of Finance and Economics(中央财经大学中国经济与管理研究院) Asian Institute of Digital Finance, National University of Singapore(新加坡国立大学亚洲数字金融研究所) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 评测与基准 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出首个评估深度研究智能体端到端金融指标构建表现的基准FinDeepIndicator,含多市场数据,实验发现DR智能体优于检索增强LLMs但仍不可靠,为金融领域智能体开发提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00711 2026-08-04 cs.AI 新提交 81%

Tracing the Cascade: A Topology-Aware Evaluation Framework for Scientific Agent Hallucinations

追踪级联:一种面向科学智能体幻觉的拓扑感知评估框架

Xinshun Feng, Ziqi Miao, Lijun Li, Jing Shao

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对科学智能体幻觉的拓扑结构评估缺口,提出SCHEMA框架,通过构建科学概念图等方式评估,发现幻觉集中于知识枢纽、最终准确率与推理轨迹诚实性脱钩,为高风险科学应用提供机制级评估方案。

Comments 36 pages, 7 figures and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00243 2026-08-04 cs.AI 新提交 81%

More Debate, Same Evidence: Structural Limits of Homogeneous Multi-Agent Groundedness

更多辩论,相同证据:同质多智能体 groundedness 的结构局限

Yuelyu Ji

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对 groundedness 验证测试多智能体小组交换意见可提升判断质量的假设,在6个基准上评估同质三智能体小组,发现其准确率差异在+8.5至-4.4个百分点,未证实该前提。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00205 2026-08-04 cs.CL 新提交 81%

Averaging Bias: Human Faithfulness Annotations are not Locally Faithful

平均偏差:人类忠实性标注并非局部忠实

Huajian Zhang, Yiyang Feng, Jiawei Zhou

机构 * Stony Brook University(石溪大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究发现文本摘要忠实性基准的人类全局标注存在平均偏差,即标注者接受大部分句子忠实的摘要,而非严格合取规则要求的所有句子都忠实,需改进人类标注设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00018 2026-08-04 cs.DB cs.AI 新提交 81%

CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs

CITBench:面向大语言模型的交互式表格数据处理综合基准

Zihan Nan, Yang Gu, Wei Liu, Xi Yan, Zhou Liu, Hao Liang, Wentao Zhang

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出 CITBench 交互式表格数据处理基准,评估发现现有 LLM 在简单表格任务表现良好,但在复杂多轮交互场景下的理解、规划与表格结构感知仍存在显著挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11245 2026-08-04 cs.AI 版本更新 81%

Mind the Sim2Real Gap in User Simulation for Agentic Tasks

注意用户模拟中的Sim2Real差距以实现代理任务

Xuhui Zhou, Weiwei Sun, Qianou Ma, Yiqing Xie, Jiarui Liu, Weihua Du, Sean Welleck, Yiming Yang, Graham Neubig, Sherry Tongshuang Wu, Maarten Sap

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究发现基于LLM的用户模拟器在代理任务中存在Sim2Real差距,表现出过度合作和缺乏真实反馈,需通过人类验证提升模拟真实性。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01792 2026-08-04 cs.AI cs.CL 新提交 81%

Can You Trust the Confidence? ConfBench for Vision-Language Models on Document Extraction

你能信任置信度吗?面向文档提取的视觉语言模型ConfBench

Priyashree Roy, Sujitha Martin, Mohammad Rostami, Spencer Romo, Renhao Xue, Bob Strahan, Diego A. Socolinsky, Boyi Xie, Md Mofijul Islam

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对视觉语言模型的文档提取任务推出校准专用基准ConfBench,评估多类VLM的置信度估计方法,揭示模态、模型能力等对置信度的影响,发布相关指标以助力可信IDP部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01624 2026-08-04 cs.CL cs.LG 新提交 81%

Not the Dimension, the Norm: What Matters in Gradient-Free Weight Perturbation of Language Models

并非维度,而是范数:无梯度语言模型权重扰动的关键因素

Taeyeong Kim, Ahhyun Kim, TaeHyeon Kim, Unggi Lee

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究探究无梯度语言模型权重扰动的关键因素,发现全权重搜索非必需,扰动范数是核心有效因素,其安全区域可跨模型与尺度迁移,优化方向聚焦于扰动强度的确定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00011 2026-08-04 cs.CL cs.AI 新提交 81%

DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis

DLLM-TTS:用于文本到语音合成的块离散扩散语言模型

Wasim Madha, Nityanand Mathur, Hamees Sayed, Apoorv Singh, Sameer Khurana, Akshat Mandloi, Sudarshan Kamath

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出 DLLM-TTS 框架,将 TTS 建模为基于 X-Codec2 的条件块离散扩散,通过块内掩码扩散与并行预测实现高效语音生成,在 Seed-TTS-eval 基准上取得良好性能,兼具实用性与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16451 2026-08-04 cs.CL cs.CV cs.LG physics.ao-ph 81%

SynopticBench: Evaluating Vision-Language Models on Generating Weather Forecast Discussions of the Future

SynopticBench:在生成未来天气预报讨论上评估视觉-语言模型

Timothy B. Higgins, Antonios Mamalakis, Chirag Agarwal

机构 * Department of Environmental Sciences(环境科学系) School of Data Science(数据科学学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出SynopticBench数据集和SPACE评估框架,用于评估视觉-语言模型在生成天气现象描述中的性能,揭示现有评估指标的局限性。

Comments Accepted for presentation at Climate Informatics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01494 2026-08-04 q-fin.PM q-fin.RM 新提交 80%

Conformal Kelly: Conformal Prediction Intervals as the Scale in Fractional Kelly Position Sizing

共形凯利:将共形预测区间用作分数凯利头寸规模的尺度

Robert Jacob Ryan

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 该研究提出将共形预测区间与分数凯利结合用于投资组合头寸规模确定,经6年测试表现优于被动基准,还引入风险控制优化回撤,相关配置经预注册和LLM智能体搜索验证。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00567 2026-08-04 econ.GN q-fin.EC 新提交 80%

Optimal Inflation Rate: A Meta-Analysis

最优通胀率:一项元分析

Matej Opatrny, Martin Opatrny, Tomas Havranek, Zuzana Irsova, Mojmir Hampl

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 该研究通过LLM辅助的可重复元分析,利用777项估计值发现最优长期通胀率约为0.6个百分点,远低于多数央行的2%目标,且明确了研究间差异的核心驱动因素。

Comments 62 pages, 4 figures. Also available as CEPR Discussion Paper 21629. Data, code, and extraction prompts: https://meta-analysis.cz/inflation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03188 2026-08-04 cs.CR 版本更新 80%

Dependency-Aware Privacy for Multi-turn Agents

多轮智能体的依赖感知隐私保护

Divyam Anshumaan, Sarthak Choudhary, Nils Palumbo, Somesh Jha

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 针对多轮 LLM 智能体交互的隐私泄露问题,提出 RootGuard 方法,通过一次清理根值并确定性计算后续发布,在多轮交互中提升隐私-效用权衡,医疗数据实验显示其误差远低于独立噪声方案。

详情

展开后加载摘要…

URL PDF HTML 收藏