arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1498 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1498 篇

2607.21419 2026-07-31 cs.AI 版本更新 57%

PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning

PATS:用于智能体强化学习的策略感知训练框架

Yipeng Shi, Zhipeng Ma, Yue Wang, Qitai Tan, Yang Li, Peng Chen, Zhengzhou Zhu

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究针对长期语言模型智能体强化学习中弱策略问题,提出以策略为中心的训练范式Pats,将技能作为动态训练框架,通过转换展开组为证据卡、特定任务评估调整上下文等改进策略,在多个任务上取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15297 2026-07-31 cs.CL 版本更新 57%

AfriEconQA: A Benchmark for Quantitative and Temporal Reasoning over World Bank Economic Reports

AfriEconQA:基于世界银行报告的非洲经济分析基准数据集

Edward Ajayi, Mustapha Alaba, David Stephen

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 AfriEconQA是一个基于世界银行报告的非洲经济分析基准数据集,旨在测试信息检索和RAG系统在处理复杂经济查询时的性能。

Comments Dataset Explorer: https://afrieconqa.pages.dev/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25991 2026-07-31 cs.AI cs.CV 版本更新 57%

Towards Unified Multimodal Misinformation Detection in Social Media: A Benchmark Dataset and Baseline

面向社交媒体中统一的多模态虚假信息检测:基准数据集与基线模型

Haiyang Li, Yaxiong Wang, Shengeng Tang, Yuchen Zhang, Lianwei Wu, Lechao Cheng, Liu Liu, Chaofeng Dong, Zhun Zhong

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院,合肥工业大学) School of Computer Science and Technology, Northwestern Polytechnical University(计算机科学与技术学院,西北工业大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 该研究构建了含9.8万样本的OmniFake基准数据集,提出UMFDet框架,实现对人工与AI生成两类多模态虚假内容的统一检测,性能优于专用基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25904 2026-07-30 cs.AI 版本更新 57%

Interactive Reward Agent: GUI Task Evaluation via Environment-State Verification

交互式奖励智能体:通过环境状态验证进行图形用户界面任务评估

Chenrui Shi, Yuwei Wu, Yang Liu, Ruining Feng, Zirui Shang, Zhi Gao, Lifeng Fan, Che Sun

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 研究图形用户界面任务评估难题,提出交互式奖励智能体IRA,基于提议验证框架,结合可见界面与环境状态证据。IRA在GUI-RewardBench基准测试中准确率达86.9%,应用于强化学习时实现34.0%的OSWorld成功率,能为训练图形用户界面智能体提供有效奖励信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24241 2026-07-30 cs.CV cs.AI 版本更新 57%

FilmBench: A Film-Grade Benchmark for Cinematic Video Generation

FilmBench:用于电影视频生成的电影级基准测试

Shengyi Wang, Niantong Li, Guangzheng Hu, Hong Qi, Fei Ding, Weixu Qiao, Jinlin Wang, Xiaotong Lv, Peng Han, Zimeng Li, Fanshu Ding, Yushu Wang, Han Wu, Jingjing Chen, Chongxiao Wang, Yanhao Wu, Chenglong Huang, Xiaoqian Zhu, Jie Tian, Hua Li, Jingjing Fan, Mingshuang Tang, Zhong Li, Hengxia Qiang, Weibin Chen, Jinyang Zhen, Bing Zhao, Lin Qu, Jing Li, Hu Wei

机构 * Alibaba Group(阿里巴巴集团) Moku Lab, Hujing Digital Media & Entertainment Group(魔氪实验室,虎鲸数字媒体与娱乐集团) Beijing Film Academy(北京电影学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 FilmBench是基于电影学院传统专业电影语言开发的文本到视频和参考到视频基准测试。它从获奖影片反向设计提示,依电影分类法评估,开发自动评估代理并开源核心套件,能再现人类模型排名,指出当前模型在动态美学等方面不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06254 2026-07-30 cs.CV cs.AI 版本更新 57%

VendorBench-100: A Unified Cross-Paradigm Benchmark for Deepfake Image Detection

VendorBench-100:用于深度伪造图像检测的统一跨范式基准测试

Sharayu N. Deshmukh, Md Rashidunnabi, Nelton Tiago Gemo, Kurundkar G. D., Mahamune M. R., Nilesh K. Deshmukh

机构 * Universidade da Beira Interior(贝拉内斯大学) Shri Guru Buddhi Swami College(什里·古鲁·布迪·斯瓦米学院) Swami Ramanand Tirtha Marathwada University(斯瓦米拉曼南德·蒂尔塔马哈拉施特拉大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究针对深度伪造图像检测的三种范式缺乏通用评估的问题,提出VendorBench-100基准测试,用统一框架评估36个模型,强调现实场景,通过MCC排名,发现ROC-AUC与MCC有差异,还发布评估框架和结果助力后续研究。

Comments Fixed scoring-normalization error in Neural Defend/TruthScan results, revising the central finding: MCC and ROC-AUC are strongly correlated (r ~ 0.86) overall, with only a specific subset showing one-directional threshold miscalibration. Abstract, tables, Discussion, Conclusion updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21033 2026-07-30 cs.CE cs.LG 版本更新 57%

TabPFN Extensions for Interpretable Geotechnical Modelling

TabPFN扩展在可解释地质建模中的应用

Taiga Saito, Yu Otake, Daijiro Mizutani, Stephen Wu

机构 * Department of Civil and Environmental Engineering, Tohoku University(东北大学土木环境工程系) Research Organization of Information and Systems, The Institute of Statistical Mathematics(信息与系统研究所统计数学研究所) Department of Statistical Science, The Graduate University for Advanced Studies(高级研究大学统计科学系)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文评估了TabPFN及其扩展库在地质任务中的表现,通过土壤类型分类和参数迭代填补,展示了TabPFN在不确定性量化和可解释性方面的优势。

Journal ref Georisk: Assessment and Management of Risk for Engineered Systems and Geohazards (2026) 1-20

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10605 2026-07-30 stat.ML cs.CY cs.LG econ.EM stat.ME 版本更新 57%

Optimal Causal Annotations: An Application to Casenotes in Social Services

批量自适应因果标注

Ezinne Nwankwo, Lauri Goldkind, Angela Zhou

机构 * UC Berkeley(加州大学伯克利分校) Fordham University(福特汉姆大学) University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 本文提出一种批量自适应方法,通过优化数据采样策略提高因果效应估计效率,减少标注成本,实验证明在缺失数据下能显著降低均方误差。

Comments Extended journal version. A preliminary version was accepted to AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22280 2026-07-28 physics.flu-dyn cs.AI 版本更新 57%

Neptuna: A Comprehensive Machine Learning Framework for Benchmarking Complex Multiphase Flows

海王星:用于复杂多相流基准测试的综合机器学习框架

Harish Ramachandran, Björn Kimpel, Thomas Paula, Josef Winter, Steffen Schmidt, Nikolaus Adams

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 针对冲击驱动的可压缩多相流基准测试难题,介绍含2.4TB数据集的Neptuna框架,评估多种替代模型家族,研究复合损失与自适应损失平衡,结果显示无单一模型最优,复合损失及SoftAdapt策略有显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10856 2026-07-28 cs.SE cs.AI cs.HC 版本更新 57%

How Do Practitioners Build SE Agents? Insights from a Mixed-Methods Study

从业者如何构建软件工程代理?来自混合方法研究的见解

Yunbo Lyu, David Williams, Jieke Shi, Zhensu Sun, Chao Peng, Zhou Yang, Federica Sarro, David Lo

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文通过混合方法研究从业者构建软件工程代理的方式,发现随着实现成本降低瓶颈转移,刻画了七阶段工作流程和评估驱动开发转变,还识别出团队面临的六个挑战及应对实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19259 2026-07-28 cs.CV cs.AI 版本更新 57%

TextRich: A Multi-Domain Benchmark for Detecting AI-Generated Text-Rich Images from GPT-Image-2

一个用于检测 GPT-Image-2 生成的含丰富文本图像的多领域基准

Yijin Wang, Shuyi Wang, Wenhan Zhang, Yuqi Ouyang

机构 * College of Computer Science(计算机科学学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 针对现有基准缺乏文本丰富图像检测的问题,构建了包含8602张图像、覆盖6个类别的多领域基准,评估5种检测器,发现性能高度依赖领域且易受JPEG压缩影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15781 2026-07-27 cs.AI cs.ET cs.MA 版本更新 57%

AgentFAIR: A Multi-Agent Collaborative Framework for FAIRness Evaluation of Geospatial Datasets

AgentFAIR:用于地理空间数据集公平性评估的多智能体协作框架

Ming Chen, Pranav Pai

机构 * The University of Melbourne(墨尔本大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究地理空间数据集公平性评估难题,提出AgentFAIR多智能体框架,结合结构化元数据提取与特定子原则语言模型评估器,给出各项评估结果,支持可审计性与可行性,不过受限于多种因素对准确性和泛化性声明有约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03159 2026-07-27 cs.CV cs.AI cs.RO 版本更新 57%

NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation

NVIDIA OmniDreams:用于闭环自动驾驶仿真的实时生成式世界模型

NVIDIA, :, Aarti Basant, Amlan Kar, Despoina Paschalidou, Fangyin Wei, Francesco Ferroni, Guillermo Garcia Cobo, Haithem Turki, Huan Ling, Jaewoo Seo, James Lucas, Jay Zhangjie Wu, Jialiang Wang, Jonathan Lorraine, Jun Gao, Kai He, Katarina Tothova, Kevin Xie, Michał Tyszkiewicz, Qi Wu, Riccardo de Lutio, Ruilong Li, Sanja Fidler, Seung Wook Kim, Tianchang Shen, Tianshi Cao, Tobias Pfaff, William Lew, Xindi Wu, Xuanchi Ren, Yifan Lu, Yuxuan Zhang, Zan Gojcic, Zian Wang

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 提出OmniDreams,一个基于Cosmos扩散模型训练的基础生成式世界模型,通过自回归生成动作条件视频,实现闭环仿真中复杂长尾场景的实时合成,并验证其在策略模型训练中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18119 2026-07-27 cs.AI 版本更新 57%

Beyond Text-to-SQL: Can LLMs Really Debug Enterprise ETL SQL?

超越文本到SQL:LLMs真的能调试企业级ETL SQL吗?

Jing Ye, Yiwen Duan, Yonghong Yu, Victor Ma, Yang Gao, Xing Chen

机构 * ByteDance Inc.(字节跳动公司)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 本文提出OurBench基准测试,用于评估LLMs在企业级SQL推理和调试中的性能,发现现有模型在复杂SQL错误检测上表现有限,需进一步改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20121 2026-07-24 cs.CL 版本更新 57%

OpenSkillRisk: Benchmarking Agent Safety When Using Real-World Risky Third-Party Skills

开放技能风险:使用现实世界中的危险第三方技能时对智能体安全性进行基准测试

Qiyuan Liu, Tingfeng Hui, Kun Zhan, Kaike Zhang, Ning Miao

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 研究基于语言模型的智能体使用第三方危险技能时的安全问题,构建OpenSkillRisk基准测试,涵盖多种不安全场景并能细粒度分析。实验发现当前系统处理危险技能能力不足,揭示三种失败模式,强调需改进语言模型风险推理和智能体框架执行控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23706 2026-07-24 eess.SP cs.HC cs.LG 版本更新 57%

Zero-Shot Neural Priors for Generalizable Cross-Subject and Cross-Task EEG Decoding

零样本神经先验用于可泛化的跨被试和跨任务脑电解码

Baimam Boukar Jean Jacques, Brandone Fonya, Nchofon Tagha Ghogomu, Pauline Nyaboe, Kipngeno Koech

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 针对脑电信号跨被试和跨任务泛化难题,提出零样本解码框架,采用渐进解冻策略微调Transformer,在大型数据集上实现优于基线的性能。

Comments EEG Decoding research

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20114 2026-07-24 cs.CV cs.AI 版本更新 57%

Benchmarking Unlearning for Vision Transformers

对视觉变换器的去学习进行基准测试

Kairan Zhao, Iurie Luca, Peter Triantafillou

机构 * University of Warwick, United Kingdom(沃里克大学)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 本研究首次对视觉变换器的去学习算法进行基准测试,评估不同数据集、算法和协议的影响,揭示了VTs在记忆训练数据方面的特性及性能基线。

Comments Accepted at CoLLAs 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00945 2026-07-24 q-bio.GN cs.CV cs.LG 版本更新 57%

Evaluation and Prognostic Validation of Deep Regression Models for WSI-Based Gene-Expression Prediction

基于全切片图像的基因表达预测的深度回归模型的评估与预后验证

Fredrik K. Gustafsson, Constance Boissin, Johan Vallon-Christersson, Mattias Rantalainen

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 研究对基于全切片图像的基因表达预测的深度回归模型进行评估与验证,采用基于注意力的多实例学习与PFM特征提取器的直接回归,在多个数据集及队列中验证,证明该方法可泛化并恢复有意义分子结构,支持其用于转录组表型分析和风险分层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17075 2026-07-23 cs.CR cs.CL 版本更新 57%

A Systematic Evaluation of Traditional Privacy Policy Analysis Tools Against LLMs

传统隐私政策分析工具针对大语言模型的系统评估

Madhav Aryal, Sudipa Saha, Sunil Manandhar, Anshuman Chhabra, Kaushal Kafle

机构 * University of South Florida(佛罗里达州立大学) IBM T.J. Watson Research Center(IBM 汤普森研究中心)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL

AI总结 本文系统评估现成大语言模型能否取代专业隐私分析工具,研究六个具三种主要功能及三个中间任务的工具,对比两个先进大语言模型与工具性能,发现大语言模型在隐私政策和法规分析功能上能匹配或超越现有工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09530 2026-07-23 cs.CL 版本更新 57%

FreyaTTS: A Compact Tokenizer-Free Flow-Matching Transformer for Turkish-First Speech Synthesis

FreyaTTS技术报告

Ahmet Erdem Pamuk, Ömer Yentür, Ahmet Tunga Bayrak, Yavuz Alp Sencer Öztürk, Mustafa Yavuz

专题命中 评测与基准 :post-training(abstract);分类 cs.CL

AI总结 介绍无分词器的土耳其语文本转语音模型Freya-TTS,通过无规则端到端建模、非自回归并行去噪等方法推进框架,在基准测试中表现出色,优于开源系统,适合边缘部署,且已开源模型权重、代码和基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30201 2026-07-23 cs.CV cs.CL 版本更新 57%

SHOVIR: A Benchmark for Evaluating Vision Shortcut Learning in Radiology Report Generation

SHOVIR:评估放射学报告生成中视觉捷径学习的基准

Filippo Ruffini, Marco Salmé, Rosa Sicilia, Valerio Guarrasi, Paolo Soda

机构 * UniCamillus-Saint Camillus International University of Health Sciences, Rome, Italy(乌尼卡米尔斯-圣卡米卢斯国际健康科学大学,意大利罗马)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出SHOVIR基准,通过遮挡实验检测放射学报告生成模型是否依赖视觉捷径而非真实病理证据,发现高报告质量模型未必具有良好空间定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03989 2026-07-23 cs.CV cs.AI 版本更新 57%

When Visual Evidence is Ambiguous: Pareidolia as a Diagnostic Probe for Vision Models

当视觉证据模糊时: pareidolia 作为视觉模型的诊断探针

Qianpu Chen, Derya Soydaner, Rob Saunders

机构 * Leiden Institute of Advanced Computer Science (LIACS), Leiden University, Leiden, The Netherlands(莱顿高级计算机科学研究所(LIACS)、莱顿大学、莱顿、荷兰)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文研究了视觉模型在模糊证据下的行为,通过分析pareidolia现象揭示了不同模型在表示层面的差异,发现语义过激活和不确定性策略等机制,为提升视觉语言系统的语义鲁棒性提供诊断和改进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12985 2026-07-22 cs.AI 版本更新 57%

Resist and Update: Counterfactual Report Coordinates for Incentive-Compatible LLMs

抵抗与更新:用于激励兼容大语言模型的反事实报告坐标

Sen Yang, Yuen-Hei Yeung

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究大语言模型在非证据激励压力下误报问题,提出学习和验证反事实报告调解器方法,通过互换干预识别低秩报告坐标,引入CRC钳位,在基准测试中取得成果,贡献了接口和认证方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14592 2026-07-21 cs.RO cs.AI 版本更新 57%

DSBench: A Comprehensive Benchmark for Evaluating External and In-Cabin Risks

DSBench:用于评估外部和车内风险的综合基准测试

Xianhui Meng, Yuchen Zhang, Zhijian Huang, Zheng Lu, Ziling Ji, Yandan Lin, Yaoyao Yin, Hongyuan Zhang, Wei Zhou, Guangfeng Jiang, Li Zhang, Long Chen, Hangjun Ye, Jun Liu, Xiaoshuai Hao

机构 * University of Science and Technology of China(中国科学技术大学) Georgia Institute of Technology(佐治亚理工学院) Xiaomi EV(小米电动车) Fudan University(复旦大学) Xidian University(西安电子科技大学) South China University of Technology(华南理工大学) The University of Hong Kong(香港大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 针对视觉语言模型在安全关键场景适用性未充分探索的问题,引入DSBench综合基准测试,涵盖外部与车内风险,分多类别。评估发现模型在复杂情况下降,构建数据集微调可提升性能,推动自动驾驶技术发展,相关资源将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15190 2026-07-20 cs.AI 版本更新 57%

Can We Trust Item Response Theory for AI Evaluation?

我们能信任项目反应理论进行人工智能评估吗?

Han Jiang, Sunbeom Kwon, Jinwen Luo, Ziang Xiao, Susu Zhang

机构 * Johns Hopkins University(约翰·霍普金斯大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究探讨项目反应理论(IRT)用于人工智能评估的可靠性,利用六个大语言模型基准模拟响应矩阵,比较四种估计工具,评估IRT在多方面的表现,发现经典估计器在大型基准中可能不可行,可扩展估计器在特定模型集下可能产生不可靠推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12175 2026-07-20 cs.CV cs.AI 版本更新 57%

From Reconstruction to Interpretation: Zero-Setup Multi-Phase Segmentation of X-ray Tomography Data

从重建到解释:X射线断层扫描数据的零设置多相分割

Pradyumna Elavarthi, Arun J. Bhattacharjee, Harrison Lisabeth, Anca Ralescu, Petrus H. Zwart, Dilworth Parkinson, Elizabeth G. Clark

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 研究针对X射线断层扫描数据快速解释受限问题,提出零设置多相分割框架,结合材料无关掩码准备策略与预训练语义分割网络,能快速生成诊断级分割,支持近实时束线反馈与可扩展成像工作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15677 2026-07-20 cs.CL cs.CV 版本更新 57%

VCG-Bench: Towards A Unified Visual-Centric Benchmark for Structured Generation and Editing

VCG-Bench:迈向统一的视觉导向基准,用于结构化生成与编辑

Xiaoyan Su, Peijie Dong, Zhenheng Tang, Song Tang, Yuyao Zhai, Kaitao Lin, Liang Chen, Gai Yuhang, Yuyu Luo, Qiang Wang, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology (GuangZhou)(香港科学与技术大学(广州)) Huawei Technologies Co., Ltd(华为技术有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) South China University of Technology(华南理工大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出VCG-Bench,一个统一的视觉导向mxGraph任务基准,通过符号逻辑和XML实现精确的图表生成与编辑,解决现有方法在结构化任务中的局限性。

Comments Accepted by ICML2026, 37 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00100 2026-07-20 cs.CY cs.AI cs.ET 版本更新 57%

A Scaffolded GenAI Lab in Early Undergraduate CS: A Mixed-Methods, Multi-Course Evaluation

本科早期计算机科学中的一个支架式生成式人工智能实验室:混合方法、多课程评估

Ethan Dickey, Andres Bejarano, Rhianna Kuperus, Bárbara Fagundes

机构 * Purdue University(普渡大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 研究在本科早期计算机科学课程中评估 “AI实验室” 这一支架式GenAI素养干预。通过多课程混合方法收集数据,发现其能改变学生对GenAI的态度及使用策略,且不增加评分作业中GenAI的使用量,推动相关三角测量研究。

Comments 18 pages, 3 figures, 18 tables; v2 substantially refined qualitative analysis and discussion

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13006 2026-07-16 cs.LG 版本更新 57%

The Spectrum Is Not Enough: When Context Helps Time-Series Forecasting

频谱并不够:上下文何时有助于时间序列预测

Mert Onur Cakiroglu, Mehmet Dalkilic, Hasan Kurban

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 研究时间序列预测中上下文的作用,指出频谱指标与添加上下文等因素回答的问题不同,通过替代对等给出覆盖不足诊断,在七个基准测试中验证,表明窗口键控检索等情况,为部署决策提供区分、比较及诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12252 2026-07-16 cs.CL 版本更新 57%

FinResearchBench II: A Deep Research Benchmark with Consensus-Derived Gold Rubrics for Distinguishing Financial Report Quality

金融研究基准II:一个具有共识衍生黄金标准的深度研究基准,用于区分财务报告质量

Beidi Luan, Rui Sun, Sinuo Wang, Yan Gu, Chao Li, Zhenliang Xiong, Jing Li, Zuo Bai

机构 * StepFun(步趣) FinStep(鳍步) University of Adelaide(阿德莱德大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 该研究针对深度研究代理生成财务报告的大规模评估瓶颈,提出可扩展管道生成高质量标准。通过构建基准、合成候选标准、比较大语言模型与人类评估,经两个过滤器得出黄金标准集,用于评估10个深度研究系统,实现可扩展的基准评估等研究。

详情

展开后加载摘要…

URL PDF HTML 收藏