arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-11 至 2026-08-11 共收录 752 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 173 篇

2607.19069 2026-08-11 cs.CV 版本更新 78%

Delineate Anything v2: A Global Foundation Model for Field Delineation

描绘一切 v2:用于田地描绘的全球基础模型

Mykola Lavreniuk, Nataliia Kussul, Andrii Shelestov, Yevhenii Salii, Volodymyr Kuzin, Charlotte Julia Li-Xing Wang, Zoltan Szantoi

机构 * European Space Agency(欧洲航天局) Space Research Institute NASU-SSAU(乌克兰国家科学院-乌克兰国家空间局空间研究所) University of Maryland(马里兰大学) National Technical University of Ukraine “Igor Sikorsky Kyiv Polytechnic Institute”(乌克兰国立技术大学“ Igor Sikorsky基辅理工学院”)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 研究针对大规模农业田地边界描绘难题,提出全球可扩展基础模型描绘一切 v2,构建 FBIS - 73M 数据集,引入特定数据处理管道,建立评估基准,该模型超越现有技术,速度适合大规模部署,相关资源公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13023 2026-08-11 cs.SD cs.MM 版本更新 78%

SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding

SpotSound: 通过细粒度时间定位增强大音频-语言模型

Luoyi Sun, Xiao Zhou, Zeqian Li, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) SAI, Shanghai Jiao Tong University(上海交通大学人工智能院)

专题命中 评测与基准 :language model(title,abstract)

AI总结 SpotSound通过引入新的训练目标和挑战性基准,提升了大音频-语言模型在时间定位任务中的性能,同时保持了通用任务的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08813 2026-08-11 cs.RO 版本更新 78%

Calib3R: Hand-Eye Calibration and 3D Metric-Scaled Scene Reconstruction with 3D Foundation Models

Calib3R:基于三维基础模型的手眼标定与三维度量尺度场景重建

Davide Allegro, Matteo Terreran, Stefano Ghidoni

机构 * Department of Information Engineering (DEI) at the University of Padova(帕多瓦大学信息工程系)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 Calib3R是一种基于3D基础模型的无标定板方法,通过统一优化联合完成手眼标定与度量尺度三维重建,仅用不到10张图像即可实现精确标定,性能优于同类方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08869 2026-08-11 cs.CL 新提交 77%

Position Bias in Ordinal Classification: A Systematic Evaluation

序数分类中的位置偏差:系统评估

Yu Wang, Jeffrey Zhou, Menglin Liu, Ge Shi

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究系统评估了序数分类中大型语言模型的位置偏差,发现其普遍存在且现有校正方法效果有限,提出需结合预测性能与稳定性选择序数分类系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27826 2026-08-11 cs.AI 版本更新 77%

NormAct: Benchmarking Embodied Agents' Proactive Compliance with Unspoken Social Norms

NormAct:具身规划中隐藏社会规范遵守的基准

Shiyun Zhao, Xinwei Song, Tianyu Guo, Xiaomeng Gao, Mingyuan Liu, Xu Han, Yuanyuan Zhang, Zhenliang Zhang, Xue Feng, Bo Dai

机构 * State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(通用人工智能国家重点实验室,北京通用人工智能研究院) China Academy of Information and Communications Technology(中国信息通信研究院) ShanghaiTech University(上海科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 提出NormAct基准,评估多模态大语言模型在具身规划中遵守隐藏社会规范的能力,发现模型在67.3%情况下达成显式目标,但仅26.4%遵守隐藏规范;提出NormPerceptor方法将任务成功率从24.2%提升至46.7%。

Comments This version revises the paper content and adds substantial details on the benchmark design and experimental setup

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03159 2026-08-11 cs.DL cs.CL 版本更新 77%

BibTeX Citation Errors in Scientific Publishing Agents: Evaluation and Mitigation

科学出版代理中的BibTeX引用幻觉:评估与缓解

Delip Rao, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文评估并缓解了科学出版代理中BibTeX引用的字段级错误,通过构建包含931篇论文的基准测试,发现模型依赖参数记忆,提出clibib工具提升准确性。

Comments 35 pages; COLM 2026 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18121 2026-08-11 cs.CV cs.AI 版本更新 77%

VCU-Bridge: Hierarchical Visual Connotation Understanding via Semantic Bridging

VCU-Bridge: 通过语义桥梁实现层次化视觉隐喻理解

Ming Zhong, Yuanlei Wang, Liuzhou Zhang, Ruichuan An, Renrui Zhang, Hao Liang, Ming Lu, Ying Shen, Wentao Zhang

机构 * Zhejiang University(浙江大学) Peking University(北京大学) Sun Yat-sen University(中山大学) CUHK(香港中文大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.AI

AI总结 VCU-Bridge通过语义桥梁实现层次化视觉隐喻理解,构建了HVCU-Bench基准,并展示了提升MLLM能力的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12265 2026-08-11 cs.CL 77%

Auto-PRE: An Automatic and Cost-Efficient Peer-Review Framework for Language Generation Evaluation

Junjie Chen, Weihang Su, Zhumin Chu, Haitao Li, Yujia Zhou, Dingbo Yuan, Xudong Wang, Jun Zhou, Yiqun Liu, Min Zhang, Shaoping Ma, Qingyao Ai

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09412 2026-08-11 cs.AI 新提交 74%

KVDiagnosis: A Diagnostic Benchmark for KV-Cache Compression in Long-Context Language Models

KVDiagnosis:长上下文语言模型中KV缓存压缩的诊断基准

Chen Qiu, Ziwu Liu, Chao Fei, Guozhong Li, Panos Kalnis

机构 * KAUST(阿卜杜拉国王科技大学)

专题命中 评测与基准 :language model(title);分类 cs.AI

AI总结 本文提出KVDiagnosis,即长上下文语言模型KV缓存压缩的诊断基准,通过分类方法、设计评估流程、建立记录格式,在Qwen3-8B上验证其可有效区分压缩成败,代码与数据公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09187 2026-08-11 cs.CL 新提交 74%

Failure-Aware Long-Form Translation: Design and Implementation of a Recoverable LLM Translation System

故障感知的长文本翻译:可恢复大语言模型翻译系统的设计与实现

Yanlin Yu

专题命中 评测与基准 :LLM(title);分类 cs.CL

AI总结 针对长文本翻译API返回不可用结果的问题,设计实现了带恢复协议的可恢复大语言模型翻译系统,该系统通过延迟发布、验证输出等方式保障翻译可用性,经测试符合多项规则要求。

Comments 9 pages, 2 figures. A sanitized reference implementation is included as ancillary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06609 2026-08-11 cs.AI 版本更新 74%

Automated item evaluation: Predicting item acceptance and rejection using LLM-generated critiques

自动化项目评估:利用大语言模型生成的评语预测项目的接受与拒绝

Hotaka Maeda, Yikai Lu

机构 * Smarter Balanced, University of California-Santa Cruz(加州大学圣克鲁兹分校 Smarter Balanced) University of Minnesota-Twin Cities(明尼苏达大学双城分校)

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 本研究利用大规模标准化测试的项目数据,通过融合DeBERTa分类器与Qwen3生成的项目评语,构建AIE模型预测项目接受/拒绝,可减轻人工评审负担,但对公平性相关项目的识别仍需人工评审。

Comments 19 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10202 2026-08-11 cs.LG 版本更新 74%

When Counterbalancing Hides the Bias: Access-Conditioned Position Lock in Forced-Choice LLM Evaluation

跨模型价值比较中的两个混淆因素:响应确定性和访问约束

Hong-In Won, Jinseok Jang, Hyoseop Kim

机构 * KITECH(韩国产业技术评价院) National Research Council of Science and Technology (NST)(韩国国家科学技术研究院)

专题命中 评测与基准 :LLM(title);分类 cs.LG

AI总结 研究跨模型价值比较中的两个混淆因素,提出无规则价值困境等方法分离并校正响应确定性,还发现访问约束影响模型价值概况,贡献了确定性校正分解,识别出部署约束是独特价值混淆因素。

Comments 16 pages, 3 figures, 7 tables. Substantially revised: reframed around an identifiability result for the counterbalanced concentration index, with access configuration presented as one generator of the failure rather than a separate confound. Code and data are included as ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08392 2026-08-11 cs.AI cs.CL 新提交 73%

CAP: A Scalable Benchmark for Evaluating Cross-Site Browser Agents with Complex Actions and Perception

CAP:用于评估具备复杂动作与感知能力的跨站点浏览器智能体的可扩展基准

Zejun Xu, Taiyi Chen, Jin Li, Yongtong Gu, Qi Cheng, Aixuan Lv, Shuai Zhu, Pengfei Zhu, Kaichen Yang, Boyu Sun, Yixian Yang, Mulong Xie, Xin Liu, Dagang Li, Xiaoteng Ma, Hongru Wang

机构 * Macau University of Science and Technology(澳门科技大学) Tsinghua University(清华大学) Southeast University(东南大学) FellouAI ARGUS Lab(ARGUS实验室) The University of Edinburgh(爱丁堡大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究人员推出可扩展基准CAP,通过分解-重组流程构建420项跨站点网页任务,实验发现当前浏览器智能体在感知密集型交互上存在明显瓶颈,与真实需求差距较大。

Comments Accepted to COLM 2026. Project page: https://warriorxu0302.github.io/CAP-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07639 2026-08-11 cs.LG cs.AI 新提交 73%

SkillConsist: Detecting Inconsistencies in Agent Skills via Bidirectional Graph Alignment

SkillConsist:通过双向图对齐检测智能体技能中的不一致性

Chaofan Meng, Yuhang Zheng, Yingnan Zhou, Sihan Xu

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 SkillConsist针对智能体技能不一致检测的挑战,通过双向图对齐等技术构建基准并取得优于基线的检测性能,提升了技能一致性检测效果。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07545 2026-08-11 cs.NE cs.AI cs.LG cs.SE 新提交 73%

DarwinX: Evolving Agent Harnesses Through Natural Selection

DarwinX:通过自然选择进化智能体控制程序

Yifan Zhang, Yutong Dai, Juntao Tan, Luyu Yang, Rishi Mullur, Thai Hoang, Zhiyuan Hu, James Zhu, Phil Mui, Silvio Savarese, Ran Xu, Zeyuan Chen

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 DarwinX是模型参数冻结时通过自然选择进化控制程序的方法,在四个基准中平均提升约17个百分点,控制程序可迁移,进化通用能力而非基准特定补丁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07542 2026-08-11 cs.AI cs.LG cs.MA cs.RO 新提交 73%

An AI Scientist that Doesn't Drift: Taste, Structure, and Falsifiable Findings in a Quadruped Navigation Research Loop

不会发生漂移的AI科学家:四足机器人导航研究循环中的偏好、结构与可证伪发现

Yiwen Zhang, Eloise Zeng, Jaeha Lee, Tony Yue Yu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出一款基于自研究范式的AI科学家,通过新增实验卡片、专门子智能体和偏好神谕kkanbu的组件,解决自主研究循环漂移问题,在四足机器人导航实验中验证了框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07537 2026-08-11 cs.NE cs.AI cs.CL cs.HC cs.MA 新提交 73%

An evolutionary model of animats with VLM-based subjective evaluation

基于视觉语言模型(VLM)主观评估的动物机器人进化模型

Shota Miyazaki, Takaya Arita, Reiji Suzuki

专题命中 评测与基准 :language model(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究提出将VLM主观评估融入遗传算法的框架,使虚拟软体机器人同步进化形态与运动,实验显示该方法可加快种群收敛,且VLM主观选择的结果与人类评估倾向相似。

Comments 18 pages, 12 figures, 2 tables. This manuscript has been accepted for publication in Artificial Life and Robotics following peer review

Journal ref Shota Miyazaki, Takaya Arita and Reiji Suzuki: An evolutionary model of animats with VLM-based subjective evaluation, Artificial Life and Robotics (2026). https://link.springer.com/article/10.1007/s10015-026-01135-4

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07530 2026-08-11 cs.AI cs.CL cs.DB 新提交 73%

NL2SHACL-Bench: A Benchmark Suite for Natural Language to SHACL Translation

NL2SHACL-Bench:面向自然语言到SHACL翻译的基准套件

Yuchen Zhou, Niels Bobet, Maribel Acosta

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出NL2SHACL-Bench基准套件,评估了四个最先进大语言模型的NL2SHACL翻译能力,发现当前模型能生成语法有效SHACL,但复杂逻辑与结构模式的语义等价约束生成仍有不足,该基准可衡量领域进展。

Comments 18 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23804 2026-08-11 cs.CL cs.AI 版本更新 73%

How Context Attribution Handles What the Model Already Knows

上下文归因如何处理模型已有的知识

Quoc-Huy Trinh, Lin Zhu, Sebastian Szyller

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型上下文归因方法在上下文与训练数据重叠时的问题,引入新评估协议和基准数据集,通过实验证明现有方法在知识重叠时归因不准确,且用于源分离时无法基于贡献分数区分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23878 2026-08-11 cs.AI cs.LG 版本更新 73%

ZenBrain: A Neuroscience-Inspired 7-Layer Memory Architecture for Autonomous AI Systems

ZenBrain:一种受神经科学启发的7层记忆架构用于自主AI系统

Alexander Bering

机构 * Zensation AI

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 ZenBrain提出一种7层神经科学启发的记忆架构,通过整合15种验证的神经科学机制,在LongMemEval-500任务中实现了与长上下文Oracle的二元判断准确率接近,并在多个指标上优于现有系统。

Comments 48 pages, 27 tables, 4 figures. v3 is a correction release: a full source-verification pass over all 83 references corrects 30 defective entries and withdraws two ancillary evaluations run on synthetic stand-in data; no measured numbers changed. Changelog: 10.5281/zenodo.21858218. Earlier versions: Zenodo concept DOI 10.5281/zenodo.19353663, TDCommons dpubs_series/9683

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19634 2026-08-11 cs.CL cs.AI cs.CV cs.SD 版本更新 73%

MCIF: Multimodal Crosslingual Instruction-Following Benchmark from Scientific Talks

MCIF: 多模态跨语言指令遵循基准从科学讲座

Sara Papi, Maike Züfle, Marco Gaido, Beatrice Savoldi, Danni Liu, Ioannis Douros, Luisa Bentivogli, Jan Niehues

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MCIF是首个多模态跨语言指令遵循基准,通过科学讲座数据评估模型在跨语言、多模态环境下处理不同输入长度的任务能力。

Comments Data available at https://huggingface.co/datasets/FBK-MT/MCIF | Evaluation, outputs, and baselines available at https://github.com/hlt-mt/mcif

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15701 2026-08-11 cs.AI cs.CL cs.HC 73%

Collaborative Gym: A Framework for Enabling and Evaluating Human-Agent Collaboration

协作健身房:一种促进和评估人机协作的框架

Yijia Shao, Vinay Samuel, Yucheng Jiang, John Yang, Diyi Yang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Co-Gym框架通过模拟和真实环境支持人机协作研究,展示协作代理在任务性能上的优势,同时揭示当前语言模型的局限性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08955 2026-08-11 cs.CV 新提交 71%

Damage Classification for 3D Point Cloud Data via 3D Data Analysis and Vision Foundation Model-based 2D Projections

基于三维数据分析与视觉基础模型二维投影的三维点云数据损伤分类

Evan Perez, Kalelo Dukuray, Erika Ardiles-Cruz, Jie Wei

机构 * City College of New York(纽约城市学院) Air Force Research Lab(空军研究实验室)

专题命中 评测与基准 :foundation model(title)

AI总结 本研究针对三维点云损伤分类的挑战,提出3PDA与2PDA两种算法,2PDA准确率略低但计算成本大幅降低且泛化性更强,为相关任务提供了高效替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09593 2026-08-11 cs.SD cs.AI 新提交 70%

MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection

MADBench:面向模态感知音频深度伪造检测的基准

Yanqiu Li, Yang Xiao, Jisheng Bai, Bin Chen, Hong Jia, Ting Dang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MADBench是首个区分语音与环境音频的音频深度伪造检测基准,测试发现环境音频操纵更易检测,现有预训练检测器在两类声学成分上均失效,为相关研究提供严谨基础。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09380 2026-08-11 cs.AI 新提交 70%

OpenLoopEvolve: A Verifiable Self-Evolution Framework for Loop Policies in Long-Horizon Complex Tasks

OpenLoopEvolve:面向长周期复杂任务中循环策略的可验证自进化框架

Siqi Wang, Xinlin Li, Zhenglin Li, Li Li

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 OpenLoopEvolve是面向长周期复杂任务的可验证自进化框架,通过在线与离线两种进化模式优化循环策略,在YC-Bench基准上提升了任务性能、成功率与风险指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08852 2026-08-11 cs.AI cs.CY cs.HC cs.MA 新提交 70%

Findings of the First Teaching Monster Challenge: A Benchmark of Pedagogical Content Knowledge in AI Agents

首届“教学怪兽挑战赛”的研究发现:AI智能体的教学内容知识基准

Yi-Cheng Lin, Yu-Kai Guo, Szu-Chi Chen, Bo-Han Feng, Yun-Man Hsu, Hsiang Hsieh, Yu-Jung Lin, Yue-Ling Wu, Jia-Kai Dong, An-Yu Cheng, Yu-Han Huang, Lok-Lam Ieong, Kuan-Yu Chen, Ming-Douo Tchouang, Shao-Hua Sun, Che Lin, Jian-Jiun Ding, Hung-yi Lee

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究推出首个以学习者角色为评估标准的教学视频生成基准“教学怪兽挑战赛”,测试发现当前AI教学系统内容适配能力不足,自动裁判存在局限,发布相关资源供后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08264 2026-08-11 cs.AI 新提交 70%

OBLIVION: Workflow-Level Operational Skill Unlearning for Deployed Agents

OBLIVION:面向已部署智能体的工作流级操作技能遗忘

Zhengyang Shan, Xu Qian, Jiayun Xin, Kun Li, Yue Zhang, Minghui Xu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大型语言模型智能体的技能撤销问题,提出OBLIVION框架,通过工作流建模、跨表面连贯擦除等技术降低技能复活风险,在基准与沙箱实验中有效减少攻击成功率与影响加权暴露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07873 2026-08-11 cs.AI 新提交 70%

Back to the Future: A workbook time machine for spread sheet creation benchmarks

回到未来:用于电子表格创建基准测试的工作簿时光机

Mansi Uniyal, Agamdeep Singh, Ananya Singha, Priyanshu Gupta, Mukul Singh, Gust Verbruggen, Vu Le, Sumit Gulwani

机构 * Microsoft(微软公司)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出workbook time machine流水线,构建了含150个任务的电子表格创建评估基准wtmbench,揭示了查询特异性等因素对大语言模型Excel任务性能的关键影响。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05656 2026-08-11 cs.CY cs.AI cs.HC 版本更新 70%

Studying People to Study AI: Expert Perspectives on the Epistemic Fit and Barriers of Human Research in AI Safety & Ethics

研究人以研究AI:关于人类研究在AI安全与伦理中的认知适配性及障碍的专家观点

Jessica Y. Bo, Paula Akemi Aoyagui, Shalaleh Rismani, Dipto Das, Syed Ishtiaque Ahmed, Ashton Anderson

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究通过对93名AI安全与伦理领域专家的调查及17名专家的访谈,分析了人类研究在AI安全与伦理领域的认知适配性与障碍,并提出相关建议以避免流于形式的“人类洗白”。

Comments Ninth AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21916 2026-08-11 cs.CL cs.SE 版本更新 70%

MathDuels: A Self-Play Benchmark That Grows

MathDuels:评估大语言模型作为问题提出者和解决者

Zhiqiu Xu, Shibo Jin, Shreya Arya, Mayur Naik

机构 * Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) Department of Mathematics, University of Pennsylvania(宾夕法尼亚大学数学系)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.CL

AI总结 MathDuels通过让模型同时扮演问题提出者和解决者角色,揭示了模型在两者能力上的差异,展示了评估方法在区分模型能力上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏