arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Apple(苹果)

2026-09-01 至 2026-09-01 共收录 3
2608.31119 2026-09-01 cs.CL 新提交

PaperGym: Rubric-Centered Evolution for Research-Plan Generation

PaperGym:以评分标准为中心的研究计划生成演化框架

Yuhan Wang, Zhengxi Lu, Yuchen Yan, Kaitao Song, Wenqi Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Apple(苹果公司)

AI总结 本文提出PaperGym框架,将论文转化为研究计划生成的训练环境,采用评分标准分阶段训练Qwen3系列模型,显著提升了研究规划能力,在多项基准上优于现有方法。

Comments 34 pages, 6 figures, 6 tables. Code: https://github.com/ZJU-REAL/PaperGym. Project page: https://zju-real.github.io/PaperGym. Dataset: https://huggingface.co/datasets/CabbageWyh/PaperGym-Data. Model: https://huggingface.co/CabbageWyh/PaperGym-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23172 2026-09-01 cs.CL cs.CV 版本更新

CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension

CaRGo-T:因果推理思维图提升多模态幽默理解能力

Abhilash Nandy, Rahul Seetharaman, Aman Bansal, Rounak Saha, Manav Nitin Kapadnis, Millon Madhur Das, Pawan Goyal, Niloy Ganguly

机构 * Microsoft Research India(微软研究院印度分部) LinkedIn(领英公司) Nutanix(Nutanix公司) Indian Institute of Science(印度科学学院) Apple(苹果公司) Fujitsu Research India(富士通印度研究院) Indian Institute of Technology Kharagpur(印度克勒格布尔印度理工学院)

AI总结 本研究提出CaRGo-T因果推理思维图框架,在四类含讽刺等喜剧内容的数据集上,提升VLMs的幽默理解与检测性能,相关代码已公开。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16344 2026-09-01 cs.CL 版本更新

IndicQE-APE: A Benchmark for Quality Estimation and Automatic Post-Editing for Indic Languages

IndicQE-APE:印度语言质量估计与自动后编辑基准

Diptesh Kanojia, Archchana Sindhujan, Sourabh Deoghare, Daria Sokova, Shenbin Qian, Girish Koushik, Tharindu Ranasinghe, Constantin Orăsan, Chrysoula Zerva, Ricardo Rei, Frédéric Blain, André F. T. Martins, Marco Turchi, Matteo Negri, Anoop Kunchukuttan, Mitesh M. Khapra, Pushpak Bhattacharyya

机构 * IIT Bombay(印度理工学院孟买分校) University of Oslo(奥斯陆大学) Lancaster University(兰卡斯特大学) INESC-ID Instituto de Telecomunicações(电信研究所) Instituto Superior Técnico(高等技术学院) University of Lisbon(里斯本大学) Sword Health Tilburg University(蒂尔堡大学) Zoom Communications(Zoom通信公司) Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) Apple(苹果公司) Bodhan AI IIT Madras(印度理工学院马德拉斯分校) University of Surrey(萨里大学)

AI总结 本研究构建了涵盖9个方向对的IndicQE-APE基准,对LLM、COMET指标及APE系统进行QE与APE基准测试,揭示质量信号冲突等因素对文本段排名的影响。

Comments Submitted to WMT 2026 for review

详情

展开后加载摘要…

URL PDF HTML 收藏