arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Microsoft(微软)

2026-07-07 至 2026-07-07 共收录 16
2607.05199 2026-07-07 cs.AI 新提交

Reason, Reward, Refine: Step-Level Errors Corrections with Structured Feedback for Physics Reasoning in Small Language Models

推理、奖励、优化:面向小语言模型物理推理的带结构化反馈步级纠错方法

Raj Jaiswal, Dhruv Jain, Rishabh Dhawan, Sree Krishna Uppalapati, Shin'ichi Satoh, Tanuja Ganu, Rajiv Ratn Shah

机构 * IIIT Delhi(印度信息技术学院德里分校) IIT BHU(印度理工学院(巴纳拉斯印度教大学)) IIT Kanpur(印度理工学院坎普尔分校) NII Tokyo(日本国立情报学研究所) Microsoft Research India(微软印度研究院)

AI总结 针对小语言模型物理推理的步级错误传播问题,提出含结构化反馈的步级奖励框架,无需偏好数据,大幅提升推理准确率并降低各类错误占比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05077 2026-07-07 cs.CV 新提交

LangLoc: "Tell Me What You See"

LangLoc:“告诉我你看到了什么”

Shaurya Kishore Panwar, Roham Zendehdel Nobari, Shirley Feng Yi Lau, Abu Bakr Rahman Shaik, Manuel Günther, Marc Pollefeys, Daniel Barath

机构 * ETH Zürich(苏黎世联邦理工学院) University of Zürich(苏黎世大学) Microsoft(微软公司) HUN-REN SZTAKI(匈牙利科学院计算机与自动化研究所)

AI总结 研究从自然语言进行室内细粒度定位,用含CLIP语义特征的双分支GATv2编码器检索场景,通过射线投射物体可见性估计位置和方向,用贝叶斯对话模块解决歧义,贡献基准数据集。

Comments Accepted at the European Conference of Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04890 2026-07-07 cs.CL 新提交

Evaluating Large Language Models for Antisemitic Incident Classification

评估用于反犹事件分类的大语言模型

Karina Halevy, Julia Mendelsohn, Chan Young Park, Yulia Tsvetkov, Maarten Sap

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Maryland(马里兰大学) Microsoft Research(微软研究院) University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

AI总结 研究利用大语言模型对反犹事件报告进行细粒度分类,评估了OpenAI的GPT-4o和Meta的Llama-3.2-3B-Instruct,发现其有潜力但需改进,提示中提供定义和示例可提升性能,还通过案例展示其能助力发现现实事件。

Comments Accepted to Digital Hate Review 2026 Issue 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04751 2026-07-07 cs.LG cs.AI 新提交

Trust Region Policy Distillation

信任区域策略蒸馏

Zhengpeng Xie, Li Lyna Zhang, Zeke Xie, Mao Yang

机构 * Microsoft(微软)

AI总结 研究将不稳定的策略蒸馏转化为稳定训练范式,核心方法是动态构建近端教师,贡献为增强训练稳定性、样本效率等,且无额外计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04739 2026-07-07 cs.RO 新提交

Spatial Attention: Adapting Execution Horizons for Diffusion Policies via Observation Sensitivity

空间注意力:通过观测敏感度调整扩散策略的执行范围

Che-Sang Park, Junsu Ha, Jianlong Fu, Frank C. Park

机构 * Robotics Laboratory, Seoul National University(首尔国立大学机器人实验室) Microsoft Research Asia(微软亚洲研究院)

AI总结 研究如何在机器人学习中自适应调整采样动作块的执行范围以平衡响应性和计算成本,引入空间注意力概念,通过预测未来值动态分配执行范围,实验表明该方法可提高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04729 2026-07-07 cs.CR cs.AI cs.SE 新提交

RustMizan: A Compilable, Contamination-Aware Benchmarking Framework for Rust Vulnerabilities

RustMizan:用于Rust漏洞的可编译、污染感知基准测试框架

Tarek Elsayed, Shiping Yang, Eunsong Koh, Sanika Goyal, Vincent Huang, Paul Ngo, Nathan Young, Mohammad Omidvar Tehrani, Alvyn Kang, Arnell Kang, Zeyu Chen, Angélica Moreira, Xuan Feng, Angel X. Chang, Nick Sumner, Steven Y. Ko

机构 * Simon Fraser University(西蒙弗雷泽大学) Trinity University(特里尼蒂大学) Microsoft Research(微软研究院) Amii(阿米国际)

AI总结 针对现有Rust漏洞分析基准不足,介绍RustMizan框架,含可编译代码变体及注释,用配对突变框架测试,给出不同模型在该框架下的测试结果。

Comments 36 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04537 2026-07-07 cs.SE cs.AI 新提交

Obey, Diverge, Collapse: Blind Obedience to Incorrect Instructions Drives Code LLMs to Irrecoverable Code Semantic Collapse

服从、发散、崩溃:对错误指令的盲目服从驱使代码语言模型陷入无法恢复的代码语义崩溃

Raj Jaiswal, Anany Singh Divy, Savar Bhasin, Adi Bajpai, Tanuja Ganu, Rajiv Ratn Shah

机构 * IIIT Delhi(印度德里国家理工学院) IIT Kanpur(印度坎浦尔理工学院) Microsoft Research India(微软印度研究院)

AI总结 研究代码语言模型在指令错误时的表现,通过四个实验评估其在单步和迭代修复设置中对错误指令的应对,发现模型会盲目服从错误指令致代码语义崩溃,引入幽灵错误且无法恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04449 2026-07-07 cs.CV cs.LG 新提交

Fields of the Planet: Field Boundary Mapping Beyond 10m

行星的田地:超越10米的田地边界测绘

Isaac Corley, Caleb Robinson, Jennifer Marcus, Hannah Kerner

机构 * Taylor Geospatial(泰勒地理空间公司) Microsoft AI for Good Research Lab(微软公益人工智能研究实验室) Arizona State University(亚利桑那州立大学)

AI总结 介绍Fields of the Planet(FTP),作为Fields of The World(FTW)的3米分辨率配套产品,通过矢量预测评估田地划分,在匹配架构和训练方法下,3米图像提升了全景质量等指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04439 2026-07-07 cs.AI 新提交

ResearchStudio-Idea: An Evidence-Grounded Research-Ideation Skill Suite from ML Conference Outcomes

研究工作室-创意:基于机器学习会议成果的有证据支持的研究创意技能套件

Qihao Zhao, Yangyu Huang, Yalun Dai, Lingao Xiao, Jianjun Gao, Xin Zhang, Wenshan Wu, Scarlett Li, Yang He, Yan Lu, Yap Kim Hui

机构 * Nanyang Technological University(南洋理工大学) Microsoft Research(微软研究院) National University of Singapore(新加坡国立大学) CFAR, A*STAR(计算机辅助放射治疗中心,新加坡科技研究局)

AI总结 研究问题是提升研究创意,核心方法是构建包含多种技能的套件,主要贡献是揭示31个反复出现的创意子模式并整合为15个可复用模式,能将其转化为可追溯研究提案,经评估效果优于基线。

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03451 2026-07-07 cs.SE cs.AI cs.LG 新提交

SkillOpt-Lite: Better and Faster Agent Self-evolution via One Line of Vibe

SkillOpt-Lite:通过一行代码实现更好更快的智能体自我进化

Yifei Shen, Bo Li, Xinjie Zhang

机构 * LMMs-Lab(LMMs实验室) NTU MMLab(国立台湾大学MMLab) Microsoft(微软公司)

AI总结 研究智能体技能优化,通过零阶优化形式化,基于相关理念和学习建立收敛与泛化原则,提出SkillOpt-Lite加速收敛且性能优,还集成到生产编码智能体,最小管道可推广到完整 harness 优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03423 2026-07-07 cs.CR cs.AI 新提交

Securing Multi-Tool AI Agent Chains With Dynamic, Real-Time Compositional Policies

通过动态实时组合策略保护多工具人工智能代理链

Chris Schneider, Kriti Faujdar, Philipp Schoenegger, Ben Bariach

机构 * Microsoft AI(微软人工智能)

AI总结 研究多工具代理链安全问题,提出动态安全控制合成器(DSCC),分两阶段实现组合安全。阶段1在会话检查时合成策略,阶段2在运行时跟踪数据敏感度,提供深度防御,评估了参考实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03181 2026-07-07 cs.GT cs.AI 新提交

Teaming Up with AI: Coordination and Cooperation

与人工智能合作:协调与协作

Nicole Immorlica, Inbal Talgam-Cohen

机构 * Yale University and Microsoft Research(耶鲁大学和微软研究院) Tel Aviv University(特拉维夫大学)

AI总结 探讨如何在劳动力中与人工智能协作以最大化经济价值并实现‘真正’协作。结合理论计算机科学和经济学,考虑协调与合作两层工具,展示基于算法和经济研究的方法可增强两者,为AI市场研究指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02521 2026-07-07 cs.DC cs.LG cs.PL 新提交

Tile-Level Activation Overlap for Efficient LLM Inference

用于高效大语言模型推理的瓦片级激活重叠

Abhinav Jangda, Tyler Sorensen, Sebastian Burckhardt, Jianlan YE, Chaoyin Li, Atul Gupta

机构 * Microsoft Research(微软研究院)

AI总结 研究针对现代大语言模型中SwiGLU中间张量物化成本高的问题,提出基于CUTLASS的SM90内核,通过瓦片级融合SwiGLU与GeMM,提升推理速度,验证手工设计的必要性且数值表现优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02622 2026-07-07 quant-ph cs.AI 新提交

COMET: Combinatorial Optimization for Multiplex Editing Targets Via Constraint-Preserving QAOA

COMET:通过保留约束的量子近似优化算法实现多重编辑目标的组合优化

Priyansh Singhal, Sumit Maheshwari, Piyush Joshi

机构 * Microsoft(微软)

AI总结 研究多重CRISPR-Cas9基因编辑中的组合问题,对比基于惩罚项和XY混合器的QAOA方法,发现XY混合器在模拟和硬件测试中表现更优,对约束执行策略进行方法学比较并经实际硬件验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00738 2026-07-07 cs.DL cs.AI 新提交

Phantom References: Hallucinated Citations That Survive Peer Review at Top-Tier Conferences

幻影引用:在顶级会议同行评审中存活的幻觉引用

Mark Russinovich, Ram Shankar Siva Kumar, Ahmed Salem

机构 * Microsoft(微软)

AI总结 本文提出RefChecker工具,通过多源验证和网络搜索复检,发现顶级会议论文中存在少量但可观的幻觉引用(如不存在的文献或作者列表严重不匹配),且同行评审未能完全阻止其进入档案记录。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24633 2026-07-07 cs.RO 新提交

Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation

超越单调进展:面向机器人模仿的重试监督值学习

Xinyao Qin, Junjie Lu, Kaixin Wang, Chuheng Zhang, Sinjae Kang, Kimin Lee, Min Xu, Bin Liang, Jun Yang, Li Zhao

机构 * Tsinghua University(清华大学) University of Technology Sydney(技术科技大学) Microsoft Research Asia(微软亚洲研究院) KAIST(韩国科学技术院)

AI总结 针对机器人模仿学习中演示数据包含错误与修正行为的问题,提出ReTVL框架,利用重试事件作为稀疏监督学习对错误敏感的值函数,通过全局进度校准与局部偏好学习捕捉错误-恢复结构,优化下游行为克隆。

详情

展开后加载摘要…

URL PDF HTML 收藏