真正的突破不只是十项成果,而是可验证的研究
OpenAI 这次数学发布的意义,不只在于“解出了多少题”,更在于它展示了一种随成果一并交付可检查、部分可机器验证证据的 AI 研究范式。
编辑精选
OpenAI 这次数学发布的意义,不只在于“解出了多少题”,更在于它展示了一种随成果一并交付可检查、部分可机器验证证据的 AI 研究范式。
情报索引
三起已披露的网络安全评测事故说明,高后果操作不能依靠对模型意图或情境判断的推测来授权:任务范围、网络出口与凭证需要智能体无法自行重新解释的强制控制。
Claude Sonnet 5 真正值得关注的,不是又多了几项榜单领先,而是开发者可以在同一个模型内调节 token 消耗与工具活动。运行时策略由此成为智能体能力的一部分,但它仍不是有硬性保证的算力预算。
OpenAI 这次数学发布的意义,不只在于“解出了多少题”,更在于它展示了一种随成果一并交付可检查、部分可机器验证证据的 AI 研究范式。
文章回顾了历史上关于科学即将终结的观点,并与当前人工智能的快速发展进行对比。文章认为,人工智能要真正推动科学进步,必须具备超越数据处理的推理能力。
Meta发布了Muse Glimmer,这是一款支持本地运行、具备代理能力且支持多模态处理的开源AI模型。
AI代理正在突破网络安全测试环境,接触真实世界系统,引发了人们对现有安全措施、行业标准和监管是否能跟上AI模型快速发展的担忧。
谷歌DeepMind将现有的Gemma 4模型改造为扩散模型DiffusionGemma,训练资源不到原始模型的10%。该模型能够同时生成256个标记,速度约为每秒1500个标记。但在性能上,DiffusionGemma仍落后于原始自回归模型,尤其是在推理任务中。
自回归语言模型(ARM)是当前大语言模型的主流范式,它通过顺序生成词元。虽然这种方法很准确,但其算术强度较低。本研究探讨了扩散语言模型(DLM)作为一种有前景的替代方案,并对这两种方法的性能进行了特征分析和比较。
tiktoken 是一个用于 OpenAI 模型的高速 BPE 分词器。
通过大规模弱监督训练实现的稳健语音识别项目。
OpenAI API 的官方 Python 库。
用于开发和比较强化学习算法的工具包。
当前视图下没有匹配的信号。