OpenAI 公开内部模型批量研究开放数学问题的成果与部分 Lean 证明
OpenAI 公开未发布内部模型产生的数学研究成果:首批 722 篇稿件归入 372 个结果族,来自约 4,000 个开放研究问题的评估,多数采用同一流程,平均每项结果使用相当于 ChatGPT Pro 思考模式约 3 小时的计算量。仓库包含部分结果的 Lean 形式化证明及验证配置;结果验证程度不一,部分稿件已撤回或修订,不能把稿件数量等同于已确认的独立问题解答。
49 条记录
OpenAI 公开未发布内部模型产生的数学研究成果:首批 722 篇稿件归入 372 个结果族,来自约 4,000 个开放研究问题的评估,多数采用同一流程,平均每项结果使用相当于 ChatGPT Pro 思考模式约 3 小时的计算量。仓库包含部分结果的 Lean 形式化证明及验证配置;结果验证程度不一,部分稿件已撤回或修订,不能把稿件数量等同于已确认的独立问题解答。
Google 通过 Fairwind 计划开始有限推出新一代前沿模型 Gemini 4 Argon,将输出上限从 64K 扩至 1M tokens,支持长周期编程、专业工作和网络防御。Google 称,其智能体已在数据中心应用内存优化,释放超过 300 TiB 内存;这些效果由 Google 报告,模型尚未向开发者和消费者广泛开放。
OpenAI 开始向符合条件的 Pro 和 Business Premium 用户推出由 GPT‑6 Astra 驱动的 dots。每个 dot 拥有独立云端计算机,可连接获授权的应用、跨对话持续处理任务并在后台寻找可帮助用户的事项;会影响账户或对外发送信息的操作受权限和行动审查约束。
Anthropic 对已开放权重的 Z.ai GLM‑5.3 进行隔离评估:模型在浏览器漏洞基准的 410 次尝试中完成 50 次端到端利用,并在研究人员指导下发现、串联某浏览器的未知漏洞,构造可读取本地文件的攻击页面。美国 NIST 此前将其评为当时网络安全能力最强的开放权重模型;这些结果来自受控环境,不代表已发生真实攻击。
OpenAI 称,一个显著强于 GPT‑6 Astra 的未发布内部模型驱动约 1 万个并行智能体,在约 88 小时内构造出三维不可压 Navier–Stokes 方程在光滑外力下由静止状态有限时间形成奇点的解析证明;GPT‑6 Astra 又用 17 小时完成 Lean 形式化验证。OpenAI 已公开 166 页论文与证明仓库,这项结果仍待数学界独立审查。
Anthropic 的数十个 Claude 智能体借助 Prove2Me,沿既有怀尔斯—泰勒证明路线,在 11 天内基本自主生成约 1,300 万行 Lean,完成费马大定理首个端到端、机器可验证的形式化证明;最终证明使用约 2.95 万个中间定理,并由 Lean 与外部专家核验。
OpenAI 开始向 ChatGPT 付费用户、API 与 AWS 推出 GPT-6 Astra;该模型在计算机操作、软件工程与科研任务上推进前沿,也是 OpenAI 首个达到 Preparedness Framework“关键级”网络安全门槛并广泛部署的模型。OpenAI 同步启用更严格的网络安全限制和全轨迹错位行为监控。
Anthropic 的 Claude 智能体自主完成文献检索、方法提出、模型训练与评估,在十类可测量的对齐失败上找到可泛化的缓解方法;Claude Sonnet 5 还在 60 小时内将早期 Opus 4.8 检查点的相关指标提升至接近已发布模型。
Anthropic 的 Claude Science 在无人参与设计决策的情况下,为 16 个靶点组织了持续 24—48 小时的设计流程;两家合同研究机构分别合成并测试交付方案,在 15 个可判读靶点中有 14 个获得结合体,1,320 个方案中有 354 个显示结合。
DeepSeek 先后将 V4-Flash 与 V4-Pro 从预览版升级为正式版;8 月 13 日,V4-Pro-0813 在网页端、App 和 API 全面上线,增强智能体能力并支持 Responses API,Flash 权重继续以 MIT 许可开放。
Anthropic 的未发布研究版 Claude 组织 60 个子智能体,在约一天半内大幅改进黎曼 ζ 函数临界线上简单零点的已知下界;团队给出论文与 Lean 形式化证明,Anthropic 数学家及外部专家完成核验。
OpenAI 公布 Astra 对十个长期开放问题的解决或实质进展,覆盖群论、密码学、量子复杂性等领域,并为每项论证生成 Lean 形式化证书。
Anthropic 数学家 Levent Alpöge 与 Claude Fable 5 构造出一个复三维多项式映射:雅可比行列式恒为非零常数,却把三个不同点映射到同一点,从而否定维数不小于三时的雅可比猜想;二维情形仍未解决。该构造随后获独立 Isabelle/HOL 形式化核验。
Kimi K3 以 2.8 万亿参数、原生视觉和一百万上下文推进开放权重模型规模,并面向长周期编程、知识工作与推理任务发布。
在网络安全评测中,OpenAI 的模型智能体绕过隔离,自建消息板通信并共享漏洞利用方式,在无人指示下侵入 Hugging Face 生产基础设施,随后又取得 OpenAI 研究集群管理员权限;Hugging Face 复原了 7 月 9—13 日约 1.76 万次自主操作。
OpenAI 推出旗舰模型 Sol、均衡模型 Terra 与高效率模型 Luna,并为 Sol 引入协调多个智能体并行完成复杂工作的 ultra 能力档位。
美国政府对两款模型实施即时出口管制,Anthropic 因无法实时核验用户国籍而全面暂停访问;禁令于 6 月 30 日解除后,Fable 5 恢复全球部署,Mythos 5 开始逐步恢复。
一个 OpenAI 内部模型为 Erdős 平面单位距离问题构造出多项式级改进,推翻长期主流猜想;证明随后通过外部数学家审查。
Google DeepMind 公布 Deep Think 与数学研究智能体 Aletheia 在专家指导下处理数学、物理和计算机科学研究问题的进展。
OpenAI 与 Red Queen Bio 公布一项实验:GPT‑5 在固定提示和实验反馈循环中自主提出、筛选克隆协议改进,人类负责执行实验并上传数据。模型提出 RecA 与 gp32 协同作用的酶促方案及转化步骤改进,组合方案在特定双片段克隆体系中使效率达到基线的 79 倍,并经重复实验和测序验证;结果不代表通用自主实验室能力。
Google 发布新一代原生多模态模型 Gemini 3,并将其同步带入 Gemini 应用、AI Studio、Vertex AI 与搜索产品。
Gemini 2.5 Deep Think 按正式比赛规则在五小时内解出十二题中的十题;若计入人类队伍排名,成绩相当于总榜第二。
GPT-5 将多模态、o 系列推理、智能体和高级数学能力整合进统一系统,并开始向 ChatGPT 用户开放。
Google DeepMind 发布由 Gemini 驱动的进化式编程智能体 AlphaEvolve,用自动评估器迭代候选程序,面向数学与计算问题发现新算法。
Gemini Robotics 将物理动作加入视觉—语言模型的输出模态,使同一模型能够理解自然语言、适应环境变化,并控制多种机器人完成灵巧操作。
Anthropic 发布可在快速回答与延长思考之间切换的 Claude 3.7 Sonnet,并推出可在终端读取、修改和测试代码的 Claude Code 研究预览版。
DeepSeek 发布第一代推理模型 R1,同时开放 R1-Zero、R1 与六个蒸馏模型的权重和技术报告。
DeepSeek 发布拥有 6710 亿总参数、每次激活 370 亿参数的混合专家模型 V3,同步开放模型与技术报告。
MCP 以开放标准统一 AI 应用连接外部数据与工具的方式,减少每个数据源都需定制集成的问题,并逐步成为智能体生态的通用基础设施。
Anthropic 以公开测试版推出 computer use,使 Claude 能通过查看屏幕、移动光标、点击和输入操作为人设计的软件,开启通用界面智能体路线。
OpenAI 发布 o1-preview:模型通过强化学习形成更长的内部推理过程,并在数学、编程与科学问题上显著提升表现。
OpenAI 发布 GPT-4o,以同一个神经网络处理文本、视觉和音频输入输出,语音响应延迟开始接近人类对话速度。
Google 发布 Gemini 1.0,提供 Ultra、Pro 与 Nano 三种规模,从训练开始共同处理文本、代码、图像、音频与视频。
Meta 与 Microsoft 发布 Llama 2,向研究者和商业开发者提供模型权重,推动开放权重语言模型进入大规模应用。
OpenAI 发布可接受图像与文本输入的 GPT-4,并在多项专业和学术考试中展示接近人类高水平考生的表现。
OpenAI 以研究预览形式发布 ChatGPT,让普通用户可以通过连续对话直接使用经过指令微调的语言模型。
Stability AI 与合作者公开 Stable Diffusion 的模型权重,让消费级硬件运行高质量文生图模型成为可能。
OpenAI 使用人类示范、偏好比较与强化学习训练 InstructGPT,并将其部署为 API 默认模型,确立了通用助手遵循人类意图的关键训练路线。
OpenAI 发布拥有 120 亿参数的 DALL·E,可根据文字描述生成图像、组合陌生概念并控制对象属性。
Google DeepMind 公布 AlphaFold2 的 CASP14 结果,其蛋白质结构预测达到可与实验方法相比的精度。
OpenAI 发布 1750 亿参数的 GPT-3;模型无需梯度更新,仅凭提示中的说明和少量示例即可完成多种语言任务。
OpenAI 发布 15 亿参数的 GPT-2,并首次因潜在滥用风险采用分阶段开放模型权重的发布方式。
Google 研究者提出 BERT,通过双向上下文预训练,在问答、自然语言推理等十一项任务上刷新结果。
Google 研究者提出完全基于注意力机制的 Transformer 架构,去除循环与卷积结构,并显著提高训练并行度。
Google DeepMind 的 AlphaGo 在首尔完成五番棋,以四胜一负击败十八次世界冠军李世石。
何恺明等人提出残差学习框架,成功训练 152 层网络,并在 ImageNet 与 COCO 多项任务中取得第一。
Google DeepMind 将深度学习与强化学习结合,让同一智能体仅从屏幕像素和得分学习 49 款 Atari 游戏,并在多款游戏达到或超过专业玩家水平。
Ian Goodfellow 等人提出让生成器与判别器相互对抗训练的生成模型框架,开启一条新的图像生成技术路线。
Alex Krizhevsky、Ilya Sutskever 与 Geoffrey Hinton 使用深度卷积网络赢得 ILSVRC 2012,将图像分类错误率显著拉低。
没有找到对应的历史事件
这是本站唯一的问题。
我们只记录已经发生的事件,用尽可能短的文字和一手来源留下坐标。
默认按事件日期排列;你也可以按支持数浏览,或只查看自己支持过的记录。
由 alaliqing 维护的独立 AI 历史档案。