Anthropic藏了更强模型Model 2,上调风险评级,IPO前释放安全信号

WEB3快讯2小时前发布 madweb3
0 0

新模型浮出水面

在8月14日, OpenAI发布了一份公司级风险报告, 这份报告有186页, 在该报告中首次披露了其内部模型Model 2的存在, 公司明确表明Model 2的能力超过了已公开的旗舰模型, 然而其跃升幅度并不如从之前一个版本到Model 5的提升幅度那般大, 更为重要的是, 公司当前并无计划把这个新模型对外发布。

报告表明, Model 2在内部已被大量运用于编码, 以及Agent工作, 还有数据生成。当下, 绝大多数合并到生产代码库的代码是由Model 2编写而成的。公司判定, AI已显著提升了内部研发速度, 不过整体速度尚未达到没有AI时速度的两倍, 而这也是公司所设定的预警线之一。

Anthropic藏了更强模型Model 2,上调风险评级,IPO前释放安全信号

性能指标对比

公司运用两项内部指标, 来判断Model 2的领先程度, 第一项含有449个真实研发问题, 是内部评测, 对于此项评测, Model 2得分62.8%, 比Model 5的50.3%高, 也比更早版本的54.%高, 公司评估, 一个真正可全面取代公司技术人员的系统, 得分至少要达到85%。

第二项是版本的Epoch Index。有限数量的数据显示, Model 2比Model 5高出大概1.5分, 不过误差区间比较大, 其增幅小于从前面一个版本到Model 5的提升幅度。这些数据说明Model 2的确更强悍, 然而进步幅度正处于放缓状态。

安全失败案例曝光

报告并行公布了众多起内部安全流程失利事例, 当中一起事故关联生物安全分类器。自2025年5月起至2026年4月止, 一个仅作内部运用的标识反常关闭了抑制模型产出危险生物信息的分类器, 影响到大约5万名外部承包商, 牵涉大约1.33亿次消息交互。

同一个标志, 也关闭了进行记录的功能, 致使该漏洞在将近一年的时间里, 没有被正常地监控察觉。之后的审查, 没有发现实际存在滥用的证据, 然而这却暴露出了内部安全机制自身的脆弱性。公司与此同时, 把高风险场景之下, 模型出现误对齐引出灾难性危害的风险评级, 从非常低提升到了低。

评测天花板问题

报告认可了一个更深入的问题, 最具针对性的基于任务的评测已然告罄, 难以再察觉模型能力水平的提高, 这表明领会自家模型的能力以及风险正日益艰难, 往昔衡量模型能力的部分关键实战测试已达极限, 无法再切实分辨不同模型能力的优劣。

理由涵盖模型自身进步迭代速率快速, 还有传统测试已然难以跟上模型能力增长速度。这种现象身处整个AI行业都存在着, 然而OpenAI身为领头羊率先于官方报告里公开承认了这一困境, 展现出其对于透明度一定的坚持。

IPO前的估值压力

资本市场对OpenAI估值进行重新测算, 构成了这份风险报告的发布背景。第二季度初步营收超过115亿美元, 在与去年同期7.87亿美元相比较时, 增长幅度至少达到14倍这么多, 并且也高于第一季度的47.3亿美元, 此阶段公司已实现调整后营业利润转变为正值这种情况。今年5月年化营收突破470亿美元。

消息是, 行业预计企业将于10月可能以约2万亿美元甚至更高的估值上市在最近的市场里, 企业没有公开确认具体估值目标。但是不过上一轮估值约9650亿美元, 超过同期xAI的 估值为约8520亿美元。惊人的近乎翻倍和跳跃的增速需要构建可持续的前沿模型性能与商业订单、从商业订单转换的事情转化的基础之上。

竞争威胁与现实挑战

在IPO之前用于高估值方面的压力测试, 在投资者所参与举行的会议里, 率先察觉到存在着裂缝。投资者们正将关注点聚焦追问三个重要问题: 其一为中国开源模型带来的竞争方面面临的威胁, 其二是与美国政府之间所呈现的紧张关系, 其三是有过上市之后股价大幅度暴跌这样的前车之鉴。虽然在美国的企业里付费渗透率已然达到了43.5%, 这一数据高于Anthropic的39.7%, 然而其所具有的最先进的Fable 5, 仅仅占据公司模型相关支出的比率为11.4%。

正在加速追赶的是位于大洋彼岸的中国开源模型 , 在发布风险报告的同一天 , 智谱发布了 GLM – 5.3 , 它在多项基准测试里位列开源模型第一名 , 其编程与智能体能力近乎接近 OpenAI Fable 5 , 此前月之暗面发布了 2.8 万亿参数的 Kimi K3 , xAI V4 Pro正式版上线登场 , 这时中国开源模型下载的占比已经超过美国这般模样。

OpenAI有没有可能凭借一份风险报告使资本市场趋于稳定? 对于开源模型和闭源模型的未来, 你究竟更倾向于看好哪一个?

© 版权声明

相关文章