Kimi发布2.8万亿参数K3大模型,性能仅次GPT-5,马斯克点赞

WEB3快讯2小时前发布 madweb3
0 0

算力告急暂停注册

K3发布之后, 热度远远超过了预期, 故而月之暗面紧急地暂停了新用户的注册。对此团队原本是做好了预案的, 然而实际的流量极为庞大, 直接顶到了算力的峰值。

黄震昕有所透露, 那时面临着两难抉择, 如若强行放开注册, 将会把现有付费用户的使用体验造成严重影响, 鉴于要守住老用户的底线, 所以只能暂且关闭新入口。

拒绝低价开源标签

有人存有这样的担忧, 即开源会致使商业回报有所降低, 然而高管却将其称作是“减速主义”。于此, 黄震昕提出反驳, 表示开源并不就意味着必定要便宜。K3达成了在全球范围内处于领先地位的性能, 那么其定价自然而然参考的便是高质量标准。

高盛所出研报表明出, 此情形意味着中国模型着手掌控定价权。摩根士丹利给出的评价称, K3于规模、性能以及价格这些方面均与美国处于领先地位的产品达成了持平状态。开源跟闭源并非相互对立的面, 其中关键在于模型质量如何。

三大创新突破瓶颈

K3性能得以实现飞跃, 源于其底层架构的创新, 首先存在二阶优化器, 它能够使20T的数据呈现出高达40T才能具有的效果效果, 并且训练的成本以及功耗都直接削减一半, 而在数据处于枯竭状态的当下, 这一点具有极为重要的意义。

Kimi发布2.8万亿参数K3大模型,性能仅次GPT-5,马斯克点赞

接着是线性注意力机制, 它解决了长文本处理期间的性能衰减问题 , 上下文窗口扩大至十倍 , 然而训练成本仅仅同步增加了十倍 , 极大地提升了效率。

最后的一项是注意力残差优化, 它对多层网络间的传递起到了改善的作用。正是基于此优化, 那有着2.8万亿参数的模型, 在实现稳定训练的状况下, 其推理效率实现了百分之二十五的提升。

复杂任务游刃有余

K3于处理复杂任务之际展现卓越表现, 诸如历经长达四年之久的芯片行业研究那般。它历经了120多轮展开自我改进, 最终塑造铸就生成涵盖包含图表以及动画的深度报告。

经历的整个流程涉及到数千次对网页的搜索以及数据的抓取, 其间处理了数量上万页的资料。此模型具备把枯燥乏味的证据转变为呈现可视化状态的叙事的能力, 充分展示出了极为强大的逻辑梳理以及信息整合方面的能力。

幻觉即创造力同源

关于媒体所关注的AI幻觉这一问题, 黄震昕坦率表示没办法将其彻底消除, 他觉得幻觉从本质上来说是模型创造力所产生的附带产物, 并且模型越强大, 幻觉所占的比例反倒越低。

在技术层面, 系统进行了布置, 使其有三个Agent去撰写相关内容, 之后会有专门的事实校验员逐个去进行核对, 尽管这样能够使得错误率有所降低, 然而从机制这个角度来看, 想要完全杜绝产生幻觉这种情况是不符合实际情况的。

聚焦高难度生产力

Kimi往后持续秉持开源路径, 不予以私有化部署服务。它那种商业模式参照海外头部企业 , API业务所占百分比高达七成 , 主要是服务像数据平台类的客户。

在产品所涉及的方向领域之中, Kimi不会去触碰跟娱乐以及文生视频相关的内容, 而是长时间地将重点聚焦于编程、 金融、法律等具备高难度特征的场景之上。黄震昕宣称, 大模型参数规模将会持续朝着向上的方向进行拓展, 绝对不会在当前阶段停止脚步于此。

你认为K3的性能展现能不能切实对阵美国顶尖模型? 欢迎于评论区留下话语探讨, 别忘了点赞予以分享呀!

Kimi发布2.8万亿参数K3大模型,性能仅次GPT-5,马斯克点赞
© 版权声明

相关文章