社区
教程
Wiki
注册
登录
创作新主题
社区所有版块导航
Python
python开源
Django
Python
DjangoApp
pycharm
DATA
docker
Elasticsearch
分享
问与答
闲聊
招聘
翻译
创业
分享发现
分享创造
求职
区块链
支付之战
aigc
aigc
chatgpt
WEB开发
linux
MongoDB
Redis
DATABASE
NGINX
其他Web框架
web工具
zookeeper
tornado
NoSql
Bootstrap
js
peewee
Git
bottle
IE
MQ
Jquery
机器学习
机器学习算法
Python88.com
反馈
公告
社区推广
产品
短视频
印度
印度
一周十大热门主题
商建刚:AIGC获得独创性的途径:汇编权 ——评“幻之翼透明艺术椅”著作权侵权案
DeepWiki : github 源码阅读工具
Devin开发团队开源DeepWiki,助你快速读懂所有GitHub代码库
o3精准破译照片位置,只靠几行Python代码?人类在AI面前已裸奔
行业报告丨2025年中国AIGC应用全景图谱报告(附下载)
Python 3.14 t-string 要来了,它与 f-string 有何不同?
nicegui,一个非常好用的 Python 库!
用了8台NAS后,终于扒出了18个神级docker!
在 Docker 里运行 Synology DSM ,体验群晖系统
GitHub实施严格规则阻止中文用户访问 疑似是反爬虫和反抓取
关注
Py学习
»
Git
历史时刻:DeepSeek GitHub星数超越OpenAI,仅用时两个月
机器之心
• 2 月前 • 121 次点击
机器之心报道
机器之心编辑部
开源 AI 世界的里程碑事件!
我们正在见证历史:DeepSeek 项目在全球最大代码托管平台 GitHub 上的 Star 量超过了 OpenAI。
截至本周五下午两点,DeepSeek 旗下热度最高的项目 DeepSeek-V3 大模型 Star 量已达 7.77 万,超越了同平台中 OpenAI 最热门项目。
DeepSeek 项目的星数还在以肉眼可见的速度增长。
去年 12 月 26 日,DeepSeek AI 开源了其最新混合专家(MoE)大语言模型
DeepSeek-V3
,它立即成为通用语言模型的性能标杆,受到了全球 AI 社区热议。
DeepSeek-V3 模型引入了动态注意力机制(Dynamic Attention Mechanism),通过实时调整注意力权重优化文本生成质量。其 MoE 架构共包含 6710 亿参数,但每 Token 仅激活 370 亿参数,大幅降低了计算成本,训练成本仅为同类闭源模型的 1/20。
据技术报告介绍,DeepSeek-V3 的预训练过程只花费 266.4 万 H800 GPU Hours,再加上上下文扩展与后训练的训练共为 278.8 H800 GPU Hours(训练成本 557.6 万美元)。相较之下,Llama 3 的训练预算约为 3930 万 H100 GPU Hours。
图源:https://arxiv.org/pdf/2412.19437
随后在 1 月 23 日,DeepSeek 以 V3 为基础使用强化学习(Reinforcement Learning)驱动重构训练范式,
提出了 DeepSeek-R1
,彻底改变了开源 AI 世界。
DeepSeek R1 性能完全对标 OpenAI o1,与 DeepSeek V3 相比性能有大幅提升,其论文指出纯强化学习可以赋予 LLM 强推理能力,而无需大量监督微调,震动了 AI 业界。
从技术角度来看,DeepSeek 展示了国内科研团队的创新能力,并在 Scaling Laws 之后揭开了大模型发展的新范式,大幅降低了 AI 对算力的依赖,并用自我进化的方式平衡了数据优势。
R1 还支持将推理能力迁移至更小模型,为边缘计算和即时应用开辟了大量的可能性。
由于 OpenAI 自 GPT-3 起并未开源其基础 AI 大模型,目前 OpenAI 的热门开源项目包括 openai-cookbook,即使用 OpenAI API 完成常见任务的示例代码和指南;以及 Whisper,这是一个 2022 年 9 月开源的通用语音识别模型。
除此之外,同属开源大模型的 Llama 系列最高星数达到了 5.75 万,阿里云的 Qwen2.5 有 1.49 万 Star,零一万物的 Yi 有 7800 Star。
DeepSeek V3 和 R1 的推出仿佛为全球大模型社区打了一针强心剂,在 AI 研究领域,围绕 R1 核心强化学习方法 GRPO 的进一步研究已经出现。
DeepSeek 开源的策略也为应用创造了大量机会。目前虽然 DeepSeek App 官方报告正在受到高频次网络攻击,但仅在国内就有阿里云、华为云、腾讯云、百度智能云、360 数字安全、云轴科技等多个平台宣布上线了 DeepSeek 大模型,方便各路开发者调用。
在海外,英伟达、亚马逊和微软云服务也宣布接入了 DeepSeek R1。
DeepSeek 系列模型被公认为是目前最先进的大语言模型之一,随着技术开源的推动,我们或许将见证生成式 AI 更快的发展。
© THE END
转载请联系本公众号获得授权
投稿或寻求报道:liyazhou@jiqizhixin.com
Python社区是高质量的Python/Django开发社区
本文地址:
http://www.python88.com/topic/178818
121 次点击
登录后回复