见闻文章网 手机版
热门文章
  • 甘井子区举办“赋能争先 聚力攻坚”知行学堂第二期培训
    为强化春季火灾防控工作,全面提升干部群众消防安全管理能力和安全意识,3月21日,区委组织部举办“赋能争先 聚力攻坚”知行学堂第二期“消防应急”专题培训。 按照“大力支持业务骨干走上讲台”的工作要求,本次培训邀请区应急管理局党委书记、局长和区消防救援大队大队长分别以《防救结合强化基层应急管理工作》《基
  • 续航灭霸来了!7300mAh大电池+90W快充,月底发!
    近日,vivo Y300 Pro+ 配置被曝光了。此前 Y300 系列凭借出色续航与亲民价格已积累不少好口碑。Y300 Pro+的配置从处理器性能提升到影像优化,可以说是亮点十足。小雷先带大家看看外观。Y300 Pro+ 延续了前代 Y300 Pro 的全等深微四曲屏,配备 6.77 英寸屏幕,具备
  • 《落子未来》!大连新势力崛起
    今晚8点大连新闻综合频道,锁定系列纪录片《落子未来》第三集《引智聚企》,带您走进具有强大创新能力的全球独角兽企业和极具创新发展潜质的瞪羚企业,了解大连创新矩阵的重要力量,解码科技创新和产业创新深度融合。看这片科创热土如何以科技为笔以产业为卷绘就一幅中国式现代化的创新蓝图全球独角兽——不同“钒”响位于
  • 今日开票!2025 中超大连英博主场首战在即,燃爆梭鱼湾!
    来源:大连英博足球俱乐部、甘井子文旅▼▼
最新文章
  • 潍坊寒亭固堤街道全面开展“九小场所”安全隐患排查
    大众网记者 郑健 通讯员张萍 庞昕宇 潍坊报道为切实加强“九小场所”安全管理,坚决防范和遏制安全事故发生,潍坊寒亭固堤街道深入开展“九小场所”安全隐患排查专项整治行动,全力筑牢安全屏障,保障群众生命财产安全。细化部署,紧扣安全“责任链”组织召开专项行动部署会,针对当前“九小场所”突出问题,制定《“九
  • 4.5亿元!刷新陕西全省纪录
      西安网讯(记者 黄敏)4月30日,经发控股旗下西安经开金融控股有限公司(简称“经开金控”)在上海证券交易所成功发行2025年非公开发行中小微企业支持债券(第一期),发行规模4.5亿元,期限3+2年,票面利率2.90%,刷新同期省内开发区同评级、同期限、无担保最低融资成本纪录,彰显“经发实力”! 
  • 芜湖又有两处旧址入选20世纪建筑遗产项目
    【来源:大江晚报】今年是中国加入《保护世界文化和自然遗产公约》40周年。5月25日,由中国文物学会20世纪建筑遗产专业委员会、北方工业大学等单位联合主办的“守护传承 阐释创新——第十批20世纪建筑遗产项目推介暨城市更新理论与实践研讨会”在北京举行。研讨会上推介了100个第十批20世纪建筑遗产项目,安
  • 全链条全过程治理食品添加剂滥用问题
    【来源:中国质量报】□ 胡立彪食品添加剂滥用问题既是民生痛点,也是食品安全监管的重点、难点。日前,国务院食安办、市场监管总局等6部门印发《食品添加剂滥用问题综合治理方案》(以下简称《方案》),聚焦人民群众关心的超范围、超限量滥用食品添加剂等问题,在全国范围内部署开展综合治理行动,通过构建“源头防控、
您的位置: 首页 > 实时讯息 >

刷新世界记录,40B模型+20万亿token,散户组团挑战算力霸权

0次浏览     发布时间:2025-05-27 09:45:00    

全球网友用闲置显卡组团训练大模型。40B大模型、20万亿token,创下了互联网上最大规模的预训练新纪录!去中心化AI的反攻,正式开始。OpenAI等巨头的算力霸权,这次真要凉了?

互联网上最大规模的预训练来了!

Nous Research宣布正式推出Psyche网络(Psyche Network),通过去中心化方式革新人工智能(AI)训练。

Psyche网络利用区块链技术,汇聚全球计算资源,成功启动了40B参数大语言模型Consilience的预训练任务,总计20万亿token,创下了迄今为止互联网上最大规模的预训练纪录。

大语言模型Consilience采用DeepSeek V3的多头潜在注意力(MLA)架构,相较于Llama使用的GQA架构更具表达力,同时通过优化QKV投影矩阵减少计算开销。

三种注意力的对比

Psyche利用全球闲置的计算资源(如4090、A100和H100等消费级GPU),大幅降低训练成本。

通过并行实验,Psyche鼓励开源社区提出新的模型架构和训练方法,未来可能催生更多创新。

Psyche网络技术原理图,核心在于DisTrO优化器与Solana区块链

过去,人们总觉得「AI模型的去中心化训练」不过是一种幻想,尤其在那些超越了爱好者规模的语言模型面前更是如此。

但几项关键技术突破——尤其是并行化和强化学习——正在逐渐打破这种局限,让除了OpenAI、Anthropic这类大公司之外的小型团队也开始进入这个赛道。

现在看来,聪明的算法可以弥补基础设施的不足,而像Nous Research这样的去中心化参与者正希望抓住这个机会。

砸碎算力墙

近年来,AI模型的训练逐渐被大型科技公司垄断。

训练一个前沿模型需要数千个高性能GPU和超高带宽的集群,这使得普通研究者或小型团队几乎无法参与。

这种集中化趋势不仅限制了创新,还可能导致少数科技去投垄断甚至控制AI模型。

集中式AI,可能会少数科技巨头「比你更了解你自己」。

Hermes系列中规模最大的模型——Hermes 3 405B,是在基础的Llama 3.1模型上进行微调完成的。

整个训练过程动用了128块H100 GPU,耗时约16小时(总计约2,086GPU小时)。

从成本上看其实并不离谱——目前租用8块H100的计算节点每小时大约在16到24美元之间,因此一次完整训练的开销大约在5,000美元左右

作为Nous Research Hermes系列的最新迭代Hermes 3 405BLlama-3.1 405B的全参数微调模型

但如果我们想更进一步,想得更大呢?

毕竟,Hermes目前还是依赖Llama作为基础模型。

如果我们不再依赖已有的模型,而是从零开始构建自己的基础模型,那我们就需要更庞大的“船”了。

要以更大规模、低成本地实现类似的训练成果,确实面临不少挑战,尤其是当训练从集中化的GPU集群转向基于互联网的去中心化网络时。

Nous Research提出了Psyche网络的解决方案:通过去中心化的方式,让全球的计算资源参与AI模型训练,降低进入门槛,推动AI发展的民主化。

Nous Research的Psyche网络成功实现了去中心化的AI训练,开创了一个全新的模式。

Psyche不仅降低了AI开发的门槛,还推动了全球协作和创新。

Consilience模型的预训练只是起点,未来Psyche网络有望成为AI民主化的重要基石,为开源社区和小型团队提供与科技巨头抗衡的机会。

用DisTrO解决带宽瓶颈

在去中心化训练中,网络带宽一直是最令人担忧的问题之一。

在传统的数据中心里,GPU之间通过极高带宽的连接(如NVLink或InfiniBand)相连,带宽可达每秒几百Gb(千兆位)。

而相比之下,互联网上的志愿者节点,往往只有几十甚至几百Mb(兆位)每秒的带宽。

质疑者认为,这种高达100倍甚至1,000倍的带宽差距,会让跨互联网的AI训练变得无比缓慢、几乎不可能。

毕竟,传统的训练方式需要GPU之间持续地交换更新信息,而如果试图用普通家用网络来完成这些通信,很可能会陷入「灾难级」的训练体验。

在此前对DeMo(Decoupled Momentum Optimization)的研究基础上,Nous推出的DisTrO技术,能够让所有训练节点保持高度同步,同时将所需带宽降低1,000到10,000倍

2024年12月,Nous与多位合作伙伴一起,在封闭测试网中,训练了一个150亿参数的基础模型,并成功验证了多项理论设想:

首次将DisTrO优化器系列大规模应用于训练任务

验证了节点中途掉线和新增节点时的容错能力

证明了增加训练节点确实能提升整体训练速度

这次实验标志着分布式、去中心化训练迈出了从理论走向现实的关键一步。

区块链+AI

在硅谷的一些圈子里,「加密」这个词几乎成了贬义词,而Nous一直努力保持与AI开发者之间的开放交流桥梁不被切断。

也正因如此,他们这次将Psyche搭建在区块链上,是一个值得关注的重要转变

Psyche将成为Nous用于预训练、微调和部署下一代模型的平台。

通过将技术栈迁移到Solana区块链,Nous希望释放区块链的以下三大优势:

无需许可:任何人都可以贡献计算资源

弹性与高可用性:不再依赖中心化基础设施

激励机制:协调并奖励为网络作出贡献的参与者

将这一协议向整个市场开放,意味着任何人都能拥有其中的一部分。而其潜在的扩展性之大,显然已经让不少极客兴奋不已。

计划概览

Nous的初期目标是先上线一个封闭测试网(Phase 0),验证是否能在Solana上运行一个更大规模、分布式、具备容错能力的DisTrO系统。后续阶段会逐步引入更高级的功能。

在Phase 0阶段,贡献者可以携带自己的GPU加入进来(明确提到支持4090、A100和H100等型号),并开始获得奖励。此阶段会对参与者进行筛选,以防止恶意行为者加入。

一旦系统稳定运行,权限将逐步开放,允许不同类型的计算资源(无论是专业的还是消费级的)自由接入网络,协助训练Llama、Diffusion等不同类型的模型架构。

强化学习后训练阶段

强化学习(Reinforcement Learning,RL)不依赖于预先准备好的数据集,而是通过模型与环境直接互动来学习。

每个节点如果做出有助于模型进化的行为,就会获得正反馈,反之则获得负反馈。

由于这些节点可以异步运行,分布式训练在强化学习框架下反而运行良好。

每个节点可以独立行动,收集经验,并定期与其他节点分享进展。

这极大缓解了传统训练中常见的「同步难题」,特别是在硬件能力和网络延迟差异大的情况下。

通过RL,Psyche上的预训练模型可以进一步学会推理能力和领域知识。

而每个Psyche节点在训练过程中的表现都将影响它的奖励:计算能力更强或使用了更先进训练方法的节点,可能会获得更多代币激励。

区块链:回归初心

在常常被斥为「过度炒作又频频令人失望」的区块链生态中,能看到真正的创新成果,确实令人欣慰——简直让人「冷漠的灵魂也重新燃起了热情」。

这一切,真的令人感到振奋。

Nous并不是一开始就拥抱区块链技术的,相反,他们几乎是被「拖着、踢着、喊着」走上了这条路——

但原因很简单:区块链确实是解决他们问题最合适的工具

他们需要一种方式,不论对方来自哪里,都能吸引计算资源与人才并进行公平支付;区块链,在这一点上表现得无比出色。

他们需要一种手段,能够协调并扩展大规模训练任务;而协调与扩展,正是区块链技术的「第二天性」。

他们还需要一种不受停电、封禁、宕机等影响的托管机制,能让项目「打不死」、无法被关闭;在这方面,区块链(这次不再是讽刺)也的确提供了最可靠的保障。

而最值得欣慰的是:这一次,人们选择区块链,不是出于投机炒作,而是出于对实际问题的认真思考与真实需求的回应。

如果Psyche成功了,它不仅将证明去中心化训练是切实可行的,更是回归初心:为取代的集中化计算,提供了强有力的工具

参考资料:

https://x.com/NousResearch/status/1922744483571171605

https://nousresearch.com/nous-psyche/

https://x.com/563defi/status/1909976170990313594

本文来自微信公众号“新智元”,作者:新智元,36氪经授权发布。

相关文章
  • 警方通报:广州某科技公司遭网攻系台湾地区黑客所为
    发布日期: 2025-05-27 10:01:00
    5月20日,广州市公安局天河区分局发布警情通报称,广州某科技公司遭境外黑客组织网络攻击,公安机关立即开展调查,提取相关攻击程序样本,全面固定相关涉案证据,并组织专业技术团队开展技术溯源。近日,记者从广州市公安局天河区分局了解到,公安机关高度重视此次境外黑客组织网络攻击事件,立即组织技术团队对提取的攻
  • 刷新世界记录,40B模型+20万亿token,散户组团挑战算力霸权
    发布日期: 2025-05-27 09:45:00
    全球网友用闲置显卡组团训练大模型。40B大模型、20万亿token,创下了互联网上最大规模的预训练新纪录!去中心化AI的反攻,正式开始。OpenAI等巨头的算力霸权,这次真要凉了?互联网上最大规模的预训练来了!Nous Research宣布正式推出Psyche网络(Psyche Network),通
  • 高中女生被造黄谣,法院判平台赔8000元
    发布日期: 2025-05-26 07:38:00
    高中女生被造黄谣,法院判平台赔8000元北京互联网法院:平台未及时有效采取必要措施应承担连带责任编者按未成年人是祖国的未来、民族的希望。人民法院高度重视对未成年人权益的司法保护工作,持续深化涉未成年人刑事、民事、行政案件综合审判改革,以最大限度消除影响未成年人身心健康的不利因素。在“六一”国际儿童节
  • 在临沂网评丨“沂蒙二姐”的泥土诗行:从崮乡果园到央视舞台的精神回响
    发布日期: 2025-05-23 09:40:00
    编者按:在中共临沂市委网信办的指导下,临沂市融媒体中心(传媒集团)“在临沂”客户端品牌栏目“在临沂网评”全方位集纳、展示全市优秀网络评论作品,剖析社会热点,回应群众关切,广泛凝聚共识,汇聚奋进力量,努力在全市范围打造有态度、有深度、有温度的网络评论生态圈,传播临沂好声音,汇聚临沂正能量。在沂蒙山腹地
  • “国家网络身份认证”,申领攻略来了!
    发布日期: 2025-05-23 08:36:00
    网购时要用到实名信息,但又不想透露个人隐私?生活中,你是否也有过这样的烦恼?近日,在第十二届中国国际警用装备博览会上,公安部展出的国家网络身份认证公共服务平台引发广泛关注。这个由公安部打造的“数字保镖”,每天能减少2000多万次身份信息泄露风险。1“网号+网证”给身份信息“加密”国家网络身份认证公共