首页

嗨,欢迎来到品牌网

全国服务热线:

品牌商入口
关注:  

扫一扫关注品牌网

比CPU/GPU快30倍!Google TPU机器学习芯片揭秘

2017-04-06   18:58:17

作者:z

处理 可以 内存
比CPU/GPU快30倍!Google TPU机器学习芯片揭秘导读:

在Google发布TPU一年后,这款机器学习定制芯片的神秘面纱终于被揭开了。昨日,Google资深硬件工程师NormanJouppi刊文表示,Google的专用机器学习芯片TPU处理速度要比GPU和CPU快15-30倍(和TPU对比的是IntelHaswellCPU以及NVIDIATeslaK80GPU),而在能效上,TPU更是提升了30到80倍。从这次发布的测试结果来看,T

在Google发布TPU一年后,这款机器学习定制芯片的神秘面纱终于被揭开了。

昨日,Google资深硬件工程师Norman Jouppi刊文表示,Google的专用机器学习芯片TPU处理速度要比GPU和CPU快15-30倍(和TPU对比的是IntelHaswell CPU以及NVIDIA Tesla K80 GPU),而在能效上,TPU更是提升了30到80倍。

从这次发布的测试结果来看,TPU似乎已经超出了业界的预期,但是藏在这一芯片背后的内部架构究竟有什么秘密呢?我们从Jouppi此前发布的论文当中,可以找到答案。

比CPU/GPU快30倍!Google TPU机器学习芯片揭秘1

据雷锋网了解,早在四年前,Google内部就开始使用消耗大量计算资源的深度学习模型。这对CPU、GPU组合而言是一个巨大的挑战,Google深知如果基于现有硬件,他们将不得不将数据中心数量翻一番来支持这些复杂的计算任务。

所以Google开始研发一种新的架构,Jouppi称之为“下一个平台”。Jouppi曾是MIPS处理器的首席架构师之一,他开创了内存系统中的新技术。三年前他加入Google的时候,公司上下正在用CPU、GPU混合架构上来进行深度学习的训练。

Jouppi表示,Google的硬件工程团队在转向定制ASIC之前,早期还曾用FPGA来解决廉价、高效和高性能推理的问题。但他指出,FPGA的性能和每瓦性能相比ASIC都有很大的差距。

他解释说,TPU可以像CPU或GPU一样可编程,它可以在不同的网络(卷积神经网络,LSTM模型和大规模完全连接的模型)上执行CISC指令,而不是为某个专用的神经网络模型设计的。

一言以蔽之,TPU兼具了CPU和ASIC的有点,它不仅是可编程的,而且比CPU、GPU和FPGA拥有更高的效率和更低的能耗。

TPU的内部架构

比CPU/GPU快30倍!Google TPU机器学习芯片揭秘2

该图显示了TPU上的内部结构,除了外挂的DDR3内存,左侧是主机界面。指令从主机发送到队列中(没有循环)。这些激活控制逻辑可以根据指令多次运行相同的指令。

TPU并非一款复杂的硬件,它看起来像是雷达应用的信号处理引擎,而不是标准的X86衍生架构。

Jouppi说,尽管它有众多的矩阵乘法单元,但是它比GPU更精于浮点单元的协处理。另外,需要注意的是,TPU没有任何存储的程序,它可以直接从主机发送指令。

TPU上的DRAM作为一个单元并行运行,因为需要获取更多的权重以馈送到矩阵乘法单元(算下来,吞吐量达到了64,000)。Jouppi并没有提到是他们是如何缩放并行结构的,但他表示,使用的主机软件加速器都将成为瓶颈。

从第一张图片可以看出,TPU有两个内存单元,以及一个用于模型中参数的外部DDR3 DRAM。参数进来后,可从顶部加载到矩阵乘法单元中。同时,可以从左边加载激活(或从“神经元”输出)。那些以收缩的方式进入矩阵单元以产生矩阵乘法,它可以在每个周期中进行64,000次累加。

毋庸置疑,Google可能使用了一些新的技巧和技术来加快TPU的性能和效率。例如,使用高带宽内存或混合3D内存。然而,Google的问题在于保持分布式硬件的一致性。

TPU对比Haswell处理器

在和Intel“Haswell”Xeon E5 v3处理器来的对比中,我们可以看到,TPU各方面的表现都要强于前者。

在Google的测试中,使用64位浮点数学运算器的18核心运行在2.3 GHz的Haswell Xeon E5-2699 v3处理器能够处理每秒1.3 TOPS的运算,并提供51GB/秒的内存带宽;Haswell芯片功耗为145瓦,其系统(拥有256 GB内存)满载时消耗455瓦特。

相比之下,TPU使用8位整数数学运算器,拥有256GB的主机内存以及32GB的内存,能够实现34GB/秒的内存带宽,处理速度高达92 TOPS ,这比Haswell提升了71倍,此外,TPU服务器的热功率只有384瓦。

比CPU/GPU快30倍!Google TPU机器学习芯片揭秘3

除此之外,Google还测试了CPU、GPU和TPU处理不同批量大小的每秒推断的吞吐量。

比CPU/GPU快30倍!Google TPU机器学习芯片揭秘4

如上图所示,在小批量任务中(16),Haswell CPU的响应时间接近7毫秒,其每秒提供5482次推断(IPS),其可以实现的比较大批量任务(64)每秒则可以完成13194次推断,但其响应时间为21.3毫秒。相比之下,TPU可以做到批量大小为200,而响应时间低于7毫秒,并提供225000个IPS运行推理基准,是其峰值性能的80%,当批量大小为250,响应时间为10毫秒。

不过需要注意的是,Google所测试的Haswell Xeon处理器似乎也不能完全说明问题,IntelBroadwell Xeon E5 v4处理器和比较新的“Skylake”Xeon E5,每核心时钟(IPC)的指令比这款处理器提升了约5%。在Skylake是28核,而Haswell为18核,所以Xeon的总体吞吐量可能会上升80%。当然,这样的提升与TPU相比仍有差距。

比较后雷锋网需要强调的是,TPU是一个推理芯片,它并非是要取代GPU,可以确定的是,TPU与CPU一起使用对训练分析更加有益,但对于CPU制造商而言,如何研发出像ASIC一样兼顾性能和能效的芯片是现在以及未来要做的。

Jouppi表示GoogleTPU已经开始出货,而Intel这些芯片商也将面临更大的挑战。

免责声明

扫一扫添加公众号本文推荐比CPU/GPU快30倍!Google TPU机器学习芯片揭秘仅代表作者观点,不代表本网站立场。本站对作者上传的所有内容将尽可能审核来源及出处,但对内容不作任何保证或承诺。请读者仅作参考并自行核实其真实性及合法性。如您发现图文视频内容来源标注有误或侵犯了您的权益请告知,本站将及时予以修改或删除。

猜您喜欢

相关新闻

  • 比CPU/GPU快30倍!Google TPU机器学习芯片揭秘

    在Google发布TPU一年后,这款机器学习定制芯片的神秘面纱终于被揭开了。昨日,Google资深硬件工程师NormanJouppi刊文表示,Google的专用机器学习芯片TPU处理速度要比GPU和CPU快15-30倍(和TPU对比的是IntelHaswellCPU以及NVIDIATeslaK80GPU),而在能效上,TPU更是提升了30到80倍。从这次发布的测试结果来看,T

  • 苹果iPad2比ipad快5倍

    苹果iPad2:相对于一代产品,二代产品有了很多项众望所归的升级。无论是重量的减轻还是体积的减小都体现了苹果设计师出色的工艺设计水准。摄像头的加入也使得iPad终于得以加入FaceTime家族。推荐给那些对iPad期待许久的苹果fans。

  • 2018年10大半导体芯片、显卡芯片、CPU芯片品牌排行榜

    201810大半导体芯片、显卡芯片、CPU芯片品牌排行榜,其中10大芯片品牌排行榜中,有6家企业来自美国,也体现了中国芯片与美国之间的差距,加油中国!

  • iPhone 7或支持WiGig技术 它竟然比WiFi快10倍!

    6月7日消息,关于苹果iPhone7的传闻不少,但大多也是集中在外观变化和配置升级方面,很难让人有“苹果再一次改变世界”的惊叹,而我们很是期待苹果能够加入些黑科技什么的。很应景地,国外有分析师就带来了这么一则猛料WiGig,苹果iPhone7可能支持全新的WiGig无线技术。报道称,芯片制造商博通公司CEOHockTan曾在财报电话会议上表示,公司准备好了接受下一代iPhone订单

  • 比Google Glass更好?未来智能耳机亮相

    它比GoogleGlass佩戴更舒服,也不会挡住正常的视线。GoogleGlass曾风光地出现,不过由于各种因素,似乎并没有得到太大的认可。但是,GoogleGlass的出现开辟了一条全新的智能设备道路,那就是智能头戴设备。近日,设计师JaeyongLee设计了一款新型概念产品,他没有从眼镜入手,而是选择了耳机,这是一款智能耳机。它比GoogleGlass佩戴更舒服,也不会挡

  • 学习英语,能力比应试重要

    “近一段时间网传“高考取消英语”引发了强烈的社会热议!”2017年英语退出高考?近日,有关“中国教育学会原会长顾明远称高考改革方案2017年实施,英语将退出统考”的报道成为关注热点。对此,教育部发言人称,考试招生制度改革,事关千万学子和广大群众切身利益。目前,教育部正在前期深入调研的基础上,紧锣密鼓地研究、制定和完善考试招生制度改革方案。方案力求充分考虑高考改革的复杂性、周期性和长期性,会

  • 三星HBM 2!AMD 分享Vega GPU芯片结构图

    根据Videocards的有关消息,AMD今天公布了Vega系列GPU的芯片结构图,以透视方式显示内部信息。图中可以看到Vega的HBM2显存与GPU一同封装,不可分割,64组CU单元分为8组,共计4096个流处理器。Vega结构图这颗芯片的HBM2显存代号为GPA022GA2656,可能来自三星。

  • 华为5G专利比苹果多129倍!为追赶进度,苹果打算自己研发芯片?

    6月18日,据媒体报道,分析师郭明錤(Ming-Qi Kuo)作出预测:苹果或将于2020年发布两款5G手机,调制解调器芯片依旧由高通提供。同时,苹果的自研5G芯片或将用于2022年、2023年的iPhone手机。据此,业界指出,苹果想要在5G芯片上有所作为,或许是想要追赶华为的进度

  • 揭秘可调节高度学习桌:如何助力孩子专注学习

    近年来,可调节高度学习桌因其独特的优势,逐渐成为了众多家庭的首选。可调节高度学习桌则通过其精密的升降机制,允许家长根据孩子的身高变化,轻松调整桌面的高度,确保孩子在学习时能够保持正确的坐姿和视距。长时间保持同一姿势学习,容易使孩子感到疲劳和不适,进而影响学习效率和专注力。当孩子处于舒适状态时,他们更容易集中注意力,享受学习的过程。这种积极的学习态度,将极大地促进他们的学业进步和全面发展。

  • 十万现金大奖战华少,比快还比怪

    2012好声音红遍中国,浙江卫视主持人华少被称为中国好舌头!2013千岛湖啤酒给你一个挑战中国好舌头的机会,你敢吗?2013千岛湖啤酒...

加盟排行榜
更多>

相关推荐