本集節目探討AI晶片技術的演進與未來趨勢,由主持人與耐能智慧創辦人劉俊成博士對談。劉博士指出,AI運算正從訓練階段轉向推論階段,NVIDIA GPU雖在訓練上具優勢,但功耗高且非專為AI設計,推論效率不佳。他舉例Google TPU和耐能NPU等專用架構,在單位功耗的AI性能上遠勝GPU,類似小客車相較卡車在城市中的省油優勢。他強調,ASIC僅適用於單一垂直應用,如Google或Amazon的特定場景,而NPU具備通用性,未來將成為主流,並可能分化出TPU、LPU等子類別。耐能作為NPU定義者,推出可重構NPU,能靈活適應變化的AI模型,如從Transformer到Mamba架構的演進。劉博士認為,AI模型架構持續變化,硬體需平衡彈性與效率,NPU將在數據中心和主權AI領域扮演關鍵角色。整體而言,節目強調專用AI晶片正逐步取代通用GPU,推動更高效、低成本的運算解決方案。
Transcription
3162 Words, 27668 Characters
Chinese 哈囉大家好歡迎收聽科技浪物事組陳哈利
科技浪是一個白話跟你聊科技的podcast
希望可以用簡單易懂
但是又深入的方式
帶你瞭解實下最好的科技話題
本集節目由NOR VPN 站主播出
最近春節壞到了
相信很多人都有在規劃要出國旅遊
或是回國過年吧
在整個規劃的過程當中
從你規劃旅遊到你實際出國
我覺得VPN都是一個不可或缺的工具
像是你在規劃行程的時候
你要訂飯店
你使用VPN的話
很有可能可以幫助你訂到更便宜的飯店
因為這些旅遊網站可能都會透過你的數位足跡
去做差別定價
在你實際出國之後
VPN也是一個非常方便的工具
像是像我本人現在就在越南現港
我第一天來的時候進到旅館
我要連WiFi 我想說看一點劇、看一點動漫這樣
結果沒想到串流平台是被鎖住的
我沒有辦法直接看
但這個時候用VPN我就可以看了
當然我在各種咨咖啡廳
使用VPN不但給我有自安的保護
也可以讓我可以連回台灣用我更習慣的網路設定
當然除此之外VPN還有很多其他的功能
我相信大家日常生活中
多多少少一定都會有用到的地方
不管你是要在台灣要打國外遊戲的伺服器
還是你想用一些國外才用的到的一些AI功能
AI工具之類的VPN都非常使用
那你如果要訂一個VPN服務的話
我真的是非常推薦NORVPN
我自己本人已經是用了三年多了
整個使用的過程中是覺得速度非常快
然後這個品牌也真的是很大
讓我用得非常安心
那你如果要購買NORVPN的話
一定要使用我們科技量的專屬連結跟優惠
我們的專屬連結就是NORVPN.com/techwve
在解釋上的售出
我們的專屬也會把TECHwve不但可以獲得30天物條件推廢
購買獨家方案的話還可以免費再送你4個月
OK 那這個專屬連結跟優惠
都放在本級的資訊欄
有興趣的可以自己使用
本級AI就要這邊使用一些NORVPN的贊助
好 那我們本集科技量又是一個久違的防彈節目了
我們這次邀請到一位重量級來賓
就是耐能智慧的創辦人記執行長
劉俊成博士來到我們的節目
那劉俊成博士他是非常資深的半導體專家
他拿到了UCLA電子工程博士之後
他先是在高通
三星電子研發中心
陳星半導體跟Wireless Info的企業認職
然後在2015年的時候
在美國勝地牙哥創辦了耐能
那劉俊成博士態勢很多國際知名學術期刊的技術審搞人
也是清大助理教授交大跟成大的課作副教授
然後在人工智慧的領域有超過30餘項的國際專利
他有出版兩本書
一本是叫做深度學習硬體設計
然後另外一本叫做認識人工智慧第四波工業革命
在很多國內外的知名大戰院校都有當作教課書
那我們今天這集Podcast會討論到許多大家最關心的半導體話題
當然像是MVDR的護成和
各種AI晶片具體的差別跟未來究竟會如何發展
好 那我們這邊就廢話不多說
一下是我跟劉俊成博士的對話
好 奧本歡迎來到科技浪
哈利你好
那奧本你作為一個AI運算硬體的專家
我覺得還是不免俗的
應該先從MVDR開始聊一下
那我們都知道AI的運算分成訓練跟推論這兩個階段
那其實我覺得一直以來在業界的共識就是MVDR在推論這邊的護成和
比較低一點 比較沒有那麼強
但是在AI訓練這邊的護成和是非常強的
還有什麼人可以取代他們
但我覺得像去年年底這個Google推出JM3的這一波
就是大家很多人一試到說
原來完全不用MVDR的GPU
也可以訓練出一個最強的AI模型這個JM3
那因為Google他們就是用自己的TPU訓練的
那這邊我不知道奧本你怎麼看
就是MVDR在訓練這邊的護成和真的有這麼強嗎
我覺得有幾個層面看
就是第一個叫做通用性
就是讓很多人都可以很容易在他的平台上訓練
那這一點MVDR的護成和主要在軟體層面就是在哭大
對 那事實上他的GPU在做AI訓練上
因為他強調他的通用性跟他的所謂的暴力式的去訓練
等於說如果你今天定義是說怎麼樣用最快的時間
產生最大的訓練效率
那這個MVDR的效果也是蠻好的
但如果你的定義是說用最小的成本
那或者是說相對應低功好的方式來訓練
或者說通用性不用這麼強那TP會比MV來好
應該是說其實GPU本身就真的不是為了AI而生的
只是我覺得今天有點像是很比較應用的一個非常靈活的軟體架構
但是他的底層的硬件其實還沒有專為AI的這個
不管是訓練還是推軟而去生的這個架構來做這件事情這樣
那TPU其實應該跟我們開始做時間蠻接近
我應該是10年前開始做NPU那TP應該是比我們晚大概半點到一年
其實Google D賣的那個方的就是Demis Raspi
就是現在在張冠整個AI的那個大腦
我也還蠻熟的這樣
黃玉勤其實應該上週應該跟他也在
上週在美國應該也有一期接受那個你有教授的專訪
所以以及剛好這兩個人也都還真的是相處還蠻深的這樣
所以主要的其實MVDR在訓練這邊的互相而還是
KUDA的這個
就是這個軟體層的部分
在其他部分因為我們講到這個AI的訓練系統
其實很多人會說這個互聯也是一個MOTEMOTE
也是一個互相而
就晶片跟晶片之間的互聯
然後機貴跟機貴之間的相連
那這邊原本很多人也是覺得說這可能是NVDR他們系統
在訓練這邊互相而的很大的一部分
但是Google在TPU這邊也是足夠強了什麼
我覺得應該是這樣
我覺得GoogleTPU跟這個Gemma
而且它證明了一件事情
就是我們一直甚至也是不只TPU在說
甚至包含我們自己
跟大家self的一個概念
就是說AI的硬體的Mite
Tekendrich migration就是技術的這個
這個眼鏡
有點是從CPU變GPU到最近
剛剛你大家有一些題目看
好像也會cover到叫AIASIC
對那在所謂的LAYNPU架構
其實不管是TPU或者是最近很熱的LPU
其他都是真的是LAYNPU架構這樣
應該說LAYNPU架構你把它在雲上的訓練強化
就是把10身扣加強那就是TPU
那如果你把它在大圓模型一進來的
第一秒的那個Token數加強
就是加了很多S-RAN
但是隨便蠻貴的
那這個就是LAYNPU架
就是Mite最近收的那個公司
我講到這邊滿有學
就Mite最近收購的GRAC
對
它就是我覺得算是
在之前大家講到AI的ASIC
是蠻常會提到的一間公司
因為他們做了這個LPU
就是號稱非常快速的推論
對不對 高速推論
那你怎麼看Mite
Sogo這個GRAC的這個案子
他們的策略可能是
還是在回到我剛剛說的概念
就是AI的運算的效率
從CPU到GPU到AIAS
到NPU的這個趨勢
其實剛好也是上個月在扭角所
一個在這裡就是
我們被採訪的人
我想扭角所應該在國際上非常的權威
就是真的是世界最大的教育中心
那被採訪的應該有Intel的前CEO配置性格
因為陳立武他那天
沒有參與這樣
所以陳立武沒有去
那他基本上就是CPU的代表
那再來就是華人熏本人
就是GPU的代表
那AIASIC的代表是波抗
波抗的Price的家裡
那這個如果需要我可以
晚一點把照片提供你
那NPU的代表是我們這樣
那是
因為我們在國際上當然
就最早做這個NPU
然後最早把它量纏
那為什麼這樣說呢
其實他在某一些層面上
他很像從錄影帶到
DVD到NPU3水盛點
只說是說某些層面
因為他這個層面
應該說這個尾度不完全正確
應該說你要在平量一個硬體
他其實有兩三個層面
但如果你AI的運算效率
在存硬體層面
軟體層面又是另外一個
另外一個角度
但如果在存硬體層面
這個講法是對的
在DVD到NPU3
意思說他是顛覆性的加溝
應該是說CPU他的本身設計
就是專位邏輯運算而生的
你可以想像CPU他有好幾個盒
大家的盒可能不會到很多
大概32盒
16盒這樣
但每個盒
他做加減層處非常的強
就是額入
然後甚至有一些層髮
是一Soupter這樣
所以你可以想像他每一個
很的人
每一個盒
他有點像博士班的水平
那GPU其實在人類歷史上
應該存在了30幾年的加溝
CPU更早
CPU30幾年
那CPU最早設計是在做圖像跟遊戲
他有點像是二為空間的矩正相成
那這個矩正相成
是三個圓設的矩正的微廳
就是RGB
就這樣
要很快地在一張照片進來
或很快的一個影像進來
我要知道每個相數
它最好的呈現顏色是什麼
所以一開始GPU的設計
它就是你可以想像它是可能有
上百個合
256成256
就是照片一進來
假如是256成256成
或者1024成1024
那最好就是256個合
然後每個合可以很快的
三個舉證
就是舉證就已經它
這個跟相片一樣
的這個大小一進來之後
可以很快的勝出
每個相數的微定
所以它做法很簡單就是
這個顏色紅色的
比方說占比凡色時
綠色占比凡色30
然後藍色占比凡色30
那這個就混出來
就像調色盤
所以它工作
你可以想像說250
有合每個就很像
是一個中學生的程度
它要做的事情
只是把三個顏色的微定算出來
那後來黃燻燻
可能想說
哇我有這麼多的這個
2506個合
那我嘗試在上面
加一個軟體
讓這個軟體呢
它意思就是說
它可以不是只是做
中學生算是算把
算把的程度輸出
這個CPU輸這個博士山
它可能沒辦法做這個
做這個微機分
然後但是
因為我有很多合
所以我一次
它就發現
就是說
在做圖像
意思說
在大量的快速的
病型運算上
很快的
每一個小小的
去做一個加緊程度
應用器程度
所以它就
做了一個很
通用的軟體
就是苦打
這花了十年
當時機在花了結被吵笑
然後大家都說
它這個要幹嘛
但它其實
也沒有想到AI了
它當時想法是說
只要你的這個問題
的定義是
我的運算量一次是
很大的
然後每一個小的運算的
單元
其實都是比較簡單的
沒有像CPU這麼複雜
意思說我現在有
256個
這個高中生
那它不要
只有給我算
這個照片的
這個微挺
如果說我現在算是
比方說隨便講說
今天
賣場有
25個收音機
我要一次快速的
數個預留
那我就每個高中生過去
反正每個都是
只是算每個人的節長
這很簡單
那
這個問題
用我這個也能做
那如果我在
換另外一個問題
它可能是說
我這個大樓
一定有256個人進來
我看每個人的
連跟你驗證這個
那每個工作也都很簡單
那我這個也能做
所以它的
哭打一開始的定義是說
我不管你的問題是什麼
只要你的問題符合
是一個大量的單位的
位元
來做運算
你就可以很容易的操作
那
所以GPU
它基本上
概念就是一個人海戰術
對
很多很多
運算和行
然後他們
什麼樣子的
算數都可以算
但是
但是
要算什麼
可能比較簡單
要算什麼
就是看這個
酷辣怎麼去運卡
沒錯
但
接下來
現在不眼睛的這個
Asic跟NPU
又是什麼
Asic很好玩
我覺得現在有很多人
把Asic跟NPU
或類ANPU
加過穩在一起
但其實不一樣
真的是不一樣
應該是說
我小的時候
其實就Asic
應該是說Asic
在行業內的定義
叫做我把某一樣東西
在某一個垂直
因為我把做得很經驗
對
Avocation specific IC
沒錯
當我以前在學生時代的時候
我其實有參與
那個
就是納少的一項子
還有埃爾帕蘭子
所以以前
又在Bairlab參與一項子
所以其實也滿心悅
有認識那個
就是
三個CNG
頭的凸凌獎
那三個
對 就是那個
Benjamin
那個幽喜瓦他們
對
然後央蘭困
你等一下有個問題會叫他
那滿巧的
當時在Bairlab
合作的時候
他們當時其實已經離開Bairlab
但是因為美國是
Bairlab其實
有很多政府的
專案
所以有時候他們也會回去
參與一些專案
反正當時就有一些overlab
對
所以我是
我是算是在行業內
很冷門很冷門的時候
就在碰這個領域的
那 Longyi
就是說
在當時還沒有AI加速
晶片出來的時候
其實就有專位
圖像
應該是說專位
GPU
或專位CPU
而做的ACC
其中我們當年做一個
項目是
我們做了一個
火機器人上火星
當時也還沒有AI算吧
那火學生時候
然後那個火星機器人
你可以想像說
火星的整個
大氣的環境
跟地球是差很多的
他可能
付200度
地球可能根本沒有這種
基地氣候
然後在他的那個
那個那個
宇宙的那個
那個層服很強
另外是火星的顏色
很單調
他沒有像
地球就是
油海
然後綠色
什麼
軟體八道
所以他要加強
他識別紅色的能力
因為說我單用
我原本地球的GPU
或我單用
我地球的CPU
要拿去做
他是沒辦法支持的
而且再來是
你要把這個
火星機人送上去
他其實
很
應該說你增加一公克
或增加兩公克
對太空的運俗
都是一大大的負擔
所以他就為了
這個火星條件
把地球的CPU
或地球的GPU
把它不要的東西
三三簡簡單
然後他需要的東西
把他加得很強
那就是其中
就是當年的
GPU的ACC
這個東西叫
AZIC
以前我有做過
那種非常好玩
就是周際飛彈
周際飛彈速度很快
那他在飛彈上去
識別東西
他就不像我們拍照
我說
這個每秒30增加
我們認知的
real time
就是人類的視覺
所以大部分你在
不管做數位相機
還是這個車禮的這個
形式機物移
每秒30增都是一個門檻
但周際飛彈
有些到因素
甚至超因素
那他叫
每一秒
你懂意思嗎
意思說
現在地球的CPU或GPU
也都承受不了
那他就專為這個應用裡
把它做到
他的Cluck-ray
就特別的
頻率就特別的高這樣
所以AZIC
其實在
很小的時候
就有了
那今天
有理像是AI
你剛剛講的那些應用
其實都
都不是
只靠KUDA+GPU
就可以解決的問題
沒錯
這個要更
更本地改變這個
晶片的架構
沒錯
那應該說
甚至還沒有GPU時代
就在Intel CPU時代為主的時候
就有AZIC
對
那你可以想說
AZIC的特色
通常都是某一種
垂直應用
我把它做得很極致
然後其他
不用的
我就把它拿到
就是大家有刷
壓刷嘛
那有些
壓刷做的是特別
尖尖細細的專門
做那種
壓軸病的那個
縫的那一種
那你就可以想像
壓刷
就是比較通用的
壓刷
那
那
為壓刷
的專為
壓軸病而生的
就是
壓刷的AZIC
大概就是這個概念
那有一點像是AI出來之後
有點像在過去
這幾年
蓬勃發展
在我們這種NPU還沒出現的時候
你可以想像說
GPU剛好
它的特性
相較於CPU
在做AI就比較
比較方便
原因是你如果看過那個
腦神經緣
它是上
有些人知道
上前到上萬個點
然後
每個合式
做的
卡姆路線或布林
就這樣
它在做這個
腦神經緣跟腦神經緣
連結
人腦就是很
商業一個神經緣
所以
意思說
相較於CPU
一次只有16合或30合
然後每個都是伯式
那不如這個GPU
256合
256合
來做這個腦神經緣
比較接近
所以我有時候會在行業內
應該說
你可以有兩個層面
來看CPUGPU到
所謂的NPU的演化
我等一下再講AZIC
那
我另外一個解釋
其實這兩個解釋都對
但是它
因為
有點像是一個三位的事情
所以你要把一個
微肚
FIX
你才能去
找到這兩個微肚的
邏輯關係
那你在把另外一個微肚
FIX
你才能找到這兩個微肚的關係
所以我剛剛說
從錄影帶
變成DVD
變成NPU3
這個相較於CPUGPU
這個NPU它的
這個微肚代表是
算力的微肚
就是單位
工號創造的
AI的性能的微肚
這個比喻是對的
意思說小小的一個NPU
可以取代
很多的GPU
或取代很多的
這個CPU
就是小小的一個NPU3
隨身也可以取代很多錄影帶
取代很多DVD
那另外一個微肚是這樣
就是工人性的微肚
就是說
其實我剛剛說這個
是以NAI的算力
所以是
CPUGPU
變NPU
但如果我今天是以
我做圖像的能力
那不好意思就是
GPU是最強的
你懂一說
那如果我今天還說
做邏輯運算的能力
那就是CPU最強
那它可能就
就是
NPUGPU
CPU
如果以邏輯
單位來講
所以我有時候會
舉例說
其實CPUGPU
NPU也很像
坦克車
因為確實
CPU的能力是
這三個
硬體裡面最強的
所以它很像
坦克車
它主要工作是打仗的
那
這個GPU
很像坦克車
很像卡車
它的供用主要是
在貨物的
那
那有一天人類
蓋的城市
就是AI的應用出來之後
大家發現
卡車在城市
專門專門去
坦克車神遊
大家就以為
GPU是適合作為
事實上不對
那A-C可是什麼呢
有一天
大家發現
我這條向到
特別的窄
那時候我今天
從台北到內湖
它就是
有一條環核快速道
那我就
專門開住
到的寬
它可能是很窄的
我就把我的車
做成這麼小
那這樣
它就開很快
但是呢
這個不是
用於非環核快速道
我要把這台車
從台北開到新竹
或台北開到高雄
它又是就沒有這麼方便
所以A-C就是
有你像是AI的模型
人類對AI的
應該說
人類剛
發現AI這個應用
剛蓋城市的時候
城市還沒有完整
但人類對AI了解
還沒有這麼深
那
它有各種
不可怕的道路
就是說
大家對AI的模型
我相信
從過去這10年
有
AlexNet,RESNet,VGG,TRINSTWOMER
對不對
那
那
應該是說 甚至最近每兩三個月又多了出一個新的模型
那有些公司或有些應用
我覺得某個模型是我現在最K而的
我很急 那我會覺得GPU太貴了
因為我剛剛說GPU是坦克車
哎 是卡車
我要卡車在這個這裡專業專業很好有
所以我就專為我這個應用
專做了一種獨特的車
這種就是所謂的AC可在
那最知名的當然就是這個播com這樣
所以這一次你有教授才會找了
Intel Media播com跟我們
NPU跟TPU跟這個LPU就是Quack
到底是什麼差異呢
你就像MP3學生也剛出
應該說MP3這個技術剛出來的時候
大家記不記得這個MP3它
曾經有些公司把它跟播割的東西整合
最有名就是Apple的IPa 跟IPa
那也有人把MP3這個技術跟
我記得而數時當時
我當時學生時代老師在講客
它出了一個就是有點像是錄音筆
然後跟MP3整合
然後我按下去我就可以把老師的刻都錄下來
對 那這又是另外一種變形
那有人又把這個MP3整在這個Memory當狗
就是這邊MP3隨身點
所以有點像是AI的應用出來之後
NPU是一個比較通用性的架構
所以今天喊NPU的公司除了耐能之外
還有什麼Intel Media on AMD
對不對 甚至Quackcom
所以你看到NPU的喊的就是好多大場
為什麼因為它是一個很通用的架構
對 那某些公司為了這個通用的架構
去 比方說剛剛說的Google TV
它是為了要雲上的訓練去加強
因為雲是Google的核心
那它就把它的Tencent Core加強
Tencent Core就是你的Vector要進去的時候
它的運算 那這個就會是TPU
那LPU那個公司呢
其實它要強調它跟GPU最大差異
是大語源模型
那大語源模型其實那個Memory
一進來的那個Token的Memory很重要
就是它想要一
大家如果去玩那個Quackcom的話
你壓下去 哇 一下子一片文章就出來
那個速度超快
為什麼它就是對一點很多Sray
但一生說你其實很貴
所以這個做法不見得是好
甚至它單位的成本
不見得比GPU好這樣
對 但是它的好處是你
我移弄進去它就一下爬爬就進來
所以你可以想像說
有點像是
我有說說人類建造的程式之後
NPU就像小客車
那小客車在城市轉來上去比較省油
那其他在AI的應用就是最好的
但是小客車也有一些車
它把它改成兩輪的
就很像小摩托車的那種
它因為它可能
香港就這種車
這樣轉來再去比較方便
那又有人把小客車加個先輩
因為它可能就是債貨物
有點像跟卡車的混合型
那也許它就是那種
相信小客車
OK 那我整理一下
我剛剛聽到了就
依照你的架構就是
這個排名是依許CPU到GPU到AIAC
現在NPU在ASIC吧是不是
還是現在ASIC的缺點
應該是現在NPU在ASIC
如果是從這個美單位的算力效率跟
但ASIC就會很垂直
非常的垂直
就是說
不然說它也許就是和跑ASIC
它在做任何運行
功能性就是另外一個圍度嘛
對
我們單純看這個
美單位的算力跟
通用性就是Flexibility的圍度
這樣子的排名排序是對的嘛
就CPU到GPU到NPU到ASIC
就以AI的算出來的效果
在某個垂直應用的話
這樣的排名是對的
然後
但問題就是
但我這邊的ASIC我會希望加AIAC
這個才是比較正確的
對 因為ASIC也可以是GPU
是GPU的ASIC
對
那這個就是在某一種特定的AI應用才會這樣子嘛
但問題就是
在於現在的AI應用實在是太多元了
雖然說我們的模型架構
感覺會慢慢的就是過去這幾年
非常去向於這個Transformer這個架構
但是其實Transformer的架構
過去這幾年還是有一些些微調
沒有到很大
但是還有些微調的部分
然後同時我們怎麼使用這些AI模型
這個Work具體的Workload
也會可能不一定會直接影響到
晶片架構本身但是至少從系統的角度來看
包括它的這個Memory
包括其他的部分
其實也是會有影響
那這邊的關鍵問題就是變成說
未來的AI的架構到底是長什麼樣子
對吧
就如果我們已經很確定未來的架構
就是某一種樣子的話
那我們可以說ASIC應該會是最後的影家
因為假設所有人
這個真的怎麼對
這真的不對
這個就真的是有點誤取
首先是這樣
應該是說模型會一直變
對不對
這個就是人類對人人腦的理解不同
所以我今天以為的這個
到了明天可能不同
另外是ASIC的應用
我就說它最後是一個TradeOff
所以TradeOff是說
靈活性跟限制性
你知道就像
如果你
如果你剛剛的Arguments正確的話
那意思是說在GPU時代
CPU時代ASIC也是最好的
但是並不是
當然我的Arguments是基於說
我們只看某一種應用
然後那種應用就是未來
就比如說AGI
我們已經知道AGI的架構就是長這樣
那我們就為它做一個ASIC
它就是會奧運的MPU GPU CPU
那如果以你的Arguments來講
CPU跟GPU的時代裡面
它的嚴敬
其實像CPU其實60幾年
GPU也30幾年
那為什麼並沒有在某個
隨機用不要用你的手機
它叫做XXASIC
那你的電腦筆電
這個應用已經非常不錯了
它也不是XXASIC
為什麼呢
所以為什麼說
剛剛那個講法真的有點不太對
為什麼會真的覺得不太對
因為事實上是長了有幾個原因
你知道Tapile一個Chip
它的成本很貴
所以它一定要一定的靈活性
不然我當位某個隨機應用
像說我剛剛說的當年的活性機器人
它也許就只需要100台
1000台了不起吧
對
結果為了這1000台
我去Tapile一個晶片
我陪似
所以最後它一定會cover
一定程度的同用性
你懂我的意思嗎
所以以當年的歷史
不管CPU GPU
其實最後都是PU取勝
而不是某種隨機應用的ACC
原因是因為投入產出成本不符合現實
另外AC為什麼製作為叫ACC
就是它在某個應用是非常非常好
但它就是非常的細
你懂我的意思嗎
這就好比你再跟我說
剛剛小客車
為什麼還是小客車在市場上
你最常看到的
不管是投優場的銀行證明
還是它能打
它做的小客車都是那種標準型
但你確實有看到一些香港那種
或者是新加坡
馬來西亞還是有那種三輪的小客車
或兩輪的小客車
它為什麼它不是主流
對
我覺得基本上答案就是這樣
所以我認為最後
AIAC只是一個暫時方案
所以最後其實存在還是CPU GPU
就是我認為的未來的趨勢
那在未來的 Workload這邊
就是我這邊 Workload 定義就包括
這些AI模型的價格
On last
我這件事對也不應該說
它也是有個備論
就是說
來説今天如果NPU的時代裡面
有某個 subclass 它就特別的大
來説它雲的訓練就特別的大
那TPU也許就在這個地方
變成其中一個主要
就像當年我們在看NP3隨身體
你會看到iPad iPad
它確實也是量很大
那你也有看到某一種的這個單口
但是
類NPU 加過不然是TPU LP 或NPU
它相較於GPU都是一個 Game changer的
一個成功
意思說我的一個小小的
都是可以舉到很多GPU
在硬體層面
而不是軟
軟體層面又是另外一個問題
有時候軟硬加起來
它的多了一個圍堵
它的問題就不同
那我這樣問你好了
就是
假設未來我們
對於AI架構的這個
定義已經非常清楚了
然後我們大概知道說
可能接下來不會有什麼太大的改變
那在這種狀況之下
專為這種AI架構做出來的這些ASIC
跟GPU比起來
他們這兩則怎麼比
就到時候我們還會像現在一樣
會使用NVDOT的GPU
就算了還是說
我們就是既然架構已經定了
我們就用一個ASIC就好了
我還是再強調一下
GPU跟ASIC為什麼會這麼的不同
是什麼意思啊
PU在行業學裡的定義叫ProcessUnit
所以ProcessUnit是說
我把我的指定級改了
我的能做的東西就會變很多
你以CPU來講你的筆記型電腦
跟你的計算機
那你的我去筆記型家
我今天可以拿來做Word
然後我可以來做Excel
我可以拿來看Browzing的Waps
就是網路
來這每個應用期差也很大
意思說我只要改變一個印刷券
它能cover的應用很廣
那這種應用cover到夠廣
讓我能太爆一個晶片
那這個PU就會是一個歷史上的存在
它就是一個Standard
那GPU實在也是一樣
我小時候玩那個可以拿來玩馬力哦
那我改變一下印刷券
我可以拿Fine Fantasy
這位太空站是這個T-File跳起來頭髮的肥
對不對
那我明天又可以拿去打這個
看那個電影
然後這個流暢度畫質很好
所以你仔細看這幾個PU的特色都是
它涵蓋的很靈活
那為什麼NPU在國際上變成了一個標準的名字
那這也是為什麼會來開始會有一些公司想要說
我做了其實
我
不會想要把cover成PPU
像TPU為什麼人家叫TPU跟LP
我也是能做到HandupPU
它已經像在通用的應用下
它還是有個小自己
像我說NP3變成Standard
但是iPad iPad
在眉 remember
也變成Stender
因為它的量夠大
所以它最後一息是一個
技術的邊界跟應用的邊界
Cover到一個夠大的範圍
它才能被較為PU
我應該是這樣講
我認為在類NPU時代或後GPU時代
AXIC只是一個暫時方案
但最後會有幾個Subclass叫XPU
或者什麼TPU或NPU這樣
那NPU是最多人用的原因
所以它Cover是
就是一個最好的背人是這樣
所以你一直說就是未來
食物上來看
就儘管
就是可能AI的加工已經訂了
但食物上來看
還是會需要有一點彈性
彈性還是有很大的價值
就是我會認為
今天AI會怎麼會讓你覺得是AI
AXIC的概念好像說
我今天問你個問題
你就只會回答幾句話
那個就不會讓你感覺舒服
你懂得說
那為什麼現在在某些公司
像Microsoft或Amazon
它會願意做AXIC
不要說今天
Google還有一個英文是YouTube
我一進來就是要點播
就是廣告的投放
或者是Facebook我一上去用
就有某個廣告的合放
這地方用AI跑
你用GPU跑
它很貴
它每個月電費可能是1000塊
那如果我只因為在這個英文
因為我每天都要用
我就為它專開一個AXIC
那這個英文
變成我的成本就變成一塊錢電費
那但我每天用個上百萬次
那這個AXIC就會存在
那任何一個東西
不管是哪個AXIC
或哪個PU存在
一定是它有價值
創造價值才能存在
那為什麼我認為PU
最後會是有幾種
就是紙集
是因為
我認為的AI是
我今天跟你講英文
你跟我講
就是
能幫我創造價值的是
我不能
你不能只給我處理
文素處理的應用
我明天要能幫我錯影片
然後我是今天心理不好
跟你聊天還可以跟我講話
甚至唱歌
那或者說
我今天放到車子
它可以變半自動駕駛的一個NJ
或我可以拿去放在
這個大樓去做這個門禁管理
來
它的應用比較夠多
那它才會
對我來講才能存在價值
Online這個單一的垂直應用是
你每天用的代價是很高的
它這種AXIC才會存在
那我們回到MVDRGPU的話題
對
MVDR
我自己覺得它
有一個很多人
沒有特別重視的
但我覺得是蠻關鍵的一個問題
就是
關於MVDR的GPU
還可以再進步多少次
它有幾個十倍可走嗎
因為我覺得很多人現在都
是我們說
OK
我們看到Hopper到 BlackRock進步這麼多
然後那個
BlackRock到Ruban持續進步
它一定會每年這樣持續進步下去
但我自己是覺得說
這個也不是免費的
就是其實
尤其在現在Morning已經
算是死亡的狀況之下
當然這個有些底背
但像黃仁雄認為
Morning已經死亡了
其實GPU的進步很多時候
是來自於一些Trick
比如說降低精度
或是
SufferHoward的一些Code的散熱之類的
那你覺得這邊MVDR
我們還有幾個十倍可以走
首先我說了
Morning有沒有死
其實我剛好我們沒辦法
沒這種我們都會
都半到兩頁的局
然後黃仁雄跟麗莎蘇都
我都會在那裡遇到
其實這兩個人看不懂
對
就是黃仁雄認為Morning遇到
後面是黃氏定律
麗莎說的是Morning還存在
其實他一個是建輸
一個是建靈
其實兩個概念都對
他都在成縮一個事實上
對
那回到數的本質
就是說GPU的持續到
你能持續多久
好
那我說了
就是說其實
幫黃仁雄最近
為什麼運氣買這個LPU
應該是說AI世代
會有所謂的Face 1Face 2Face 3
我有時候會講說
太陽底下
沒有新鮮事實
今天的LM時代
其實在更早之前
實驗時代
已經走過這三個步驟
這樣
應該說你可以想像說
LM比較像人腦一樣
很聰明的AI
但是在16年到19年
其實有個貓跟狗的腦袋的AI
就是實驗案為主的
或者是叫LSTN為主的
他其實在做影像識別
或語音識別
或RN為主這樣
對
那當時呢
在模型
大家都是無道有的時候
那個我們叫Face 1F
當時對岸有這個商湯
雲重E2
這個什麼AI世小龍
那美國當然就是Google Facebook
Microsoft
那我剛好也
工逢其勝也經過那個史蘭
因為15年就在做這個事情
那當年的16年最初
其實大家也就是買很多GPU
在做訓練
那去年他的特色就是說
就是我回答你第一問題
MiaGPU在訓練的優勢是
他就是暴力
你就是說他很貴
然後他可以用很快的速度
大量的用最快的速度去訓練
如果你Mia在訓練的成績是十分的話
其實今天Google TPU的單位創造的
訓練成本是
效率是沒有像MiaGPU
他可能是7分這樣
對
但是
RU
成績的耗電可能是100
那TPU的耗電可能是2或3
大概是這樣的概念
那一樣的是說
如果你拿這個訓練
很貴很貴的這個100的東西
結果當大家的模型都一樣了
你知道16年我就影響
影彩的經歷的那一段
就是商湯說他跑出來的模型是
人臉是別的版是99
然後雲重說他是99.5
然後呢
隔一兩個禮拜變99.9
然後99.9
後面是99.9
後面99.9
後面大家無感了
然後你就會發現16年的時候
大家買GPU
890%是還做訓練
結果當大家的模型都差不多
已經無感的時候
到第二階段就是執行
就是推論英文
那當你在英文時的時候
你用很貴的GPU
到英文時我就叫這個
這個Face2
到Face2的時候
大家如果都用這麼貴的
你就你競爭力就輸人家了
因為你就很貴的東西
結果你只要做
就是一說我剛剛說了
MVIDIA的訓練假設是10分
TPU假設是7分
但英文時他只需要2分
就是這樣
你懂我意思嗎
那你用10分的東西
你每個月電費就比人家多
80%
那你投個壞
所以在英文時你就發現
雲上的GPU
變成80%
在做英文時只有10%
在做全理
還有一些小微調
那這個比賽是在17年到18年的時候
然後等到模型大家都差不多的時候
連英文時都差不多的時候
就到了Face3
這就是叫HAI
大家開始把模型變小
嘗試塞到中端設備
你當時看到人家的識別
雲上的模型
大概在1819年的時候
你的手機的那個準確度跟雲經
差不多了
那時候就很多什麼簡支量化
就是Consultization
Puting,Transport,Dissortation
真六
當年就有真六了
所以Dipsick的這個真六
其實也不是新的
這個在當年就有了
那我認為
LOM時代基本上就在Follow
那三步
只是我們才剛過第一步
那Google TV一出來
甚至Dipsick出來的時候
其他在加快
Face2跟Face3的發生
那你剛剛說
Google
Media這個褲打的護成很強
老實說Dipsick現在
他也不是用褲打的方式訓練
因為他被美國封鎖
中國不得已
去用很多Moe的方式
然後用了Dissortation
Consultization Puting
去讓他
因為他沒有那麼好的褲打的系統
所以他用的是PDF
就在做訓練
他是更底層的東西
所以
就是科系有的時候
有趣的地方
其他就是一直在變
你懂得說
但我認為今天已經
我認為
我認為已經從Face1到Face2了
所以你還用這麼貴的GPU
老實說是很危險的
那我認為今年也許還
所以他們開始在喊這個主權AI
然後
那老實說這個主權AI的argument到底
廢廢
我來跟你分析幾年
就是說
我覺得你剛剛講到很有趣
就我們現在進入Face2
就是比較偏重於推論這邊
對
Inference
那其實我覺得從Fedia最近的一些
行為也可以看得到說
他們現在越來越
往推論中
推論的有法嘛
對不對
那
但是你剛剛有說就是
GPU他的設計本身
就是
綁得Mento就是不適合做
其實他連訓練都不適合做
老實說
他強了其實他的軟體
然後應用軟體去做這樣
其實Google TV是比較適合做
真正的AI訓練
他是類 MPU 架構這樣
OK
那你覺得具體來說
這邊會發生什麼事情
所以我們進入Face2的時候
NVIDIA目前其實
就雖然說就像你說的他在
跑推論的時候真的是功耗非常高
但是目前因為
就是很多公司他們可能
要首先可能就是
模型的架構上面會有一些變化
然後有Cuda的這套系統
能夠最好的寫出這些CustomColonel
可以最好的
去為他們的Workload做優化
所以目前很多人
其實在推論這邊還是都使用MVIDIA
但你覺得接下來這邊會改變嘛
對不對
我覺得會變
你等著看
而且我認為
Face1過去之後其實Face2跟Face2
就是同步啟動的
在這個
AM時代
那我還是回到我的
阿雲們就是說
但那在Face2這邊
你覺得接下來可能誰會是贏家
就是我認為他會擺花氣放
對
應該說MVIDIA的Cuda
互相和在Face2跟Face3都不存在
對
所以這也是為什麼他很急著
花大錢去買了一個LPU這樣
就MVIDIA的Cuda
互相和目前在Face2
這個階段可能就只是
Defaloper可能開發的方便性
這個有點像
我有時候會舉個例子
就是說
這個年代有點像是有坦克車
跟卡車在市場上
然後以前城市剛出來的時候
大部分的駕駛習慣開卡車
在城市轉來轉去
因為
當時沒有小克斯的選擇
對
後來有出現的小克斯
但因為駕駛都已經習慣看卡車了
我就不想學習這種東西
我已經正在我這裡了
後來卡車又拼命造使卡車成立的工會
把這個Sappline 竟然卡死
所以你可以看到GPU公司每次來台灣
現在都去參觀Sappline 竟然要讓做車的
就幫他做卡車
不要去做小克車
因為他也怕小克斯的崛起這樣
對
可是突然
加上油價當時還很簡單
就在CN時代
Ai算力的需求
沒有像今天LM
就是暴力式的增長到上百倍上千倍
Bers當年的CN時代
所以意思說
我開卡車跟開小克車
我的油價大概就差了20塊
那我卡車司機我懶得學
我就願意付這個額外的20塊的差價
沒錯
結果有一天
油價突然爆漲了1000倍
就是今天的LM時代
你覺得我
你另外一批人
你如果是土豪的時候
我反正我就另一花錢
但你另外吸引一群人
先去學小克車
然後當小克車開始崛起的時候
我覺得那個馬太效應就發生
那這邊小克車值得就是ASIC嘛
不是不是
NPU
你認為是NPU
是的
ASIC真的
ASIC不會通過你
所以像其他
OK
像目前很多的
滿有趣的
我覺得台灣的
台灣的可能都是在看那個叫做股市
有沒有
為什麼ASIC大家會一直在講
ASIC講白就是現在播放的股價很高
那是因為NPU還沒有普及
你懂我的意思嗎
OK
所以我把這個問題再講的
清楚一點具體
現在很多人可能在講的
就是在託論這邊
ASIC
就是ASIC取代MVDR這邊講的
可能是包括像是科技巨頭
他們自己內部研發
像TPU或者是
像這個
AWLAS的這個
Penium and Francher
但除此之外還有一些新闖公司
像Serever's的這種計畫
你認為這些不會是
就是小克車的銀家
不會出現在這邊什麼
不是我想要說的是講
是說ASIC跟NPU的認知
現在被人家把它混在一起了
你懂我的意思嗎
像你剛剛講的那幾個TPU
其實類於NPU加勾
所以它叫PU
你懂我的意思嗎
那會自己真的自稱ASIC
那就真的是ASIC
不要說暈上的公司
應該說ASIC只會存在暈的公司
但是在同用跟普及
不會是這種公司
因為它通信不夠強
你懂我的意思嗎
那你剛剛說那個
那個什麼CBRS
它是一個整個金圓的
那是超算中心
超算中心它也許
就是需要大量的運算
那它就做整個金圓的
但這種東西其實風險很高
所以你只一看
CBRS它的客戶基本上
就是某家
沙漠地的某個王式的某一個單位
就是ASIC它運用
就一定會非常隨時
它也許就單一客戶
你懂我的意思嗎
對
那所以通常會用ASIC公司
就是
Google或者是
Amazon裡面的
或者是
Facebook裡面
某一個運用它可能
每天
Sets是上前次
我才願意
做一件事情就開一個ASIC
這件事情在當年的CPUs
來跟GPUs來
就已經發生了這樣
那其實你剛剛
蠻多次提到你的公司
但我們還沒有聊到
所以我們來聊一下
就是那個
你們公司
是在做什麼的
可以跟大家介紹一下嗎
對剛剛那個
NPU老師講
全球廁所把NPU定義出來
就是我們
對
這是事實
我們在15年就在做了
其實你剛剛說的
CRAC的那個
LPU
那個比我們玩個3到4年
Google TV有比我們玩一年
所以
我們才會
所以你剛剛一提的這個NPU
其實
基本上就是我們定義的這樣
對
那大概
你要學會讀到我寫的書
所以
所以才
才能得到HP會打令論
講跟HP會的
CTS orCT的學會這樣
這幾個講還算是
滿權威的
達林隊應該是
Kate & Ceylon
時的口方隊以前有得國
我們也得了一個
Maxwell Maddow這個應該是
Corecom的方德
Evan Zekab的國
所以它在國際上是
很權威的
那你們的產品是什麼
我們的產品就是NPU
我們
那應該不是大家認知中的
因為
就像你剛剛說的
其實台灣人對於NPU的認知
通常都是什麼
手機裡面的
SLC裡面
對
那是因為台灣臉發科很強
或者是一個電腦SLC裡面的一塊
那你們的NPU是放在哪裡
我們的NPU滿多元的
其實應該這樣講
我覺得台灣認知的NPU
因為可能台灣的
半導體
IC設計公司
最有名的可能就練發科
所以我們的印尼啟爾
把NPU會被練發科帶到
那練發科對標當然是高童
那所以Corecom
所以我們也使對NPU理解
也會
很容易被
局限在這個方向
但是
上NPU是可以很多元的
對
畢竟我們是定義者
我們其實
至今有六七代的這個NPU在想像
那NPU確實能做在手機
它也能整在SLC裡面
但它也可以獨立存在
這個你
你把NPU忘掉
來看以前的CPU跟GPU
其實手機也有GPU
你的筆電也有GPU
那
可是你越大的系統
GPU是獨立出來的
為什麼你知道
因為
其實應該是說CPU
最有名的
當然是插860就要夠
就Intel
那MD其實也是插860
那
其實當年的CPU跟GPU時代
也有一個聲音
就是說
不可能有獨立的GPU
這個GPU一定會被整在CPU裡面
當年Intel就幹了一樣
是它的那個
那個任天堂的地方
就是整在
就是把CPU整在裡面
但為什麼GPU還是
還是今天獨立存在
好一點的筆電
它的GPU都是獨立存在的
對
那個遊戲筆電
對
為什麼
因為當你把CPU跟GPU整一起
兩個性能都會掉
你懂我意思嗎
所以連8K也很好玩
或者我不要講這個名字
這個得罪人
就是台灣有一些公司都說
它這個耐能不可能活的
這個
這個
這個NPU一定是整在
SOC裡面
在手機對
你懂我意思嗎
但是非手機不對
原因是因為
就是
就跟CPU跟GPU整一起之後
它性能都會各調一樣
當你把NPU
CPU整一起
它的性能
NPU也會掉
GPU也會掉
因為它架構
我說了這三個是不一樣的東西
它架構從
那個Data Flow到
耳入這個運算單元
它的設計都不同
就是你把彈克車跟卡車整在一起
它能在乎我誤跟能打算嗎
很怪
真的有這種東西存在
那就像卡車跟小顆車
也有整在一起的
但它就是在乎我又不行
然後
再層次省油也不行
應該是說
它確實有它的需求
就是你以前有玩過那個Race-down
Race-down裡面有水果
它只知道你沒有水果大跟紙甲
跟這個銷錢刀
它只是讓你方便
所以當有樣東西
你只要方便你不在乎性能
你在乎的是集成性
它就會是整在一起
手機就是這個例子
沒錯
但是你看
比較便宜的筆電
它的CPUGPU也是整在一起的
但是比較好的筆電
它在乎遊戲的性能的時候
它的GPU就是獨立存在的
一樣的NPU
以耐能的NPU
我們其實有整個手錫
對我們也有把
跟CPUGPU
甚至
DSP跟NPU整在一起的手錫
我們也有做
但我們也有做獨立的NPU
所以
那獨立的這邊
是什麼樣子的功用
越接近DataScenter
你越在意AI的算利
多明年的時候你就需要獨立
原因是我很在意它的性能
我就說
我就說
我今天就很簡單
我今天
你問了
你問了這個問題
就是很簡單
我要在台北新竹
在城市抓來轉去
我就不一定不會去開
卡車跟小客車的混合車
我一定會開小客車
因為省油
省油是我這時候最在意的
就是說
這個應用
如果是AI多明內的
我就一定需要一個
獨立的NPU
大概就是這樣
所以未來的NPU
也是擺花氣放
就是會有
雲上的DataScenter
很大很肥的NPU
它用的是
超算中心的
你懂我意思嗎
那
甚至會有一些公司
我為我的訓練
就把天生扣加強
這就是所謂的TPU
那還有這個
使此會有
而瑞進去的那個出品
那這個就是TPU的樣子
應該說
你今天只要把NPU
為某一種應用去加強
因為我今天把NPU
為了LAM的這個
偷懇加強
它就是LPU這樣
所以你說
你們的NPU是獨立的
然後是
比較是放在這條中心的嗎
沒有
所以你沒有很多種嗎
對
會總是獨立的
然後比較重心
但這個是
什麼樣子的Uscaster
像主權AI
我們有在做主權AI
可以定義一下嘛
主權AI具體來說
主權AI
像我們在德國的主權AI
就是單位時間
有20萬人
20萬人以上
去SS
其實我們也做了RIGER
我們在世界上
有展
跟GPU的RIGER長得很像
跟TPU的RIGER也很像
也是一個LLAM嘛
是嗎
對
就是LM的機器
所以我說了其實
NPU是可以很多元的
應該說
那也能強向
叫可充夠NPU
這在國際上很經典
所以可充夠就是說
它是可以像
機幕一樣跌的
就是我可以跌
2030
可是我的客戶才會有Naver
而那一拳這種
收索
其實它已經收索
以及韓國的Google嘛
我能做它
就能做Google這樣
那
可以定義一下
可充夠NPU嗎
可充夠就是說
我可以把我的
指定級改了之後
我裡面就可以變形
那結果你像
概念有像人腦很大
但我沒有去
見整個人腦
人腦
其實有
視覺區
它好像在中間
蘋果形狀的
那有聽覺區
在前面
很像香蕉形狀的
但我們做的
沒有去見整個腦
我們見的是腦的
基本原件
就是腦神經緣
你可以想
我會一堆腦神經緣
然後就像年圖
當我需要做視覺區的時候
我就把它黏起來
就是
找蘋果形狀
我就做影像的
AI
下個月把拆
再做成香蕉形狀
就做聽覺的AI
這次我們同一刻
經歷可以做語音影像
我唸
然後
甚至有個新的架構出來
我只要
就是我有一天對人腦的理解
我發現
視覺區不是蘋果形狀
它應該是
但只要它還是腦身經驗組成
我把它改改 我還是能支持
那我們來聊一下AI模型未來的這個架構的演變
因為我覺得這個
其實回到你追一開始說的
我們再看這些各種不同的AI硬體
就我們要比較他們的這個通用性的價值
他們彈性的價值
要看的還是未來的這些
他們要跑的模型到底長什麼樣
對吧
那我記得我在年初的時候
去年了 去年年初
有聽到你一場訪談就是有說到說
你們非常看好
StaySpace Model
就你們認為他們未來會取代
Transformer的這個架構
那就是Mamba
Mamba架構
對
就是那個StaySpace Model的其中一種嗎
那你目前還是這樣子看嗎
應該說現在Mamba跟Transform基本上
以算值的層面它基本已經是Moger在一起了
其實Mamba確實取代的成縮
只是因為在算值層面它已經拆得比較分析
所以現在大概率你去支持Mamba
都是支持全是我們的這樣
就你有一種有我
你一種有你這樣
是Mamba架構在很多應用
真的是比全是不好
就是不管在準度
還有它的這個空間集合跟邏輯
前後文的這個分析
都是比較好的這樣
但是就目前來看
就Transformer還是完全的當面的主流嗎
不是不是我剛剛講的是說
Mamba的底層現在也是Transformer
它是Transformer的變形這樣
在現在就是最近的幾個主流
你説就是你要算Mamba推論要做的運算
你break down到最基本的單位
跟Transformer是差不多
很接近
它只是變成說它在重集上的不同而已
它在下面的指擊
我的理解
但我的意思是說
從應用的層面來看
所以你這樣的Argument其實
應該是對也不對
就是說你說這個
現在也許是Mamba的鬥米
但你說是Transformer的鬥米
是因為我在做Mamba的時候
在某些今天的硬體上面
或者在應用上面
我其實把猜測幾個Transformer來做
你懂我意思嗎
所以對我來看它是Transformer
這我來看它是Mamba
但對你來看是Transformer
應該是說這真的是有很多Argument
程序其實說它現在主流是這個Mamba
其實在Google或Facebook
現在主流也是Mamba
只是在底層下
它都是用Transformer方式
去把它做重集來做的這樣
OK這邊我不是很理解
你的意思就是說
我們今天用到這些Charge VT
我們先不講避遠的
我們不知道他們加溝
但你看Lama
或者是Defseek的這些模型
你認為他們其實也算是Mamba的模型
是嗎
Baba加溝
是的
怎麼說
你不要看
我覺得一個
就像你剛剛說的
黃仁勳跟Lisa數在說
莫有定律到底存不存在
兩個
我債務的是本質
其實兩個講的都是本質
你知道
因為
黃仁勳來講
他認為算力現在的快速增長
已經不是如這樣
去不程度的增長
因為現在LAM的算力的增長
大概每1.5個月就翻倍了
你懂我意思嗎
但是晶片的增長速度是
24個月才能翻倍
你懂嗎
以莫有定律來講
所以他認為
為什麼他叫黃師定律
因為他現在用HBM
所以為什麼最HBM跟Covard是這麼紅
我等於在系統層面
我用堆疊的方式
去報了算力增長
所以我認為莫有定律
現在要支撐這個LAM或者是
AI的算力
完全需要系統層面
我定義的黃師定律
叫HBM跟Covard
來把晶片堆上去
那為什麼我說
他說的是對的呢
這個以這個層面來講
他是對的
但是
為什麼歷史來說
莫有定律沒有死
因為現在
你晶片層面還是每24個月才
翻倍一次
你懂我意思嗎
這個叫一個叫建數
一個叫建齡
所以兩個都對
他都在成績一個事實
那你看到的可能是在某
其實新聞某些論文說
我現在還是用唇書末來做這個LAM
但我跟你說
他在重集上面都是漫吧
你懂我意思嗎
OK
就架構來看
他們是不一樣
就是
從學術的架構
就比如說
唇書們的算
A tension mechanism
處理即使那漫吧
沒有
漫吧可能是比較接近
R&D的那種
這個
把記憶壓縮在一個路
不完全是
真的不完全是
他在底層都
基本的和
基本算是基本是一樣的
就是已經接近了
最近的幾個
比較新的幾個論文都是這樣
說什麼
老實
我確定觀眾懂不懂
但我沒有還沒有到
真的非常理解
你說的
這邊的本質上
他們是一樣的
到底是一樣
就是
你是break down到
最基礎的數學運算
他們是什麼都的這種話
是的
就當然
就所有的這些
Motion運算
你break down到最基礎的數學運算
其實當然就是
加減成足
就那些嘛
但是
你覺得
他們
稍微還 level一點的
這些架構的差異是沒有
沒有意義的嗎
就是
Attention跟R&N的差異
這種是
其實這就
我可能我
畢竟是寫教科書的
所以我看到事情
都會把他
break down到
很細很細
到公式層面
那
就像我說的
我為什麼說
NPU跟TPPU跟LPU
他都是類架構
這是每個人的定義
就是那個圈
到底
藉的線在哪裡
你懂意思嗎
但是
我會提出這一點
是因為
就是我認為他們
就是 transformer
跟
那樣把
對於某一些
可能
在開發ASIC的人來說
是有差別的
是因為
可能他今天這個
當然有差別
對
他今天要設計這個晶片
他要讀說
兩年之後
到底是
其實他是 transformer
還是mamba
其實我們就
推出了mamba的晶片了
真的
這個我應該
上上個月才
而nounce的
但老實說
我雖然
可以那個是
mamba的晶片
但我的底層算值
老實說
他也是
就是
還是一樣
我真的覺得是
就是意思就是說
你這樣的做法
是你的晶片未來
可以支援
這兩個種
不同的架構都可以
都可以
但是也是有些
ASIC的玩家
是他們就是
all-in-7種一種
那個就叫ASIC
ASIC我跟你說
ASIC就
結果你像是
我今天對腦的理解
我以為是蘋果
就把科使成蘋果
沒錯
但對於
他們來說
這些人確實存在
像我看前一次
你有一家叫
好像叫 etched
他們就是專門
all-in-transformer
搞不好未來
搞不好期待期待
有其他家在all-in-mamba
你以說
哈佛的那個
那個
對
那個
那反正就是
有一些人
會all-in
其中一種架構
那對於
他們來說
未來
哈佛的那個
那個初學
我跟你說
對於他們來說
未來到底是
transformer
還是mamba
對他們來說
是有意義的
可能對於
來說
他們來說
是有意義的
你知道嗎
我一直
我也覺得
蠻有趣
他在
市場上說
他是世界
第一個
做全什麼
但你一直去
查新聞稿
你就查
2022
2021年的新聞稿
2021年
其實全球
沒有人看好
全什麼會變主流
對
後來
當然
有一些
大的公司
號稱
什麼
自己做的
第一個
全什麼
我真的覺得
那個叫
市場語言
但你去
查2021年
真的
有號稱
自己的
智慧
我們
有一個
智慧
我們很多
真的是
世界第一步
然後你說
就是
我有時候
真的覺得
市場語言
跟
為什麼
很多
本質
其實這樣
常常
在批評別人
這樣講
我覺得
我當年在
高通
或我當年
在三星的時候
我絕對不會
去用
一個
剛畢業
或者是
沒有畢業的
學生
另外一件完整的討論一下就是MPU它的未來到底是什麼樣
可能有幾個層面嘛第一個就是它還有多大的進步空間
然後第二個就是它未來會被運用在哪些地方
現在其實從當然消費者的認知還是說可能MPU目前就是SOC裡面的一個小小單位
然後那是台灣的聯發科的認知 真的不是相信嗎?
也不要這樣講的聯發科應該說應該是類手機的SOC的場會認為MPU在裡面是一個小盒
那是因為手機的應用它確實就是這樣
對 我的理解但就我們就講AI的應用好了
AI的應用目前大家的認知就是雲端的AI就是用GPU去算
然後邊緣的AI就是有時候用GPU有時候用MPU
比較小的模型然後需要更高效的推論的時候能耗比較低的時候就是用FPU在SOC上面這樣子
那如果是比較大一點的模型可能就是用內顯或者是有獨立顯卡就用獨立顯卡
那這個是一般的消費者的場景 然後雲端的AI使用的場景
基本上全部都是GPU或者是有一部分可能TPU之類的
也不會有NPU 雖然說你說TPU是類NPU嘛
那你覺得未來NPU的會你認為它的角色會變得更分量會更重嗎?它會出現在哪裡?
我覺得是這樣就是說這個年代有點像是DVD普及
然後大家都習慣用DVD然後也沒有人家裡可能很多DV的隨身點放硬機
對 那藍光出現或者NP3出現它本來就是一個Renab的過程
所以你剛剛講的我覺得是以這個時刻這個時間點沒有錯
這個這個漏到這樣 但是為什麼TPU出來之後MPU來股價當天崩
也沒有崩很多啦 但那為什麼不管怎麼樣你去試一下German來的效果
跟Google and NUMS的效果就是以它的單位功耗創造的效果
它確實就是一個名鴨式的差異嘛
那我覺得這個名鴨式的差異在今天的時代還是以Training為主的時候
你也許會覺得這個就像我說了 也許以AI的暴力式的訓練啦
還講 美亞也許是十分
那TP月只有七分八分
但是我投入的這個價值
美亞也許是比TPU就是大了好幾十倍
那這是沒辦法否認的事實
那當你到Face2到Face3的時候
就像我說的 當年其實Face1的時候
雲端的Trending在市場百分之八十
但到了Face2的時候 雲上Trending只剩十分
英文時事百分之八九十
那只要到了Face2 我認為
哭打的必須沒有那麼強
它就是一個白花期放的時代
那到了HG為什麼ClendNPU會是多密呢
是因為月H 工號成本面積會更粹粘口
講白了這三樣東西GPU就是貴
但是在AI大家習慣的靈活性
還有這個Trending的效果是比較好的
但是NPU就是成本更低 工號更低這樣
那我今天也講的就是說
以耐能的客戶來講
就我們畢竟是國際上最早做NPU的
那我們客戶東開的有PennerSony Fade革命
這是穿在市場
穿在市場我認為它就是一個HGPU
不可能進去的一個戰場
因為GPU很大很肥
然後又很好
你帶的時候不要幫你燒燒
你就不會帶了嘛
那AI OT在工業製造GPU也見不去
因為它那個產線很快
無人機NPU絕對的影響力是因為
無人機是耗電池
只要是電池Battleary Base的NPU絕對是天下
這個Node到的
這種東西其實很多
甚至對
我說的手機筆電
其實今天
為什麼NPU這個時開始紅
其實也是筆電的AI PC開始搭吹
對
所以我覺得筆電手機應該說
越小的單位NPU就會是舞台
那這個東西一樣它才剛倒露
那剛倒露它有時候會需要一個
像為什麼人家說AI PC其實沒有紅
其實我覺得它會紅
其實它只是
有點像是手機三居時代
四居時代的時候
有時候人類需要打開那個攀躲
你才不知道應用什麼
像當年我在高通的時候
三居時代的時候我們再推
很多人在AQ說手機不需要
不需要這麼多頻寬
我只要打文字
丟用FeedChill Phone就好了
結果後來照就是Nokia
這種FeedChill Phone
這種智慧手機就出現了
然後
這邊查的是一個Killer app
我認為Killer app
是當你把攀躲到盒子打開
Killer app智慧當然會出現
當你所謂的攀躲到盒子
就是它的算力到一定的水準
我覺得這件事情
我當年在三居時代
四居在無線通訊手機時代的時候
在參與那時候在一部網站
在三星還是高通
四居剛出來的時候
大家說不會有應用
結果後來
應該說三居出來的時候
大家覺得不會有應用
後來就出現App
App的定義
那App
App都出現的時候
三居就擺花西放了
然後四居出來的時候
大家說不會有應用
結果大家發現
四居既然可以在手機上看
就是傳照片
然後看短片
然後這個應用也出來了
應該是說當
沒有這個功能出來的時候
你不會想有什麼應用
你懂我意思嗎
那一樣的當這個功能打開之後
應用自然的人會出現
也許是一年也許是兩年
但當它出現的時候
它就會擺花西放
那只能說
LAM是什麼時候開始普及的
LAM是兩年前三年前
那應該是說
確實GPC是那時候紅的
你知道專為這個LAM
帶到第一段的景點
它開發時其實就兩年三年了
所以我認為
今年其實就是它開始擺花西放的
一年
它真的會發生
應該等它你拭目以待
你在講的是
地端的
是消費者的這種手機跟電腦
就是說
AIPC、IS手機在今年
因為就是他們
晶片花兩年的時間
慢慢去設計
退報到這樣產
我認為很多人都會被你的
我一直強調本質
我覺得很多人都會被
我們的認知的狂假限制住人命
今天的端跟雲
其實不是端也不是雲
是這樣講的
我今天的比起起起起起
其實比我小時候的雲強
我當年你可能不了解
我當年在Belv的時候
我們曾經有
看人家那個
第一代把那個
那個
納薩的那個火箭
送出去
太空的那個
很有趣
你現在一支手機
比它當年的那個
超算電腦還要強
這是真的
他們當年
對
所以我一講的是說
可是當年的超算電腦
是語音
你的手機是什麼
是端
所以應該是說
因為高通的
獨特的經驗出現
造就我的手機
比我當年的雲強
因為
Intel的CPU出現
造就我的筆電比我
當年的超算中心的
語音還要強
對
一說我如果
GangJunge的Tech Technology
其實我可以讓你的端的
能力比我今天的
語號要強
假設我是個
下個世代的架構
我可能就是
很好的NPU
我講的是我們家的NPU
我不是說
市面上在那邊
拿DSP印改
說自己是NPU
我覺得像是
耐米實在太紅的時候
我當年也看到
什麼耐米馬桶
耐米靈代
我都覺得那個不是耐米
但那個就是一個市場語言
那不管這樣
撇開這個
不講
我Argument是說
今天如果
有一種架構
你也不要講耐人
或NPU
這個可能會限制你的想象
你可能會不符
那我就說他有個架構
如果他是專位AI而生
他的效率
就是比GPU強個
450倍
我都不要講百倍
其實很多NPU
都是可能百倍的
那我的功耗
就是他的1/100
或1/1
我可以讓你的地端的東西
跟今天的運類式
強了
我可以把40B
150B的
大原模型帶到你地端
那我們的人類的生活
其實會很像
我們熟悉的客丸電影
對不對
對
所以這件事情正在發生
OK
所以你認為
未來大家
因為現在大家使用手機電腦
再用AI的時候
通常都是打開一個網頁
然後使用Chatch P
或是App
對
因為第一端的模型
雖然可以跑
現在已經可以跑了
智能上還是差非常多
你等著看
那你是認為未來
主要都是
最消費者可以直接在
這就是我說的
我覺得當
你不要被端
跟運線自主
你就想說
有一天
如果你的端的
穿在式設備
你的手機
你的筆電
跟你的車
你跟他對話的感覺
跟確實比一樣
那客丸電影的場景
就是發生了
那
他你說這個東西
不會補給
我覺得他會補給
所以確實
確實我覺得過去這幾年來看
我們現在
因為技術跟應用的
編輯還沒發生
但當他發生
他就會碰撥發展
就是
Chatch P
他也是兩年前才變這樣
其實三年前
四年前就
就
就
存什麼門了
但那時候
因為
其實Chatch P
一一的時候
很多拿去用的時候
覺得很笨
他就沒有補給
有時候他就是要一個
剛好那個
叫新GeroyPoint發生
那我就他才會
才會碰撥發展
但是
我覺得這邊
雖然說就像你說
其實有很多
歷史的
這個案例可以去
借錢這樣子
但現在
其實也是有人在
Argie說
未來
其實
基本上
在語音上面跑
就夠了
大家這些
只要中心都見起來了
然後未來的模型
其實真的
也會達到一定程度
像其實
現在
最先進的這一批
可能捐不來三
Grock
接下來要出來的模型
可能都已經
三四
叫四五
照的參數
你看
好
這個方向
最推崇的
Media跟
OpenAI
我就以他們
公開的數據說
今
在去年的
10月的時候
OpenAI
跟Media
簽了一個MOU
MOU是
框架寫
其他沒有
一定要執行的發育效益
那是說
Media要投
一千億
美金
去OpenAI
讓他們買
他的GPU
然後
當年的
SendOteman說
他要
需要的
超算中心
對吧
好
我就不講
有時候說
這叫
避緩交易
我們在
我們在
Archie說
這東西
到底是
Bubble
我也很客觀的
客觀
40來分析
第一
以
亞護Data Center的
這個
算力中心來說
一GWA
需要多少錢
需要一千億
美金
到兩千億
美金
這個是
箭制成本
他的RPU
先Cose
RPU
我每一年
花的那個
電費運費
那我
一樣
這個
取掉
就算
以兩千億
美金
27萬億
他說
他未來
五年內
以四年
攤體
我每一年要
多投
兩千億美金
那
好
就講說
他超強
他全部都拿到錢
Media
一千億
叫做
十分之一
他創造
是75萬人的
用電量
一年
對
他基本
就是一座
合電廠的
我都假設
他都能達成
我要多蓋
幾座合電廠
二十座
我現在
馬上蓋了
對啊
因為
所以
好
蓋到太空
那
你知道 CarbonData
很多
課長
你確定
兩年前的
他
他
湯匙 CarbonData
產生
59湯匙 CarbonData
跟新加坡
一年
產生
一年
十月
十月
是有颱風
去年十月
有颱風
你覺得
在
大前年
之前
十月
有颱風
我覺得
我們
很容易
被這些
媒體
給你
就是王者的。
他也是到處給大家洗腦
讓大家認為打遊戲不需要GPU
CPU就好了
當時確實有一段時間
CPU的
Media他已經死掉
他的視戰率是80%
但是我還是講說
反正是還是回到15本
我就說好就像你說全是真的
但我們地球根本承受不了這種
碳排放
氣候變遷
核電廠
然後
我就可能把地球整個燒起來
你都不知道對不對
然後順利海水都被燒光
所以我覺得本質上還是說
什麼樣是
但是如果我有一個專位AI的
神他的功耗就是
千分之一
那
你可以
寄引就AI
又可以讓我們的人類生活帶來便利
那你說MPU只能局限在端嗎
其實不對的
他也能到語言
就像GPU他也能在你的筆電
也可以到語言
今天語言你有
超吻東西也有GPU
那另外有些應用
端就絕對的Key的
Application
不要說
我今天跟你說
自動價值的時候
是雲上AI在控制
你敢做嗎
我做上去之後
有時候海晶他就把我綁架了
那我就說
好今天其實我的網路傳出超快
那你的手機
有時候到沙漠太會斷訊
那你開開
突然斷訊
你就把前面的人撞死了
那一樣就是說
醫院的應用
一定要飲食
就是說
今天其實雲上的AI在強
他不會知道我的病例
那你的病例敢放進去嗎
你放進去之後
有時候海晶來上去看你的全身的裸照
你也蠻恐怖的
那一樣的
以在你就是有一個案例
是我們曾經幫台灣的一家公司
做他的克服系統
他本來也用雲上的AI
其實我們公司的這個
生存之外機器
有在國泰常跟農總
很多都是醫療相關
原因就是飲食
那另外就是說
我的公司內部的資料
我也不會想要上雨
對
那我
你知道那個沙漠送期
他是嚴格禁止用OPENAI
因為他公司的資料
靠我們這些雲分就上去
他可以提升公司效率
沒錯
但是他的海里考慮
你說台積
我如果把我的
資料都拿去雲
現在大家不是很擔心
我們變美機店嗎
你用OPENAI來幫你做
每天事情
就美國人就知道你的秘密
你就真的是美機店
對
所以
而且還有一件事
你叫做
Data Corruption
就是我剛剛說
我幫一個公司
做他的線上克服系統
他希望人家來問他
說這個公司是
什麼樣的公司
他希望他回答
是我住中科技人物
數量的公司
但是結果有一天
人家來問他
他用OPENAI
他就是怎麼樣
他可能往網路上
太多跳樓時間
人家就說他是血汗工廠
我是公司
我當然不會希望你來問我
你就回答
我不想要的
但他你把東西
帶到地端
但是網路上的資料
你是沒辦法控制
因為他是上億筆資料
對不對
但你把他帶到地端
我就跟他說
我教你東西是
白日宰正確的
那你就教他說
我公司是符合科技的
文素養的公司
你現在來問
你的答案才會是
FIX跟正確的
你懂我的意思嗎
那這才能真正解決
Datute Deer的Work
好
OPENAI
就是你晚上睡覺的時候
在想什麼
就是What Keeps You Up And Night
就是你最近
可能最大的挑戰
或者是
還好
你都在想什麼東西
其實我覺得我
這個公司
你如果去網路上查我的故事
我是十年前
大家不看我一樣
我做的時候是連
Dimai
阿發購都還沒擊敗人的時候
我就在做
AR而且在做
AR晶片
那時候是非常非常早的
等於是說我在選擇
一條路是我心中生性的
即使別人不看好跟不認可
我其實當時選的時候
我也沒有想到
也會這麼快爆發
對應該是說
本來在踏上旅程的
那一個時刻
就是在選擇
一條我認為是比較
忍耐跟孤單的路
那只是因為我生性
這條路是有意義的
而去做的
對
所以
反而這麼快
蓬佩發展
我還滿意外的
那我也覺得
滿有趣就是說
我絕對是從學生時代
畢竟DemiSARS比跟
就學我都認識
對
其實我認識他們的時候
他也滿有趣的
就是說
你可能不了解
我對這句話的意識是
我當時認識DemiS
跟就學我的時候
就學我Benjamin的時候
其實當年軟體是很值錢的
你去Google Facebook
可以抓非常多錢
然後我在BearLug的時候
他們去求那個案子
我以在意就看他去跟那個負責的
那個那個那個
那個Lid講說
他的八角要皮壓
因為
然後我就想說奇怪
你明學歷怎麼好
你為什麼不去Google Facebook
他們我看過他們
窮瞅瞅的時候
然後找八角找不到的時候
可是我問他說你們
為什麼要
要要選這條路
他的說法是說
其實
他把他定義為創作者
其實我也定義我自己是創作者
那他說創作者
最大的幸福
其實
我就是在做一件
我生愛的事情
不管你喜歡也好
不喜歡也好
他人們也好
熱門也好
我就是希望我這一生能去
證明這件事
真的
然後他去選了
對 他那時候真的是
窮瞅瞅到
連那個便當
我們都是去外面吃這種
這品質的這樣
對 那
那他說他很幸福
對 那我覺得
我因為跟他們合作
是很
感受到那種所謂的幸福
所以應該是說
現在反而是
沒有想到十年前
認為的事情
現在真的
也許大家還是有很多指甲
但我覺得現在已經
比我十年前
好太多太多太多
那我還剩下有這個
應該說我們十年前
定義種東西叫NPU
那不管你認或不認
反正
隔幾年之後
突然在學界大家認可
所以我才得答應論講
那
IQPOWE的
CTSO112學
然後那本
我寫的書才會這麼多大學用
那後來在三年前
因為卻GP的關係
大廠開始
跟
OMG
AMD跟
Intel跟
Cocon跟
那
現在
我們公司也做了很多客戶
就是什麼Penaloni
Gami
Ryche8
NH
那最近是一個
國際
我覺得是一線巨頭
對
那有一點像是我們剛打完了
一個華山論解
然後我們
在裡面
晚敗了大家
就是即使跟著人
也被我們幹掉
對
那只是你們還不知道而已
你知道
對
那
你就會覺得說
反正現在每天都還
還滿有精神的
對
就應該比我十年前好多
我十年前還被追在過
公司還是兩個人這樣
OK
好 谢谢你 偶尔
OK
Podcast Summary
Key Points:
- VPN在出國旅遊中不可或缺,可用於訂房差別定價、解鎖串流平台及保護公共WiFi安全。
- 來賓劉俊成博士是耐能智慧創辦人,定義了NPU架構,專注於AI晶片設計。
- AI運算從訓練轉向推論階段,NVIDIA GPU在推論上功耗高,NPU和ASIC更具效率。
- GPU的優勢來自CUDA軟體生態,但硬體非為AI設計;NPU和TPU等專用架構更適合AI。
- 劉博士預測AI晶片將從GPU過渡到NPU,類似小客車取代卡車,ASIC僅限於特定垂直應用。
- 耐能提供可重構NPU,能適應不同AI模型,未來主權AI和數據中心將推動獨立NPU需求。
Summary:
本集節目探討AI晶片技術的演進與未來趨勢,由主持人與耐能智慧創辦人劉俊成博士對談。劉博士指出,AI運算正從訓練階段轉向推論階段,NVIDIA GPU雖在訓練上具優勢,但功耗高且非專為AI設計,推論效率不佳。他舉例Google TPU和耐能NPU等專用架構,在單位功耗的AI性能上遠勝GPU,類似小客車相較卡車在城市中的省油優勢。他強調,ASIC僅適用於單一垂直應用,如Google或Amazon的特定場景,而NPU具備通用性,未來將成為主流,並可能分化出TPU、LPU等子類別。耐能作為NPU定義者,推出可重構NPU,能靈活適應變化的AI模型,如從Transformer到Mamba架構的演進。劉博士認為,AI模型架構持續變化,硬體需平衡彈性與效率,NPU將在數據中心和主權AI領域扮演關鍵角色。整體而言,節目強調專用AI晶片正逐步取代通用GPU,推動更高效、低成本的運算解決方案。
FAQs
VPN可以幫助你訂到更便宜的飯店,因為旅遊網站可能根據數位足跡差別定價;出國後還能解鎖被鎖住的串流平台,並提供安全保護,讓你連回台灣使用習慣的網路設定。
NORD VPN速度很快,品牌大且使用安心。使用專屬連結NORDVPN.com/techwve可享30天無條件退費,購買獨家方案還額外送4個月。
NVIDIA GPU的優勢在於其通用性和CUDA軟體生態,能快速進行大規模訓練,但成本較高。TPU等其他架構在單位成本或功耗上可能更優。
CPU擅長邏輯運算,GPU擅長並行處理(如圖像),NPU是專為AI設計的通用架構,ASIC則針對特定應用極致優化。NPU在單位功耗的AI性能上通常優於GPU。
未來NPU可能成為主流,因為它兼顧通用性和效率。ASIC只是針對特定高頻應用的暫時方案,而GPU在推論階段因功耗高可能被NPU取代。
NVIDIA GPU在推論時功耗很高,而NPU或ASIC能以更低成本完成相同任務。隨著模型趨於成熟,推論需求增長,GPU的劣勢會更明顯。