Go back

EP125 - NVIDIA 護城河失效?誰會是 AI 晶片贏家? | 專訪 耐能智慧創辦人暨執行長劉峻誠博士

76m 23s

EP125 - NVIDIA 護城河失效?誰會是 AI 晶片贏家? | 專訪 耐能智慧創辦人暨執行長劉峻誠博士

本集節目探討AI晶片技術的演進與未來趨勢,由主持人與耐能智慧創辦人劉俊成博士對談。劉博士指出,AI運算正從訓練階段轉向推論階段,NVIDIA GPU雖在訓練上具優勢,但功耗高且非專為AI設計,推論效率不佳。他舉例Google TPU和耐能NPU等專用架構,在單位功耗的AI性能上遠勝GPU,類似小客車相較卡車在城市中的省油優勢。他強調,ASIC僅適用於單一垂直應用,如Google或Amazon的特定場景,而NPU具備通用性,未來將成為主流,並可能分化出TPU、LPU等子類別。耐能作為NPU定義者,推出可重構NPU,能靈活適應變化的AI模型,如從Transformer到Mamba架構的演進。劉博士認為,AI模型架構持續變化,硬體需平衡彈性與效率,NPU將在數據中心和主權AI領域扮演關鍵角色。整體而言,節目強調專用AI晶片正逐步取代通用GPU,推動更高效、低成本的運算解決方案。

Transcription

3162 Words, 27668 Characters

Chinese
哈囉大家好歡迎收聽科技浪物事組陳哈利 科技浪是一個白話跟你聊科技的podcast 希望可以用簡單易懂 但是又深入的方式 帶你瞭解實下最好的科技話題 本集節目由NOR VPN 站主播出 最近春節壞到了 相信很多人都有在規劃要出國旅遊 或是回國過年吧 在整個規劃的過程當中 從你規劃旅遊到你實際出國 我覺得VPN都是一個不可或缺的工具 像是你在規劃行程的時候 你要訂飯店 你使用VPN的話 很有可能可以幫助你訂到更便宜的飯店 因為這些旅遊網站可能都會透過你的數位足跡 去做差別定價 在你實際出國之後 VPN也是一個非常方便的工具 像是像我本人現在就在越南現港 我第一天來的時候進到旅館 我要連WiFi 我想說看一點劇、看一點動漫這樣 結果沒想到串流平台是被鎖住的 我沒有辦法直接看 但這個時候用VPN我就可以看了 當然我在各種咨咖啡廳 使用VPN不但給我有自安的保護 也可以讓我可以連回台灣用我更習慣的網路設定 當然除此之外VPN還有很多其他的功能 我相信大家日常生活中 多多少少一定都會有用到的地方 不管你是要在台灣要打國外遊戲的伺服器 還是你想用一些國外才用的到的一些AI功能 AI工具之類的VPN都非常使用 那你如果要訂一個VPN服務的話 我真的是非常推薦NORVPN 我自己本人已經是用了三年多了 整個使用的過程中是覺得速度非常快 然後這個品牌也真的是很大 讓我用得非常安心 那你如果要購買NORVPN的話 一定要使用我們科技量的專屬連結跟優惠 我們的專屬連結就是NORVPN.com/techwve 在解釋上的售出 我們的專屬也會把TECHwve不但可以獲得30天物條件推廢 購買獨家方案的話還可以免費再送你4個月 OK 那這個專屬連結跟優惠 都放在本級的資訊欄 有興趣的可以自己使用 本級AI就要這邊使用一些NORVPN的贊助 好 那我們本集科技量又是一個久違的防彈節目了 我們這次邀請到一位重量級來賓 就是耐能智慧的創辦人記執行長 劉俊成博士來到我們的節目 那劉俊成博士他是非常資深的半導體專家 他拿到了UCLA電子工程博士之後 他先是在高通 三星電子研發中心 陳星半導體跟Wireless Info的企業認職 然後在2015年的時候 在美國勝地牙哥創辦了耐能 那劉俊成博士態勢很多國際知名學術期刊的技術審搞人 也是清大助理教授交大跟成大的課作副教授 然後在人工智慧的領域有超過30餘項的國際專利 他有出版兩本書 一本是叫做深度學習硬體設計 然後另外一本叫做認識人工智慧第四波工業革命 在很多國內外的知名大戰院校都有當作教課書 那我們今天這集Podcast會討論到許多大家最關心的半導體話題 當然像是MVDR的護成和 各種AI晶片具體的差別跟未來究竟會如何發展 好 那我們這邊就廢話不多說 一下是我跟劉俊成博士的對話 好 奧本歡迎來到科技浪 哈利你好 那奧本你作為一個AI運算硬體的專家 我覺得還是不免俗的 應該先從MVDR開始聊一下 那我們都知道AI的運算分成訓練跟推論這兩個階段 那其實我覺得一直以來在業界的共識就是MVDR在推論這邊的護成和 比較低一點 比較沒有那麼強 但是在AI訓練這邊的護成和是非常強的 還有什麼人可以取代他們 但我覺得像去年年底這個Google推出JM3的這一波 就是大家很多人一試到說 原來完全不用MVDR的GPU 也可以訓練出一個最強的AI模型這個JM3 那因為Google他們就是用自己的TPU訓練的 那這邊我不知道奧本你怎麼看 就是MVDR在訓練這邊的護成和真的有這麼強嗎 我覺得有幾個層面看 就是第一個叫做通用性 就是讓很多人都可以很容易在他的平台上訓練 那這一點MVDR的護成和主要在軟體層面就是在哭大 對 那事實上他的GPU在做AI訓練上 因為他強調他的通用性跟他的所謂的暴力式的去訓練 等於說如果你今天定義是說怎麼樣用最快的時間 產生最大的訓練效率 那這個MVDR的效果也是蠻好的 但如果你的定義是說用最小的成本 那或者是說相對應低功好的方式來訓練 或者說通用性不用這麼強那TP會比MV來好 應該是說其實GPU本身就真的不是為了AI而生的 只是我覺得今天有點像是很比較應用的一個非常靈活的軟體架構 但是他的底層的硬件其實還沒有專為AI的這個 不管是訓練還是推軟而去生的這個架構來做這件事情這樣 那TPU其實應該跟我們開始做時間蠻接近 我應該是10年前開始做NPU那TP應該是比我們晚大概半點到一年 其實Google D賣的那個方的就是Demis Raspi 就是現在在張冠整個AI的那個大腦 我也還蠻熟的這樣 黃玉勤其實應該上週應該跟他也在 上週在美國應該也有一期接受那個你有教授的專訪 所以以及剛好這兩個人也都還真的是相處還蠻深的這樣 所以主要的其實MVDR在訓練這邊的互相而還是 KUDA的這個 就是這個軟體層的部分 在其他部分因為我們講到這個AI的訓練系統 其實很多人會說這個互聯也是一個MOTEMOTE 也是一個互相而 就晶片跟晶片之間的互聯 然後機貴跟機貴之間的相連 那這邊原本很多人也是覺得說這可能是NVDR他們系統 在訓練這邊互相而的很大的一部分 但是Google在TPU這邊也是足夠強了什麼 我覺得應該是這樣 我覺得GoogleTPU跟這個Gemma 而且它證明了一件事情 就是我們一直甚至也是不只TPU在說 甚至包含我們自己 跟大家self的一個概念 就是說AI的硬體的Mite Tekendrich migration就是技術的這個 這個眼鏡 有點是從CPU變GPU到最近 剛剛你大家有一些題目看 好像也會cover到叫AIASIC 對那在所謂的LAYNPU架構 其實不管是TPU或者是最近很熱的LPU 其他都是真的是LAYNPU架構這樣 應該說LAYNPU架構你把它在雲上的訓練強化 就是把10身扣加強那就是TPU 那如果你把它在大圓模型一進來的 第一秒的那個Token數加強 就是加了很多S-RAN 但是隨便蠻貴的 那這個就是LAYNPU架 就是Mite最近收的那個公司 我講到這邊滿有學 就Mite最近收購的GRAC 對 它就是我覺得算是 在之前大家講到AI的ASIC 是蠻常會提到的一間公司 因為他們做了這個LPU 就是號稱非常快速的推論 對不對 高速推論 那你怎麼看Mite Sogo這個GRAC的這個案子 他們的策略可能是 還是在回到我剛剛說的概念 就是AI的運算的效率 從CPU到GPU到AIAS 到NPU的這個趨勢 其實剛好也是上個月在扭角所 一個在這裡就是 我們被採訪的人 我想扭角所應該在國際上非常的權威 就是真的是世界最大的教育中心 那被採訪的應該有Intel的前CEO配置性格 因為陳立武他那天 沒有參與這樣 所以陳立武沒有去 那他基本上就是CPU的代表 那再來就是華人熏本人 就是GPU的代表 那AIASIC的代表是波抗 波抗的Price的家裡 那這個如果需要我可以 晚一點把照片提供你 那NPU的代表是我們這樣 那是 因為我們在國際上當然 就最早做這個NPU 然後最早把它量纏 那為什麼這樣說呢 其實他在某一些層面上 他很像從錄影帶到 DVD到NPU3水盛點 只說是說某些層面 因為他這個層面 應該說這個尾度不完全正確 應該說你要在平量一個硬體 他其實有兩三個層面 但如果你AI的運算效率 在存硬體層面 軟體層面又是另外一個 另外一個角度 但如果在存硬體層面 這個講法是對的 在DVD到NPU3 意思說他是顛覆性的加溝 應該是說CPU他的本身設計 就是專位邏輯運算而生的 你可以想像CPU他有好幾個盒 大家的盒可能不會到很多 大概32盒 16盒這樣 但每個盒 他做加減層處非常的強 就是額入 然後甚至有一些層髮 是一Soupter這樣 所以你可以想像他每一個 很的人 每一個盒 他有點像博士班的水平 那GPU其實在人類歷史上 應該存在了30幾年的加溝 CPU更早 CPU30幾年 那CPU最早設計是在做圖像跟遊戲 他有點像是二為空間的矩正相成 那這個矩正相成 是三個圓設的矩正的微廳 就是RGB 就這樣 要很快地在一張照片進來 或很快的一個影像進來 我要知道每個相數 它最好的呈現顏色是什麼 所以一開始GPU的設計 它就是你可以想像它是可能有 上百個合 256成256 就是照片一進來 假如是256成256成 或者1024成1024 那最好就是256個合 然後每個合可以很快的 三個舉證 就是舉證就已經它 這個跟相片一樣 的這個大小一進來之後 可以很快的勝出 每個相數的微定 所以它做法很簡單就是 這個顏色紅色的 比方說占比凡色時 綠色占比凡色30 然後藍色占比凡色30 那這個就混出來 就像調色盤 所以它工作 你可以想像說250 有合每個就很像 是一個中學生的程度 它要做的事情 只是把三個顏色的微定算出來 那後來黃燻燻 可能想說 哇我有這麼多的這個 2506個合 那我嘗試在上面 加一個軟體 讓這個軟體呢 它意思就是說 它可以不是只是做 中學生算是算把 算把的程度輸出 這個CPU輸這個博士山 它可能沒辦法做這個 做這個微機分 然後但是 因為我有很多合 所以我一次 它就發現 就是說 在做圖像 意思說 在大量的快速的 病型運算上 很快的 每一個小小的 去做一個加緊程度 應用器程度 所以它就 做了一個很 通用的軟體 就是苦打 這花了十年 當時機在花了結被吵笑 然後大家都說 它這個要幹嘛 但它其實 也沒有想到AI了 它當時想法是說 只要你的這個問題 的定義是 我的運算量一次是 很大的 然後每一個小的運算的 單元 其實都是比較簡單的 沒有像CPU這麼複雜 意思說我現在有 256個 這個高中生 那它不要 只有給我算 這個照片的 這個微挺 如果說我現在算是 比方說隨便講說 今天 賣場有 25個收音機 我要一次快速的 數個預留 那我就每個高中生過去 反正每個都是 只是算每個人的節長 這很簡單 那 這個問題 用我這個也能做 那如果我在 換另外一個問題 它可能是說 我這個大樓 一定有256個人進來 我看每個人的 連跟你驗證這個 那每個工作也都很簡單 那我這個也能做 所以它的 哭打一開始的定義是說 我不管你的問題是什麼 只要你的問題符合 是一個大量的單位的 位元 來做運算 你就可以很容易的操作 那 所以GPU 它基本上 概念就是一個人海戰術 對 很多很多 運算和行 然後他們 什麼樣子的 算數都可以算 但是 但是 要算什麼 可能比較簡單 要算什麼 就是看這個 酷辣怎麼去運卡 沒錯 但 接下來 現在不眼睛的這個 Asic跟NPU 又是什麼 Asic很好玩 我覺得現在有很多人 把Asic跟NPU 或類ANPU 加過穩在一起 但其實不一樣 真的是不一樣 應該是說 我小的時候 其實就Asic 應該是說Asic 在行業內的定義 叫做我把某一樣東西 在某一個垂直 因為我把做得很經驗 對 Avocation specific IC 沒錯 當我以前在學生時代的時候 我其實有參與 那個 就是納少的一項子 還有埃爾帕蘭子 所以以前 又在Bairlab參與一項子 所以其實也滿心悅 有認識那個 就是 三個CNG 頭的凸凌獎 那三個 對 就是那個 Benjamin 那個幽喜瓦他們 對 然後央蘭困 你等一下有個問題會叫他 那滿巧的 當時在Bairlab 合作的時候 他們當時其實已經離開Bairlab 但是因為美國是 Bairlab其實 有很多政府的 專案 所以有時候他們也會回去 參與一些專案 反正當時就有一些overlab 對 所以我是 我是算是在行業內 很冷門很冷門的時候 就在碰這個領域的 那 Longyi 就是說 在當時還沒有AI加速 晶片出來的時候 其實就有專位 圖像 應該是說專位 GPU 或專位CPU 而做的ACC 其中我們當年做一個 項目是 我們做了一個 火機器人上火星 當時也還沒有AI算吧 那火學生時候 然後那個火星機器人 你可以想像說 火星的整個 大氣的環境 跟地球是差很多的 他可能 付200度 地球可能根本沒有這種 基地氣候 然後在他的那個 那個那個 宇宙的那個 那個層服很強 另外是火星的顏色 很單調 他沒有像 地球就是 油海 然後綠色 什麼 軟體八道 所以他要加強 他識別紅色的能力 因為說我單用 我原本地球的GPU 或我單用 我地球的CPU 要拿去做 他是沒辦法支持的 而且再來是 你要把這個 火星機人送上去 他其實 很 應該說你增加一公克 或增加兩公克 對太空的運俗 都是一大大的負擔 所以他就為了 這個火星條件 把地球的CPU 或地球的GPU 把它不要的東西 三三簡簡單 然後他需要的東西 把他加得很強 那就是其中 就是當年的 GPU的ACC 這個東西叫 AZIC 以前我有做過 那種非常好玩 就是周際飛彈 周際飛彈速度很快 那他在飛彈上去 識別東西 他就不像我們拍照 我說 這個每秒30增加 我們認知的 real time 就是人類的視覺 所以大部分你在 不管做數位相機 還是這個車禮的這個 形式機物移 每秒30增都是一個門檻 但周際飛彈 有些到因素 甚至超因素 那他叫 每一秒 你懂意思嗎 意思說 現在地球的CPU或GPU 也都承受不了 那他就專為這個應用裡 把它做到 他的Cluck-ray 就特別的 頻率就特別的高這樣 所以AZIC 其實在 很小的時候 就有了 那今天 有理像是AI 你剛剛講的那些應用 其實都 都不是 只靠KUDA+GPU 就可以解決的問題 沒錯 這個要更 更本地改變這個 晶片的架構 沒錯 那應該說 甚至還沒有GPU時代 就在Intel CPU時代為主的時候 就有AZIC 對 那你可以想說 AZIC的特色 通常都是某一種 垂直應用 我把它做得很極致 然後其他 不用的 我就把它拿到 就是大家有刷 壓刷嘛 那有些 壓刷做的是特別 尖尖細細的專門 做那種 壓軸病的那個 縫的那一種 那你就可以想像 壓刷 就是比較通用的 壓刷 那 那 為壓刷 的專為 壓軸病而生的 就是 壓刷的AZIC 大概就是這個概念 那有一點像是AI出來之後 有點像在過去 這幾年 蓬勃發展 在我們這種NPU還沒出現的時候 你可以想像說 GPU剛好 它的特性 相較於CPU 在做AI就比較 比較方便 原因是你如果看過那個 腦神經緣 它是上 有些人知道 上前到上萬個點 然後 每個合式 做的 卡姆路線或布林 就這樣 它在做這個 腦神經緣跟腦神經緣 連結 人腦就是很 商業一個神經緣 所以 意思說 相較於CPU 一次只有16合或30合 然後每個都是伯式 那不如這個GPU 256合 256合 來做這個腦神經緣 比較接近 所以我有時候會在行業內 應該說 你可以有兩個層面 來看CPUGPU到 所謂的NPU的演化 我等一下再講AZIC 那 我另外一個解釋 其實這兩個解釋都對 但是它 因為 有點像是一個三位的事情 所以你要把一個 微肚 FIX 你才能去 找到這兩個微肚的 邏輯關係 那你在把另外一個微肚 FIX 你才能找到這兩個微肚的關係 所以我剛剛說 從錄影帶 變成DVD 變成NPU3 這個相較於CPUGPU 這個NPU它的 這個微肚代表是 算力的微肚 就是單位 工號創造的 AI的性能的微肚 這個比喻是對的 意思說小小的一個NPU 可以取代 很多的GPU 或取代很多的 這個CPU 就是小小的一個NPU3 隨身也可以取代很多錄影帶 取代很多DVD 那另外一個微肚是這樣 就是工人性的微肚 就是說 其實我剛剛說這個 是以NAI的算力 所以是 CPUGPU 變NPU 但如果我今天是以 我做圖像的能力 那不好意思就是 GPU是最強的 你懂一說 那如果我今天還說 做邏輯運算的能力 那就是CPU最強 那它可能就 就是 NPUGPU CPU 如果以邏輯 單位來講 所以我有時候會 舉例說 其實CPUGPU NPU也很像 坦克車 因為確實 CPU的能力是 這三個 硬體裡面最強的 所以它很像 坦克車 它主要工作是打仗的 那 這個GPU 很像坦克車 很像卡車 它的供用主要是 在貨物的 那 那有一天人類 蓋的城市 就是AI的應用出來之後 大家發現 卡車在城市 專門專門去 坦克車神遊 大家就以為 GPU是適合作為 事實上不對 那A-C可是什麼呢 有一天 大家發現 我這條向到 特別的窄 那時候我今天 從台北到內湖 它就是 有一條環核快速道 那我就 專門開住 到的寬 它可能是很窄的 我就把我的車 做成這麼小 那這樣 它就開很快 但是呢 這個不是 用於非環核快速道 我要把這台車 從台北開到新竹 或台北開到高雄 它又是就沒有這麼方便 所以A-C就是 有你像是AI的模型 人類對AI的 應該說 人類剛 發現AI這個應用 剛蓋城市的時候 城市還沒有完整 但人類對AI了解 還沒有這麼深 那 它有各種 不可怕的道路 就是說 大家對AI的模型 我相信 從過去這10年 有 AlexNet,RESNet,VGG,TRINSTWOMER 對不對 那 那 應該是說 甚至最近每兩三個月又多了出一個新的模型 那有些公司或有些應用 我覺得某個模型是我現在最K而的 我很急 那我會覺得GPU太貴了 因為我剛剛說GPU是坦克車 哎 是卡車 我要卡車在這個這裡專業專業很好有 所以我就專為我這個應用 專做了一種獨特的車 這種就是所謂的AC可在 那最知名的當然就是這個播com這樣 所以這一次你有教授才會找了 Intel Media播com跟我們 NPU跟TPU跟這個LPU就是Quack 到底是什麼差異呢 你就像MP3學生也剛出 應該說MP3這個技術剛出來的時候 大家記不記得這個MP3它 曾經有些公司把它跟播割的東西整合 最有名就是Apple的IPa 跟IPa 那也有人把MP3這個技術跟 我記得而數時當時 我當時學生時代老師在講客 它出了一個就是有點像是錄音筆 然後跟MP3整合 然後我按下去我就可以把老師的刻都錄下來 對 那這又是另外一種變形 那有人又把這個MP3整在這個Memory當狗 就是這邊MP3隨身點 所以有點像是AI的應用出來之後 NPU是一個比較通用性的架構 所以今天喊NPU的公司除了耐能之外 還有什麼Intel Media on AMD 對不對 甚至Quackcom 所以你看到NPU的喊的就是好多大場 為什麼因為它是一個很通用的架構 對 那某些公司為了這個通用的架構 去 比方說剛剛說的Google TV 它是為了要雲上的訓練去加強 因為雲是Google的核心 那它就把它的Tencent Core加強 Tencent Core就是你的Vector要進去的時候 它的運算 那這個就會是TPU 那LPU那個公司呢 其實它要強調它跟GPU最大差異 是大語源模型 那大語源模型其實那個Memory 一進來的那個Token的Memory很重要 就是它想要一 大家如果去玩那個Quackcom的話 你壓下去 哇 一下子一片文章就出來 那個速度超快 為什麼它就是對一點很多Sray 但一生說你其實很貴 所以這個做法不見得是好 甚至它單位的成本 不見得比GPU好這樣 對 但是它的好處是你 我移弄進去它就一下爬爬就進來 所以你可以想像說 有點像是 我有說說人類建造的程式之後 NPU就像小客車 那小客車在城市轉來上去比較省油 那其他在AI的應用就是最好的 但是小客車也有一些車 它把它改成兩輪的 就很像小摩托車的那種 它因為它可能 香港就這種車 這樣轉來再去比較方便 那又有人把小客車加個先輩 因為它可能就是債貨物 有點像跟卡車的混合型 那也許它就是那種 相信小客車 OK 那我整理一下 我剛剛聽到了就 依照你的架構就是 這個排名是依許CPU到GPU到AIAC 現在NPU在ASIC吧是不是 還是現在ASIC的缺點 應該是現在NPU在ASIC 如果是從這個美單位的算力效率跟 但ASIC就會很垂直 非常的垂直 就是說 不然說它也許就是和跑ASIC 它在做任何運行 功能性就是另外一個圍度嘛 對 我們單純看這個 美單位的算力跟 通用性就是Flexibility的圍度 這樣子的排名排序是對的嘛 就CPU到GPU到NPU到ASIC 就以AI的算出來的效果 在某個垂直應用的話 這樣的排名是對的 然後 但問題就是 但我這邊的ASIC我會希望加AIAC 這個才是比較正確的 對 因為ASIC也可以是GPU 是GPU的ASIC 對 那這個就是在某一種特定的AI應用才會這樣子嘛 但問題就是 在於現在的AI應用實在是太多元了 雖然說我們的模型架構 感覺會慢慢的就是過去這幾年 非常去向於這個Transformer這個架構 但是其實Transformer的架構 過去這幾年還是有一些些微調 沒有到很大 但是還有些微調的部分 然後同時我們怎麼使用這些AI模型 這個Work具體的Workload 也會可能不一定會直接影響到 晶片架構本身但是至少從系統的角度來看 包括它的這個Memory 包括其他的部分 其實也是會有影響 那這邊的關鍵問題就是變成說 未來的AI的架構到底是長什麼樣子 對吧 就如果我們已經很確定未來的架構 就是某一種樣子的話 那我們可以說ASIC應該會是最後的影家 因為假設所有人 這個真的怎麼對 這真的不對 這個就真的是有點誤取 首先是這樣 應該是說模型會一直變 對不對 這個就是人類對人人腦的理解不同 所以我今天以為的這個 到了明天可能不同 另外是ASIC的應用 我就說它最後是一個TradeOff 所以TradeOff是說 靈活性跟限制性 你知道就像 如果你 如果你剛剛的Arguments正確的話 那意思是說在GPU時代 CPU時代ASIC也是最好的 但是並不是 當然我的Arguments是基於說 我們只看某一種應用 然後那種應用就是未來 就比如說AGI 我們已經知道AGI的架構就是長這樣 那我們就為它做一個ASIC 它就是會奧運的MPU GPU CPU 那如果以你的Arguments來講 CPU跟GPU的時代裡面 它的嚴敬 其實像CPU其實60幾年 GPU也30幾年 那為什麼並沒有在某個 隨機用不要用你的手機 它叫做XXASIC 那你的電腦筆電 這個應用已經非常不錯了 它也不是XXASIC 為什麼呢 所以為什麼說 剛剛那個講法真的有點不太對 為什麼會真的覺得不太對 因為事實上是長了有幾個原因 你知道Tapile一個Chip 它的成本很貴 所以它一定要一定的靈活性 不然我當位某個隨機應用 像說我剛剛說的當年的活性機器人 它也許就只需要100台 1000台了不起吧 對 結果為了這1000台 我去Tapile一個晶片 我陪似 所以最後它一定會cover 一定程度的同用性 你懂我的意思嗎 所以以當年的歷史 不管CPU GPU 其實最後都是PU取勝 而不是某種隨機應用的ACC 原因是因為投入產出成本不符合現實 另外AC為什麼製作為叫ACC 就是它在某個應用是非常非常好 但它就是非常的細 你懂我的意思嗎 這就好比你再跟我說 剛剛小客車 為什麼還是小客車在市場上 你最常看到的 不管是投優場的銀行證明 還是它能打 它做的小客車都是那種標準型 但你確實有看到一些香港那種 或者是新加坡 馬來西亞還是有那種三輪的小客車 或兩輪的小客車 它為什麼它不是主流 對 我覺得基本上答案就是這樣 所以我認為最後 AIAC只是一個暫時方案 所以最後其實存在還是CPU GPU 就是我認為的未來的趨勢 那在未來的 Workload這邊 就是我這邊 Workload 定義就包括 這些AI模型的價格 On last 我這件事對也不應該說 它也是有個備論 就是說 來説今天如果NPU的時代裡面 有某個 subclass 它就特別的大 來説它雲的訓練就特別的大 那TPU也許就在這個地方 變成其中一個主要 就像當年我們在看NP3隨身體 你會看到iPad iPad 它確實也是量很大 那你也有看到某一種的這個單口 但是 類NPU 加過不然是TPU LP 或NPU 它相較於GPU都是一個 Game changer的 一個成功 意思說我的一個小小的 都是可以舉到很多GPU 在硬體層面 而不是軟 軟體層面又是另外一個問題 有時候軟硬加起來 它的多了一個圍堵 它的問題就不同 那我這樣問你好了 就是 假設未來我們 對於AI架構的這個 定義已經非常清楚了 然後我們大概知道說 可能接下來不會有什麼太大的改變 那在這種狀況之下 專為這種AI架構做出來的這些ASIC 跟GPU比起來 他們這兩則怎麼比 就到時候我們還會像現在一樣 會使用NVDOT的GPU 就算了還是說 我們就是既然架構已經定了 我們就用一個ASIC就好了 我還是再強調一下 GPU跟ASIC為什麼會這麼的不同 是什麼意思啊 PU在行業學裡的定義叫ProcessUnit 所以ProcessUnit是說 我把我的指定級改了 我的能做的東西就會變很多 你以CPU來講你的筆記型電腦 跟你的計算機 那你的我去筆記型家 我今天可以拿來做Word 然後我可以來做Excel 我可以拿來看Browzing的Waps 就是網路 來這每個應用期差也很大 意思說我只要改變一個印刷券 它能cover的應用很廣 那這種應用cover到夠廣 讓我能太爆一個晶片 那這個PU就會是一個歷史上的存在 它就是一個Standard 那GPU實在也是一樣 我小時候玩那個可以拿來玩馬力哦 那我改變一下印刷券 我可以拿Fine Fantasy 這位太空站是這個T-File跳起來頭髮的肥 對不對 那我明天又可以拿去打這個 看那個電影 然後這個流暢度畫質很好 所以你仔細看這幾個PU的特色都是 它涵蓋的很靈活 那為什麼NPU在國際上變成了一個標準的名字 那這也是為什麼會來開始會有一些公司想要說 我做了其實 我 不會想要把cover成PPU 像TPU為什麼人家叫TPU跟LP 我也是能做到HandupPU 它已經像在通用的應用下 它還是有個小自己 像我說NP3變成Standard 但是iPad iPad 在眉 remember 也變成Stender 因為它的量夠大 所以它最後一息是一個 技術的邊界跟應用的邊界 Cover到一個夠大的範圍 它才能被較為PU 我應該是這樣講 我認為在類NPU時代或後GPU時代 AXIC只是一個暫時方案 但最後會有幾個Subclass叫XPU 或者什麼TPU或NPU這樣 那NPU是最多人用的原因 所以它Cover是 就是一個最好的背人是這樣 所以你一直說就是未來 食物上來看 就儘管 就是可能AI的加工已經訂了 但食物上來看 還是會需要有一點彈性 彈性還是有很大的價值 就是我會認為 今天AI會怎麼會讓你覺得是AI AXIC的概念好像說 我今天問你個問題 你就只會回答幾句話 那個就不會讓你感覺舒服 你懂得說 那為什麼現在在某些公司 像Microsoft或Amazon 它會願意做AXIC 不要說今天 Google還有一個英文是YouTube 我一進來就是要點播 就是廣告的投放 或者是Facebook我一上去用 就有某個廣告的合放 這地方用AI跑 你用GPU跑 它很貴 它每個月電費可能是1000塊 那如果我只因為在這個英文 因為我每天都要用 我就為它專開一個AXIC 那這個英文 變成我的成本就變成一塊錢電費 那但我每天用個上百萬次 那這個AXIC就會存在 那任何一個東西 不管是哪個AXIC 或哪個PU存在 一定是它有價值 創造價值才能存在 那為什麼我認為PU 最後會是有幾種 就是紙集 是因為 我認為的AI是 我今天跟你講英文 你跟我講 就是 能幫我創造價值的是 我不能 你不能只給我處理 文素處理的應用 我明天要能幫我錯影片 然後我是今天心理不好 跟你聊天還可以跟我講話 甚至唱歌 那或者說 我今天放到車子 它可以變半自動駕駛的一個NJ 或我可以拿去放在 這個大樓去做這個門禁管理 來 它的應用比較夠多 那它才會 對我來講才能存在價值 Online這個單一的垂直應用是 你每天用的代價是很高的 它這種AXIC才會存在 那我們回到MVDRGPU的話題 對 MVDR 我自己覺得它 有一個很多人 沒有特別重視的 但我覺得是蠻關鍵的一個問題 就是 關於MVDR的GPU 還可以再進步多少次 它有幾個十倍可走嗎 因為我覺得很多人現在都 是我們說 OK 我們看到Hopper到 BlackRock進步這麼多 然後那個 BlackRock到Ruban持續進步 它一定會每年這樣持續進步下去 但我自己是覺得說 這個也不是免費的 就是其實 尤其在現在Morning已經 算是死亡的狀況之下 當然這個有些底背 但像黃仁雄認為 Morning已經死亡了 其實GPU的進步很多時候 是來自於一些Trick 比如說降低精度 或是 SufferHoward的一些Code的散熱之類的 那你覺得這邊MVDR 我們還有幾個十倍可以走 首先我說了 Morning有沒有死 其實我剛好我們沒辦法 沒這種我們都會 都半到兩頁的局 然後黃仁雄跟麗莎蘇都 我都會在那裡遇到 其實這兩個人看不懂 對 就是黃仁雄認為Morning遇到 後面是黃氏定律 麗莎說的是Morning還存在 其實他一個是建輸 一個是建靈 其實兩個概念都對 他都在成縮一個事實上 對 那回到數的本質 就是說GPU的持續到 你能持續多久 好 那我說了 就是說其實 幫黃仁雄最近 為什麼運氣買這個LPU 應該是說AI世代 會有所謂的Face 1Face 2Face 3 我有時候會講說 太陽底下 沒有新鮮事實 今天的LM時代 其實在更早之前 實驗時代 已經走過這三個步驟 這樣 應該說你可以想像說 LM比較像人腦一樣 很聰明的AI 但是在16年到19年 其實有個貓跟狗的腦袋的AI 就是實驗案為主的 或者是叫LSTN為主的 他其實在做影像識別 或語音識別 或RN為主這樣 對 那當時呢 在模型 大家都是無道有的時候 那個我們叫Face 1F 當時對岸有這個商湯 雲重E2 這個什麼AI世小龍 那美國當然就是Google Facebook Microsoft 那我剛好也 工逢其勝也經過那個史蘭 因為15年就在做這個事情 那當年的16年最初 其實大家也就是買很多GPU 在做訓練 那去年他的特色就是說 就是我回答你第一問題 MiaGPU在訓練的優勢是 他就是暴力 你就是說他很貴 然後他可以用很快的速度 大量的用最快的速度去訓練 如果你Mia在訓練的成績是十分的話 其實今天Google TPU的單位創造的 訓練成本是 效率是沒有像MiaGPU 他可能是7分這樣 對 但是 RU 成績的耗電可能是100 那TPU的耗電可能是2或3 大概是這樣的概念 那一樣的是說 如果你拿這個訓練 很貴很貴的這個100的東西 結果當大家的模型都一樣了 你知道16年我就影響 影彩的經歷的那一段 就是商湯說他跑出來的模型是 人臉是別的版是99 然後雲重說他是99.5 然後呢 隔一兩個禮拜變99.9 然後99.9 後面是99.9 後面99.9 後面大家無感了 然後你就會發現16年的時候 大家買GPU 890%是還做訓練 結果當大家的模型都差不多 已經無感的時候 到第二階段就是執行 就是推論英文 那當你在英文時的時候 你用很貴的GPU 到英文時我就叫這個 這個Face2 到Face2的時候 大家如果都用這麼貴的 你就你競爭力就輸人家了 因為你就很貴的東西 結果你只要做 就是一說我剛剛說了 MVIDIA的訓練假設是10分 TPU假設是7分 但英文時他只需要2分 就是這樣 你懂我意思嗎 那你用10分的東西 你每個月電費就比人家多 80% 那你投個壞 所以在英文時你就發現 雲上的GPU 變成80% 在做英文時只有10% 在做全理 還有一些小微調 那這個比賽是在17年到18年的時候 然後等到模型大家都差不多的時候 連英文時都差不多的時候 就到了Face3 這就是叫HAI 大家開始把模型變小 嘗試塞到中端設備 你當時看到人家的識別 雲上的模型 大概在1819年的時候 你的手機的那個準確度跟雲經 差不多了 那時候就很多什麼簡支量化 就是Consultization Puting,Transport,Dissortation 真六 當年就有真六了 所以Dipsick的這個真六 其實也不是新的 這個在當年就有了 那我認為 LOM時代基本上就在Follow 那三步 只是我們才剛過第一步 那Google TV一出來 甚至Dipsick出來的時候 其他在加快 Face2跟Face3的發生 那你剛剛說 Google Media這個褲打的護成很強 老實說Dipsick現在 他也不是用褲打的方式訓練 因為他被美國封鎖 中國不得已 去用很多Moe的方式 然後用了Dissortation Consultization Puting 去讓他 因為他沒有那麼好的褲打的系統 所以他用的是PDF 就在做訓練 他是更底層的東西 所以 就是科系有的時候 有趣的地方 其他就是一直在變 你懂得說 但我認為今天已經 我認為 我認為已經從Face1到Face2了 所以你還用這麼貴的GPU 老實說是很危險的 那我認為今年也許還 所以他們開始在喊這個主權AI 然後 那老實說這個主權AI的argument到底 廢廢 我來跟你分析幾年 就是說 我覺得你剛剛講到很有趣 就我們現在進入Face2 就是比較偏重於推論這邊 對 Inference 那其實我覺得從Fedia最近的一些 行為也可以看得到說 他們現在越來越 往推論中 推論的有法嘛 對不對 那 但是你剛剛有說就是 GPU他的設計本身 就是 綁得Mento就是不適合做 其實他連訓練都不適合做 老實說 他強了其實他的軟體 然後應用軟體去做這樣 其實Google TV是比較適合做 真正的AI訓練 他是類 MPU 架構這樣 OK 那你覺得具體來說 這邊會發生什麼事情 所以我們進入Face2的時候 NVIDIA目前其實 就雖然說就像你說的他在 跑推論的時候真的是功耗非常高 但是目前因為 就是很多公司他們可能 要首先可能就是 模型的架構上面會有一些變化 然後有Cuda的這套系統 能夠最好的寫出這些CustomColonel 可以最好的 去為他們的Workload做優化 所以目前很多人 其實在推論這邊還是都使用MVIDIA 但你覺得接下來這邊會改變嘛 對不對 我覺得會變 你等著看 而且我認為 Face1過去之後其實Face2跟Face2 就是同步啟動的 在這個 AM時代 那我還是回到我的 阿雲們就是說 但那在Face2這邊 你覺得接下來可能誰會是贏家 就是我認為他會擺花氣放 對 應該說MVIDIA的Cuda 互相和在Face2跟Face3都不存在 對 所以這也是為什麼他很急著 花大錢去買了一個LPU這樣 就MVIDIA的Cuda 互相和目前在Face2 這個階段可能就只是 Defaloper可能開發的方便性 這個有點像 我有時候會舉個例子 就是說 這個年代有點像是有坦克車 跟卡車在市場上 然後以前城市剛出來的時候 大部分的駕駛習慣開卡車 在城市轉來轉去 因為 當時沒有小克斯的選擇 對 後來有出現的小克斯 但因為駕駛都已經習慣看卡車了 我就不想學習這種東西 我已經正在我這裡了 後來卡車又拼命造使卡車成立的工會 把這個Sappline 竟然卡死 所以你可以看到GPU公司每次來台灣 現在都去參觀Sappline 竟然要讓做車的 就幫他做卡車 不要去做小克車 因為他也怕小克斯的崛起這樣 對 可是突然 加上油價當時還很簡單 就在CN時代 Ai算力的需求 沒有像今天LM 就是暴力式的增長到上百倍上千倍 Bers當年的CN時代 所以意思說 我開卡車跟開小克車 我的油價大概就差了20塊 那我卡車司機我懶得學 我就願意付這個額外的20塊的差價 沒錯 結果有一天 油價突然爆漲了1000倍 就是今天的LM時代 你覺得我 你另外一批人 你如果是土豪的時候 我反正我就另一花錢 但你另外吸引一群人 先去學小克車 然後當小克車開始崛起的時候 我覺得那個馬太效應就發生 那這邊小克車值得就是ASIC嘛 不是不是 NPU 你認為是NPU 是的 ASIC真的 ASIC不會通過你 所以像其他 OK 像目前很多的 滿有趣的 我覺得台灣的 台灣的可能都是在看那個叫做股市 有沒有 為什麼ASIC大家會一直在講 ASIC講白就是現在播放的股價很高 那是因為NPU還沒有普及 你懂我的意思嗎 OK 所以我把這個問題再講的 清楚一點具體 現在很多人可能在講的 就是在託論這邊 ASIC 就是ASIC取代MVDR這邊講的 可能是包括像是科技巨頭 他們自己內部研發 像TPU或者是 像這個 AWLAS的這個 Penium and Francher 但除此之外還有一些新闖公司 像Serever's的這種計畫 你認為這些不會是 就是小克車的銀家 不會出現在這邊什麼 不是我想要說的是講 是說ASIC跟NPU的認知 現在被人家把它混在一起了 你懂我的意思嗎 像你剛剛講的那幾個TPU 其實類於NPU加勾 所以它叫PU 你懂我的意思嗎 那會自己真的自稱ASIC 那就真的是ASIC 不要說暈上的公司 應該說ASIC只會存在暈的公司 但是在同用跟普及 不會是這種公司 因為它通信不夠強 你懂我的意思嗎 那你剛剛說那個 那個什麼CBRS 它是一個整個金圓的 那是超算中心 超算中心它也許 就是需要大量的運算 那它就做整個金圓的 但這種東西其實風險很高 所以你只一看 CBRS它的客戶基本上 就是某家 沙漠地的某個王式的某一個單位 就是ASIC它運用 就一定會非常隨時 它也許就單一客戶 你懂我的意思嗎 對 那所以通常會用ASIC公司 就是 Google或者是 Amazon裡面的 或者是 Facebook裡面 某一個運用它可能 每天 Sets是上前次 我才願意 做一件事情就開一個ASIC 這件事情在當年的CPUs 來跟GPUs來 就已經發生了這樣 那其實你剛剛 蠻多次提到你的公司 但我們還沒有聊到 所以我們來聊一下 就是那個 你們公司 是在做什麼的 可以跟大家介紹一下嗎 對剛剛那個 NPU老師講 全球廁所把NPU定義出來 就是我們 對 這是事實 我們在15年就在做了 其實你剛剛說的 CRAC的那個 LPU 那個比我們玩個3到4年 Google TV有比我們玩一年 所以 我們才會 所以你剛剛一提的這個NPU 其實 基本上就是我們定義的這樣 對 那大概 你要學會讀到我寫的書 所以 所以才 才能得到HP會打令論 講跟HP會的 CTS orCT的學會這樣 這幾個講還算是 滿權威的 達林隊應該是 Kate & Ceylon 時的口方隊以前有得國 我們也得了一個 Maxwell Maddow這個應該是 Corecom的方德 Evan Zekab的國 所以它在國際上是 很權威的 那你們的產品是什麼 我們的產品就是NPU 我們 那應該不是大家認知中的 因為 就像你剛剛說的 其實台灣人對於NPU的認知 通常都是什麼 手機裡面的 SLC裡面 對 那是因為台灣臉發科很強 或者是一個電腦SLC裡面的一塊 那你們的NPU是放在哪裡 我們的NPU滿多元的 其實應該這樣講 我覺得台灣認知的NPU 因為可能台灣的 半導體 IC設計公司 最有名的可能就練發科 所以我們的印尼啟爾 把NPU會被練發科帶到 那練發科對標當然是高童 那所以Corecom 所以我們也使對NPU理解 也會 很容易被 局限在這個方向 但是 上NPU是可以很多元的 對 畢竟我們是定義者 我們其實 至今有六七代的這個NPU在想像 那NPU確實能做在手機 它也能整在SLC裡面 但它也可以獨立存在 這個你 你把NPU忘掉 來看以前的CPU跟GPU 其實手機也有GPU 你的筆電也有GPU 那 可是你越大的系統 GPU是獨立出來的 為什麼你知道 因為 其實應該是說CPU 最有名的 當然是插860就要夠 就Intel 那MD其實也是插860 那 其實當年的CPU跟GPU時代 也有一個聲音 就是說 不可能有獨立的GPU 這個GPU一定會被整在CPU裡面 當年Intel就幹了一樣 是它的那個 那個任天堂的地方 就是整在 就是把CPU整在裡面 但為什麼GPU還是 還是今天獨立存在 好一點的筆電 它的GPU都是獨立存在的 對 那個遊戲筆電 對 為什麼 因為當你把CPU跟GPU整一起 兩個性能都會掉 你懂我意思嗎 所以連8K也很好玩 或者我不要講這個名字 這個得罪人 就是台灣有一些公司都說 它這個耐能不可能活的 這個 這個 這個NPU一定是整在 SOC裡面 在手機對 你懂我意思嗎 但是非手機不對 原因是因為 就是 就跟CPU跟GPU整一起之後 它性能都會各調一樣 當你把NPU CPU整一起 它的性能 NPU也會掉 GPU也會掉 因為它架構 我說了這三個是不一樣的東西 它架構從 那個Data Flow到 耳入這個運算單元 它的設計都不同 就是你把彈克車跟卡車整在一起 它能在乎我誤跟能打算嗎 很怪 真的有這種東西存在 那就像卡車跟小顆車 也有整在一起的 但它就是在乎我又不行 然後 再層次省油也不行 應該是說 它確實有它的需求 就是你以前有玩過那個Race-down Race-down裡面有水果 它只知道你沒有水果大跟紙甲 跟這個銷錢刀 它只是讓你方便 所以當有樣東西 你只要方便你不在乎性能 你在乎的是集成性 它就會是整在一起 手機就是這個例子 沒錯 但是你看 比較便宜的筆電 它的CPUGPU也是整在一起的 但是比較好的筆電 它在乎遊戲的性能的時候 它的GPU就是獨立存在的 一樣的NPU 以耐能的NPU 我們其實有整個手錫 對我們也有把 跟CPUGPU 甚至 DSP跟NPU整在一起的手錫 我們也有做 但我們也有做獨立的NPU 所以 那獨立的這邊 是什麼樣子的功用 越接近DataScenter 你越在意AI的算利 多明年的時候你就需要獨立 原因是我很在意它的性能 我就說 我就說 我今天就很簡單 我今天 你問了 你問了這個問題 就是很簡單 我要在台北新竹 在城市抓來轉去 我就不一定不會去開 卡車跟小客車的混合車 我一定會開小客車 因為省油 省油是我這時候最在意的 就是說 這個應用 如果是AI多明內的 我就一定需要一個 獨立的NPU 大概就是這樣 所以未來的NPU 也是擺花氣放 就是會有 雲上的DataScenter 很大很肥的NPU 它用的是 超算中心的 你懂我意思嗎 那 甚至會有一些公司 我為我的訓練 就把天生扣加強 這就是所謂的TPU 那還有這個 使此會有 而瑞進去的那個出品 那這個就是TPU的樣子 應該說 你今天只要把NPU 為某一種應用去加強 因為我今天把NPU 為了LAM的這個 偷懇加強 它就是LPU這樣 所以你說 你們的NPU是獨立的 然後是 比較是放在這條中心的嗎 沒有 所以你沒有很多種嗎 對 會總是獨立的 然後比較重心 但這個是 什麼樣子的Uscaster 像主權AI 我們有在做主權AI 可以定義一下嘛 主權AI具體來說 主權AI 像我們在德國的主權AI 就是單位時間 有20萬人 20萬人以上 去SS 其實我們也做了RIGER 我們在世界上 有展 跟GPU的RIGER長得很像 跟TPU的RIGER也很像 也是一個LLAM嘛 是嗎 對 就是LM的機器 所以我說了其實 NPU是可以很多元的 應該說 那也能強向 叫可充夠NPU 這在國際上很經典 所以可充夠就是說 它是可以像 機幕一樣跌的 就是我可以跌 2030 可是我的客戶才會有Naver 而那一拳這種 收索 其實它已經收索 以及韓國的Google嘛 我能做它 就能做Google這樣 那 可以定義一下 可充夠NPU嗎 可充夠就是說 我可以把我的 指定級改了之後 我裡面就可以變形 那結果你像 概念有像人腦很大 但我沒有去 見整個人腦 人腦 其實有 視覺區 它好像在中間 蘋果形狀的 那有聽覺區 在前面 很像香蕉形狀的 但我們做的 沒有去見整個腦 我們見的是腦的 基本原件 就是腦神經緣 你可以想 我會一堆腦神經緣 然後就像年圖 當我需要做視覺區的時候 我就把它黏起來 就是 找蘋果形狀 我就做影像的 AI 下個月把拆 再做成香蕉形狀 就做聽覺的AI 這次我們同一刻 經歷可以做語音影像 我唸 然後 甚至有個新的架構出來 我只要 就是我有一天對人腦的理解 我發現 視覺區不是蘋果形狀 它應該是 但只要它還是腦身經驗組成 我把它改改 我還是能支持 那我們來聊一下AI模型未來的這個架構的演變 因為我覺得這個 其實回到你追一開始說的 我們再看這些各種不同的AI硬體 就我們要比較他們的這個通用性的價值 他們彈性的價值 要看的還是未來的這些 他們要跑的模型到底長什麼樣 對吧 那我記得我在年初的時候 去年了 去年年初 有聽到你一場訪談就是有說到說 你們非常看好 StaySpace Model 就你們認為他們未來會取代 Transformer的這個架構 那就是Mamba Mamba架構 對 就是那個StaySpace Model的其中一種嗎 那你目前還是這樣子看嗎 應該說現在Mamba跟Transform基本上 以算值的層面它基本已經是Moger在一起了 其實Mamba確實取代的成縮 只是因為在算值層面它已經拆得比較分析 所以現在大概率你去支持Mamba 都是支持全是我們的這樣 就你有一種有我 你一種有你這樣 是Mamba架構在很多應用 真的是比全是不好 就是不管在準度 還有它的這個空間集合跟邏輯 前後文的這個分析 都是比較好的這樣 但是就目前來看 就Transformer還是完全的當面的主流嗎 不是不是我剛剛講的是說 Mamba的底層現在也是Transformer 它是Transformer的變形這樣 在現在就是最近的幾個主流 你説就是你要算Mamba推論要做的運算 你break down到最基本的單位 跟Transformer是差不多 很接近 它只是變成說它在重集上的不同而已 它在下面的指擊 我的理解 但我的意思是說 從應用的層面來看 所以你這樣的Argument其實 應該是對也不對 就是說你說這個 現在也許是Mamba的鬥米 但你說是Transformer的鬥米 是因為我在做Mamba的時候 在某些今天的硬體上面 或者在應用上面 我其實把猜測幾個Transformer來做 你懂我意思嗎 所以對我來看它是Transformer 這我來看它是Mamba 但對你來看是Transformer 應該是說這真的是有很多Argument 程序其實說它現在主流是這個Mamba 其實在Google或Facebook 現在主流也是Mamba 只是在底層下 它都是用Transformer方式 去把它做重集來做的這樣 OK這邊我不是很理解 你的意思就是說 我們今天用到這些Charge VT 我們先不講避遠的 我們不知道他們加溝 但你看Lama 或者是Defseek的這些模型 你認為他們其實也算是Mamba的模型 是嗎 Baba加溝 是的 怎麼說 你不要看 我覺得一個 就像你剛剛說的 黃仁勳跟Lisa數在說 莫有定律到底存不存在 兩個 我債務的是本質 其實兩個講的都是本質 你知道 因為 黃仁勳來講 他認為算力現在的快速增長 已經不是如這樣 去不程度的增長 因為現在LAM的算力的增長 大概每1.5個月就翻倍了 你懂我意思嗎 但是晶片的增長速度是 24個月才能翻倍 你懂嗎 以莫有定律來講 所以他認為 為什麼他叫黃師定律 因為他現在用HBM 所以為什麼最HBM跟Covard是這麼紅 我等於在系統層面 我用堆疊的方式 去報了算力增長 所以我認為莫有定律 現在要支撐這個LAM或者是 AI的算力 完全需要系統層面 我定義的黃師定律 叫HBM跟Covard 來把晶片堆上去 那為什麼我說 他說的是對的呢 這個以這個層面來講 他是對的 但是 為什麼歷史來說 莫有定律沒有死 因為現在 你晶片層面還是每24個月才 翻倍一次 你懂我意思嗎 這個叫一個叫建數 一個叫建齡 所以兩個都對 他都在成績一個事實 那你看到的可能是在某 其實新聞某些論文說 我現在還是用唇書末來做這個LAM 但我跟你說 他在重集上面都是漫吧 你懂我意思嗎 OK 就架構來看 他們是不一樣 就是 從學術的架構 就比如說 唇書們的算 A tension mechanism 處理即使那漫吧 沒有 漫吧可能是比較接近 R&D的那種 這個 把記憶壓縮在一個路 不完全是 真的不完全是 他在底層都 基本的和 基本算是基本是一樣的 就是已經接近了 最近的幾個 比較新的幾個論文都是這樣 說什麼 老實 我確定觀眾懂不懂 但我沒有還沒有到 真的非常理解 你說的 這邊的本質上 他們是一樣的 到底是一樣 就是 你是break down到 最基礎的數學運算 他們是什麼都的這種話 是的 就當然 就所有的這些 Motion運算 你break down到最基礎的數學運算 其實當然就是 加減成足 就那些嘛 但是 你覺得 他們 稍微還 level一點的 這些架構的差異是沒有 沒有意義的嗎 就是 Attention跟R&N的差異 這種是 其實這就 我可能我 畢竟是寫教科書的 所以我看到事情 都會把他 break down到 很細很細 到公式層面 那 就像我說的 我為什麼說 NPU跟TPPU跟LPU 他都是類架構 這是每個人的定義 就是那個圈 到底 藉的線在哪裡 你懂意思嗎 但是 我會提出這一點 是因為 就是我認為他們 就是 transformer 跟 那樣把 對於某一些 可能 在開發ASIC的人來說 是有差別的 是因為 可能他今天這個 當然有差別 對 他今天要設計這個晶片 他要讀說 兩年之後 到底是 其實他是 transformer 還是mamba 其實我們就 推出了mamba的晶片了 真的 這個我應該 上上個月才 而nounce的 但老實說 我雖然 可以那個是 mamba的晶片 但我的底層算值 老實說 他也是 就是 還是一樣 我真的覺得是 就是意思就是說 你這樣的做法 是你的晶片未來 可以支援 這兩個種 不同的架構都可以 都可以 但是也是有些 ASIC的玩家 是他們就是 all-in-7種一種 那個就叫ASIC ASIC我跟你說 ASIC就 結果你像是 我今天對腦的理解 我以為是蘋果 就把科使成蘋果 沒錯 但對於 他們來說 這些人確實存在 像我看前一次 你有一家叫 好像叫 etched 他們就是專門 all-in-transformer 搞不好未來 搞不好期待期待 有其他家在all-in-mamba 你以說 哈佛的那個 那個 對 那個 那反正就是 有一些人 會all-in 其中一種架構 那對於 他們來說 未來 哈佛的那個 那個初學 我跟你說 對於他們來說 未來到底是 transformer 還是mamba 對他們來說 是有意義的 可能對於 來說 他們來說 是有意義的 你知道嗎 我一直 我也覺得 蠻有趣 他在 市場上說 他是世界 第一個 做全什麼 但你一直去 查新聞稿 你就查 2022 2021年的新聞稿 2021年 其實全球 沒有人看好 全什麼會變主流 對 後來 當然 有一些 大的公司 號稱 什麼 自己做的 第一個 全什麼 我真的覺得 那個叫 市場語言 但你去 查2021年 真的 有號稱 自己的 智慧 我們 有一個 智慧 我們很多 真的是 世界第一步 然後你說 就是 我有時候 真的覺得 市場語言 跟 為什麼 很多 本質 其實這樣 常常 在批評別人 這樣講 我覺得 我當年在 高通 或我當年 在三星的時候 我絕對不會 去用 一個 剛畢業 或者是 沒有畢業的 學生 另外一件完整的討論一下就是MPU它的未來到底是什麼樣 可能有幾個層面嘛第一個就是它還有多大的進步空間 然後第二個就是它未來會被運用在哪些地方 現在其實從當然消費者的認知還是說可能MPU目前就是SOC裡面的一個小小單位 然後那是台灣的聯發科的認知 真的不是相信嗎? 也不要這樣講的聯發科應該說應該是類手機的SOC的場會認為MPU在裡面是一個小盒 那是因為手機的應用它確實就是這樣 對 我的理解但就我們就講AI的應用好了 AI的應用目前大家的認知就是雲端的AI就是用GPU去算 然後邊緣的AI就是有時候用GPU有時候用MPU 比較小的模型然後需要更高效的推論的時候能耗比較低的時候就是用FPU在SOC上面這樣子 那如果是比較大一點的模型可能就是用內顯或者是有獨立顯卡就用獨立顯卡 那這個是一般的消費者的場景 然後雲端的AI使用的場景 基本上全部都是GPU或者是有一部分可能TPU之類的 也不會有NPU 雖然說你說TPU是類NPU嘛 那你覺得未來NPU的會你認為它的角色會變得更分量會更重嗎?它會出現在哪裡? 我覺得是這樣就是說這個年代有點像是DVD普及 然後大家都習慣用DVD然後也沒有人家裡可能很多DV的隨身點放硬機 對 那藍光出現或者NP3出現它本來就是一個Renab的過程 所以你剛剛講的我覺得是以這個時刻這個時間點沒有錯 這個這個漏到這樣 但是為什麼TPU出來之後MPU來股價當天崩 也沒有崩很多啦 但那為什麼不管怎麼樣你去試一下German來的效果 跟Google and NUMS的效果就是以它的單位功耗創造的效果 它確實就是一個名鴨式的差異嘛 那我覺得這個名鴨式的差異在今天的時代還是以Training為主的時候 你也許會覺得這個就像我說了 也許以AI的暴力式的訓練啦 還講 美亞也許是十分 那TP月只有七分八分 但是我投入的這個價值 美亞也許是比TPU就是大了好幾十倍 那這是沒辦法否認的事實 那當你到Face2到Face3的時候 就像我說的 當年其實Face1的時候 雲端的Trending在市場百分之八十 但到了Face2的時候 雲上Trending只剩十分 英文時事百分之八九十 那只要到了Face2 我認為 哭打的必須沒有那麼強 它就是一個白花期放的時代 那到了HG為什麼ClendNPU會是多密呢 是因為月H 工號成本面積會更粹粘口 講白了這三樣東西GPU就是貴 但是在AI大家習慣的靈活性 還有這個Trending的效果是比較好的 但是NPU就是成本更低 工號更低這樣 那我今天也講的就是說 以耐能的客戶來講 就我們畢竟是國際上最早做NPU的 那我們客戶東開的有PennerSony Fade革命 這是穿在市場 穿在市場我認為它就是一個HGPU 不可能進去的一個戰場 因為GPU很大很肥 然後又很好 你帶的時候不要幫你燒燒 你就不會帶了嘛 那AI OT在工業製造GPU也見不去 因為它那個產線很快 無人機NPU絕對的影響力是因為 無人機是耗電池 只要是電池Battleary Base的NPU絕對是天下 這個Node到的 這種東西其實很多 甚至對 我說的手機筆電 其實今天 為什麼NPU這個時開始紅 其實也是筆電的AI PC開始搭吹 對 所以我覺得筆電手機應該說 越小的單位NPU就會是舞台 那這個東西一樣它才剛倒露 那剛倒露它有時候會需要一個 像為什麼人家說AI PC其實沒有紅 其實我覺得它會紅 其實它只是 有點像是手機三居時代 四居時代的時候 有時候人類需要打開那個攀躲 你才不知道應用什麼 像當年我在高通的時候 三居時代的時候我們再推 很多人在AQ說手機不需要 不需要這麼多頻寬 我只要打文字 丟用FeedChill Phone就好了 結果後來照就是Nokia 這種FeedChill Phone 這種智慧手機就出現了 然後 這邊查的是一個Killer app 我認為Killer app 是當你把攀躲到盒子打開 Killer app智慧當然會出現 當你所謂的攀躲到盒子 就是它的算力到一定的水準 我覺得這件事情 我當年在三居時代 四居在無線通訊手機時代的時候 在參與那時候在一部網站 在三星還是高通 四居剛出來的時候 大家說不會有應用 結果後來 應該說三居出來的時候 大家覺得不會有應用 後來就出現App App的定義 那App App都出現的時候 三居就擺花西放了 然後四居出來的時候 大家說不會有應用 結果大家發現 四居既然可以在手機上看 就是傳照片 然後看短片 然後這個應用也出來了 應該是說當 沒有這個功能出來的時候 你不會想有什麼應用 你懂我意思嗎 那一樣的當這個功能打開之後 應用自然的人會出現 也許是一年也許是兩年 但當它出現的時候 它就會擺花西放 那只能說 LAM是什麼時候開始普及的 LAM是兩年前三年前 那應該是說 確實GPC是那時候紅的 你知道專為這個LAM 帶到第一段的景點 它開發時其實就兩年三年了 所以我認為 今年其實就是它開始擺花西放的 一年 它真的會發生 應該等它你拭目以待 你在講的是 地端的 是消費者的這種手機跟電腦 就是說 AIPC、IS手機在今年 因為就是他們 晶片花兩年的時間 慢慢去設計 退報到這樣產 我認為很多人都會被你的 我一直強調本質 我覺得很多人都會被 我們的認知的狂假限制住人命 今天的端跟雲 其實不是端也不是雲 是這樣講的 我今天的比起起起起起 其實比我小時候的雲強 我當年你可能不了解 我當年在Belv的時候 我們曾經有 看人家那個 第一代把那個 那個 納薩的那個火箭 送出去 太空的那個 很有趣 你現在一支手機 比它當年的那個 超算電腦還要強 這是真的 他們當年 對 所以我一講的是說 可是當年的超算電腦 是語音 你的手機是什麼 是端 所以應該是說 因為高通的 獨特的經驗出現 造就我的手機 比我當年的雲強 因為 Intel的CPU出現 造就我的筆電比我 當年的超算中心的 語音還要強 對 一說我如果 GangJunge的Tech Technology 其實我可以讓你的端的 能力比我今天的 語號要強 假設我是個 下個世代的架構 我可能就是 很好的NPU 我講的是我們家的NPU 我不是說 市面上在那邊 拿DSP印改 說自己是NPU 我覺得像是 耐米實在太紅的時候 我當年也看到 什麼耐米馬桶 耐米靈代 我都覺得那個不是耐米 但那個就是一個市場語言 那不管這樣 撇開這個 不講 我Argument是說 今天如果 有一種架構 你也不要講耐人 或NPU 這個可能會限制你的想象 你可能會不符 那我就說他有個架構 如果他是專位AI而生 他的效率 就是比GPU強個 450倍 我都不要講百倍 其實很多NPU 都是可能百倍的 那我的功耗 就是他的1/100 或1/1 我可以讓你的地端的東西 跟今天的運類式 強了 我可以把40B 150B的 大原模型帶到你地端 那我們的人類的生活 其實會很像 我們熟悉的客丸電影 對不對 對 所以這件事情正在發生 OK 所以你認為 未來大家 因為現在大家使用手機電腦 再用AI的時候 通常都是打開一個網頁 然後使用Chatch P 或是App 對 因為第一端的模型 雖然可以跑 現在已經可以跑了 智能上還是差非常多 你等著看 那你是認為未來 主要都是 最消費者可以直接在 這就是我說的 我覺得當 你不要被端 跟運線自主 你就想說 有一天 如果你的端的 穿在式設備 你的手機 你的筆電 跟你的車 你跟他對話的感覺 跟確實比一樣 那客丸電影的場景 就是發生了 那 他你說這個東西 不會補給 我覺得他會補給 所以確實 確實我覺得過去這幾年來看 我們現在 因為技術跟應用的 編輯還沒發生 但當他發生 他就會碰撥發展 就是 Chatch P 他也是兩年前才變這樣 其實三年前 四年前就 就 就 存什麼門了 但那時候 因為 其實Chatch P 一一的時候 很多拿去用的時候 覺得很笨 他就沒有補給 有時候他就是要一個 剛好那個 叫新GeroyPoint發生 那我就他才會 才會碰撥發展 但是 我覺得這邊 雖然說就像你說 其實有很多 歷史的 這個案例可以去 借錢這樣子 但現在 其實也是有人在 Argie說 未來 其實 基本上 在語音上面跑 就夠了 大家這些 只要中心都見起來了 然後未來的模型 其實真的 也會達到一定程度 像其實 現在 最先進的這一批 可能捐不來三 Grock 接下來要出來的模型 可能都已經 三四 叫四五 照的參數 你看 好 這個方向 最推崇的 Media跟 OpenAI 我就以他們 公開的數據說 今 在去年的 10月的時候 OpenAI 跟Media 簽了一個MOU MOU是 框架寫 其他沒有 一定要執行的發育效益 那是說 Media要投 一千億 美金 去OpenAI 讓他們買 他的GPU 然後 當年的 SendOteman說 他要 需要的 超算中心 對吧 好 我就不講 有時候說 這叫 避緩交易 我們在 我們在 Archie說 這東西 到底是 Bubble 我也很客觀的 客觀 40來分析 第一 以 亞護Data Center的 這個 算力中心來說 一GWA 需要多少錢 需要一千億 美金 到兩千億 美金 這個是 箭制成本 他的RPU 先Cose RPU 我每一年 花的那個 電費運費 那我 一樣 這個 取掉 就算 以兩千億 美金 27萬億 他說 他未來 五年內 以四年 攤體 我每一年要 多投 兩千億美金 那 好 就講說 他超強 他全部都拿到錢 Media 一千億 叫做 十分之一 他創造 是75萬人的 用電量 一年 對 他基本 就是一座 合電廠的 我都假設 他都能達成 我要多蓋 幾座合電廠 二十座 我現在 馬上蓋了 對啊 因為 所以 好 蓋到太空 那 你知道 CarbonData 很多 課長 你確定 兩年前的 他 他 湯匙 CarbonData 產生 59湯匙 CarbonData 跟新加坡 一年 產生 一年 十月 十月 是有颱風 去年十月 有颱風 你覺得 在 大前年 之前 十月 有颱風 我覺得 我們 很容易 被這些 媒體 給你 就是王者的。 他也是到處給大家洗腦 讓大家認為打遊戲不需要GPU CPU就好了 當時確實有一段時間 CPU的 Media他已經死掉 他的視戰率是80% 但是我還是講說 反正是還是回到15本 我就說好就像你說全是真的 但我們地球根本承受不了這種 碳排放 氣候變遷 核電廠 然後 我就可能把地球整個燒起來 你都不知道對不對 然後順利海水都被燒光 所以我覺得本質上還是說 什麼樣是 但是如果我有一個專位AI的 神他的功耗就是 千分之一 那 你可以 寄引就AI 又可以讓我們的人類生活帶來便利 那你說MPU只能局限在端嗎 其實不對的 他也能到語言 就像GPU他也能在你的筆電 也可以到語言 今天語言你有 超吻東西也有GPU 那另外有些應用 端就絕對的Key的 Application 不要說 我今天跟你說 自動價值的時候 是雲上AI在控制 你敢做嗎 我做上去之後 有時候海晶他就把我綁架了 那我就說 好今天其實我的網路傳出超快 那你的手機 有時候到沙漠太會斷訊 那你開開 突然斷訊 你就把前面的人撞死了 那一樣就是說 醫院的應用 一定要飲食 就是說 今天其實雲上的AI在強 他不會知道我的病例 那你的病例敢放進去嗎 你放進去之後 有時候海晶來上去看你的全身的裸照 你也蠻恐怖的 那一樣的 以在你就是有一個案例 是我們曾經幫台灣的一家公司 做他的克服系統 他本來也用雲上的AI 其實我們公司的這個 生存之外機器 有在國泰常跟農總 很多都是醫療相關 原因就是飲食 那另外就是說 我的公司內部的資料 我也不會想要上雨 對 那我 你知道那個沙漠送期 他是嚴格禁止用OPENAI 因為他公司的資料 靠我們這些雲分就上去 他可以提升公司效率 沒錯 但是他的海里考慮 你說台積 我如果把我的 資料都拿去雲 現在大家不是很擔心 我們變美機店嗎 你用OPENAI來幫你做 每天事情 就美國人就知道你的秘密 你就真的是美機店 對 所以 而且還有一件事 你叫做 Data Corruption 就是我剛剛說 我幫一個公司 做他的線上克服系統 他希望人家來問他 說這個公司是 什麼樣的公司 他希望他回答 是我住中科技人物 數量的公司 但是結果有一天 人家來問他 他用OPENAI 他就是怎麼樣 他可能往網路上 太多跳樓時間 人家就說他是血汗工廠 我是公司 我當然不會希望你來問我 你就回答 我不想要的 但他你把東西 帶到地端 但是網路上的資料 你是沒辦法控制 因為他是上億筆資料 對不對 但你把他帶到地端 我就跟他說 我教你東西是 白日宰正確的 那你就教他說 我公司是符合科技的 文素養的公司 你現在來問 你的答案才會是 FIX跟正確的 你懂我的意思嗎 那這才能真正解決 Datute Deer的Work 好 OPENAI 就是你晚上睡覺的時候 在想什麼 就是What Keeps You Up And Night 就是你最近 可能最大的挑戰 或者是 還好 你都在想什麼東西 其實我覺得我 這個公司 你如果去網路上查我的故事 我是十年前 大家不看我一樣 我做的時候是連 Dimai 阿發購都還沒擊敗人的時候 我就在做 AR而且在做 AR晶片 那時候是非常非常早的 等於是說我在選擇 一條路是我心中生性的 即使別人不看好跟不認可 我其實當時選的時候 我也沒有想到 也會這麼快爆發 對應該是說 本來在踏上旅程的 那一個時刻 就是在選擇 一條我認為是比較 忍耐跟孤單的路 那只是因為我生性 這條路是有意義的 而去做的 對 所以 反而這麼快 蓬佩發展 我還滿意外的 那我也覺得 滿有趣就是說 我絕對是從學生時代 畢竟DemiSARS比跟 就學我都認識 對 其實我認識他們的時候 他也滿有趣的 就是說 你可能不了解 我對這句話的意識是 我當時認識DemiS 跟就學我的時候 就學我Benjamin的時候 其實當年軟體是很值錢的 你去Google Facebook 可以抓非常多錢 然後我在BearLug的時候 他們去求那個案子 我以在意就看他去跟那個負責的 那個那個那個 那個Lid講說 他的八角要皮壓 因為 然後我就想說奇怪 你明學歷怎麼好 你為什麼不去Google Facebook 他們我看過他們 窮瞅瞅的時候 然後找八角找不到的時候 可是我問他說你們 為什麼要 要要選這條路 他的說法是說 其實 他把他定義為創作者 其實我也定義我自己是創作者 那他說創作者 最大的幸福 其實 我就是在做一件 我生愛的事情 不管你喜歡也好 不喜歡也好 他人們也好 熱門也好 我就是希望我這一生能去 證明這件事 真的 然後他去選了 對 他那時候真的是 窮瞅瞅到 連那個便當 我們都是去外面吃這種 這品質的這樣 對 那 那他說他很幸福 對 那我覺得 我因為跟他們合作 是很 感受到那種所謂的幸福 所以應該是說 現在反而是 沒有想到十年前 認為的事情 現在真的 也許大家還是有很多指甲 但我覺得現在已經 比我十年前 好太多太多太多 那我還剩下有這個 應該說我們十年前 定義種東西叫NPU 那不管你認或不認 反正 隔幾年之後 突然在學界大家認可 所以我才得答應論講 那 IQPOWE的 CTSO112學 然後那本 我寫的書才會這麼多大學用 那後來在三年前 因為卻GP的關係 大廠開始 跟 OMG AMD跟 Intel跟 Cocon跟 那 現在 我們公司也做了很多客戶 就是什麼Penaloni Gami Ryche8 NH 那最近是一個 國際 我覺得是一線巨頭 對 那有一點像是我們剛打完了 一個華山論解 然後我們 在裡面 晚敗了大家 就是即使跟著人 也被我們幹掉 對 那只是你們還不知道而已 你知道 對 那 你就會覺得說 反正現在每天都還 還滿有精神的 對 就應該比我十年前好多 我十年前還被追在過 公司還是兩個人這樣 OK 好 谢谢你 偶尔 OK

Podcast Summary

Key Points:

  1. VPN在出國旅遊中不可或缺,可用於訂房差別定價、解鎖串流平台及保護公共WiFi安全。
  2. 來賓劉俊成博士是耐能智慧創辦人,定義了NPU架構,專注於AI晶片設計。
  3. AI運算從訓練轉向推論階段,NVIDIA GPU在推論上功耗高,NPU和ASIC更具效率。
  4. GPU的優勢來自CUDA軟體生態,但硬體非為AI設計;NPU和TPU等專用架構更適合AI。
  5. 劉博士預測AI晶片將從GPU過渡到NPU,類似小客車取代卡車,ASIC僅限於特定垂直應用。
  6. 耐能提供可重構NPU,能適應不同AI模型,未來主權AI和數據中心將推動獨立NPU需求。

Summary:

本集節目探討AI晶片技術的演進與未來趨勢,由主持人與耐能智慧創辦人劉俊成博士對談。劉博士指出,AI運算正從訓練階段轉向推論階段,NVIDIA GPU雖在訓練上具優勢,但功耗高且非專為AI設計,推論效率不佳。他舉例Google TPU和耐能NPU等專用架構,在單位功耗的AI性能上遠勝GPU,類似小客車相較卡車在城市中的省油優勢。他強調,ASIC僅適用於單一垂直應用,如Google或Amazon的特定場景,而NPU具備通用性,未來將成為主流,並可能分化出TPU、LPU等子類別。耐能作為NPU定義者,推出可重構NPU,能靈活適應變化的AI模型,如從Transformer到Mamba架構的演進。劉博士認為,AI模型架構持續變化,硬體需平衡彈性與效率,NPU將在數據中心和主權AI領域扮演關鍵角色。整體而言,節目強調專用AI晶片正逐步取代通用GPU,推動更高效、低成本的運算解決方案。

FAQs

VPN可以幫助你訂到更便宜的飯店,因為旅遊網站可能根據數位足跡差別定價;出國後還能解鎖被鎖住的串流平台,並提供安全保護,讓你連回台灣使用習慣的網路設定。

NORD VPN速度很快,品牌大且使用安心。使用專屬連結NORDVPN.com/techwve可享30天無條件退費,購買獨家方案還額外送4個月。

NVIDIA GPU的優勢在於其通用性和CUDA軟體生態,能快速進行大規模訓練,但成本較高。TPU等其他架構在單位成本或功耗上可能更優。

CPU擅長邏輯運算,GPU擅長並行處理(如圖像),NPU是專為AI設計的通用架構,ASIC則針對特定應用極致優化。NPU在單位功耗的AI性能上通常優於GPU。

未來NPU可能成為主流,因為它兼顧通用性和效率。ASIC只是針對特定高頻應用的暫時方案,而GPU在推論階段因功耗高可能被NPU取代。

NVIDIA GPU在推論時功耗很高,而NPU或ASIC能以更低成本完成相同任務。隨著模型趨於成熟,推論需求增長,GPU的劣勢會更明顯。

Chat with AI

Loading...

Pro features

Go deeper with this episode

Unlock creator-grade tools that turn any transcript into show notes and subtitle files.