這段對話主要圍繞人工智慧的發展哲學與KIMI K2模型的技術實踐展開。受訪者楊智玲以「無限的開始」為喻,指出AI發展如同攀登一座沒有頂峰的雪山,問題會不斷產生,但也總能找到解決方案,這是一個動態且持續的過程。
在技術層面,K2模型的研發重點在於打造一個優秀的基礎模型,並提升其智慧代理能力。團隊透過如Million優化器等創新,大幅提高了模型的「token效率」,讓模型能更有效地從數據中學習。同時,他們也致力於解決智慧代理在泛化性上面臨的挑戰,避免模型過度擬合於特定任務或工具。
展望未來,對話指出強化學習、多輪推理與工具使用是智慧代理能力規模化的關鍵。真正的突破可能在於讓AI能參與自身的研發過程,實現「創新」。此外,長上下文處理能力與更通用的任務設計,也是提升代理能力的重要方向。整體而言,AI的發展路徑並非線性,而是一個各項能力持續疊加、相互促進的動態演進過程。
Transcription
3416 Words, 36372 Characters
就有點像我最近可能看一本書的Beginning of Infinity
我其實看好幾遍就是
他說有兩句話要刻在石頭上
一句話叫問題是不可避免的
但是第二句話是說問題是可以解決的
也許我知道有可能這個雪山才有可能沒有鏡頭
我不知道就是我希望它一直沒有鏡頭
因為這樣的話
所謂的Beginning of Infinity就是這個意思
就是它可能是一座無限的山
當然這個是Tim今天跟我講的
就是說他覺得要用這個I/O的方式去管理
而不是用SFT
過去年Tim也是播風播谷來回震盪
你在這個其中也不心害是什麼樣的
你需要平衡自己心態嗎
哈囉大家好
歡迎收聽張小鈞商業訪談論
我是小鈞
這是一檔由語言及世界工作使出品的深度訪談節目
我們希望和你一起從這裡探索新世界
今天的嘉賓是月專面的創始人間C.O.楊智玲
舉例他上一次來我們的節目
南海時生業訪談錄的第59集
已經過去一年半了
就在剛剛過去的7月份
Kimi K2模型發布引發了比較廣泛的關注
K2是一個機於Moe架構的開源編程和
Egentic智能體式的大約模型
那今天這集節目我和楊智玲聊了聊
K2的研發技術性節和他當下的技術認知技術判斷
以及在過去這一年的輿論風暴與創業起伏之中
作為創始人他的心情與思考
哈囉至靈性給觀眾朋友們打個招呼
哈囉大家好
在你創業第一年結束的時候
2024年我們訪談報的標題是
像嚴名而未知的選擇前進
那現在又過了一年站在
現在此刻2025年7月份你最新的感受是什麼樣的
你剛剛提到這個詞我感覺都是好像過了很久
已經一年多了
AI一天人間一年所以可能AI一年
我不知道在人間試度好甜
所以對感覺最使得很多東西發生了很多變化
但是我覺得那種感覺
你剛剛說的那種雪山的感覺好像
倒是差不太多的
可能往山頂的過程我們又再走了一段距離
多遠既然行進到哪裡了
所以現在想說什麼我現在進步挺大的
就是可能兩年前寫片文章都寫不太明白
然後現在它不光可以寫很好的文章
它能夠連續工作幾個小時
你完成一個可能很負責的代碼
任務我覺得這個東西可能在兩年前是很難想像
所以我覺得可能就是在一個爬水山的過程中
然後你解鎖了一些
解鎖了一些新的長景
你大概知道我中間這條路是什麼樣的
但同時就在網上的過程中
你可能還是觀察到差不多的景象
就是說接下來的網上的過程
它人家會有很多位置的比如技術問題需要去解決
所以我現在可能大概是這樣的感受
更清晰了還是更迷惘
就是在這個我私下都是選一個地方
對我覺得肯定會有很多東西變得更清楚
就比如說可能我覺得在兩年之前
比如說各種強化學習的責物範疇
怎麼去做兩個模型有更強的推理能力
或者有更強的這種Egentic的能力
我覺得在當時可能沒有那麼清楚
但是可能更多的是說你這個模型的預訊鏈
怎麼能做得更好
然後那是比他有可能
HF的這樣的技術
讓他的這個在對話的體驗裡面做得更好
對但是現在我覺得會有新的一些問題
可能得到了單一但同時這些新的問題
他有展開可能又產生了一些新的別的問題
比如說可能我們今天看到
雖然你可以做這些強化學習
但是你的強化學習可能最初還是依賴於一個
很好的評估或者很好的驗證
比如說你讓他去做一個數學機
或者一些有Task case的編程
那可能可以做得比較好
但是如果讓他去做一個可能
更加複雜的段段段
就讓我有時候你並不非常容易找到這個評估
或者很好的方式
所以我覺得現在的
這個系統可能你會產生一些新的問題
就有點像我最近可能看一本書
就是這個叫這個的Beginning of Infinity
我其實看好幾遍就是
然後你發現他裡面講的最重要的一個事情
就是說
他說有兩句話要刻在石頭上
一句話叫那個問題是不可避免的
但是第二句話是說問題是可以解決的
然後基本上就是說你就可以認為
在可能起模運動之前
這個社會它是一個靜態的社會
就是大家並不追求創新
就是說你看會用很多神奇的方式去解釋
你觀察到的現象
那這些解釋它可能是並不是一個好的解釋
比如說你看到這個天上打雷
你會覺得是有雷功
然後你去看到這個冬天下雪
你覺得可能是因為某個神他的心情不好
所以下雪了
就是你會有很多這種
就是
不是不好的解釋
去參數這些東西
所以它整個社會這個靜態的時候
只有非常少數的人是在真正
做所謂的科學研究或者說知識的創造
所以它其實
會是一個靜態的結構
但是如果是在起模運動之後
你發現這個社會它變成動態的
就是
你會有很多新的知識被創造出來
然後這個創造的過程中它就是會
比如說你產生了一個知識
它就解決了一個問題
但解決這個問題的時候
你會產生新的問題
你的問題是因為
不斷因為你的知識編輯是在拓展
你就會遇到很多新的問題
研發這個AI的過程中
我覺得可能恰好就是一個這樣的過程
就是你解決了比如說
講話學習的很多問題
但你發現就有面臨的很多新的問題
比如說評估的剛我剛剛講的評估的
這些問題或者很量的問題
而驗證的問題
這些問題它可能就
我們需要一些新的答案
大概是會是這樣的一個過程
但這個也是非常有意思的一個點
就是因為你一直會有新的問題
可以去解決
然後每次解決一個問題
你的技術就是會往上
再判斷幾百米
然後可能有一天
也許我知道
有可能這個學生它又可能沒有鏡頭
我不知道就是
我希望它一直沒有鏡頭
因為這樣的話就是
所謂的 beginning of infinity
就是這個意思
它可能是一座無線的山
就是你一直在
你一直在往上爬
然後而且甚至有可能
爬到一段時間之後
不一定是自己在爬
而有可能是你
用AI來爬
就比如說你現在我我們也會
把
就是比如用K2這個模型
去做很多可能模型訓練
或者說數據處理相關的工作
這些東西它以前可能都是要人工寫蛋
或者
有些同學它不一定會寫蛋嘛
以前就做不了
但是現在比如說很多是處理
或者說模型的一些分析
甚至包括模型的一些訓練
你慢慢於又多可以用這個
用模型來做
對所以
那你可能
就是可以
把這個東西做一個放大器具
更好的去判斷做生的
所以
我覺得會有這種感覺
反正你的問題是會持續產生
對 然後你就持續去解決
然後發現有新的問題
如果學生是無盡的你追求的
是什麼呢
追求就是這個判斷的過程
或者說你呢
你呢一直越爬越高
就是就是你可能原來是在
在三比下的
然後爬到那個就是
又往上提升了一點
然後你能看到的
景色會不一樣
就是
然後
就是它是一個動態
可能精幻的過程
然後我們可能想追求的是
你就是越爬越高
以前我們會固壞的認為
就是HDI今天的中點
已經不睡HDI了是什麼
那HDI是什麼
對HDI可能是個方向
就是它可能不是某一集臺階
就是說你爬到這集臺階
就
突然一夜就進達到HDI
而是說
可能它是一個方向
比如說我們今天可能在很多領域
其實你可能
你可以認為它是HDI
就是因為它可能做的比
90%99%的人類可能都更好
對吧 然後
對 然後
包括就是現在比如很多數學題
或者說編成精賽
這些題可能
我覺得按照現在的體生速度
你可以
可能預想就是說它會很快
有很多問題
就可以被充分的解決
對 然後
對 但是它可能很難說
我是很良心說
某一個時間點
我突然就是
我就
我就可以
還一個口號說
我們在這個時間前
辭職的時間HDI
它跟
就是我們又登月來年
名公司的名字
但它跟登月有一個區別
就是登月就是你
在它月球那一個
你就是
你好稱我就達到了
但是可能HDI
它就是你不難做
而且這裡面我覺得兩個層面
一個是說
一方面是技術是一直在提升
對
當然
另一方面
除了技術之外
我覺得
這個技術對於
人類社會的影響
它可能是
更長週期的事情
對
那你也可以認為它其實是HDI的一部分
就是就有點像
比如你產生了
產生了蒸奇機之後
你整個社會的變化
它只是需要
可能幾十十百年
那時間去消化
就是你有
一些工作可能不再必要
但是你會產生新的工作
然後有新的方式可能人會用
AI去做更
就是每個人都會成為超人
就是你可以做更多的事情
那這個社會他的工作方式和他的
御性效率可能都會翻成他的變化
那我們先來毀忘一下過去年
過去一年全球大模型在
腦海中最重要的幾件事情是什麼
有哪些在人物陣子的犯事機的變化
我覺得可能有幾個重要的
一個是這種強思考的推理模型
至於強思考的我們
對 其實對歐巴爾
歐巴爾就是作為第一個
做出來這樣的一個代表
然後我覺得是
本質下來講是
他通過讓模型在這個過程中
去做很多的強思和犯事
然後我覺得可能犯事是這裡面的重點
就是犯事其實本質上是兩種能力
一種能力是
提出來一個新的猜想
你可以認為就是模型在解決一個問題
過程中他會不斷提出新的猜想
然後這個猜想他會得到一個自我的驗證
如果他提出這個猜想之後
我到底這個猜想是對的還是錯的
他其實是需要具備一定的驗證能力
雖然你不是顯示的
訓練一個驗證模型
但是他是在這個推理過程中
可能隱示的去做了驗證
然後你可以理解成
就是他把這個問題做了很多次
每次猜想驗證
然後最後可能就可以得到一個答案
對 那這個東西就是說
他其實是會很大程度提升模型的能力
是因為你本來只能做一次
你本來只能就是我直接給出一個答案
那這個答案可能是對可能是錯的
你並沒有這個過程
但是你現在可以不斷地提出猜想去驗證
那等於說你其實
等價的長適了好幾次
那你就是可以把passer key可能被成passer
不然才本身像是一個這樣的道理
就其實跟人做科研或者解題的過程也很像
也是不斷提出新的猜想
兩個去驗證
他是一個自由探索的過程
他不是一個現行的過程
實在有效的工作方式
實際上還是很多時候是比較現性
你如果不考慮
比如說我做兵型的採樣
假設我就是做串型的採樣
他其實是有現性提現在
就是說你每次是提出新的猜想
這個猜想成的是基於你之前的猜想
你已經否定過的猜想
然後你其實出來一個是你的猜想
對 但他會接近更現性的過程
當然只是說現在你也可以把這個現性的過程
去搭配到
就是搭配一些可能兵型的策略
就是定期可譬如說你同時採樣很多個
然後那他就會結合可能兵型和串型
兩種不同的方式
但是最近也有一些配合角
就是說你可能串型他的上線
所以會更高這個可能跟我們的實驗結論
有些相關 對
所以這個我覺得是一種犯事
就是
他還是一個就是剛中之腦
就是說他並不需要跟外界交互
他剛中之腦
對 他就是一個
想像一個魚缸
然後你把一個腦子放在裡面
然後他跟外界是沒有連線
他就是這個環境裡面的
對 他是指在自己大腦裡面想
他就一直想
他不需要跟外界採診任何的交互
他就能結一道題
但是有另外一個很重要的犯事
就是說現在可能基於這種
多倫的AZN的
強化學習的犯事
或者說你通過這種強化學習技術訓練出來
這種Agentic的這個模型
那他的特點就是說
他會跟外界做很多交互
比如說我可能我邊思考
邊去做一些操作
然後我可能做很多倫的操作
我一會兒掉用一個搜索
一會兒使用一下流然氣
一會兒可能協助很大嘛
然後我通過多倫的方式
解決了一個問題
那他就不在於剛剛我們知道
他是跟外界有交互的
所以他的
我的下一步行為是根據
用過這個交互得到的
外界給我的這個犯會
外界給我的新的狀態
跟新式有關係的
然後後果成
對
然後
但這兩個東西他都指向了同一個東西
就是都是
所謂的TestTimeSkating
就是你可以在測試的時候
或者說在推理的時候
做更好的規模化
意思就是說
比如說我們之前
如果在做對話的時候
你更多的是我只是單輪的
輸出一個結果的吧
我可能讓你寫篇文
這樣你就寫篇文這樣
然後我在問你
我再讓你認識一下
你又輸出了幾百個Token
他這個Token數量是很少的
但是不管是剛剛說的
這個基於強思考的
強化學習還是說這種Agent的強化學習
他本身上都是一種
去規模化這個
在預測的時候的Token的方式
對就是你不管是說
我把輪述打了更多
或者說在每一輪裡面
我有更多的思考的Token
他都是一種去
規模化這個Token的方式
使得說你能去完成更複雜的任務
然後這個也伴隨著
就是你的完成時間會更長
一個可能就是你可能現在會花
幾個小時的時間
比如說去做一件很複雜的事情
在這個過程中
你可能不需要人工的參與
對他就可以把一個
代把常鋪客容下來
然後把它翻一層
另外一種新的語言
然後去調視測試
然後去把所有的8個都修了
然後讓人正常的運行
這樣的一個工作可能
是可以斷斷了
去直接完成
他這對於我覺得是這種測試時的
這個規模化
這兩個都是
我覺得都是Test Times Gating的
表現方式
對
然後可能還有一個
很有意思的趨勢
我覺得就是說可能現在會有
更多的模型公司去做這種
一方的產品
對
一方的這種AZN產品
然後我覺得這個也很有意思
因為一開始更多的
比如說我們如果看半年前開始的話
或者說去年的
就會有很多產品
它是基於這個基礎模型
然後你在上面可能做一些教授架
或者去設計一些工具
去更好的讓模型去使用
然後來大屆一個產品
想說模型一處的能力
對
然後他本身上在做的一些事情
就是說去你像工程
我認為就是去你像工程
這個模型的訓練過程
就是因為模型訓練過程
他也是通過各種
比如說你可以認為
SRBK音house的這個
反進工具
然後他的教授架
可能訓練出來的
這樣的一個模型
但他可能沒有直接開放給你
那你是成立向出來
你更接近去你和他的分布
到底你用什麼工具
SRBK會好
到底用什麼樣的
是生formSRBK
到底用什麼樣的Context
Ange and engineering他的效果會好
是一個這樣立向的過程
但是你發現就是說
如果模型公司去做一方的產品
他的邏輯是完全不一樣的
就是你不需要
你不再需要這個立向的過程
他更多是一個正向的做法
就是我現在先把這些工具
可能設計好
我的Context and engineering的方法
都設計好
然後我就在這個環境裡面
去訓練這個模型
所以你的模型
天然在你的環境裡面
就會表現得更好
對 然後所以我覺得
這個是兩種不同的思路
但可能就是第二種
他的上線也許會更高
就是你可以更好的去整合這個工具
整合這個模型
然後你的模型
有可能也些解決不好的地方
你可以去調整這個工具的設計
你可以把它設計得更好
然後同時你又可以端端的去做訓練
我覺得這個可能也是在
可能開發方式上
一個其實可能比較大的變量
就是我能觀察到
這幾個可能是我感覺比較有意思
讓大家比較好理解
其實你剛剛說
那個第一種角色
就像Manus這種方式
然後第二種就是你們量的
就是端端的去模型
對 但我們現在在一方產品上的
投入還不算特別多
我們現在可能主要還是說
做很多還是以模型作為
我們的主線
但你可以看到
比如像Clockcode
或者像CypTation
這樣的東西
它其實就是
其實就是一方的產品
然後我覺得應該也會是一個很大趨勢
所以可能後面就是看這兩種東西
它會怎麼去配合
或者說他們在這個生態裡面
會是在什麼樣
他們邊界分別在哪裡
看到主線
你看CypTation設置了L1到L5
其實我一直很好奇這裡的邏輯
就是L1插報
第二種是Reason的人
第三種是Agent
為什麼有了插報和Reason的時候才有了Agent
然後為什麼後面又是
創新者和組織者
他們的邏輯是什麼樣子
就是在邏輯模型上它的變化型
就是它是這個能力
一步一步的依賴
但是就是現在我覺得實際看起來
實際看起來就是說你Agent
我覺得Agent的上線是取決
你有很強的Reason能力
但是好像並不是說你必須
比如說我們如果把這個技術發展稍微
換一個順序
才是你先做出來的Agent能力
然後再去做現在
這個下一項的Reason能就是說
你做這種Long-CypT的Reason能力
我覺得實際上可能也是成立的
也是強力的
對
對
而且你可以
因為可能Clout的路線
它就是Bat在這點上
就是我可能在Reason領上做的
並不是那麼多
但是它可能在這個Agent上會做得非常好
因為它對你的事實是
你技術背後是兩種不同的
Test Time Scaling的範疇
你一種Scal的是通過這種多輪的方式
因為你需要跟外界交互
你使用很多次工具
所以它是這種多輪的交互
你可以Scal這個輪次
另外一種是Scal
就是像我剛剛說的
你可能其實並沒有什麼交互
你只是一直在那四考
成確的四考
它是兩種不同的
我覺得是Scaling的圍堵
那你現在
我覺得就是說
你可以看就是可能
比如說你看Clout很多模型
它的Reason能力的 performance
並不是非常高
對
但是它的Agent上的 performance是很高的
讓我覺得這兩東西它
它其實並不一定是依賴的關係
但是有一點就是說
如果你想做最好的Agent
就是想讓他自己的最負擔的任務
那你最終可能是需要你的Rizan
你能力也很強
對 所以他是這樣的一個關係
我覺得在研發上他不是必然的順序
但是就是如果你想達到一個東西的最好
你需要另外把Rizan
你要達到Agent最好你需要把Rizan
你也做到最好
然後當你有了Agent之後
就是他就可以去做一些
為什麼是對你接下來是Innovation
就我覺得這裡面最關鍵的一個點
就是你的模型到底什麼時候
能參與到模型的開發
就比如說我們希望K2能夠參與到K3的開發裡面
那如果你沒有這個Agentic能力
你只是很難做到這個事情
但當你有Agentic能力之後
他就是可以去不管是說你提出一些新的想法
還是說去做對應的實驗
然後去分析實驗的結果
得到一些結論
然後去跌在下一版的想法
或者去優化一個
某一個Infra的什麼一個性能
那這個東西他就需要很強Agentic的能力擦成能做
對 所以我覺得Innovation
其實最大會產生在
至少會有一個很關鍵的點
就是看你這個模型什麼時候
能參與到你的模型的本身的研發裡面
做一點點
然後
但這個東西他跟我跟DanJayson就是他可能也
我覺得也不一定是完全現性的關係
我的東西實驗也是兵型的
就比如說
現在這個組織這個東西他也在
對 就是我覺得現在已經看到很多這樣的趨勢
就是當你有一個Agent之後
你就可以把它拓展成因為MotiaAgent的系統
對 你可以從一個AgentFocus出來
很多個不同的Agent讓他去做不同的事情
然後他很多可以穿型
然後破的兵型
然後再和兵起來
然後再分成幾個不同的Task
可能有的視覺
去寫測試有的去寫溫當
有的去設計就是整體的
這個軟件的框架
他可以有不同的這個分工
然後
我覺得現在已經在有這樣的趨勢
所以TaiPo一定是現性關係
對 就是你有可能兩個都會一起發生
但是他確實是
我覺得
我覺得Rigen你看Agent相當於說
對 就是可能會是Innovation
很organization的一個前提吧
我理解Rigen的是Agent的前提
是因為他能夠讓語言
通過推理在Agent中得以方法
對 就是如果說如果想去解決一個
可能最複雜的Agent的問題
你肯定如果不會推理是很難
對 但是你假設
沒有推理的這種範疇
你還是可以定程度上做一些Agent的任務
不需要推理的任務
對 就是或者你不需要那麼強的推理能力
你其實就
你不需要說我在思考過程中輸出來幾
前一個偷可能去推理一下
我當前這個到底我應該怎麼做
你也可以去通過多輪的交互方式
從環境裡面得到反饋
你寫一些測試
然後去跑這個測試
你也能解決一些相對比較複雜的任務
所以我覺得這次為什麼現在可能
你發現CLOLE的模型在很
在有一些場景它會做得更好
就是因為我覺得可能你是背後
其實對你的不同的技術的Bat
但最終你是繞不開
就是說 你最終你要做到
就是你要往三頂在爬幾步
的話你還是兩個都要
它只是一個時間問題
然後所以對你就是organization
innovation在兩個都是一樣
就是你在這裡面
如果你有不同的技術的Bat
可能會讓你短期的路徑稍微有些區別
然後這些短期路徑的區別可能
會有一些影響
因為它畢竟你要面對的是
一個動態的市場
innovation的標誌是模型的做跌彈
那organization
organization就是可能就比較簡單的思考
就是它會是一個模型的模型的系統
然後可能會從現在的Agent變成
我覺得現在也有很多這樣的出型
然後大家就說你模型Agent的系統
怎麼很好的等到端的訓練
然後你可能不要去過
你和到我集中對完Agent的類型
讓它有更好的方法性
我覺得有挑戰的
會奧運來自於是雪山的風頂嗎
我覺得也不是
可能它真的就是沒有頂
就是這幾個能力
它可能隨著時間的發展
它都會持續地變得更好
就包括推領能力
你說推領能力的上線到底是在哪裡
我覺得今天也不好說
雖然你看起來是L2的
但是也真正說做到很強很強的推領
我覺得今天也還是有很大的空間
所以你怎麼看L1到L5的這個分子
你把它當作一個什麼樣的課堵
我覺得它是就是幾個
可能做到的技術MilesDone
但是就是首先它並不一定
完全是喚醒的關係
像我們剛剛說
我們會預計說有一個東西
它就馬上被解決掉
然後你去解決下面的問題
它可能是會
你同時都會再提升
我覺得這樣
比如說Reasoning就是你要去
你真的要解決一些開放的問題
或者說
就是你你要做很好創新
提出來新的模型架構
你的推領能力可能又需要有更高的要求
所以我是覺得
可能這幾個能力到持續的提升
我來復興一下
23到24年你們的關鍵角色
當時2月份決定的創業
然後開始融資組建團隊
然後到了下半年KIMI上線了
然後Baptop成文本
24到25年這一年
你的關鍵的幾個重要的角色是什麼
好問題
我覺得很多人都知道
可能技術上就是說
你從以預訓練和
比如說SFT
為重點的這樣的研發範圍轉變成
就是說以預訓練和強化學師
以為重點的方式
然後我覺得這個其實你就需要做很多的
不管是人才的儲備
還是說你研發方式的改變
然後可能
還有就是說可能從對話到A1
我覺得是一個重要的
範圍的改變
然後這個東西他會很影響
我們的實際的工作方式
我覺得這兩位是可能比較
重要的方向上的變化
過去半年你們推出了K1.5和K2嗎
這個分別對於KIMI以為是什麼
我覺得K1.5更多的是
可能是喬爾徐這個技術的驗證
就是我們
對我們可能是也是比較早去
在這個技術路線上去做投入
然後可能得到一些結果
看背後的技術到底怎麼做
就是當時我們發現說
你可能不太需要太多的
這個process reward或者這種
bear value function
或者甚至這種事可能在訓練過程中
還有一些副作用的感覺
我們發現就是你可能直接
我們端到端的這個 reward
就可以把這個訓練得非常好
我覺得這個在早期時
可能還是並不是非常明確
然後在這個過程中
我們可能是積累了一些
喬爾徐錫的基建
還有他的這個
一些算法的一些No號
K2的主要的點我覺得是幾個
一個是說我們希望他是一個
非常好的基礎模型
希望他是一個非常好的 base model
所以那如果你想有一個更好的 base model
我們就要去看現在
比如說整個領域他的
預訓練的平靜是在哪裡
然後我們發現就是
因為你其實
高質量數據的增長確實很緩慢
然後多摩太的數據
你又沒有辦法很好地去提升
紋本本身他那個智商
你可以認為就是高質量數據
他有點接近是一個長數
所以在這裡面我們希望的是說
我們希望把每一份的數據
能夠最大化的使用
就所謂的這個token efficiency
就是你希望說你
你同樣吃下一樣多的數據
你能腦子長得更多
就是你能得到更多的智能
會跟之前有一些思路不太一樣
就是說比如說你現在假設
你在這個訓練系統裡面
做很多的性能的優化
讓他訓得更快
這個東西也很有價值
但是訓得更快
本身他並不能提升智能的上限
因為你的token還是只有這麼多
你訓得更快
你最後只是說我在更短的時間內
完成訓練
但他他的模型的效果
並不一定會變得更好
所以這個是所謂的訓練效率
或者說Computee efficiency上的優化
這個可能之前有一些人做
那我們現在更多的是
希望說去提升他的token efficiency
就是把一份數據當成好幾份來用
比如說我們很關注的
像比如說Millon的優化器
Millon優化器就是這個東西
他很有意思就是他對token efficiency也提升是比較大
你可以認為就是說像Adam這樣的優化器
可能已經用了10年
然後大家一直都在用所有美
就是大部分的模型
都會用Adam來訓練
但是他的token efficiency並不夠好
對 就是並不是把每個元素獨立的去考慮
比如說一個舉證的參數
還會考慮他們之間的dependence
然後通過這種方式
你其實是可以更好的
有更好的學習效率
也就是說你學同樣一份數據
你能夠更多的智能
比如說我們早些時間
如果你是在Computee Altima我的情況下
你基本上會有一個兩倍的提升
也就是說你學一份數據
就等於別人學兩份數據
等於你用Adam學兩份數據
所以假設你有30T的高智量的token
你等價就是變成你現在有60T的高智量的token
但是他還是那麼多數據
對 但是他學了之後
他會他的腦子會長得更快
為什麼
對 因為他的學習效率高
因為你的優化器更好
所以他會所謂吸收的更快
就是你都是位一樣的數據
但是他就吸收的更好
所以你的壓縮率會長得更快
你的Loss會這樣更快
OK 這是每個人窗嗎
沒有優化器
沒有優化器是Callert提出來的一個東西
我們在上面做了很多的優化
讓他能夠在很大規模的
這個語言模型是失配和訓練
比如說
我們之前其實有一個Molite的工作
就是讓他能夠第一次在
有一定規模的語言模型下去去
然後後來就是說我們那個在去進一步規模化的過程中
我發現有很多新的可能比如說你發現他的
Mexlogic可能會有這個爆炸的這個問題
這個其實在爽規模線上你是很難得到
但是你在大規模線上你可能會遇到這樣的問題
然後可能我不就提出來一些新的比如說clicking的方式
去解它讓它能夠在一個非常大規模的情況下
人人能夠很好地有去訓練
這個是很重要的就是就是因為你的偷騰說實上有限
所以你希望每一份偷騰能才能可能跟大的價值
對然後包括就是說我們也會對數據做很多的這種
Refraze的操作就是因為高質量的數據你比如說
你有30T偷騰在時期裡面高質量的數據可能更少
你可能有幾十B或者幾百B這樣很高這樣的數據
但你希望它能夠好的使用
對所以我們就是對這些數據可能做了一些改卸的操作
讓它能夠更好的被模型吸收和有更好的翻化
對我讀了你們這個記住報告
你們常識以一個模型感謝我書記生日新的餘料
那就聚集的改卸過程是什麼樣的改卸策略是什麼樣
這個急劇你沒有提了
如果你同一份書記學很多次它可能
它可能翻化不一定那麼好
對就是它可能會有一些這個
會有一些過你和的問題
對然後所以我們希望就是說你通過這個改卸
讓它有一定有一定程度的翻化
改卸有一定程度的翻化
對所以所以這個可能是一個主要的思想
反正就是改卸的方式可能會有非常多種
就是我們可能找到一種就是說
在時間裡面它效果比較好的
但我覺得這個空間也很大
所以我覺得可以有非常多的研究的機會
你怎麼看那一種觀點
就說改卸過庫中期是沒有
我寫出來支持說明支持本身
就在裡面沒有心執是除非改卸的時候
用到雜方法
這個是一個很好問題
就是可能確實跟你的改卸方式有關系
原來上就是看你有沒有新的這個商的這個輸入
新的商的輸入
對所以我覺得這個它對改卸的方式
是有一些要求的
但我覺得我們今天也不一定是
就是說一定是最好的改卸方式
我覺得這裡面還有很多可以去探索的空間
大家回到剛剛講的點
我們說這個Keyel這個模型
我覺得一方面是希望它成為一個好的base model
然後所以我們也會很希望去提供它的tokenfission C
這些是我們可能對應的設計
包括就是去加更多的這個
通過更大的技術度去加更多的參數
那它的tokenfission C也會更高
因為因為你參數多了之後
你雖然學一樣多的數據
但是你你也會吸收
就是你會吸收的更好
因為你有更大的這個
對就反而你通過時間
你可以驗證它確實有更好的tokenfission C
然後所以這個是很重要
第二個就是我們希望它是一個好的
有好的agentic的能力
對韓華學習或者說對於這個工具
很環境的這個模擬
讓它能源比較好的泛化性
就是我是覺得對於
對於一個agentic模型來講
可能現在最大的挑戰其實是
在模型的泛化上
所以就是
就是因為現在的iiu技術
我覺得它的局限性在於說你的
你不管你的訓練任務還是你的
評價指標
它很多時候都是單點的
比如說你就訓水扔持它提升水扔持
然後我覺得它是一個基本上
很確定的東西
但是
但是你的指標提升上去
是因為你的模型的泛化
會變得更好
對然後所以我們也嘗試
去可能解決一部分這種泛化的問題
就是
就是我們不希望說
它過你和他們
有一些工具或者過你和他們
有一些環境或者過你和他們
有一些
具體的任務上
對但這些任務可能是很好的觀測
但是我們不希望去
過你和他
而且這個問題可能在
AZEN的訓練裡面
它更加嚴重
就是像比可能之前的對話模型
它的好像
它的這個泛化是一個
更大的挑戰
為什麼不在PREACH你們的局勸
我覺得這個也是接下來
我們想探索的東西
對就是你有可能會有一些
更多的Egentic能力
是可以在於訓練階段去
這可能提高泛化行嗎
也取決你的這個
取決你的做法
比如說你的數據的分布
是不是足夠的
廣泛以及就是
有沒有很好的方法去評估
就是我認為
現在整體的評估
還會是一個平靜
就是它是阻礙你的
AZEN模型變得更加
半化的一個
很重要的平靜
所以你會慢慢觀察到
就是說你現在只是AZEN
能用的Bansmanck不是非常多
然後你在那邊Bansmanck上
如果觀察到一個分數
它其實很多時候
它並不是
對這個能力的反應
它其實也比較偏面
這個其實我覺得是可能
大家要去想辦法
解決對一個問題
這裡面可能有一種
前他的事物就說
我們還是用
跟AINetities的方式去訓練AI
就是說可能我們
希望讓模型參與到
更多的訓練過程裡面
比如說如果你的AI
能夠做很好的
Elimon Research
能夠做很多對期
你就理論上
它可能會有更好的分化
你就不僅僅是
在優化一些單點的任務
我覺得這個是AZEN
下一步可能非常重要的一個點
就是它今天可能還不像
對話一樣有這麼好的分化性
對
或者是接下來可能
就雪山上的這個幾百個台階
也有可能是這個
接下來可以1.5
是在跟著Open App好
然後可以兔式在強迫什麼
我覺得整體就是說
肯定我們還是
也是借件了很多技術上的這個方向
但是在這裡面
我們也希望能有一些自己的創新
比如說至少我們可能是
公開的時候能看到的資料裡面
就是說第一個去使用我們這種
Faith Adam的或者說
基於這種舉辦政交化的方式
去做這個新的優化器
然後再這麼大規模的模型上去訓練
我覺得這個還是
是一個創新的地方
然後包括可能
我們一些AZEN的數據的做法
至少在公開可查的資料裡面
也是也是比較早的去做的
因為我覺得這個空間會有一個人大
就是當然是有意思就是說
當你的右往上爬的時候
你發現就是你的空間是在變大
首先它偷更在變多
你完成同一個任務的偷可能是在變多了
所以它的問題的複雜度是變得更複雜
這事要剛剛講的就是問題不可避免
但是問題總可以被解決
就是說你這個不可避免的問題看起來
會比之前可能更多一些
所以你的研究空間可能會更大
對,這是我現在的一些直觀的感受
K20是怎麼理想的
籌備的多少時間
籌備可能比照長時間了
就是很多這裡面很多設計到
很多技術可能我們從去年就開始在研究
一個技術就比如說你像MewonClip的這樣
技術它需要經過一個比較長的週期
你一開始可能就是做一些非常早期的實驗
然後你發現這個想法好像有一些潛力
對嗎,就我們會有一些小的實驗
能夠去驗這個想法的潛力到底有多好
你有這個想法之後
它其實到你最後能夠去把它放到一個萬一模型
裡面去訓練它只是要經過很長的週期
你也要從過不同的技術實驗去驗證它會有效性
然後像我說的就是可能有一些問題
你只有當你 scale到一定的規模之後才會發現
所以整個東西這個週期其實是比較長
當然就是如果你看你只看這個模型本身
它的訓練從開始按下那個訓練的按鈕到
結束那其實其實時間到沒有那麼長
就是你整體的研發其實是需要更前置
做很多事情才能最後保證你這個訓練
是一個比較順利的過程
張寄給要按這個的大磁是什麼時候開始
要做很多的積累
就是可能像
大概只是說你不同時間點的做法可能會不太一樣
比如說你一開始可能並不一定非常端端的到那去做
可能你積累一些環境和數據
但你到後面可以更端端的到去做強化學習
那你終點需要很多基建還有很多這個數據
的積累的過程
但這個東西它肯定很難說你兩個月做得非常好
也是需要時間積累
我整體覺得就是
那大模型或者相關的這些技術
它的
它是挺需要時間積累的
就是還是要做時間朋友吧
就是你要
不但積累這個東西
它是相對我覺得技術的曲線是還是有點鬥笑的
就定不是說我今天想做就能把它做出來
所以什麼說力量呢
首先我們可能去積累這些技術
然後就是一年前開始積累各種技術
我覺得
對 然後但是你說K2這個東西可能是
那就是最近幾個月我們決定要去
宣營一個這樣的模型
然後把那些技術用上
我覺得大概是這樣那個決策
但是你不是說我今天想去這個模型
可以然後我們再重點去搞很多東西
那可能就不是兩三個元能積累的問題
為什麼你一直想
當然是這個
我覺得也很正常
因為我們就一直訓練下一代模型
那你其實無非就是決策
就是說我下一代模型到底是
我到底是要加入那些技術
然後你期待它是一個什麼樣的模型
就跟現在我們也會去考慮
我們K2之後下一代模型到底上什麼樣的吧
這個是一個持續要思考的決策的問題
然後你看到每一次就是看
現在你工具箱裡面
其實AO多了很多新的東西
那你到底要把那些東西拿出來用
就是有一個這樣的過程
那你的做研究和做訓練的團隊是分開的嘛
就是它他們一個什麼的過程就是
因為一年前就已經開始研究這些技術了嘛
那到真實訓練
就是一個團隊在做這個事情嗎
對對其實是一個團隊在做
對就是因為因為這些東西它很難分開
就是比如說你在實際訓練過程中
你會遇到這個問題
如果你之前都不了解你沒有辦法去解決它
所以實際上這兩個並不會分開
K2個人終於有遇到什麼挑戰力了
就是我們遇到就是那個Millon你去訓的時候
他就會炸
就是我們
那個都有畫一些圖在那個paper裡面就是說
Mastodge就會長非常高
然後就是我們認為這個東西
對訓練的穩定性有影響
你可能迅久了
他有很多所謂的這個內課
只不要不正常的話
其實對模型的上線是有害的
對 然後我們就是說
等於是我又回過頭去
Revigit 去重新看這個問題
然後去修復它
因為這個東西是你在少婚模型上
沒有辦法預測
因為小規模像我們沒法負限這個結果
對 它就是不會有這個爆炸的問題
然後其他的基本還好
因為其他的我們都在小規模
這樣做了很多實驗
然後它基本上也是可以遷疑的
所以問題就不是很大
唯一有這個是
小規模像驗證不了
所以你需要在SKILL
或成功再去另一句解決
你在KR訓練過程中
所以中央幾個弄號是什麼
這個弄號是寫在paper裡
就是我們都很open
就是主要的東西是在paper裡面
因為我們還是想跟
更多的社區去分享
所以好幾年你會怎麼定義
AZN可以給怎麼對AZN分類
好問題
就是其實我剛剛說的就是
Tack可能是一個
就是從一個剛中之鳥
變成可以跟世界交互
因為水AZN它其實就是最重要的特徵
就是它可以去多人的使用工具
我覺得兩個一個就是
一個是多倫 一個是工具
多倫就是你能做很多次
這是一種TacksTime scaling的方式
然後工具就是其實你是連接這個腦
跟外部世界的一個方式
比如說你用手水晶晴
但你就可以把這個模型跟
整個互聯網連接起來
然後你如果
就是你可以寫蛋馬
那你就可以把這個腦跟這個數字
因為這個數字世界基本所有自動化
都可以用蛋馬描述
那你就可以讓它擁有這種自動化的能力
所以我覺得這兩個是
我想像中可能AZN的特徵
那接下來就會有更
越來越多的工具
但你會有常委的一個分布
就是這個模型如果翻化得好的的話
它就不只只使用一些常見的工具
它可能可以使用非常個性化的工具
比如說加上你今天要有一個
就是非常具體問題
比如說你想讓這個模型能夠反問
公司內部的一些數據布獲
你個人的一些溫大
然後能夠甚至是反問一些訂製的API
讓它能完成某些業務的操作
比如說去退票或者去下一個訂單
這種就是它應該是能夠翻化到
它沒有見過的工具上
對
然後
所以我一直在想說
我覺得AZN現在可能最缺的
其實是這種翻化能力
但如果你有更好的翻化的話
那其實所謂的
比如說之前大家在討論
各種垂直的AZN
它可能就不一定非常需要
就是因為當你這個通用AZN
它能去翻化到常委的工具上
那基本上你很多領域專有的問題
但是可以直接用這些工具去解決的
你只是每次給它加不同的工具
比如說說的你家裡
可能訂製的需酷
訂製的API訂製的這些溫檔的接口
什麼你就可以完成一個非常垂直
一個AZN
它的這個
我私信就會講很多
然後多人主要是你可以做TESTIM SCATING
就是你可以做很複雜的任務
不只是做一次
就像對話模型一樣
我就只是出了一輪的
但它現在是可以做不同的事情
就跟人一樣
就是人每天的工作
其實就是你可以用它就是一個
多輪使用工具的訓練
本來就是讓你是希望把人的訓練給它
你合進去
但你要收集不到這樣的數字化數據的話
那你又可以用強化學習來構造
對 就是它本來就是在模擬人的行為
但它也是一個很朋友的
它是一個
對 你也不能說這樣模擬人
這樣模擬人的行為可能不太準確
就是因為它只是一個通用的
什麼叫它是通用的
所以不是模擬人
人也很通用
對 人也是通用
人是一個所謂的Universal Constructor
所以它主要目的不是去模擬人
它主要目的是通用
就是說它這個形式的話
就是這個這個
這個第一本身它是通用
它可以完成幾乎所有的任務
對 所以這個可能才是這個設計的目的
就是說它跟人的做法
類似 可能只是一個
只是一個剛好的結果
並不是說設計這個系統的目的
就是涉及飛機去為人能夠
當作一個交通工具
它並不是為人向鳥樣的飛
對 所以我們有這個Agent的系統
它更多的是通用
Jenial Profits的一個智能
就是你也是跟這個目標對起
但它剛好跟人是一樣
剛好跟人是相似的
怎麼提高通用性
有它做到什麼方法嗎
對 我覺得這也是一個很難的問題
就是我覺得今天Agent的發化
有一個風險就是會現實到
可能有一些Dutchmark的這個過你盒裡面
但是但是現在有可能缺少
很好的Dutchmark
所以我覺得這個會是接下來的挑戰
但我覺得可能有一些解法
就是如果我還是覺得
如果能用更多的用AI去訓練AI
那一定從頭上緩解這個問題
什麼時候能做到用AI訓練
AI現在的平解是什麼
現在其實已經有一部分
你可以這樣做
但是就是你希望它
有更多的這樣去做
也現在很多還是要靠人的設計
這個到Innovation那個階段
所以這很有意思就是說
它其實有可能不是現性
你要用一些Innovation的方式
去解決你的Agent問題
因為今天你的Agent算話不夠
所以你要Innovation的方式
它就是你要L4的技術去解決一個L3
所以我覺得L1到L5的定義
有可能它真的不是現性
就是又回到剛剛說那個點
就是你沒有這個
很好的Innovation沒有用AI去訓練
或者AI對其AI的方式的話
它可能
這個Agent它就是很難做到特別好的翻話
就是你今天翻案就是你
人工地來一些Task
然後你就feet的Task
但是你在別的
你可能看不見的Task相當
它就也有可能表現沒有那麼好
然後但是你只feet的那些Task
可能就只刷那幾個Task的分
其實很多時候用戶或者說
你在一些更OD的場景裡面
它的體感就是沒有那麼好
我是覺得現在這個領域其實面臨
就是可能Benchmark不夠用
或者Benchmark是效果
然後Agent的翻話有問題
這樣的一個階段
為什麼數學蛋白是相當容易方法的領域
其實也沒有
就是你說你如果做強化學習
但是現在就還會我覺得會有一樣的問題
就是對於這些任務
然後
你當然就是說強化學習本身
它的翻話性要比比如做SFT要好
就是因為你在這棟中
有更多的OnPolicy的Sanpo
就是你從模型本身去Sanpo
它學出來的東西
三方現在看起來是更好翻話
而且你有附屁肚
就在兩個東西會導致
從小的東西上來看它的翻話會好
但是它的翻話還是有限度
就比如說
你今天這次假設在某一種類型的數學競賽上
做到99分
那你別的數學問題可能會提升5個點
但是它很難直接也做到99分
就是你如果不做對應的I/O的任務進去的話
它就很難直接做到這樣的一個翻話性
我是覺得也人愛有一樣的問題
你說做數學題
它也有人有一樣的問題
就是它是被分布所
制約的一個東西
就說你還是中瓜的瓜中豆的豆
但是我們希望就是
我現在就是我覺得整體的I/O或者Policy
還是需要有更多的AI
來讓它能夠擺脫這種中瓜的瓜
這樣的一個情況
後面擺脫不了
會不會提高不了方法性
就是還是回到剛剛說的
就是問題是不可避免的
來問題是可以被解決
所以就是你每次會往前推進
你翻話就是會變得更好
它可能是一個
它不一定有鏡頭
對 就是你只會有更好的翻話
H&M說認為環境非常重要
怎麼定好的入總定好的環境
你再看看過程中有沒有什麼思考
回到剛剛講
就是說
你一種方式就是說
給另一個模型
然後我就設計一些環境去穿
你向上去你和這個模型
然後你可以就是現在
你可能正向的設計假設
你是一方的做
你就正向的設計一些工具環境
然後模型在這個環境裡面去體傷
可能很重要的還是說
讓這個設計
有更好的通用性
就它能做很多的任務
就是它不應該是說為了
某一些任務去專門的設計
這個工具環境
然後
當你的設計足夠通用的時候
然後你用模型去在這個過程中去學
而不是可能反過來去你和這個模型
我覺得這樣可能會是一個
更好的做法
我注意到一點
就是一般的他們覺得在任務設計上
你設計一個足夠挑戰的任務
這樣這個任務可能會做出
有本質的新的方法
但是你們的H&M其實是用的
一些中的難度的人物
這是有什麼思考了
這個會帶人通用性嗎
會
就是它也是一個爬山的過程
就是你不能一向來
就讓它去證明一個
就是還沒有人證明過的數學問題
然後看可能這個Fampway Fission時
就會非常非常低
所以現在感覺比較好的方式
就是說其實強化學習
如果你搭配好的Fampway
撤了它本質上是一個隱世的
特成學習的機制
希望它
就所謂 Curriculum Learning
就是你希望它從
合適難度開始學
學完逐漸去提升它的難度
倒不是你一上來就學非常難
因為那樣的你的採量效率很低
就基本上學到什麼東西
可能算力都會非常廢掉
對
但這個挑戰還是說
今天很多任務
我覺得它還是來自於比如說
人類存在的數據或者說
人去設計的一些任務
而不是就這裡面可能
AI Native的部分還比較少
所以會帶來
剛剛說的犯法性的問題
BuyCoding和ToneAG的是什麼關係
Coding可能是一個比較垂直的
就或者說它是一個紙機
然後它你只要把
兩個工具用得足夠好
你就能做大部分的事情
最後還是希望說能夠
不光只是說Coding
對 包括現在我們去訓練這個模型
我們也不是說讓他只能做Coding
因為他的
還是會有一些局限性
Coding是將到一個環境
他是
將到有人來的手
對 他是任務的一個紙籍
對 但他可能是很重要的一個紙籍
他是相對對於 Agnall說比較容易任務什麼
比較好驗證 所以比較好學習
對 但是他還是會有一樣挑戰
就比如說我剛剛講到這個翻話性的問題
他還是會我覺得即便是Coding Agent
他也會面臨一樣的挑戰
然後Coding是很重要的一個紙籍
是在於說
就是他代表了可能數字世界的這種話
你今天假設你想創建一個新的工具
因為現在很多Agent他的工具集合是一個固定
然後如果你想創建一個新的工具
他本身上是寫一段
寫一段或者
以大段代碼來實現
或者如果你今天想做更好的
比如說上下文管理
或者所謂的Connecting Engineering
東西他可能
對我對應的也是一個工具
這個工具可能也用代碼來實現
就是代碼在這裡面他有
他有一個獨特的位置
獨特的作用
但是並不是說你做了Coding Agent就足夠
因為很多
比如今天大家有很多不是程序員的人
他會用Clock code去做很多他的任務
你是一個律師或者你是一個
產品經歷或者你是一個設立師
你也會用Clock code去做一些事情
是因為你的模型是
是一定常做上有一些
有一些範圍他不僅只是會寫
寫來嘛
所以你們是要做通用Agent模型
並不是說要做一個Coding的模型
我們還是希望能
就是做通用的模型
或是代碼到錯工者
而出不至見
覺得Agent還缺乏什麼能力
意思我覺得首先
現在這些高屏的工具使用也還不過好
能力上還有很大的空間
然後這一方面也是說
現在
缺少一些更好的Benchmark
過來觀測吧
就是你可能水Benz三號現在也是
也可能馬上會有Satuary
就會保合
然後有很多Bench他不過好
不過真實的反應
就是
實際的用戶體驗
然後所以我覺得高屏
高屏工具本身會有空間
然後常委的工具
就是在一些可能你沒有見過完全OVD的
什麼有更好的方法
就不覺得
也是可能很重要需要解決的問題
你自己最看重能提升Agent
你這是哪幾個關係能力
長期來看讓他的能力提升
希望能用Innovation
最成的一些技術
去抵抗Agent
最成的能力
所以希望
我覺得這個可能是
很重要的一個方向
Long Kong has long term memory重要嗎
Long Kong has very important
就是因為現在
很多任務你
你128K
256K這種context完全是解決不了
你需要可能比如百萬級別這樣
或者甚至更多
但是你又需要在這個級別下
你的腦子還非常好用
它不能只是說長
你可能腦子還得非常好用
就是你的致上還得非常高
所以這個對於模型的訓練
是挑戰是很大的
就是你要讓他希望
你的壓縮率如果高
所以你的模型可能要最高大
然後同時你又希望他也不要長
所以就是這個
這兩個東西它是天然會存在一些衝突
你需要可能需要更好的架構
但是有一些架構可能你發現
它在更長的context下
可能效果會有提升
但是你短的context也有可能
又不一定會有提升
或者甚至會有下降
所以就會有很多這種
可能架構上的一些
一些平衡的問題
但這些問題可能也會接下來
逐漸被解決
我覺得它是有一些接法
所以這個也很重要
這個可能是一個
Tax上的一個支持
還有就是我覺得
現在的IRO訓練方式肯定也會有
提升的空間
比如說當你要訓練一個很複雜的
MOTI agent的系統的時候
那你只用端到端到的Reward
可能就不太夠
但中間的Reward怎麼產生
是不是能擺脫一些人工的設計
我覺得也會是很有意思的挑戰
我有一個就是我會看我們去年對話
我有一句話你非常想問你
就是你去年說太元會如何會避允
因為太元的方式跟你以前不一樣
以前所有人都可以
共進到開源
因為開源本身是中心化的
開源的功績很多沒有經過算利驗診
打避允會有人才聚集合著秘聚
是一個對市場整合
所以領先者不會太遠
就落後者才會這麼做
但是你那看遠了
對 因為我們還不是覺得
我們還沒有做到非常
就是完全的領先
有一些判斷上
其實基本上是這樣
就是說你確實你的模型出來之後
就是這個社區
它能貢獻一些些東西
比如說你在推理測的可以做很多事情
然後你可以讓這個模型有更多人免費
跟你賺
然後有更多人去用
然後
但是確實你要共進到模型本身的
把這個模型本身變得更好
好像還只能是你原廠自己來做
大家就是說現在
如果是放在這個
你如果它被smoto是這樣
但是就是說你如果繼續在開模型
去做很多post-training
特別是Agentic的post-training的話
有可能會產生出來一些新的機會
比如說加速你現在想去做一個
就是說法律相關的Agent
然後你是一個
比如說你是一個創業公司
想去做這個事情
讓你們去GKR
然後在你的定制
你的工具集合下面
你可以訓出來一個specialized agent
然後它在你關注的場景上表現得非常好
我覺得成這樣機會
對 但它更多的是可能去負能
就是更多的可能下午的應用
你可能可能說把這些東西
在變成說你的主模型
這個被smoto的提升
這個可能目前還是很難
我覺得大概是這樣
對 我覺得這問題
可能可以動態的觀察
就是就是
你們會長期選的開始嗎
我覺得這個是一個
我們希望長期去做的事情
但是我們不一定是說指揮開
我們會希望能夠去跟社區去分享
你像剛剛說的技術很好
對吧
然後我覺得這個是可以去加速
就是我們我們往把技術
再往下去提升的一個很重要的
一個點就是大家可以不完全就是競爭
就是你也可以有一些合作
或者甚至就是說
你說開源的公司
它會形成一個生態
就是說你能更好把這個技術
往下去推進
就你在雪山
可以趴得更好
然後Race the top
也不一定說我東西都是開源
比如說假設我們現在跟某些公司
有一些合作
就是它不一定是說你說東西都要開出來
但是我們可能會希望能持續的
去開放一些好的技術
所以這是一個技術體系的信仰
還是說一直是一個市場某一個促良
我覺得客觀的說是都有
就是而且可能都有好處
但最終我們是希望說
能通過這個東西
讓這個技術可能跟安全
更快的達到一個更好的水平
它變成生態會怎麼嚴敬
你覺得最終開源和畢源全球會生下幾家
我覺得不會很多吧
就是說整體來說
但幾家肯定還是會有的
就是我覺得整體來說
其實你如果去看過去兩年
我覺得這個趨勢還是比較明確
就是你還是這個市場會逐漸的
更集中跟收聯
對於更收聯
你可能一開始有幾百個
高了是幾十個到幾個
我覺得幾個可能是最終一個比到穩定的數
我覺得生態看起來還是一個大概率的事情
你們屬於開源那邊
那邊還是畢業這邊呢
像我剛剛說我們可能會持續的去開
但是並不是說東西一定都會完全的開
我覺得選擇性的是一個
對吧
這個很多可能我們要動態的去觀察
對但是我們可能也希望能夠長期去分享
更多的技術
為什麼中國公司都開源了
也不是都自己就沒開
對我覺得客觀的說還是
就像我剛剛講的
就是說你看到有市場不會一種因素
我覺得這個對社區來說是一個好事
就是說然後你開源可以互相接見
那你可以去加速做到收台
我覺得它是一個很好的方式
去年你提到一個很多的詞
是有概率的飛工時人
你今天有概率的飛工時是什麼
好問題
我覺得就是可能像我剛剛講的
就是幾個接太比較重要的人技術的點
比如說怎麼去提升Agent的範化
我還是覺得可能是一個非常重要的問題
然後這裡面可能我們希望看能否
在技術上有一些新的東西
然後包括我們去做優化器
這東西我覺得在我們做出來之前
但我現在不知道是不是
就是至少在我們做出來之前
應該沒有人在做這個東西
所以它也是一個
它也是做成了一個飛工時
因為之前所有人都會失去Agent
所以我覺得這個也算是一個比較重要的
因為它對TokenFusion實際提升就是很大
所以是的我們現在可以有一個比較好的Basemodel
Basemodel我們後面就可以有更多的PostChannel
去把它所有的上線、所有的性能去壓榨出來
我覺得這些其實都是
你怎麼看AI時代的產品
就是你因為做Kin年做了很長時間
你就做比如說做AI時代的產品
跟做移動護擁有的產品會有不一樣嗎
我只能說說AI的產品
因為移動護擁擁沒有做過
但是就是
以前就很喜歡說模型級產品
對我覺得這個現在還是沒有變化
還是沒有變化
就是比如你在
假設你現在做一個Agent產品移動
在做的時候其實需要把模型跟工具
和這個Context去結合起來
但是你發現就是在訓練模型的時候
你基本上已經要把這些套全部搭好
你才會辦法訓練這個模型
所以當你模型訓完之後
你的產品已經做完了
就是你在上面做一些可能交互的東西
我覺得肯定也有很大的價值
但是可能它是最後的
這集上天花的這一步
就是你的模型的性能
它已經在這個過程中
然後打磨好了
然後跟這些工具和環境
已經有非常好的試配
所以它是
它是在訓練之中完成的
就是你訓練好了之後
你的產品就基本上已經做差不多
因為你訓練的時候
現在開了方式也沒實際上
你要做一個巨大的系統
同期下午有事
21世紀初Google做新鮮做系統
那你今天對於AI就舉達系統
你們什麼想像
更多的想像
金額比如說以前的搜索
已經系統或以前的推薦已經系統
但是它都是
是配不同的時代呢
我覺得現在的系統複雜性
在於你想
就想這張這個模型變得通用
就是通用它會帶來很多的複雜性
OK
但你一方面可以認為它是變簡單了
你一方面也可以認為它變複雜
就簡單再說
你只要把所有東西都放在同一個模型裡
就你不需要維護那麼多模型
你不需要搞一堆的這個Routing的策略
對吧
就是它從概念上來講
或者說有一些工程實現上來講
它是變簡單的
但是另外一方面就是它有一個變得複雜
就是你發現你如果希望它很通用
那你就希望說這個模型
在各種場景下它都可以工作
比如說你做Agent的模型
你不希望它只在你的工具之下
很工作
你希望說
別人用你這個模型
它在別的工具之下
甚至你沒有見過的工具
或者說工具不同的定義
不同的實現方式
它都能工作
這個其實就是
要求是很高
然後你可能比如Agent裡面
它現在可能會有幾種不同類型的任務
你不然是Coding的Agent Search Agent
還是可能一些其他的Agent
就是你要把它
放在同一個通用模型裡面
那它就可能會有這個
會有一些打架的問題
就是你可能也許你的工具
定義不一樣
或者你的數據的Patham不一樣
就是你把它做成一個通用模型的過程
它其實是有很多的技術挑戰
但是如果你不做成通用的模型
它的方法性有沒有那麼好
你只能做一件事情
特別是現在就是Agent
它是需要很多部的完成任務
即便是成續員
它也不僅只是寫太滿
或者說寫太滿裡面
它也不僅只是做Switch
所以你當然就是
你要做很通用的東西
或者說真正可用的東西
隨著你的部數變多
它對於通用性的要求是會更高
我是覺得它的系統負擔性
主要是體現在說
你在訓練這個模型的過程中
需要讓它是足夠通用的
不是說去你合到某一些單點的能力上
對你合到單點的力量
你可能會
你可能會BanceMark分數看起來很好
但是你實際上就是
你的通用性可能是不夠
對 就是我覺得這個事
現在這個系統
我自己能觀察到表達
討論好 包括有個例子
就是說比如你想想
往這個模型裡面加多摩太的能力
對
你就需要讓這個多摩太的能力
不要去損傷它的腦子
而且你希望就是在多摩太的模式
下來跟你們這樣
我覺得能夠不損傷什麼
對 就是你能不損傷已經很好了
你希望它
多摩太的模式下來
跟你這個
文本模式下來
你希望它
它能共用一個腦子
就是它能在多摩太的模式下
也能把它文本的那個智商
給激發出來
而不是它就進入另外另外一部分的參數
那它可能就是完全丟到來的原來
它在文本裡面學習的部分
所以就是你作為一個通用的模型
它就會面臨這樣的挑戰
就是當你有各種模太
各種任務類型
各種
還有Agent Reasoning Chat
這些東西它要全部合到一起
我覺得是存在這樣的一個挑戰
而且你現在不光是SFT
你還要說I-L
I-L的時候它你就可能這個挑戰
就會進一步的加重
這個是相比
就是說你只做就是
通用的Pri-Channing設想的比較好做的
就是你只要把所有的文本
就是放上在一起
它基本上不會有太多的問題
但是你越到Protrion
後期越到I-L
它的這個問題會更加嚴重
我覺得這是它的系統負擔
你看Soswony型系統
其實是勾結在PC固域網上之上的
然後推薦已經系統是勾結在手機上
就移動過往上
你就親自接電在哪裡
這是在Air試的
有超級接電在哪裡
就是新的系統
對它肯定會跑到很多數據中心
所謂的健身經常說的這個AI factory
但肯定還會有很多中端嗎
就是我覺得中端可能還是有些可以復用現在
有一些可能會有新的
會帶著新的照顧版主
肯定會Chart是一種
就是你如果兩年前看
Chart是一種新的
交互方式
因為之前可能
沒有說人跟機器這種對話
現在你可能Agent
其實也有很多新的交互方式
就比如你讓它一步只是一個任務
然後你也可以看這些中間的結果
它其實也是一種交互方式
但可能接下來會有更多
比如說當你有一個Motage Assistant
那它的交互方式
會怎麼樣就可能你會隨著能力的編輯去變化
對 然後比如說你看Coding這個東西
Coding開始你有Copilot
然後Copilot之後有Cursor
Cursor之後有ClockCode
但是你每一代的交互都會發生變化
然後你發生這個交互它其實是隨著模型的變化
對 基本上就當你有新的一代模型
然後它能力提升了很多
你就發現你的交互可以改了
就你不再需要說我單個的人去點
我要不要Except一個修改
而是說我可以去多步的
去只是一個AgentCoding的任務
所以你的交互方便
當然今天可能Crowcode的交互它也
它也不是終極型態
就是因為你的模型還會提升
提升之後它的交互就會持續變化
我覺得是一個這樣的過程
今天Skatee Loan你覺得還沒有方法
Skatee Loan對Skatee Loan就是有數據強
我覺得這個肯定是一個客觀的事實
然後就是說你出過這個續強
你就是要提高Token Efficiency
就是我剛剛說的就是
我怎麼會去做Token Efficiency
提高Token Efficiency的事情就是因為
你肯定續強是存在的
然後你同時你要Skatee Loan跟多的Computer到
這個I/L
想各種各樣的I/L的任務上
但三號我們現在觀察就是
其實模型變好的速度並沒有再減少
我覺得甚至在加速
為什麼A&R場面都還沒有形成數據飛輪
就是因為
其實算力的Skating太強大了
其實算力的Skating太強大了
就是我覺得這是一方面
就是說你比如說你先Skatee Loan
然後你又Skatee Loan
I/L的Skating它的效率又比Precating要高很多
因為它是On Policy帶負負度的訓練
所以它的Skating效果其實是效率是更高
所以當你有很高的Skating效率的時候
我覺得你發現你直接Skatee Loan這個Computer
Skatee Loan這個Flops它帶來的提升是非常非常大
所以你會顯得其他帶來的提升很小
這個是一方面
另一方面就是說所謂的速度飛輪它是
很依賴於這個外界環境的V-BAC
然後這個V-BAC它我們不希望它有太多的造生
但現在可能三號就是還沒有完全
說這個問題做得非常好
就是因為你造生
就大模型的學習它對造成是比較敏感
它跟可能傳統的
比如說推薦系統有點不太一樣
它是造生很敏感的
現在看起來還是說
基於這個Flops的Skating是更有效
但這個平衡什麼時候會產生變化
也有可能就是說你
通過新的交互去
讓你收集到的新號的造生能夠去減少
對
但是你就是創造一種新交互
對
但是你這個交互要是配模型能力的發展
你的交互不能超越模型能力
你應該在大型模型能力的這個範圍內
去設計一個好的交互
但是我覺得這個是值得嘗試
只是說今天可能會看來會覺得說
可能你去Skating那個Flops那個微圖
或者說提升它的學習效率
它還是更確定性更高
而且看起來更有效的一個方法
如果說像比如說演進解說
用戶處去無法提供模式的智能
那好像今天就沒有必要做脫機產品了
我們就一般提升智能就好了
這個東西要看怎麼看
就是你可能還是要有一定量
就是你大概知道說這個
我覺得這樣就說你可能沒有辦法直接
去使用一些比如說用戶的反饋
直接拿去訓練
但是你也有一定能戶量的好處
是在說你知道整體的這個
比如說需求的分布是什麼樣
你大概知道就是說有哪些可能是
用戶用得好
那些用得不好
然後你再把這個東西抽象程可能一直
比如說EVILLE REACTION
然後去又怕這個模型
如果你這個模型完全沒有人用
那你可能都不知道往哪裡去又怕
另外就是說也要看這個用戶的三下架子
對就是我覺得現在
其實又到了一個新的分水領
就是說你的用戶
實施是有可能
能產生三下架子
比如說你就看我看他
他使用用戶其實產生的三下架子
就是很大可能這樣
他的因素的
比較大的比例
然後特別是現在
你可能有很多AZEN的產品
可能斷斷斷產生很多加持
所以銀戶可能現在
所以也要看你是什麼用戶
就是如果普通的去
先聊問一下天氣
他可能不一定
所以有那麼大三下架子
但是如果你是很多AZEN的
這個專業的用戶
那他可能是已經
本身就是一個很好的生產力的價值
可能這個事情他又不完全一樣了
你的產品有什麼新的想法嗎
我覺得更多還是想模型怎麼做
因為我覺得像我剛剛講的
就是模型訊好了這個產品
他就已經基本上做了差不多了
模型機產品
我覺得他今天還是成立
今天還是成立
我們還是會研的這個方式一直在做
有人會說
Kimi是要從要做
當然你不認可
你們是中國要做中國的歐後來以前
但是他們會怎麼看
你們是要從做要做中國的歐後來
需要變成你想做中國的
Dropick是有這樣的一個轉換嗎
我覺得很難算定義
就是因為中美他不太一樣
而且今天我們更多的
還是得站在全球的
吃饺去吃烤這個問題
我覺得做中國的什麼什麼
可能本身他就不一定非常勝利
我覺得還是其實簡單一點
就是說
我們希望
才是繼續爬山上
對 我覺得這爬山上
做時間的朋友
然後
跟肯定的提一起
說去加速的技術的推進
我覺得這是我們想做的事情
那我們聊聊雙眼模式
你怎麼思考的
API是好生意嗎
我覺得
現在就是明確的三眼模式
一個對一個API
一個是說
可能一方產品
覺得這兩個可能
我們也都會
去做一些嘗試
但是我覺得今天可能
這主要就先給
還是繼續把模型做得更好
我覺得這個還是
可能所要目標
但是你在把這個模型做
更好過程中
對比如說
你在某些方面
領先
那它其實確實是
有這個
會有這個三眼化的空間
因為我覺得今天整體的市場規模
其實長得很快
就是可能
投步的公司
有幾十億三百億美元的
AR而且是在快速增長
可能每一個
每一兩個紀錄
可能翻個兩三倍
這樣的情況
我覺得這個肯定
我們是會動態去觀察
然後可能
做一些嘗試
但是可能最主要
還是說
比如說你如果模型
真的能做到
比如說
OPUS的水平
會甚至做得更好
這個空間可能
更大所以
我們會花更多時間去
把效果做得更好
因為你能用不住
他們很喜歡
TMI但是
很擔心KMI不賺不錢
怎麼辦
你們能賺到錢嗎
對就是你還是先投資
你能夠交到錢
取決你就是你的模型效果
就是怎麼樣
我現在覺得
我覺得市場它
是一個
其實已經一定從上面驗證的市場
然後也在快速增長
像我剛剛說的
所以我覺得還是專注
把技術做得更好
然後這次要東西
我覺得其實可能
確定性感還是更高
KMI你心情有什麼變化嗎
也沒有
就是這次還好
就是說
我覺得還是這個
還是一個漫長的旅程
你只反正
要持續做下一代的模型
反正還是回到
或者在石頭上2句話
就是說你會產生新的問題
然後你去解決它
然後這個是
這個是可能是最有意思的部分
這個旅程就創業旅程
有什麼意料之外
完全意料之外
我覺得還好
就是
基本上
所有的困難
就是我們也有預料到
就是說具體是什麼困難的
我覺得最有意思的點是
你永遠不知道
會產生什麼新的技術問題
然後這些新的技術問題
會怎麼樣被解決
我覺得這個是最有意思的部分
就是這個是你
基本上很難預測
如果能預測
它就不是那麼創新
對
但我覺得這個是最有意思的
就是你會永遠遇到新的問題
你現在生活是什麼樣子
生活節奏
現在就是
可能睡得比較晚
怎麼樣
我不太一樣
就是可能每天不一樣
但是反正
然後
但也還好
就是花很多時間去看
怎麼把模型訓得更好
所以你的時間主要投入在模型訓練上
我覺得是
對就是
但我跟訓練是很抽象的概念
就是說我覺得
我覺得裡面很重要的一個是
就是你的技術
一些技術的戰略
我覺得這個是可能
公司戰略裡面最重要的這一部分
就是你的技術戰略
就是你現在
下一步到底是
你現在要做你一些不要做
因為這個技術空間很大
你總是要選一些東西去重點去做
去年選擇的是
就是說我覺得我們在很多東西上的
大致還是有效而且比較早
比如說想去做
Long CLT的
我們是反應比較快
然後去做
沒有優化器
然後去做
更大規模的
去選擇
然後去比如去做這個
做一個
可能第一個
Open的
Hagetic的模型
我覺得這些可能都是一些技術的
Bat
或者技術的決策
我覺得這個東西基本上
會至少決定
五六層的公司的走向
但你要做很好的決策
還是需要很多證據
支撐
就是我們還得做很多實驗
所以你得了解很多具體的實驗結果
就是到底這個東西什麼樣
那個怎麼樣
跟接下來可能會怎麼樣發展
這個東西它你不能攀脲
大概就是還是被
知道更多的信息
我覺得這個的話很多時間
第二個就是說
可能具體的技術上
你這些決策
你們最糾結的是那個
畫實驗最長思考
我覺得最重要就是說
你接下來要做什麼
補助什麼
就是剛才說那些決策裡面
其中每一個
是畫實驗最長時間思考的
也還好
就因為我覺得這個東西
它觀點是一個
蒐集數據的過程
就是你做實驗
然後看這個實驗是不是紮實
然後通過這個東西結合結合
就是你對這個一定的技術理解
然後去判斷就是很多時候
其實你只要數據如果充分
它的這個判斷
也是比較顯然的
這台
接下來又是
我們也在想
也在做一些實驗
還是有很多東西可以做的
我覺得至少說現在
KR的它的性能
前例其實還沒有被完全壓站得出來
因為我們之前放了
我覺得更接近
是一個
更接近是一個
Base Model這樣的東西
我覺得這樣
接下來我們可以加更多的
Post-Channing的Flops
就是我覺得它的上線
應該會比現在還會高很多
肯定就是我們還會去做下一代的模型
下一代的模型
就是我覺得應該可以
有在更多的提升
就是Base Model
對
然後
但這些具體怎麼做
我們現在就是
也會通過一些實驗
來決策
你也會加多麼太吧
對
多麼太肯定是
我不要確定
你剛剛一直說多麼太
其實
只要不干擾制的
就已經很好的什麼
對
對
它本身多麼帶你多麼太能力
也要做好
多麼帶你能力
本身要做好
也不容易
對
就是裡面有很多的工作
然後你怎麼讓它能夠去
接見這個紋本的腦子
不是自己單開一個腦子
就是比如說你Moe裡面
你Express
假設你有
Express它專門在做多麼太
你可能不希望這種情況出現
這樣的話
你可能
你可能隨著來多麼太
是個傻的傻的多麼太
對
我們希望它是個聰明的多麼太
像有什麼重要的理成悲
再就算是理成悲
放滑性被必須一步
對
我覺得是
我覺得AZN放滑性
是可能是最重要的
就是我今天是一個
沒有管全被子覺得問題
你們解決了一部分了嗎
解決了一些
對
我們寫在Papherly
對
你可以去
盡可能夠到更多的
多樣的數據
我覺得
也不只是這個
所以你們數據上的篇幅很大
我覺得還是盡量可能避免
說你通過強化學習的方式
但是你只能合到幾個任務上
因為還是我說的
因為BatchMark現在表現
所以你有法BatchMark
它就會導致說你的
I/O任務就會
可能彈梭到幾個單點
但這個只是我們不希望
你沒有觀察的東西
它可能就掉了非常多
我們現在也在
可能希望想更多的
辦法去解決
我覺得這個會很重要
像剛剛說的這個
DoneConTechs的支持
我覺得肯定我們也會繼續看
怎麼做
在它智商很高情
現在還能有更長的ConTechs
我覺得這個會是一個
DoneConTechs的架構它還是會影響你的智商
我們不希望它影響智商
就是希望它
DoneConTechs架構會影響智商
比如說如果做LiniaTancer
你純粹的LiniaTancer
你可能它就是會影響智商
因為這個架構會有一些Bas
可能在一些場景下
效果沒有那麼好
但這個是一定程度上
也可以被解決的問題
模型公司和做Agent產品的公司
長期來看他們的關係
和編輯是在哪裡
這個問題我畢業
沒有明確的答案
就只能說今天看起來
就是一方的產品有個好處
就是它可以做垂直的整合
因為我可以把模型放在這裡面訓練
所以我的模型跟工具它是融為一體
它不是說分開來做
然後再去印象工程
但是因為有非常多的Agent的空間
就是我感覺一方產品不一定做得過來
對吧
所以有可能是
如果能找到一些空間
比如說你這個工具的實現
它是需要非常多的領域的No號
或者說你的Evaluation是可能
一方產品根本不會考慮的東西
考慮不過來的東西
那我覺得是有機會
我覺得有像K2這樣的開源的模型
然後你就是說大家可以在上面去微調
讓你更容易產生出來
也有一些可能這種
Specialize Agent 垂直Agent的可能性
我覺得這個可能性還是
還是一定程度上可能會存在了
那要看你通用模型的通用到多少程度了
對
但你不管多通用就是說你總還是有一些工具你要做
所以你有可能也不一定是要去做的模型
而是說你把這個工具做得非常好
但這個工具你如果是做得太通用
你可能就會
就是跟一方的這個產品
overlap 到即會比較大
對 那這個就是可能你還是做垂直Agent
和優勢跟的
但是如果你這個工具是一個
我就是專門針對一個東西去做
然後甚至我這個工具是別人做不了的
比如說我今天如果掌握了一些線下服務的
入口
那我這個工具就是我這個
下訂單或者成交這個工具
是別人根本做不出來了
那你也有可能是
能產生一些獨特的價值
當然我覺得存在另外一種可能性
就是說當你這個一方產品
或者說你這個通用的Agent
它的流量或者3M是足夠成熟之後
那你很多這種專有的
本來壟斷的工具
它也會願意去接入進來
因為它的整體的3M效率會更高
對但3M效率的提升
我覺得是需要一些時間的
對 所以那在這個時間窗口內
你可能其實專有的Agent
也會有空間
對
對 就是但我覺得最終
就是通用的
通用就是Taiwan什麼
通用的工作是因為它整體的
3M效率會更高
所以今天甚至包括我覺得很多內容平台
你最終有可能你把內容
接到這個通用Agent裡面
你的3M效率是
會比今天更高
這個是有可能
大家可能要花很長時間
像Mindless這種公司
或許你的客戶還是你們經過對手
在生態上來說
我覺得它很早期
就是你很難
看著它到底有怎麼樣
而且可能
這個產品本身也會嚴禁
對 所以我覺得短期內
它可能更多的會是這種
合作的關係是可能是大於競爭的
但是未來它確實會嚴禁
所以像比如說
就有點像Claw的Cursor的關係
那Cursor它可能要動態的變化
它可能也得
在產品設備上有一些動態的調整
說它可能就是需要去
一方面是說能不能有一些模型的能力
我的技術研發的曲線還是很抖竅
另一方面就是說它能不能有一些
就是比別人做不到的工具
或者環境就是
但這個我覺得都是一些
現在沒有辦法直接回答的問題
但只能說現在看起來
我覺得一方的整合優勢
應該是存在的
你現在說Claw是哪個風
哪個山風
對Claw本來就是一個
可能是世界上最難判斷的山風
剛好這個名字有點重合
只是你威選的證明度
對 剛好也是Claw
對 就是我們也希望說
首先它不是中點的
因為它不是最高的山風
它可能是最難的
因為我覺得就是說你可能
因為現在有很多範疇的轉變
你可能從對話到這個Agent
然後可能你的Basemodel的Scal
進一步變大就是它本身
它肯定存在難度
所以剛好反而跟這個好像有點關聯
結果超出你預期的
差不多反而就因為基本上你這個模型訊
其實在過程中就已經知道了
就是它並不會說有一些驚喜或者驚訝
不是說你的AHA moment嗎
也還好因為很多東西它是可以被預測的
就是因為我覺得更重要的是
這個預測的能力
因為這個你去一次模型
一是需要週期二是需要的成本
所以我們希望在早期進行可能多的
就是把所有的預測都預測到
唯一的那個沒有預測到
就剛剛說那個Mex logic的問題
但那個確實沒辦法
就是因為你小規模它是預測不了
對 其他的我覺得都是
都是我們希望進行可能把來預測好
所以你說的東西都是在
都是驗證清楚的情況下
然後在Skylnesis scale的成功率是比較高的
你怎麼看張翔宇說
Nastoke and Prediction的本質缺陷
你得到這嗎
我不是太遠
他第一次就說隨著模型規模擴大
對話能力是量和情商的變強
但是推理能力遊戲數據的表現
是肩上升後頻緩
然後再擴大反而下降
所以他覺得就是更難模型
比如說做數據問題
心向於跳步不老實
他覺得這是Nastoke and Prediction的本質缺陷
對 但是可以對所以要搭配
我覺得就是確實如果你今天
不多強調學習他的模型
他很難說很聰明
會有一個像數學體這種
他不一定做得非常好
但確實我覺得更大的
Based他的強調學習
強調學習的上限還是會更高
對 就是因為他的知識更多
本質上是說去機會一個推理的
反正是要他能把那個知識接鎖出來
然後把那個對 就是
他上限的更高
但是你要搭配一個RL去機會
世界模型怎麼看
一種說說世界模型是造世界
做AZN是資料道人
所以最後
像我剛剛說的
因為AI訓了AI有一點這個意思
你有一個好好的世界模型
你就模擬這些東西
他就是用AI訓了AI的方式
他的範畫就有很多
就是我覺得這個可能是
去通往更好的範畫的一種可能性
你那個頭線說
第一次見你的時候
你就開始講GPT10可能長什麼樣
你現在覺得GPT10長什麼樣
還會有GP10嗎
我當然說了什麼
他對你講很深的原因
就是因為你第一次見他
你就開始說
你說GPT4GP5長什麼樣子
你說GP10長什麼
我不知道你還說什麼
對
現在你這樣深
OK
對 我覺得
但其實我覺得我們今天其實已經
已經好像實現了
之前預想了很多東西
比如說你真的能完成
幾個小時的這種任務
覺得這個發展還是很快的
對 然後
但我覺得整體就是
你就是逐漸
見得更多的
因為就是
逐漸見得更多的variation
然後然後去
突破這個範畫的過程
其實我倒是覺得這個好像
相對來說還是比較明確了
見一般日A.S.N.上面你們有獲得什麼
認知沒有
我們也在探索嘛
你剛剛說的時間
模型你可以認為它是這裡面的一部分
對 但是怎麼實現
我覺得現在還
還需要更多的實驗
對
過去年的組織
有新的想法
新的思考
好問題
我覺得現在就是
最近在想一個事情
有幾個東西它好像
有點聯繫在一起
就是如果你看我們去做科研或者說
創造新知識的過程
它很像一個強化學習的過程
就是說有一種理論
是叫經驗主義
說能得到新的知識
是從經驗來的
然後後來大家有很多觀點
就是認為不是這樣
就是其實人類在這個地球上
已經存在非常非常多年
但是可能你
但是百年之前沒有任何人
說其實地球是個球
就是一直在這個經驗裡
但是你並不知道事實是什麼樣
所以經驗並不能直接給你這個知識
而是你提出了這個猜想
就是說你觀察到一些東西
但你提出猜想說
我認為這個球可能是原來
然後我想各種辦法去驗證它
包括現在訓練這個神經網路
你可能觀察到
幾十萬個內科指標
你觀察到有一些內科指標
可能不太對
那你直接觀察
你並不能給你新的知識
你只是說我
我提出來一個猜想
他為什麼會這樣
然後我再設計一些實驗
去驗證它
所以這個是
現在可能我們覺得比較好的
當然就是可能所有好的
科研的方式都是這樣
但這幾個東西想要三方式相通
就是說因為你翻譯就是
你好像管理一個團隊
它也是這樣的方法
就是你是要
用I/O的方式去管理
對 當然這個是
這個是Tim天天跟我講的
就是說他
你覺得要用這個
I/O的方式去管理
而不是用SFT
對 當然現在你翻好的技術
就是說你做I/O的時候
你其實也希望加一部分SFT
因為SFT是很好的鮮艷
所謂的PTX loss
然後你不是希望這個模型
可能非太遠
對 但是你也要關注自己的手
就是說你不能SFT太多
SFT太多這個你的
其實是同學他就會失去這個
主觀的東西
然後就沒辦法創新了
這個點我現在反正我會再做一些實踐
就是好像看起來有一些效果
然後但是可惜是長為SFT和I/O的平衡
SFT就是你直接給他
就是說這個東西應該這樣這樣這樣做
I/O就是說你給他一個
手上的想
I/O就是給他一個獎勵
就是說如果做成這樣
那他可能就是好的
那可能跟很多時候
他就是反映在目標上
然後就我覺得這兩個東西
他可能需要一些挺恨
然後可能比如說以I/O為主
對 就是然後通過一部分
來 SFT去防止他
就是非太遠的
你還是要有一些鮮艷去控制
或者防止他以往你掉一些東西
我覺得這些好像
某種程度就是連接在一起
就是I/O好像是一個很本質的東西
就是好像你的組織在做創新
那本質上也是一個I/O
但這個其實就是說
你在I/O的觀眾
你在I/O觀眾你訂這個獎勵
或者訂這個指標
他並不是非常簡單的一個事情
比如說如果你只是最後
我就是要把所有的benchmark
做得很高
那你可能就會出現很多
overfeating的問題
就是因為你所有人
都會不折手段的把那個分
給弄下去
但是弄完之後你發現
這個模型好像還並沒有變好
也就是有可能會出現這樣的問題
所以這個獎勵的定義就很重要
對
或者說這個獎勵的定義也需要
你很了解這個
具體的細節是怎麼運作的
不然的話就他就會出現
reward hacking
什麼第一維握的
這個是一個很重要的客題
因為你想法沒
所以還是你建立更多觀測指標
然後進可能不要去過你了
對
所以就是
我覺得是一定程度有效
就這樣你才有更好的翻話
然後不會被
不會被hack
對 就是用I/O管理團隊的方式
最大的問題就是你容易被hack
就是就是你的hack的reward
大家看起來各種
好像結果都很好
但是實際上並沒有達到你
最後想要的
這個是他的風險
然後你用I/O管理團隊的風險
就是
就是
大家是去創造力
所以最後你是這個
幾個東西
他一定程度的這個balance
但這個我也在學習
我覺得今天肯定
不是說做到很完美的情況
但是可能也
也要逐漸去學習和理解這個事情
你過幾年很低落的時刻嗎
我覺得還好就是
跟多就有些東西會
我可有些東西不 work
會有寫決一些問題
會有新的問題產生
就像剛剛說了
所以我覺得就是不斷在這個過程中
我覺得只要你覺得這個東西
是有意思的
你就是
你就一直想去做下去
你的心又是一個
很微信的理解
我現在最新的理解
就是怎麼去把握這個
I/O管社會
還有我還挺你之前的挺
就是
對
我覺得這個可能很重要
其實過去年
Pinnie也是波風波谷
來回正當
你在這個取中你的心態是什麼樣的
你需要平衡自己的心態嗎
心態就是反正做時間的朋友吧
真實的心態不會這麼簡單的
我覺得就是你會有高點和低點像你剛剛說的
對嗎
然後我覺得
可能很專業的就是還是說
你就喜歡做這個事情
然後想把它做好
所以你也不用想別的東西
你就想怎麼把它做好
所以好像也比較簡單
我覺得沒有什麼特別複雜
很多複雜性都是
人為強行加上去的
實際上並沒有那麼複雜
但你對人性有多了理解嗎
我覺得這個東西也還是需要時間的打磨吧
我覺得就是
我覺得不敢說
其實有那麼深入
就你只能說是在自己的這個故事裡面
你不斷的感受
說自己到底是什麼樣的一個人
然後你希望
你為什麼要做這個事情
對吧
然後
我覺得可能是不斷去思考這些問題
你去有什麼樣的人
你為什麼要做這個話實際
就是我覺得有意思
對
就是
對 就是
就是我
我 但就是
是什麼有意思嗎
是做學校有意思
做課業有意思
就是做AI有意思
尋找這個真相的過程嗎
去不斷發現新的問題
解決它的這個過程
那你還可以解決別的問題
對 解決這個問題呢
對
因為這個問題他很重要
就或者說
哪個問題很重要
就是我覺得AI很重要
就是因為
這個問題我也問過Kimi
他要跟我說
這個東西是
他
他說這個東西是人類文明的放大器
我覺得很有道理就是
又回到那個的
Beginning of Infinity
就是
你從起模運動到現在的
人類一直在找到新的方法
去突破這個
支持的編輯
但是
可能下一個突破編輯的確實
就是你在以靠AI
因為它是一個巨大的槓桿
然後比如你今天在任何一個前學課
你要花幾十年的時間
二三十年時間
你才能學到最前學的支持
但是AI可能一夜之間
你才能學會
然後你就
往下去做新的突破
就是AI會從一個Mata的Science
我覺得這個是
這個是很重要
人類文明的放大器
我覺得
我大概有可能撤回人類文明嗎
我覺得這點上
我覺得還是
我覺得首先這個風險
肯定你不能說它不存在
但是我們可以有很多事情去做
就是你不管是說
更安全的對齊
還是說就是
更好的社會的機制
我覺得這東西都是
比如說就是
當然它可以做一些事情的時候
那它其實很有可能會
比如說創造出來一些新的工作
那我們需要有一些方法
去完成這個過度
那最終就是可能這個
技術的進步對
對我其實在比問題
就是說它雖然有這樣的一個風險
但是
但是我們可能不能放棄這個事情
因為你如果放棄這個事情
你就等於放棄了
人類文明的上線就是你不知道
它上線能做到什麼樣
對就是有一點EF-A-S
但是我成這樣就是說
我們得
做很多的事情去
特別是你今天其實看到很多AI能力
我覺得是有點震驚的
根本半年前你都想不到
現在能做到這樣的程度
需要做很多的事情
而且同時我認為
就是可能人的獨特價值
就人的體驗
人的情感
這些東西它是沒有辦法被AI去替代
所以就是可能會有不同的活法
但是
就是希望是應該是能活得更好
是怎麼樣不同的活法
我之前覺得人的一生
可能有幾個不同意義的
就是可能創造體驗和愛
然後
但這個每個人不一樣
這個是我對我來說
但我覺得創造可能創造裡面的
很大一部分
也許有可能AI是可以做的
我還是很享受這個過程
但是你不得不成
就是說有一天你可能會有很多的
創造性的工作者是AI去做
但是我覺得後兩條
就是說可能它還是會是以人為中心
但如果它創造拿走了的話
它其實把生產力拿走
所以我手會
因為人可以享受這個生產的結果
就是如果我們有一個好的機制的話
它需要改變社會的機制
對對
但它也是一個緩慢的過程
它不會是說你一兩年做完
它可能是要一二十年
逐漸地去調整
你會平凡地跟Kimi聊天嗎
當然
對我要測試模型
你會跟他聊一些很深刻的話題嗎
有時候會
或者很自我話題
有時候會
比如說會聊什麼
除了剛才說的那些
還好
還有一些是這個工作室的問題
你就今天Kimi的成功概率
是增大了還是Strekali增大
想必是什麼時候
想必於一年前
我覺得是增大了
因為我們
成功概率還是Strekali
成功概率
對
對
因為我覺得就是
就你只要
沒往上爬
你的成功概率都會變大
因為會有一些人
就不會是去爬
你再去恐懼掉下去
我覺得肯定
肯定會有恐懼
但是恐懼很多時候
它是會
更多的可能是
還是關注
就是你當前這部
然後
你能做什麼
有時候可能想這個問題
是更重要的
你覺得過去你也沒有走頒路
肯定有
就像我剛剛說的
就是你在這個過程中
會有很多很多決策
有一些是技術決策
有一些是
例如業務的決策
我覺得很重要的是
就是說
就是一個公司
在這個過程中
可能去組建
調整能力
就像比如說
支持創造也是
這樣的一個過程
就是你
你不可能
創造出來
支持所有的東西都是對
就是你會發現
有的東西
它也是錯的
但是它在一定時間內
可能是對的
然後
但它一定時間內
可能是錯的
但是它
但是它是錯的
你
你知道去做調整
比如說
像劉奔奔做的很多東西
但是它當時
是最好的理論
但是它不是完美的理論
它是猜有錯的
對吧
它在一些場景下
就是完全錯我的理論
你在這個萬永隱利
需要有一些別的解釋
需要有一些這種
相對論的解釋
有通過
這個失控的
有趣趣的解釋
我覺得是一樣
就是就是
我覺得組織的進化
或者一個公司的發展
它是一個動態的過程
然後任何來的中間點
在某些時間
是對的
有一些時間可能是錯的
這個也是KIMI告訴我的
就是說它
任何的中間狀態
都會成為
被批評的
對象或者這些
反而類似這個意思
就是說我覺得你總是會
有這個時代的局限性
然後可能更重要的是說
你怎麼在這個過程中去
我覺得意思是說
投入一些可能一定不變的
比如說你的人才要技術的積累
然後另一些就是說
在這個過程中
去取失硬它調整
就是你能夠針對
不管是說
就是這個反饋性好
或者你這個環境的狀態電話
然後去做解決設調整
我覺得這兩個東西是很重要的
到底做AI是在產品
是不是跟互動產品完全不一樣
因為互動產品就會通過頭流去
擴大跌擴大還是上規模
但是AI產品它很不一樣
就是它模型能力提高了
然後提高了那個BAR以後
它自然就可以獲刻
但是互動產品也不知道
用來看嘛
就是其實所以我們知道
這個這個平衡的
對它有時候也不一定那麼自然
我覺得取決兩個變量哪個大
但是你確實
如果你是在技術快速發展
你覺得你很難說
透過頭流的方式去
取贏的這個戰爭我覺得是很難的
對但它可能更多是一個輔助的手段
就是說你這個輔助手段跟你的主要的手段
之間它到底什麼樣的一個配比
它可能是需要動態調整的一個關係
然後也取決就是說
你現在的算話的進展
或者說你的這個PMF到底有多強
就是它可能不同時間點
它是有不同的策略
甚至這個策略也許你再過兩年
它又是一個好的策略
我覺得BD就是我覺得
我們是用更open的心態去看這個東西
但是可能在每個時間點是
我覺得最重要的看
哪個是最大的電量
我覺得這個是一個挺重要的事情
OK今天最大的電量依然是智能
對就是還是爬山
還是爬山
我一直問你各種的情緒
你都說愛好
所以你最近一次
或最近兩次
如那一次還是什麼情境
我想問你為什麼
我覺得它不已無息
不已幾杯
這是我等一下
你也說什麼
對 但是我覺得是避免一些情緒化的決策
所以你會情緒化嗎
可能多少
可能會因為你是一個人
但是就是說我是說
可能避免一些情緒化的決策
就是從落實到決策和執行上
還是要更理性一點
這大概成長了什麼樣
過幾年
我覺得是說認識到一個點
就是說問題是不可避免的
它會一直存在
然後持續解決新問題
我覺得最重要的可能也是最有意思
我覺得這個是一個心態上的一個變化
然後它當然它可能會改變
你很多做事情的方式
這是一種正面的方式
說我不知道怎麼理解
但是可能差不多
你這個你一年前跟新方嗎
對 因為我覺得
有兩名數一個是說
你方面也跟失應這種狀態
所以它會興奮之減少
但另一方面就是說你發現
AI的進展很快
就是你現在能力又提升了
所以興奮只有增加
所以我覺得基本上可能微食
在一個比較穩定的水平
我問你最後解塊塊答
一個請求範圍你喜歡的食物
食物
拉麵
為什麼
好吃
一個小人知道
但必須知道的知識點了
我好像不太擅長回答這種問題
其實所有讀過的書
推薦涼滿幣讀書
這個有一本我剛才在講了
對 推薦的最
新的中文是在AI進程的幾篇論文
這是什麼
最重要的
最重要的幾篇論文
最重要的幾篇論文
就是
back propagation
可能
cance formula我覺得可以算
然後可能
GPC
GPC3
那,然後. 大家有一些是building block 我覺得也很重要
就是像be a restnet 我覺得也很重要
就是它可能是這個範圍的技術
然後add-m 但現在可能還有沒有
基於當下的認知一個最關鍵的bats
如果你的bats有範圍的
用innovations用L4做L3
這件豆腐是什麼
不知道 我感覺我腦子已經服了
我已經本來一年的話都講
大家把探機商務的局限也進行
好了 今天的節目就是這樣
這裡是商業訪談路
是一檔由語言及世界工作室
出品的深度訪談節目
你可以到公眾號關注我們的工作室
或取更多的信息
我們的公眾號是語言及世界
Language is world
我們希望和你一起從這裡探索新的世界
(音樂)
Podcast Summary
Key Points:
- 人工智慧發展如同攀登無盡的雪山,問題不可避免但總能解決,體現了「無限的開始」這一概念。
- KIMI K2模型的研發重點在於提升基礎模型能力與智慧代理的泛化性,並採用如Million優化器等技術提高數據使用效率。
- 智慧代理的未來發展關鍵在於提升推理能力、工具使用的通用性,並透過AI參與自身研發來實現創新。
Summary:
這段對話主要圍繞人工智慧的發展哲學與KIMI K2模型的技術實踐展開。受訪者楊智玲以「無限的開始」為喻,指出AI發展如同攀登一座沒有頂峰的雪山,問題會不斷產生,但也總能找到解決方案,這是一個動態且持續的過程。
在技術層面,K2模型的研發重點在於打造一個優秀的基礎模型,並提升其智慧代理能力。團隊透過如Million優化器等創新,大幅提高了模型的「token效率」,讓模型能更有效地從數據中學習。同時,他們也致力於解決智慧代理在泛化性上面臨的挑戰,避免模型過度擬合於特定任務或工具。
展望未來,對話指出強化學習、多輪推理與工具使用是智慧代理能力規模化的關鍵。真正的突破可能在於讓AI能參與自身的研發過程,實現「創新」。此外,長上下文處理能力與更通用的任務設計,也是提升代理能力的重要方向。整體而言,AI的發展路徑並非線性,而是一個各項能力持續疊加、相互促進的動態演進過程。
FAQs
核心概念是「問題不可避免,但問題總能被解決」。這代表社會從靜態轉為動態,知識不斷創造,解決舊問題的同時會產生新問題,形成無限進步的循環。
K2基於MoE架構,專注於提升token效率,例如使用Million優化器讓模型更有效吸收數據。同時強化Agentic能力,讓模型能與環境多輪互動,完成複雜任務。
可透過讓AI參與自身訓練過程(如用AI做研究),並設計更通用的工具環境來提升泛化。避免過度擬合單一任務,並持續用強化學習擴展能力邊界。
Agent具備多輪互動與使用工具的能力,能連接外部世界(如網路、代碼),執行複雜任務。其目標是通用智能,而非單純模仿人類行為。
不一定線性。例如推理(Reasoning)與Agent能力可並行發展,但若要達到Agent最佳表現,仍需強大推理支持。創新(Innovation)與組織(Organization)也可能同時發生。
優勢在於透過互動採樣提升泛化性,比單純SFT更適應動態環境。挑戰則是評估指標不足,容易過擬合特定任務,需更多AI參與訓練來突破限制。