Go back

113. 和杨植麟时隔1年的对话:K2、Agentic LLM、缸中之脑和“站在无限的开端”

101m 13s

113. 和杨植麟时隔1年的对话:K2、Agentic LLM、缸中之脑和“站在无限的开端”

這段對話主要圍繞人工智慧的發展哲學與KIMI K2模型的技術實踐展開。受訪者楊智玲以「無限的開始」為喻,指出AI發展如同攀登一座沒有頂峰的雪山,問題會不斷產生,但也總能找到解決方案,這是一個動態且持續的過程。 在技術層面,K2模型的研發重點在於打造一個優秀的基礎模型,並提升其智慧代理能力。團隊透過如Million優化器等創新,大幅提高了模型的「token效率」,讓模型能更有效地從數據中學習。同時,他們也致力於解決智慧代理在泛化性上面臨的挑戰,避免模型過度擬合於特定任務或工具。 展望未來,對話指出強化學習、多輪推理與工具使用是智慧代理能力規模化的關鍵。真正的突破可能在於讓AI能參與自身的研發過程,實現「創新」。此外,長上下文處理能力與更通用的任務設計,也是提升代理能力的重要方向。整體而言,AI的發展路徑並非線性,而是一個各項能力持續疊加、相互促進的動態演進過程。

Transcription

3416 Words, 36372 Characters

Traditional Chinese
就有點像我最近可能看一本書的Beginning of Infinity 我其實看好幾遍就是 他說有兩句話要刻在石頭上 一句話叫問題是不可避免的 但是第二句話是說問題是可以解決的 也許我知道有可能這個雪山才有可能沒有鏡頭 我不知道就是我希望它一直沒有鏡頭 因為這樣的話 所謂的Beginning of Infinity就是這個意思 就是它可能是一座無限的山 當然這個是Tim今天跟我講的 就是說他覺得要用這個I/O的方式去管理 而不是用SFT 過去年Tim也是播風播谷來回震盪 你在這個其中也不心害是什麼樣的 你需要平衡自己心態嗎 哈囉大家好 歡迎收聽張小鈞商業訪談論 我是小鈞 這是一檔由語言及世界工作使出品的深度訪談節目 我們希望和你一起從這裡探索新世界 今天的嘉賓是月專面的創始人間C.O.楊智玲 舉例他上一次來我們的節目 南海時生業訪談錄的第59集 已經過去一年半了 就在剛剛過去的7月份 Kimi K2模型發布引發了比較廣泛的關注 K2是一個機於Moe架構的開源編程和 Egentic智能體式的大約模型 那今天這集節目我和楊智玲聊了聊 K2的研發技術性節和他當下的技術認知技術判斷 以及在過去這一年的輿論風暴與創業起伏之中 作為創始人他的心情與思考 哈囉至靈性給觀眾朋友們打個招呼 哈囉大家好 在你創業第一年結束的時候 2024年我們訪談報的標題是 像嚴名而未知的選擇前進 那現在又過了一年站在 現在此刻2025年7月份你最新的感受是什麼樣的 你剛剛提到這個詞我感覺都是好像過了很久 已經一年多了 AI一天人間一年所以可能AI一年 我不知道在人間試度好甜 所以對感覺最使得很多東西發生了很多變化 但是我覺得那種感覺 你剛剛說的那種雪山的感覺好像 倒是差不太多的 可能往山頂的過程我們又再走了一段距離 多遠既然行進到哪裡了 所以現在想說什麼我現在進步挺大的 就是可能兩年前寫片文章都寫不太明白 然後現在它不光可以寫很好的文章 它能夠連續工作幾個小時 你完成一個可能很負責的代碼 任務我覺得這個東西可能在兩年前是很難想像 所以我覺得可能就是在一個爬水山的過程中 然後你解鎖了一些 解鎖了一些新的長景 你大概知道我中間這條路是什麼樣的 但同時就在網上的過程中 你可能還是觀察到差不多的景象 就是說接下來的網上的過程 它人家會有很多位置的比如技術問題需要去解決 所以我現在可能大概是這樣的感受 更清晰了還是更迷惘 就是在這個我私下都是選一個地方 對我覺得肯定會有很多東西變得更清楚 就比如說可能我覺得在兩年之前 比如說各種強化學習的責物範疇 怎麼去做兩個模型有更強的推理能力 或者有更強的這種Egentic的能力 我覺得在當時可能沒有那麼清楚 但是可能更多的是說你這個模型的預訊鏈 怎麼能做得更好 然後那是比他有可能 HF的這樣的技術 讓他的這個在對話的體驗裡面做得更好 對但是現在我覺得會有新的一些問題 可能得到了單一但同時這些新的問題 他有展開可能又產生了一些新的別的問題 比如說可能我們今天看到 雖然你可以做這些強化學習 但是你的強化學習可能最初還是依賴於一個 很好的評估或者很好的驗證 比如說你讓他去做一個數學機 或者一些有Task case的編程 那可能可以做得比較好 但是如果讓他去做一個可能 更加複雜的段段段 就讓我有時候你並不非常容易找到這個評估 或者很好的方式 所以我覺得現在的 這個系統可能你會產生一些新的問題 就有點像我最近可能看一本書 就是這個叫這個的Beginning of Infinity 我其實看好幾遍就是 然後你發現他裡面講的最重要的一個事情 就是說 他說有兩句話要刻在石頭上 一句話叫那個問題是不可避免的 但是第二句話是說問題是可以解決的 然後基本上就是說你就可以認為 在可能起模運動之前 這個社會它是一個靜態的社會 就是大家並不追求創新 就是說你看會用很多神奇的方式去解釋 你觀察到的現象 那這些解釋它可能是並不是一個好的解釋 比如說你看到這個天上打雷 你會覺得是有雷功 然後你去看到這個冬天下雪 你覺得可能是因為某個神他的心情不好 所以下雪了 就是你會有很多這種 就是 不是不好的解釋 去參數這些東西 所以它整個社會這個靜態的時候 只有非常少數的人是在真正 做所謂的科學研究或者說知識的創造 所以它其實 會是一個靜態的結構 但是如果是在起模運動之後 你發現這個社會它變成動態的 就是 你會有很多新的知識被創造出來 然後這個創造的過程中它就是會 比如說你產生了一個知識 它就解決了一個問題 但解決這個問題的時候 你會產生新的問題 你的問題是因為 不斷因為你的知識編輯是在拓展 你就會遇到很多新的問題 研發這個AI的過程中 我覺得可能恰好就是一個這樣的過程 就是你解決了比如說 講話學習的很多問題 但你發現就有面臨的很多新的問題 比如說評估的剛我剛剛講的評估的 這些問題或者很量的問題 而驗證的問題 這些問題它可能就 我們需要一些新的答案 大概是會是這樣的一個過程 但這個也是非常有意思的一個點 就是因為你一直會有新的問題 可以去解決 然後每次解決一個問題 你的技術就是會往上 再判斷幾百米 然後可能有一天 也許我知道 有可能這個學生它又可能沒有鏡頭 我不知道就是 我希望它一直沒有鏡頭 因為這樣的話就是 所謂的 beginning of infinity 就是這個意思 它可能是一座無線的山 就是你一直在 你一直在往上爬 然後而且甚至有可能 爬到一段時間之後 不一定是自己在爬 而有可能是你 用AI來爬 就比如說你現在我我們也會 把 就是比如用K2這個模型 去做很多可能模型訓練 或者說數據處理相關的工作 這些東西它以前可能都是要人工寫蛋 或者 有些同學它不一定會寫蛋嘛 以前就做不了 但是現在比如說很多是處理 或者說模型的一些分析 甚至包括模型的一些訓練 你慢慢於又多可以用這個 用模型來做 對所以 那你可能 就是可以 把這個東西做一個放大器具 更好的去判斷做生的 所以 我覺得會有這種感覺 反正你的問題是會持續產生 對 然後你就持續去解決 然後發現有新的問題 如果學生是無盡的你追求的 是什麼呢 追求就是這個判斷的過程 或者說你呢 你呢一直越爬越高 就是就是你可能原來是在 在三比下的 然後爬到那個就是 又往上提升了一點 然後你能看到的 景色會不一樣 就是 然後 就是它是一個動態 可能精幻的過程 然後我們可能想追求的是 你就是越爬越高 以前我們會固壞的認為 就是HDI今天的中點 已經不睡HDI了是什麼 那HDI是什麼 對HDI可能是個方向 就是它可能不是某一集臺階 就是說你爬到這集臺階 就 突然一夜就進達到HDI 而是說 可能它是一個方向 比如說我們今天可能在很多領域 其實你可能 你可以認為它是HDI 就是因為它可能做的比 90%99%的人類可能都更好 對吧 然後 對 然後 包括就是現在比如很多數學題 或者說編成精賽 這些題可能 我覺得按照現在的體生速度 你可以 可能預想就是說它會很快 有很多問題 就可以被充分的解決 對 然後 對 但是它可能很難說 我是很良心說 某一個時間點 我突然就是 我就 我就可以 還一個口號說 我們在這個時間前 辭職的時間HDI 它跟 就是我們又登月來年 名公司的名字 但它跟登月有一個區別 就是登月就是你 在它月球那一個 你就是 你好稱我就達到了 但是可能HDI 它就是你不難做 而且這裡面我覺得兩個層面 一個是說 一方面是技術是一直在提升 對 當然 另一方面 除了技術之外 我覺得 這個技術對於 人類社會的影響 它可能是 更長週期的事情 對 那你也可以認為它其實是HDI的一部分 就是就有點像 比如你產生了 產生了蒸奇機之後 你整個社會的變化 它只是需要 可能幾十十百年 那時間去消化 就是你有 一些工作可能不再必要 但是你會產生新的工作 然後有新的方式可能人會用 AI去做更 就是每個人都會成為超人 就是你可以做更多的事情 那這個社會他的工作方式和他的 御性效率可能都會翻成他的變化 那我們先來毀忘一下過去年 過去一年全球大模型在 腦海中最重要的幾件事情是什麼 有哪些在人物陣子的犯事機的變化 我覺得可能有幾個重要的 一個是這種強思考的推理模型 至於強思考的我們 對 其實對歐巴爾 歐巴爾就是作為第一個 做出來這樣的一個代表 然後我覺得是 本質下來講是 他通過讓模型在這個過程中 去做很多的強思和犯事 然後我覺得可能犯事是這裡面的重點 就是犯事其實本質上是兩種能力 一種能力是 提出來一個新的猜想 你可以認為就是模型在解決一個問題 過程中他會不斷提出新的猜想 然後這個猜想他會得到一個自我的驗證 如果他提出這個猜想之後 我到底這個猜想是對的還是錯的 他其實是需要具備一定的驗證能力 雖然你不是顯示的 訓練一個驗證模型 但是他是在這個推理過程中 可能隱示的去做了驗證 然後你可以理解成 就是他把這個問題做了很多次 每次猜想驗證 然後最後可能就可以得到一個答案 對 那這個東西就是說 他其實是會很大程度提升模型的能力 是因為你本來只能做一次 你本來只能就是我直接給出一個答案 那這個答案可能是對可能是錯的 你並沒有這個過程 但是你現在可以不斷地提出猜想去驗證 那等於說你其實 等價的長適了好幾次 那你就是可以把passer key可能被成passer 不然才本身像是一個這樣的道理 就其實跟人做科研或者解題的過程也很像 也是不斷提出新的猜想 兩個去驗證 他是一個自由探索的過程 他不是一個現行的過程 實在有效的工作方式 實際上還是很多時候是比較現性 你如果不考慮 比如說我做兵型的採樣 假設我就是做串型的採樣 他其實是有現性提現在 就是說你每次是提出新的猜想 這個猜想成的是基於你之前的猜想 你已經否定過的猜想 然後你其實出來一個是你的猜想 對 但他會接近更現性的過程 當然只是說現在你也可以把這個現性的過程 去搭配到 就是搭配一些可能兵型的策略 就是定期可譬如說你同時採樣很多個 然後那他就會結合可能兵型和串型 兩種不同的方式 但是最近也有一些配合角 就是說你可能串型他的上線 所以會更高這個可能跟我們的實驗結論 有些相關 對 所以這個我覺得是一種犯事 就是 他還是一個就是剛中之腦 就是說他並不需要跟外界交互 他剛中之腦 對 他就是一個 想像一個魚缸 然後你把一個腦子放在裡面 然後他跟外界是沒有連線 他就是這個環境裡面的 對 他是指在自己大腦裡面想 他就一直想 他不需要跟外界採診任何的交互 他就能結一道題 但是有另外一個很重要的犯事 就是說現在可能基於這種 多倫的AZN的 強化學習的犯事 或者說你通過這種強化學習技術訓練出來 這種Agentic的這個模型 那他的特點就是說 他會跟外界做很多交互 比如說我可能我邊思考 邊去做一些操作 然後我可能做很多倫的操作 我一會兒掉用一個搜索 一會兒使用一下流然氣 一會兒可能協助很大嘛 然後我通過多倫的方式 解決了一個問題 那他就不在於剛剛我們知道 他是跟外界有交互的 所以他的 我的下一步行為是根據 用過這個交互得到的 外界給我的這個犯會 外界給我的新的狀態 跟新式有關係的 然後後果成 對 然後 但這兩個東西他都指向了同一個東西 就是都是 所謂的TestTimeSkating 就是你可以在測試的時候 或者說在推理的時候 做更好的規模化 意思就是說 比如說我們之前 如果在做對話的時候 你更多的是我只是單輪的 輸出一個結果的吧 我可能讓你寫篇文 這樣你就寫篇文這樣 然後我在問你 我再讓你認識一下 你又輸出了幾百個Token 他這個Token數量是很少的 但是不管是剛剛說的 這個基於強思考的 強化學習還是說這種Agent的強化學習 他本身上都是一種 去規模化這個 在預測的時候的Token的方式 對就是你不管是說 我把輪述打了更多 或者說在每一輪裡面 我有更多的思考的Token 他都是一種去 規模化這個Token的方式 使得說你能去完成更複雜的任務 然後這個也伴隨著 就是你的完成時間會更長 一個可能就是你可能現在會花 幾個小時的時間 比如說去做一件很複雜的事情 在這個過程中 你可能不需要人工的參與 對他就可以把一個 代把常鋪客容下來 然後把它翻一層 另外一種新的語言 然後去調視測試 然後去把所有的8個都修了 然後讓人正常的運行 這樣的一個工作可能 是可以斷斷了 去直接完成 他這對於我覺得是這種測試時的 這個規模化 這兩個都是 我覺得都是Test Times Gating的 表現方式 對 然後可能還有一個 很有意思的趨勢 我覺得就是說可能現在會有 更多的模型公司去做這種 一方的產品 對 一方的這種AZN產品 然後我覺得這個也很有意思 因為一開始更多的 比如說我們如果看半年前開始的話 或者說去年的 就會有很多產品 它是基於這個基礎模型 然後你在上面可能做一些教授架 或者去設計一些工具 去更好的讓模型去使用 然後來大屆一個產品 想說模型一處的能力 對 然後他本身上在做的一些事情 就是說去你像工程 我認為就是去你像工程 這個模型的訓練過程 就是因為模型訓練過程 他也是通過各種 比如說你可以認為 SRBK音house的這個 反進工具 然後他的教授架 可能訓練出來的 這樣的一個模型 但他可能沒有直接開放給你 那你是成立向出來 你更接近去你和他的分布 到底你用什麼工具 SRBK會好 到底用什麼樣的 是生formSRBK 到底用什麼樣的Context Ange and engineering他的效果會好 是一個這樣立向的過程 但是你發現就是說 如果模型公司去做一方的產品 他的邏輯是完全不一樣的 就是你不需要 你不再需要這個立向的過程 他更多是一個正向的做法 就是我現在先把這些工具 可能設計好 我的Context and engineering的方法 都設計好 然後我就在這個環境裡面 去訓練這個模型 所以你的模型 天然在你的環境裡面 就會表現得更好 對 然後所以我覺得 這個是兩種不同的思路 但可能就是第二種 他的上線也許會更高 就是你可以更好的去整合這個工具 整合這個模型 然後你的模型 有可能也些解決不好的地方 你可以去調整這個工具的設計 你可以把它設計得更好 然後同時你又可以端端的去做訓練 我覺得這個可能也是在 可能開發方式上 一個其實可能比較大的變量 就是我能觀察到 這幾個可能是我感覺比較有意思 讓大家比較好理解 其實你剛剛說 那個第一種角色 就像Manus這種方式 然後第二種就是你們量的 就是端端的去模型 對 但我們現在在一方產品上的 投入還不算特別多 我們現在可能主要還是說 做很多還是以模型作為 我們的主線 但你可以看到 比如像Clockcode 或者像CypTation 這樣的東西 它其實就是 其實就是一方的產品 然後我覺得應該也會是一個很大趨勢 所以可能後面就是看這兩種東西 它會怎麼去配合 或者說他們在這個生態裡面 會是在什麼樣 他們邊界分別在哪裡 看到主線 你看CypTation設置了L1到L5 其實我一直很好奇這裡的邏輯 就是L1插報 第二種是Reason的人 第三種是Agent 為什麼有了插報和Reason的時候才有了Agent 然後為什麼後面又是 創新者和組織者 他們的邏輯是什麼樣子 就是在邏輯模型上它的變化型 就是它是這個能力 一步一步的依賴 但是就是現在我覺得實際看起來 實際看起來就是說你Agent 我覺得Agent的上線是取決 你有很強的Reason能力 但是好像並不是說你必須 比如說我們如果把這個技術發展稍微 換一個順序 才是你先做出來的Agent能力 然後再去做現在 這個下一項的Reason能就是說 你做這種Long-CypT的Reason能力 我覺得實際上可能也是成立的 也是強力的 對 對 而且你可以 因為可能Clout的路線 它就是Bat在這點上 就是我可能在Reason領上做的 並不是那麼多 但是它可能在這個Agent上會做得非常好 因為它對你的事實是 你技術背後是兩種不同的 Test Time Scaling的範疇 你一種Scal的是通過這種多輪的方式 因為你需要跟外界交互 你使用很多次工具 所以它是這種多輪的交互 你可以Scal這個輪次 另外一種是Scal 就是像我剛剛說的 你可能其實並沒有什麼交互 你只是一直在那四考 成確的四考 它是兩種不同的 我覺得是Scaling的圍堵 那你現在 我覺得就是說 你可以看就是可能 比如說你看Clout很多模型 它的Reason能力的 performance 並不是非常高 對 但是它的Agent上的 performance是很高的 讓我覺得這兩東西它 它其實並不一定是依賴的關係 但是有一點就是說 如果你想做最好的Agent 就是想讓他自己的最負擔的任務 那你最終可能是需要你的Rizan 你能力也很強 對 所以他是這樣的一個關係 我覺得在研發上他不是必然的順序 但是就是如果你想達到一個東西的最好 你需要另外把Rizan 你要達到Agent最好你需要把Rizan 你也做到最好 然後當你有了Agent之後 就是他就可以去做一些 為什麼是對你接下來是Innovation 就我覺得這裡面最關鍵的一個點 就是你的模型到底什麼時候 能參與到模型的開發 就比如說我們希望K2能夠參與到K3的開發裡面 那如果你沒有這個Agentic能力 你只是很難做到這個事情 但當你有Agentic能力之後 他就是可以去不管是說你提出一些新的想法 還是說去做對應的實驗 然後去分析實驗的結果 得到一些結論 然後去跌在下一版的想法 或者去優化一個 某一個Infra的什麼一個性能 那這個東西他就需要很強Agentic的能力擦成能做 對 所以我覺得Innovation 其實最大會產生在 至少會有一個很關鍵的點 就是看你這個模型什麼時候 能參與到你的模型的本身的研發裡面 做一點點 然後 但這個東西他跟我跟DanJayson就是他可能也 我覺得也不一定是完全現性的關係 我的東西實驗也是兵型的 就比如說 現在這個組織這個東西他也在 對 就是我覺得現在已經看到很多這樣的趨勢 就是當你有一個Agent之後 你就可以把它拓展成因為MotiaAgent的系統 對 你可以從一個AgentFocus出來 很多個不同的Agent讓他去做不同的事情 然後他很多可以穿型 然後破的兵型 然後再和兵起來 然後再分成幾個不同的Task 可能有的視覺 去寫測試有的去寫溫當 有的去設計就是整體的 這個軟件的框架 他可以有不同的這個分工 然後 我覺得現在已經在有這樣的趨勢 所以TaiPo一定是現性關係 對 就是你有可能兩個都會一起發生 但是他確實是 我覺得 我覺得Rigen你看Agent相當於說 對 就是可能會是Innovation 很organization的一個前提吧 我理解Rigen的是Agent的前提 是因為他能夠讓語言 通過推理在Agent中得以方法 對 就是如果說如果想去解決一個 可能最複雜的Agent的問題 你肯定如果不會推理是很難 對 但是你假設 沒有推理的這種範疇 你還是可以定程度上做一些Agent的任務 不需要推理的任務 對 就是或者你不需要那麼強的推理能力 你其實就 你不需要說我在思考過程中輸出來幾 前一個偷可能去推理一下 我當前這個到底我應該怎麼做 你也可以去通過多輪的交互方式 從環境裡面得到反饋 你寫一些測試 然後去跑這個測試 你也能解決一些相對比較複雜的任務 所以我覺得這次為什麼現在可能 你發現CLOLE的模型在很 在有一些場景它會做得更好 就是因為我覺得可能你是背後 其實對你的不同的技術的Bat 但最終你是繞不開 就是說 你最終你要做到 就是你要往三頂在爬幾步 的話你還是兩個都要 它只是一個時間問題 然後所以對你就是organization innovation在兩個都是一樣 就是你在這裡面 如果你有不同的技術的Bat 可能會讓你短期的路徑稍微有些區別 然後這些短期路徑的區別可能 會有一些影響 因為它畢竟你要面對的是 一個動態的市場 innovation的標誌是模型的做跌彈 那organization organization就是可能就比較簡單的思考 就是它會是一個模型的模型的系統 然後可能會從現在的Agent變成 我覺得現在也有很多這樣的出型 然後大家就說你模型Agent的系統 怎麼很好的等到端的訓練 然後你可能不要去過 你和到我集中對完Agent的類型 讓它有更好的方法性 我覺得有挑戰的 會奧運來自於是雪山的風頂嗎 我覺得也不是 可能它真的就是沒有頂 就是這幾個能力 它可能隨著時間的發展 它都會持續地變得更好 就包括推領能力 你說推領能力的上線到底是在哪裡 我覺得今天也不好說 雖然你看起來是L2的 但是也真正說做到很強很強的推領 我覺得今天也還是有很大的空間 所以你怎麼看L1到L5的這個分子 你把它當作一個什麼樣的課堵 我覺得它是就是幾個 可能做到的技術MilesDone 但是就是首先它並不一定 完全是喚醒的關係 像我們剛剛說 我們會預計說有一個東西 它就馬上被解決掉 然後你去解決下面的問題 它可能是會 你同時都會再提升 我覺得這樣 比如說Reasoning就是你要去 你真的要解決一些開放的問題 或者說 就是你你要做很好創新 提出來新的模型架構 你的推領能力可能又需要有更高的要求 所以我是覺得 可能這幾個能力到持續的提升 我來復興一下 23到24年你們的關鍵角色 當時2月份決定的創業 然後開始融資組建團隊 然後到了下半年KIMI上線了 然後Baptop成文本 24到25年這一年 你的關鍵的幾個重要的角色是什麼 好問題 我覺得很多人都知道 可能技術上就是說 你從以預訓練和 比如說SFT 為重點的這樣的研發範圍轉變成 就是說以預訓練和強化學師 以為重點的方式 然後我覺得這個其實你就需要做很多的 不管是人才的儲備 還是說你研發方式的改變 然後可能 還有就是說可能從對話到A1 我覺得是一個重要的 範圍的改變 然後這個東西他會很影響 我們的實際的工作方式 我覺得這兩位是可能比較 重要的方向上的變化 過去半年你們推出了K1.5和K2嗎 這個分別對於KIMI以為是什麼 我覺得K1.5更多的是 可能是喬爾徐這個技術的驗證 就是我們 對我們可能是也是比較早去 在這個技術路線上去做投入 然後可能得到一些結果 看背後的技術到底怎麼做 就是當時我們發現說 你可能不太需要太多的 這個process reward或者這種 bear value function 或者甚至這種事可能在訓練過程中 還有一些副作用的感覺 我們發現就是你可能直接 我們端到端的這個 reward 就可以把這個訓練得非常好 我覺得這個在早期時 可能還是並不是非常明確 然後在這個過程中 我們可能是積累了一些 喬爾徐錫的基建 還有他的這個 一些算法的一些No號 K2的主要的點我覺得是幾個 一個是說我們希望他是一個 非常好的基礎模型 希望他是一個非常好的 base model 所以那如果你想有一個更好的 base model 我們就要去看現在 比如說整個領域他的 預訓練的平靜是在哪裡 然後我們發現就是 因為你其實 高質量數據的增長確實很緩慢 然後多摩太的數據 你又沒有辦法很好地去提升 紋本本身他那個智商 你可以認為就是高質量數據 他有點接近是一個長數 所以在這裡面我們希望的是說 我們希望把每一份的數據 能夠最大化的使用 就所謂的這個token efficiency 就是你希望說你 你同樣吃下一樣多的數據 你能腦子長得更多 就是你能得到更多的智能 會跟之前有一些思路不太一樣 就是說比如說你現在假設 你在這個訓練系統裡面 做很多的性能的優化 讓他訓得更快 這個東西也很有價值 但是訓得更快 本身他並不能提升智能的上限 因為你的token還是只有這麼多 你訓得更快 你最後只是說我在更短的時間內 完成訓練 但他他的模型的效果 並不一定會變得更好 所以這個是所謂的訓練效率 或者說Computee efficiency上的優化 這個可能之前有一些人做 那我們現在更多的是 希望說去提升他的token efficiency 就是把一份數據當成好幾份來用 比如說我們很關注的 像比如說Millon的優化器 Millon優化器就是這個東西 他很有意思就是他對token efficiency也提升是比較大 你可以認為就是說像Adam這樣的優化器 可能已經用了10年 然後大家一直都在用所有美 就是大部分的模型 都會用Adam來訓練 但是他的token efficiency並不夠好 對 就是並不是把每個元素獨立的去考慮 比如說一個舉證的參數 還會考慮他們之間的dependence 然後通過這種方式 你其實是可以更好的 有更好的學習效率 也就是說你學同樣一份數據 你能夠更多的智能 比如說我們早些時間 如果你是在Computee Altima我的情況下 你基本上會有一個兩倍的提升 也就是說你學一份數據 就等於別人學兩份數據 等於你用Adam學兩份數據 所以假設你有30T的高智量的token 你等價就是變成你現在有60T的高智量的token 但是他還是那麼多數據 對 但是他學了之後 他會他的腦子會長得更快 為什麼 對 因為他的學習效率高 因為你的優化器更好 所以他會所謂吸收的更快 就是你都是位一樣的數據 但是他就吸收的更好 所以你的壓縮率會長得更快 你的Loss會這樣更快 OK 這是每個人窗嗎 沒有優化器 沒有優化器是Callert提出來的一個東西 我們在上面做了很多的優化 讓他能夠在很大規模的 這個語言模型是失配和訓練 比如說 我們之前其實有一個Molite的工作 就是讓他能夠第一次在 有一定規模的語言模型下去去 然後後來就是說我們那個在去進一步規模化的過程中 我發現有很多新的可能比如說你發現他的 Mexlogic可能會有這個爆炸的這個問題 這個其實在爽規模線上你是很難得到 但是你在大規模線上你可能會遇到這樣的問題 然後可能我不就提出來一些新的比如說clicking的方式 去解它讓它能夠在一個非常大規模的情況下 人人能夠很好地有去訓練 這個是很重要的就是就是因為你的偷騰說實上有限 所以你希望每一份偷騰能才能可能跟大的價值 對然後包括就是說我們也會對數據做很多的這種 Refraze的操作就是因為高質量的數據你比如說 你有30T偷騰在時期裡面高質量的數據可能更少 你可能有幾十B或者幾百B這樣很高這樣的數據 但你希望它能夠好的使用 對所以我們就是對這些數據可能做了一些改卸的操作 讓它能夠更好的被模型吸收和有更好的翻化 對我讀了你們這個記住報告 你們常識以一個模型感謝我書記生日新的餘料 那就聚集的改卸過程是什麼樣的改卸策略是什麼樣 這個急劇你沒有提了 如果你同一份書記學很多次它可能 它可能翻化不一定那麼好 對就是它可能會有一些這個 會有一些過你和的問題 對然後所以我們希望就是說你通過這個改卸 讓它有一定有一定程度的翻化 改卸有一定程度的翻化 對所以所以這個可能是一個主要的思想 反正就是改卸的方式可能會有非常多種 就是我們可能找到一種就是說 在時間裡面它效果比較好的 但我覺得這個空間也很大 所以我覺得可以有非常多的研究的機會 你怎麼看那一種觀點 就說改卸過庫中期是沒有 我寫出來支持說明支持本身 就在裡面沒有心執是除非改卸的時候 用到雜方法 這個是一個很好問題 就是可能確實跟你的改卸方式有關系 原來上就是看你有沒有新的這個商的這個輸入 新的商的輸入 對所以我覺得這個它對改卸的方式 是有一些要求的 但我覺得我們今天也不一定是 就是說一定是最好的改卸方式 我覺得這裡面還有很多可以去探索的空間 大家回到剛剛講的點 我們說這個Keyel這個模型 我覺得一方面是希望它成為一個好的base model 然後所以我們也會很希望去提供它的tokenfission C 這些是我們可能對應的設計 包括就是去加更多的這個 通過更大的技術度去加更多的參數 那它的tokenfission C也會更高 因為因為你參數多了之後 你雖然學一樣多的數據 但是你你也會吸收 就是你會吸收的更好 因為你有更大的這個 對就反而你通過時間 你可以驗證它確實有更好的tokenfission C 然後所以這個是很重要 第二個就是我們希望它是一個好的 有好的agentic的能力 對韓華學習或者說對於這個工具 很環境的這個模擬 讓它能源比較好的泛化性 就是我是覺得對於 對於一個agentic模型來講 可能現在最大的挑戰其實是 在模型的泛化上 所以就是 就是因為現在的iiu技術 我覺得它的局限性在於說你的 你不管你的訓練任務還是你的 評價指標 它很多時候都是單點的 比如說你就訓水扔持它提升水扔持 然後我覺得它是一個基本上 很確定的東西 但是 但是你的指標提升上去 是因為你的模型的泛化 會變得更好 對然後所以我們也嘗試 去可能解決一部分這種泛化的問題 就是 就是我們不希望說 它過你和他們 有一些工具或者過你和他們 有一些環境或者過你和他們 有一些 具體的任務上 對但這些任務可能是很好的觀測 但是我們不希望去 過你和他 而且這個問題可能在 AZEN的訓練裡面 它更加嚴重 就是像比可能之前的對話模型 它的好像 它的這個泛化是一個 更大的挑戰 為什麼不在PREACH你們的局勸 我覺得這個也是接下來 我們想探索的東西 對就是你有可能會有一些 更多的Egentic能力 是可以在於訓練階段去 這可能提高泛化行嗎 也取決你的這個 取決你的做法 比如說你的數據的分布 是不是足夠的 廣泛以及就是 有沒有很好的方法去評估 就是我認為 現在整體的評估 還會是一個平靜 就是它是阻礙你的 AZEN模型變得更加 半化的一個 很重要的平靜 所以你會慢慢觀察到 就是說你現在只是AZEN 能用的Bansmanck不是非常多 然後你在那邊Bansmanck上 如果觀察到一個分數 它其實很多時候 它並不是 對這個能力的反應 它其實也比較偏面 這個其實我覺得是可能 大家要去想辦法 解決對一個問題 這裡面可能有一種 前他的事物就說 我們還是用 跟AINetities的方式去訓練AI 就是說可能我們 希望讓模型參與到 更多的訓練過程裡面 比如說如果你的AI 能夠做很好的 Elimon Research 能夠做很多對期 你就理論上 它可能會有更好的分化 你就不僅僅是 在優化一些單點的任務 我覺得這個是AZEN 下一步可能非常重要的一個點 就是它今天可能還不像 對話一樣有這麼好的分化性 對 或者是接下來可能 就雪山上的這個幾百個台階 也有可能是這個 接下來可以1.5 是在跟著Open App好 然後可以兔式在強迫什麼 我覺得整體就是說 肯定我們還是 也是借件了很多技術上的這個方向 但是在這裡面 我們也希望能有一些自己的創新 比如說至少我們可能是 公開的時候能看到的資料裡面 就是說第一個去使用我們這種 Faith Adam的或者說 基於這種舉辦政交化的方式 去做這個新的優化器 然後再這麼大規模的模型上去訓練 我覺得這個還是 是一個創新的地方 然後包括可能 我們一些AZEN的數據的做法 至少在公開可查的資料裡面 也是也是比較早的去做的 因為我覺得這個空間會有一個人大 就是當然是有意思就是說 當你的右往上爬的時候 你發現就是你的空間是在變大 首先它偷更在變多 你完成同一個任務的偷可能是在變多了 所以它的問題的複雜度是變得更複雜 這事要剛剛講的就是問題不可避免 但是問題總可以被解決 就是說你這個不可避免的問題看起來 會比之前可能更多一些 所以你的研究空間可能會更大 對,這是我現在的一些直觀的感受 K20是怎麼理想的 籌備的多少時間 籌備可能比照長時間了 就是很多這裡面很多設計到 很多技術可能我們從去年就開始在研究 一個技術就比如說你像MewonClip的這樣 技術它需要經過一個比較長的週期 你一開始可能就是做一些非常早期的實驗 然後你發現這個想法好像有一些潛力 對嗎,就我們會有一些小的實驗 能夠去驗這個想法的潛力到底有多好 你有這個想法之後 它其實到你最後能夠去把它放到一個萬一模型 裡面去訓練它只是要經過很長的週期 你也要從過不同的技術實驗去驗證它會有效性 然後像我說的就是可能有一些問題 你只有當你 scale到一定的規模之後才會發現 所以整個東西這個週期其實是比較長 當然就是如果你看你只看這個模型本身 它的訓練從開始按下那個訓練的按鈕到 結束那其實其實時間到沒有那麼長 就是你整體的研發其實是需要更前置 做很多事情才能最後保證你這個訓練 是一個比較順利的過程 張寄給要按這個的大磁是什麼時候開始 要做很多的積累 就是可能像 大概只是說你不同時間點的做法可能會不太一樣 比如說你一開始可能並不一定非常端端的到那去做 可能你積累一些環境和數據 但你到後面可以更端端的到去做強化學習 那你終點需要很多基建還有很多這個數據 的積累的過程 但這個東西它肯定很難說你兩個月做得非常好 也是需要時間積累 我整體覺得就是 那大模型或者相關的這些技術 它的 它是挺需要時間積累的 就是還是要做時間朋友吧 就是你要 不但積累這個東西 它是相對我覺得技術的曲線是還是有點鬥笑的 就定不是說我今天想做就能把它做出來 所以什麼說力量呢 首先我們可能去積累這些技術 然後就是一年前開始積累各種技術 我覺得 對 然後但是你說K2這個東西可能是 那就是最近幾個月我們決定要去 宣營一個這樣的模型 然後把那些技術用上 我覺得大概是這樣那個決策 但是你不是說我今天想去這個模型 可以然後我們再重點去搞很多東西 那可能就不是兩三個元能積累的問題 為什麼你一直想 當然是這個 我覺得也很正常 因為我們就一直訓練下一代模型 那你其實無非就是決策 就是說我下一代模型到底是 我到底是要加入那些技術 然後你期待它是一個什麼樣的模型 就跟現在我們也會去考慮 我們K2之後下一代模型到底上什麼樣的吧 這個是一個持續要思考的決策的問題 然後你看到每一次就是看 現在你工具箱裡面 其實AO多了很多新的東西 那你到底要把那些東西拿出來用 就是有一個這樣的過程 那你的做研究和做訓練的團隊是分開的嘛 就是它他們一個什麼的過程就是 因為一年前就已經開始研究這些技術了嘛 那到真實訓練 就是一個團隊在做這個事情嗎 對對其實是一個團隊在做 對就是因為因為這些東西它很難分開 就是比如說你在實際訓練過程中 你會遇到這個問題 如果你之前都不了解你沒有辦法去解決它 所以實際上這兩個並不會分開 K2個人終於有遇到什麼挑戰力了 就是我們遇到就是那個Millon你去訓的時候 他就會炸 就是我們 那個都有畫一些圖在那個paper裡面就是說 Mastodge就會長非常高 然後就是我們認為這個東西 對訓練的穩定性有影響 你可能迅久了 他有很多所謂的這個內課 只不要不正常的話 其實對模型的上線是有害的 對 然後我們就是說 等於是我又回過頭去 Revigit 去重新看這個問題 然後去修復它 因為這個東西是你在少婚模型上 沒有辦法預測 因為小規模像我們沒法負限這個結果 對 它就是不會有這個爆炸的問題 然後其他的基本還好 因為其他的我們都在小規模 這樣做了很多實驗 然後它基本上也是可以遷疑的 所以問題就不是很大 唯一有這個是 小規模像驗證不了 所以你需要在SKILL 或成功再去另一句解決 你在KR訓練過程中 所以中央幾個弄號是什麼 這個弄號是寫在paper裡 就是我們都很open 就是主要的東西是在paper裡面 因為我們還是想跟 更多的社區去分享 所以好幾年你會怎麼定義 AZN可以給怎麼對AZN分類 好問題 就是其實我剛剛說的就是 Tack可能是一個 就是從一個剛中之鳥 變成可以跟世界交互 因為水AZN它其實就是最重要的特徵 就是它可以去多人的使用工具 我覺得兩個一個就是 一個是多倫 一個是工具 多倫就是你能做很多次 這是一種TacksTime scaling的方式 然後工具就是其實你是連接這個腦 跟外部世界的一個方式 比如說你用手水晶晴 但你就可以把這個模型跟 整個互聯網連接起來 然後你如果 就是你可以寫蛋馬 那你就可以把這個腦跟這個數字 因為這個數字世界基本所有自動化 都可以用蛋馬描述 那你就可以讓它擁有這種自動化的能力 所以我覺得這兩個是 我想像中可能AZN的特徵 那接下來就會有更 越來越多的工具 但你會有常委的一個分布 就是這個模型如果翻化得好的的話 它就不只只使用一些常見的工具 它可能可以使用非常個性化的工具 比如說加上你今天要有一個 就是非常具體問題 比如說你想讓這個模型能夠反問 公司內部的一些數據布獲 你個人的一些溫大 然後能夠甚至是反問一些訂製的API 讓它能完成某些業務的操作 比如說去退票或者去下一個訂單 這種就是它應該是能夠翻化到 它沒有見過的工具上 對 然後 所以我一直在想說 我覺得AZN現在可能最缺的 其實是這種翻化能力 但如果你有更好的翻化的話 那其實所謂的 比如說之前大家在討論 各種垂直的AZN 它可能就不一定非常需要 就是因為當你這個通用AZN 它能去翻化到常委的工具上 那基本上你很多領域專有的問題 但是可以直接用這些工具去解決的 你只是每次給它加不同的工具 比如說說的你家裡 可能訂製的需酷 訂製的API訂製的這些溫檔的接口 什麼你就可以完成一個非常垂直 一個AZN 它的這個 我私信就會講很多 然後多人主要是你可以做TESTIM SCATING 就是你可以做很複雜的任務 不只是做一次 就像對話模型一樣 我就只是出了一輪的 但它現在是可以做不同的事情 就跟人一樣 就是人每天的工作 其實就是你可以用它就是一個 多輪使用工具的訓練 本來就是讓你是希望把人的訓練給它 你合進去 但你要收集不到這樣的數字化數據的話 那你又可以用強化學習來構造 對 就是它本來就是在模擬人的行為 但它也是一個很朋友的 它是一個 對 你也不能說這樣模擬人 這樣模擬人的行為可能不太準確 就是因為它只是一個通用的 什麼叫它是通用的 所以不是模擬人 人也很通用 對 人也是通用 人是一個所謂的Universal Constructor 所以它主要目的不是去模擬人 它主要目的是通用 就是說它這個形式的話 就是這個這個 這個第一本身它是通用 它可以完成幾乎所有的任務 對 所以這個可能才是這個設計的目的 就是說它跟人的做法 類似 可能只是一個 只是一個剛好的結果 並不是說設計這個系統的目的 就是涉及飛機去為人能夠 當作一個交通工具 它並不是為人向鳥樣的飛 對 所以我們有這個Agent的系統 它更多的是通用 Jenial Profits的一個智能 就是你也是跟這個目標對起 但它剛好跟人是一樣 剛好跟人是相似的 怎麼提高通用性 有它做到什麼方法嗎 對 我覺得這也是一個很難的問題 就是我覺得今天Agent的發化 有一個風險就是會現實到 可能有一些Dutchmark的這個過你盒裡面 但是但是現在有可能缺少 很好的Dutchmark 所以我覺得這個會是接下來的挑戰 但我覺得可能有一些解法 就是如果我還是覺得 如果能用更多的用AI去訓練AI 那一定從頭上緩解這個問題 什麼時候能做到用AI訓練 AI現在的平解是什麼 現在其實已經有一部分 你可以這樣做 但是就是你希望它 有更多的這樣去做 也現在很多還是要靠人的設計 這個到Innovation那個階段 所以這很有意思就是說 它其實有可能不是現性 你要用一些Innovation的方式 去解決你的Agent問題 因為今天你的Agent算話不夠 所以你要Innovation的方式 它就是你要L4的技術去解決一個L3 所以我覺得L1到L5的定義 有可能它真的不是現性 就是又回到剛剛說那個點 就是你沒有這個 很好的Innovation沒有用AI去訓練 或者AI對其AI的方式的話 它可能 這個Agent它就是很難做到特別好的翻話 就是你今天翻案就是你 人工地來一些Task 然後你就feet的Task 但是你在別的 你可能看不見的Task相當 它就也有可能表現沒有那麼好 然後但是你只feet的那些Task 可能就只刷那幾個Task的分 其實很多時候用戶或者說 你在一些更OD的場景裡面 它的體感就是沒有那麼好 我是覺得現在這個領域其實面臨 就是可能Benchmark不夠用 或者Benchmark是效果 然後Agent的翻話有問題 這樣的一個階段 為什麼數學蛋白是相當容易方法的領域 其實也沒有 就是你說你如果做強化學習 但是現在就還會我覺得會有一樣的問題 就是對於這些任務 然後 你當然就是說強化學習本身 它的翻話性要比比如做SFT要好 就是因為你在這棟中 有更多的OnPolicy的Sanpo 就是你從模型本身去Sanpo 它學出來的東西 三方現在看起來是更好翻話 而且你有附屁肚 就在兩個東西會導致 從小的東西上來看它的翻話會好 但是它的翻話還是有限度 就比如說 你今天這次假設在某一種類型的數學競賽上 做到99分 那你別的數學問題可能會提升5個點 但是它很難直接也做到99分 就是你如果不做對應的I/O的任務進去的話 它就很難直接做到這樣的一個翻話性 我是覺得也人愛有一樣的問題 你說做數學題 它也有人有一樣的問題 就是它是被分布所 制約的一個東西 就說你還是中瓜的瓜中豆的豆 但是我們希望就是 我現在就是我覺得整體的I/O或者Policy 還是需要有更多的AI 來讓它能夠擺脫這種中瓜的瓜 這樣的一個情況 後面擺脫不了 會不會提高不了方法性 就是還是回到剛剛說的 就是問題是不可避免的 來問題是可以被解決 所以就是你每次會往前推進 你翻話就是會變得更好 它可能是一個 它不一定有鏡頭 對 就是你只會有更好的翻話 H&M說認為環境非常重要 怎麼定好的入總定好的環境 你再看看過程中有沒有什麼思考 回到剛剛講 就是說 你一種方式就是說 給另一個模型 然後我就設計一些環境去穿 你向上去你和這個模型 然後你可以就是現在 你可能正向的設計假設 你是一方的做 你就正向的設計一些工具環境 然後模型在這個環境裡面去體傷 可能很重要的還是說 讓這個設計 有更好的通用性 就它能做很多的任務 就是它不應該是說為了 某一些任務去專門的設計 這個工具環境 然後 當你的設計足夠通用的時候 然後你用模型去在這個過程中去學 而不是可能反過來去你和這個模型 我覺得這樣可能會是一個 更好的做法 我注意到一點 就是一般的他們覺得在任務設計上 你設計一個足夠挑戰的任務 這樣這個任務可能會做出 有本質的新的方法 但是你們的H&M其實是用的 一些中的難度的人物 這是有什麼思考了 這個會帶人通用性嗎 會 就是它也是一個爬山的過程 就是你不能一向來 就讓它去證明一個 就是還沒有人證明過的數學問題 然後看可能這個Fampway Fission時 就會非常非常低 所以現在感覺比較好的方式 就是說其實強化學習 如果你搭配好的Fampway 撤了它本質上是一個隱世的 特成學習的機制 希望它 就所謂 Curriculum Learning 就是你希望它從 合適難度開始學 學完逐漸去提升它的難度 倒不是你一上來就學非常難 因為那樣的你的採量效率很低 就基本上學到什麼東西 可能算力都會非常廢掉 對 但這個挑戰還是說 今天很多任務 我覺得它還是來自於比如說 人類存在的數據或者說 人去設計的一些任務 而不是就這裡面可能 AI Native的部分還比較少 所以會帶來 剛剛說的犯法性的問題 BuyCoding和ToneAG的是什麼關係 Coding可能是一個比較垂直的 就或者說它是一個紙機 然後它你只要把 兩個工具用得足夠好 你就能做大部分的事情 最後還是希望說能夠 不光只是說Coding 對 包括現在我們去訓練這個模型 我們也不是說讓他只能做Coding 因為他的 還是會有一些局限性 Coding是將到一個環境 他是 將到有人來的手 對 他是任務的一個紙籍 對 但他可能是很重要的一個紙籍 他是相對對於 Agnall說比較容易任務什麼 比較好驗證 所以比較好學習 對 但是他還是會有一樣挑戰 就比如說我剛剛講到這個翻話性的問題 他還是會我覺得即便是Coding Agent 他也會面臨一樣的挑戰 然後Coding是很重要的一個紙籍 是在於說 就是他代表了可能數字世界的這種話 你今天假設你想創建一個新的工具 因為現在很多Agent他的工具集合是一個固定 然後如果你想創建一個新的工具 他本身上是寫一段 寫一段或者 以大段代碼來實現 或者如果你今天想做更好的 比如說上下文管理 或者所謂的Connecting Engineering 東西他可能 對我對應的也是一個工具 這個工具可能也用代碼來實現 就是代碼在這裡面他有 他有一個獨特的位置 獨特的作用 但是並不是說你做了Coding Agent就足夠 因為很多 比如今天大家有很多不是程序員的人 他會用Clock code去做很多他的任務 你是一個律師或者你是一個 產品經歷或者你是一個設立師 你也會用Clock code去做一些事情 是因為你的模型是 是一定常做上有一些 有一些範圍他不僅只是會寫 寫來嘛 所以你們是要做通用Agent模型 並不是說要做一個Coding的模型 我們還是希望能 就是做通用的模型 或是代碼到錯工者 而出不至見 覺得Agent還缺乏什麼能力 意思我覺得首先 現在這些高屏的工具使用也還不過好 能力上還有很大的空間 然後這一方面也是說 現在 缺少一些更好的Benchmark 過來觀測吧 就是你可能水Benz三號現在也是 也可能馬上會有Satuary 就會保合 然後有很多Bench他不過好 不過真實的反應 就是 實際的用戶體驗 然後所以我覺得高屏 高屏工具本身會有空間 然後常委的工具 就是在一些可能你沒有見過完全OVD的 什麼有更好的方法 就不覺得 也是可能很重要需要解決的問題 你自己最看重能提升Agent 你這是哪幾個關係能力 長期來看讓他的能力提升 希望能用Innovation 最成的一些技術 去抵抗Agent 最成的能力 所以希望 我覺得這個可能是 很重要的一個方向 Long Kong has long term memory重要嗎 Long Kong has very important 就是因為現在 很多任務你 你128K 256K這種context完全是解決不了 你需要可能比如百萬級別這樣 或者甚至更多 但是你又需要在這個級別下 你的腦子還非常好用 它不能只是說長 你可能腦子還得非常好用 就是你的致上還得非常高 所以這個對於模型的訓練 是挑戰是很大的 就是你要讓他希望 你的壓縮率如果高 所以你的模型可能要最高大 然後同時你又希望他也不要長 所以就是這個 這兩個東西它是天然會存在一些衝突 你需要可能需要更好的架構 但是有一些架構可能你發現 它在更長的context下 可能效果會有提升 但是你短的context也有可能 又不一定會有提升 或者甚至會有下降 所以就會有很多這種 可能架構上的一些 一些平衡的問題 但這些問題可能也會接下來 逐漸被解決 我覺得它是有一些接法 所以這個也很重要 這個可能是一個 Tax上的一個支持 還有就是我覺得 現在的IRO訓練方式肯定也會有 提升的空間 比如說當你要訓練一個很複雜的 MOTI agent的系統的時候 那你只用端到端到的Reward 可能就不太夠 但中間的Reward怎麼產生 是不是能擺脫一些人工的設計 我覺得也會是很有意思的挑戰 我有一個就是我會看我們去年對話 我有一句話你非常想問你 就是你去年說太元會如何會避允 因為太元的方式跟你以前不一樣 以前所有人都可以 共進到開源 因為開源本身是中心化的 開源的功績很多沒有經過算利驗診 打避允會有人才聚集合著秘聚 是一個對市場整合 所以領先者不會太遠 就落後者才會這麼做 但是你那看遠了 對 因為我們還不是覺得 我們還沒有做到非常 就是完全的領先 有一些判斷上 其實基本上是這樣 就是說你確實你的模型出來之後 就是這個社區 它能貢獻一些些東西 比如說你在推理測的可以做很多事情 然後你可以讓這個模型有更多人免費 跟你賺 然後有更多人去用 然後 但是確實你要共進到模型本身的 把這個模型本身變得更好 好像還只能是你原廠自己來做 大家就是說現在 如果是放在這個 你如果它被smoto是這樣 但是就是說你如果繼續在開模型 去做很多post-training 特別是Agentic的post-training的話 有可能會產生出來一些新的機會 比如說加速你現在想去做一個 就是說法律相關的Agent 然後你是一個 比如說你是一個創業公司 想去做這個事情 讓你們去GKR 然後在你的定制 你的工具集合下面 你可以訓出來一個specialized agent 然後它在你關注的場景上表現得非常好 我覺得成這樣機會 對 但它更多的是可能去負能 就是更多的可能下午的應用 你可能可能說把這些東西 在變成說你的主模型 這個被smoto的提升 這個可能目前還是很難 我覺得大概是這樣 對 我覺得這問題 可能可以動態的觀察 就是就是 你們會長期選的開始嗎 我覺得這個是一個 我們希望長期去做的事情 但是我們不一定是說指揮開 我們會希望能夠去跟社區去分享 你像剛剛說的技術很好 對吧 然後我覺得這個是可以去加速 就是我們我們往把技術 再往下去提升的一個很重要的 一個點就是大家可以不完全就是競爭 就是你也可以有一些合作 或者甚至就是說 你說開源的公司 它會形成一個生態 就是說你能更好把這個技術 往下去推進 就你在雪山 可以趴得更好 然後Race the top 也不一定說我東西都是開源 比如說假設我們現在跟某些公司 有一些合作 就是它不一定是說你說東西都要開出來 但是我們可能會希望能持續的 去開放一些好的技術 所以這是一個技術體系的信仰 還是說一直是一個市場某一個促良 我覺得客觀的說是都有 就是而且可能都有好處 但最終我們是希望說 能通過這個東西 讓這個技術可能跟安全 更快的達到一個更好的水平 它變成生態會怎麼嚴敬 你覺得最終開源和畢源全球會生下幾家 我覺得不會很多吧 就是說整體來說 但幾家肯定還是會有的 就是我覺得整體來說 其實你如果去看過去兩年 我覺得這個趨勢還是比較明確 就是你還是這個市場會逐漸的 更集中跟收聯 對於更收聯 你可能一開始有幾百個 高了是幾十個到幾個 我覺得幾個可能是最終一個比到穩定的數 我覺得生態看起來還是一個大概率的事情 你們屬於開源那邊 那邊還是畢業這邊呢 像我剛剛說我們可能會持續的去開 但是並不是說東西一定都會完全的開 我覺得選擇性的是一個 對吧 這個很多可能我們要動態的去觀察 對但是我們可能也希望能夠長期去分享 更多的技術 為什麼中國公司都開源了 也不是都自己就沒開 對我覺得客觀的說還是 就像我剛剛講的 就是說你看到有市場不會一種因素 我覺得這個對社區來說是一個好事 就是說然後你開源可以互相接見 那你可以去加速做到收台 我覺得它是一個很好的方式 去年你提到一個很多的詞 是有概率的飛工時人 你今天有概率的飛工時是什麼 好問題 我覺得就是可能像我剛剛講的 就是幾個接太比較重要的人技術的點 比如說怎麼去提升Agent的範化 我還是覺得可能是一個非常重要的問題 然後這裡面可能我們希望看能否 在技術上有一些新的東西 然後包括我們去做優化器 這東西我覺得在我們做出來之前 但我現在不知道是不是 就是至少在我們做出來之前 應該沒有人在做這個東西 所以它也是一個 它也是做成了一個飛工時 因為之前所有人都會失去Agent 所以我覺得這個也算是一個比較重要的 因為它對TokenFusion實際提升就是很大 所以是的我們現在可以有一個比較好的Basemodel Basemodel我們後面就可以有更多的PostChannel 去把它所有的上線、所有的性能去壓榨出來 我覺得這些其實都是 你怎麼看AI時代的產品 就是你因為做Kin年做了很長時間 你就做比如說做AI時代的產品 跟做移動護擁有的產品會有不一樣嗎 我只能說說AI的產品 因為移動護擁擁沒有做過 但是就是 以前就很喜歡說模型級產品 對我覺得這個現在還是沒有變化 還是沒有變化 就是比如你在 假設你現在做一個Agent產品移動 在做的時候其實需要把模型跟工具 和這個Context去結合起來 但是你發現就是在訓練模型的時候 你基本上已經要把這些套全部搭好 你才會辦法訓練這個模型 所以當你模型訓完之後 你的產品已經做完了 就是你在上面做一些可能交互的東西 我覺得肯定也有很大的價值 但是可能它是最後的 這集上天花的這一步 就是你的模型的性能 它已經在這個過程中 然後打磨好了 然後跟這些工具和環境 已經有非常好的試配 所以它是 它是在訓練之中完成的 就是你訓練好了之後 你的產品就基本上已經做差不多 因為你訓練的時候 現在開了方式也沒實際上 你要做一個巨大的系統 同期下午有事 21世紀初Google做新鮮做系統 那你今天對於AI就舉達系統 你們什麼想像 更多的想像 金額比如說以前的搜索 已經系統或以前的推薦已經系統 但是它都是 是配不同的時代呢 我覺得現在的系統複雜性 在於你想 就想這張這個模型變得通用 就是通用它會帶來很多的複雜性 OK 但你一方面可以認為它是變簡單了 你一方面也可以認為它變複雜 就簡單再說 你只要把所有東西都放在同一個模型裡 就你不需要維護那麼多模型 你不需要搞一堆的這個Routing的策略 對吧 就是它從概念上來講 或者說有一些工程實現上來講 它是變簡單的 但是另外一方面就是它有一個變得複雜 就是你發現你如果希望它很通用 那你就希望說這個模型 在各種場景下它都可以工作 比如說你做Agent的模型 你不希望它只在你的工具之下 很工作 你希望說 別人用你這個模型 它在別的工具之下 甚至你沒有見過的工具 或者說工具不同的定義 不同的實現方式 它都能工作 這個其實就是 要求是很高 然後你可能比如Agent裡面 它現在可能會有幾種不同類型的任務 你不然是Coding的Agent Search Agent 還是可能一些其他的Agent 就是你要把它 放在同一個通用模型裡面 那它就可能會有這個 會有一些打架的問題 就是你可能也許你的工具 定義不一樣 或者你的數據的Patham不一樣 就是你把它做成一個通用模型的過程 它其實是有很多的技術挑戰 但是如果你不做成通用的模型 它的方法性有沒有那麼好 你只能做一件事情 特別是現在就是Agent 它是需要很多部的完成任務 即便是成續員 它也不僅只是寫太滿 或者說寫太滿裡面 它也不僅只是做Switch 所以你當然就是 你要做很通用的東西 或者說真正可用的東西 隨著你的部數變多 它對於通用性的要求是會更高 我是覺得它的系統負擔性 主要是體現在說 你在訓練這個模型的過程中 需要讓它是足夠通用的 不是說去你合到某一些單點的能力上 對你合到單點的力量 你可能會 你可能會BanceMark分數看起來很好 但是你實際上就是 你的通用性可能是不夠 對 就是我覺得這個事 現在這個系統 我自己能觀察到表達 討論好 包括有個例子 就是說比如你想想 往這個模型裡面加多摩太的能力 對 你就需要讓這個多摩太的能力 不要去損傷它的腦子 而且你希望就是在多摩太的模式 下來跟你們這樣 我覺得能夠不損傷什麼 對 就是你能不損傷已經很好了 你希望它 多摩太的模式下來 跟你這個 文本模式下來 你希望它 它能共用一個腦子 就是它能在多摩太的模式下 也能把它文本的那個智商 給激發出來 而不是它就進入另外另外一部分的參數 那它可能就是完全丟到來的原來 它在文本裡面學習的部分 所以就是你作為一個通用的模型 它就會面臨這樣的挑戰 就是當你有各種模太 各種任務類型 各種 還有Agent Reasoning Chat 這些東西它要全部合到一起 我覺得是存在這樣的一個挑戰 而且你現在不光是SFT 你還要說I-L I-L的時候它你就可能這個挑戰 就會進一步的加重 這個是相比 就是說你只做就是 通用的Pri-Channing設想的比較好做的 就是你只要把所有的文本 就是放上在一起 它基本上不會有太多的問題 但是你越到Protrion 後期越到I-L 它的這個問題會更加嚴重 我覺得這是它的系統負擔 你看Soswony型系統 其實是勾結在PC固域網上之上的 然後推薦已經系統是勾結在手機上 就移動過往上 你就親自接電在哪裡 這是在Air試的 有超級接電在哪裡 就是新的系統 對它肯定會跑到很多數據中心 所謂的健身經常說的這個AI factory 但肯定還會有很多中端嗎 就是我覺得中端可能還是有些可以復用現在 有一些可能會有新的 會帶著新的照顧版主 肯定會Chart是一種 就是你如果兩年前看 Chart是一種新的 交互方式 因為之前可能 沒有說人跟機器這種對話 現在你可能Agent 其實也有很多新的交互方式 就比如你讓它一步只是一個任務 然後你也可以看這些中間的結果 它其實也是一種交互方式 但可能接下來會有更多 比如說當你有一個Motage Assistant 那它的交互方式 會怎麼樣就可能你會隨著能力的編輯去變化 對 然後比如說你看Coding這個東西 Coding開始你有Copilot 然後Copilot之後有Cursor Cursor之後有ClockCode 但是你每一代的交互都會發生變化 然後你發生這個交互它其實是隨著模型的變化 對 基本上就當你有新的一代模型 然後它能力提升了很多 你就發現你的交互可以改了 就你不再需要說我單個的人去點 我要不要Except一個修改 而是說我可以去多步的 去只是一個AgentCoding的任務 所以你的交互方便 當然今天可能Crowcode的交互它也 它也不是終極型態 就是因為你的模型還會提升 提升之後它的交互就會持續變化 我覺得是一個這樣的過程 今天Skatee Loan你覺得還沒有方法 Skatee Loan對Skatee Loan就是有數據強 我覺得這個肯定是一個客觀的事實 然後就是說你出過這個續強 你就是要提高Token Efficiency 就是我剛剛說的就是 我怎麼會去做Token Efficiency 提高Token Efficiency的事情就是因為 你肯定續強是存在的 然後你同時你要Skatee Loan跟多的Computer到 這個I/L 想各種各樣的I/L的任務上 但三號我們現在觀察就是 其實模型變好的速度並沒有再減少 我覺得甚至在加速 為什麼A&R場面都還沒有形成數據飛輪 就是因為 其實算力的Skating太強大了 其實算力的Skating太強大了 就是我覺得這是一方面 就是說你比如說你先Skatee Loan 然後你又Skatee Loan I/L的Skating它的效率又比Precating要高很多 因為它是On Policy帶負負度的訓練 所以它的Skating效果其實是效率是更高 所以當你有很高的Skating效率的時候 我覺得你發現你直接Skatee Loan這個Computer Skatee Loan這個Flops它帶來的提升是非常非常大 所以你會顯得其他帶來的提升很小 這個是一方面 另一方面就是說所謂的速度飛輪它是 很依賴於這個外界環境的V-BAC 然後這個V-BAC它我們不希望它有太多的造生 但現在可能三號就是還沒有完全 說這個問題做得非常好 就是因為你造生 就大模型的學習它對造成是比較敏感 它跟可能傳統的 比如說推薦系統有點不太一樣 它是造生很敏感的 現在看起來還是說 基於這個Flops的Skating是更有效 但這個平衡什麼時候會產生變化 也有可能就是說你 通過新的交互去 讓你收集到的新號的造生能夠去減少 對 但是你就是創造一種新交互 對 但是你這個交互要是配模型能力的發展 你的交互不能超越模型能力 你應該在大型模型能力的這個範圍內 去設計一個好的交互 但是我覺得這個是值得嘗試 只是說今天可能會看來會覺得說 可能你去Skating那個Flops那個微圖 或者說提升它的學習效率 它還是更確定性更高 而且看起來更有效的一個方法 如果說像比如說演進解說 用戶處去無法提供模式的智能 那好像今天就沒有必要做脫機產品了 我們就一般提升智能就好了 這個東西要看怎麼看 就是你可能還是要有一定量 就是你大概知道說這個 我覺得這樣就說你可能沒有辦法直接 去使用一些比如說用戶的反饋 直接拿去訓練 但是你也有一定能戶量的好處 是在說你知道整體的這個 比如說需求的分布是什麼樣 你大概知道就是說有哪些可能是 用戶用得好 那些用得不好 然後你再把這個東西抽象程可能一直 比如說EVILLE REACTION 然後去又怕這個模型 如果你這個模型完全沒有人用 那你可能都不知道往哪裡去又怕 另外就是說也要看這個用戶的三下架子 對就是我覺得現在 其實又到了一個新的分水領 就是說你的用戶 實施是有可能 能產生三下架子 比如說你就看我看他 他使用用戶其實產生的三下架子 就是很大可能這樣 他的因素的 比較大的比例 然後特別是現在 你可能有很多AZEN的產品 可能斷斷斷產生很多加持 所以銀戶可能現在 所以也要看你是什麼用戶 就是如果普通的去 先聊問一下天氣 他可能不一定 所以有那麼大三下架子 但是如果你是很多AZEN的 這個專業的用戶 那他可能是已經 本身就是一個很好的生產力的價值 可能這個事情他又不完全一樣了 你的產品有什麼新的想法嗎 我覺得更多還是想模型怎麼做 因為我覺得像我剛剛講的 就是模型訊好了這個產品 他就已經基本上做了差不多了 模型機產品 我覺得他今天還是成立 今天還是成立 我們還是會研的這個方式一直在做 有人會說 Kimi是要從要做 當然你不認可 你們是中國要做中國的歐後來以前 但是他們會怎麼看 你們是要從做要做中國的歐後來 需要變成你想做中國的 Dropick是有這樣的一個轉換嗎 我覺得很難算定義 就是因為中美他不太一樣 而且今天我們更多的 還是得站在全球的 吃饺去吃烤這個問題 我覺得做中國的什麼什麼 可能本身他就不一定非常勝利 我覺得還是其實簡單一點 就是說 我們希望 才是繼續爬山上 對 我覺得這爬山上 做時間的朋友 然後 跟肯定的提一起 說去加速的技術的推進 我覺得這是我們想做的事情 那我們聊聊雙眼模式 你怎麼思考的 API是好生意嗎 我覺得 現在就是明確的三眼模式 一個對一個API 一個是說 可能一方產品 覺得這兩個可能 我們也都會 去做一些嘗試 但是我覺得今天可能 這主要就先給 還是繼續把模型做得更好 我覺得這個還是 可能所要目標 但是你在把這個模型做 更好過程中 對比如說 你在某些方面 領先 那它其實確實是 有這個 會有這個三眼化的空間 因為我覺得今天整體的市場規模 其實長得很快 就是可能 投步的公司 有幾十億三百億美元的 AR而且是在快速增長 可能每一個 每一兩個紀錄 可能翻個兩三倍 這樣的情況 我覺得這個肯定 我們是會動態去觀察 然後可能 做一些嘗試 但是可能最主要 還是說 比如說你如果模型 真的能做到 比如說 OPUS的水平 會甚至做得更好 這個空間可能 更大所以 我們會花更多時間去 把效果做得更好 因為你能用不住 他們很喜歡 TMI但是 很擔心KMI不賺不錢 怎麼辦 你們能賺到錢嗎 對就是你還是先投資 你能夠交到錢 取決你就是你的模型效果 就是怎麼樣 我現在覺得 我覺得市場它 是一個 其實已經一定從上面驗證的市場 然後也在快速增長 像我剛剛說的 所以我覺得還是專注 把技術做得更好 然後這次要東西 我覺得其實可能 確定性感還是更高 KMI你心情有什麼變化嗎 也沒有 就是這次還好 就是說 我覺得還是這個 還是一個漫長的旅程 你只反正 要持續做下一代的模型 反正還是回到 或者在石頭上2句話 就是說你會產生新的問題 然後你去解決它 然後這個是 這個是可能是最有意思的部分 這個旅程就創業旅程 有什麼意料之外 完全意料之外 我覺得還好 就是 基本上 所有的困難 就是我們也有預料到 就是說具體是什麼困難的 我覺得最有意思的點是 你永遠不知道 會產生什麼新的技術問題 然後這些新的技術問題 會怎麼樣被解決 我覺得這個是最有意思的部分 就是這個是你 基本上很難預測 如果能預測 它就不是那麼創新 對 但我覺得這個是最有意思的 就是你會永遠遇到新的問題 你現在生活是什麼樣子 生活節奏 現在就是 可能睡得比較晚 怎麼樣 我不太一樣 就是可能每天不一樣 但是反正 然後 但也還好 就是花很多時間去看 怎麼把模型訓得更好 所以你的時間主要投入在模型訓練上 我覺得是 對就是 但我跟訓練是很抽象的概念 就是說我覺得 我覺得裡面很重要的一個是 就是你的技術 一些技術的戰略 我覺得這個是可能 公司戰略裡面最重要的這一部分 就是你的技術戰略 就是你現在 下一步到底是 你現在要做你一些不要做 因為這個技術空間很大 你總是要選一些東西去重點去做 去年選擇的是 就是說我覺得我們在很多東西上的 大致還是有效而且比較早 比如說想去做 Long CLT的 我們是反應比較快 然後去做 沒有優化器 然後去做 更大規模的 去選擇 然後去比如去做這個 做一個 可能第一個 Open的 Hagetic的模型 我覺得這些可能都是一些技術的 Bat 或者技術的決策 我覺得這個東西基本上 會至少決定 五六層的公司的走向 但你要做很好的決策 還是需要很多證據 支撐 就是我們還得做很多實驗 所以你得了解很多具體的實驗結果 就是到底這個東西什麼樣 那個怎麼樣 跟接下來可能會怎麼樣發展 這個東西它你不能攀脲 大概就是還是被 知道更多的信息 我覺得這個的話很多時間 第二個就是說 可能具體的技術上 你這些決策 你們最糾結的是那個 畫實驗最長思考 我覺得最重要就是說 你接下來要做什麼 補助什麼 就是剛才說那些決策裡面 其中每一個 是畫實驗最長時間思考的 也還好 就因為我覺得這個東西 它觀點是一個 蒐集數據的過程 就是你做實驗 然後看這個實驗是不是紮實 然後通過這個東西結合結合 就是你對這個一定的技術理解 然後去判斷就是很多時候 其實你只要數據如果充分 它的這個判斷 也是比較顯然的 這台 接下來又是 我們也在想 也在做一些實驗 還是有很多東西可以做的 我覺得至少說現在 KR的它的性能 前例其實還沒有被完全壓站得出來 因為我們之前放了 我覺得更接近 是一個 更接近是一個 Base Model這樣的東西 我覺得這樣 接下來我們可以加更多的 Post-Channing的Flops 就是我覺得它的上線 應該會比現在還會高很多 肯定就是我們還會去做下一代的模型 下一代的模型 就是我覺得應該可以 有在更多的提升 就是Base Model 對 然後 但這些具體怎麼做 我們現在就是 也會通過一些實驗 來決策 你也會加多麼太吧 對 多麼太肯定是 我不要確定 你剛剛一直說多麼太 其實 只要不干擾制的 就已經很好的什麼 對 對 它本身多麼帶你多麼太能力 也要做好 多麼帶你能力 本身要做好 也不容易 對 就是裡面有很多的工作 然後你怎麼讓它能夠去 接見這個紋本的腦子 不是自己單開一個腦子 就是比如說你Moe裡面 你Express 假設你有 Express它專門在做多麼太 你可能不希望這種情況出現 這樣的話 你可能 你可能隨著來多麼太 是個傻的傻的多麼太 對 我們希望它是個聰明的多麼太 像有什麼重要的理成悲 再就算是理成悲 放滑性被必須一步 對 我覺得是 我覺得AZN放滑性 是可能是最重要的 就是我今天是一個 沒有管全被子覺得問題 你們解決了一部分了嗎 解決了一些 對 我們寫在Papherly 對 你可以去 盡可能夠到更多的 多樣的數據 我覺得 也不只是這個 所以你們數據上的篇幅很大 我覺得還是盡量可能避免 說你通過強化學習的方式 但是你只能合到幾個任務上 因為還是我說的 因為BatchMark現在表現 所以你有法BatchMark 它就會導致說你的 I/O任務就會 可能彈梭到幾個單點 但這個只是我們不希望 你沒有觀察的東西 它可能就掉了非常多 我們現在也在 可能希望想更多的 辦法去解決 我覺得這個會很重要 像剛剛說的這個 DoneConTechs的支持 我覺得肯定我們也會繼續看 怎麼做 在它智商很高情 現在還能有更長的ConTechs 我覺得這個會是一個 DoneConTechs的架構它還是會影響你的智商 我們不希望它影響智商 就是希望它 DoneConTechs架構會影響智商 比如說如果做LiniaTancer 你純粹的LiniaTancer 你可能它就是會影響智商 因為這個架構會有一些Bas 可能在一些場景下 效果沒有那麼好 但這個是一定程度上 也可以被解決的問題 模型公司和做Agent產品的公司 長期來看他們的關係 和編輯是在哪裡 這個問題我畢業 沒有明確的答案 就只能說今天看起來 就是一方的產品有個好處 就是它可以做垂直的整合 因為我可以把模型放在這裡面訓練 所以我的模型跟工具它是融為一體 它不是說分開來做 然後再去印象工程 但是因為有非常多的Agent的空間 就是我感覺一方產品不一定做得過來 對吧 所以有可能是 如果能找到一些空間 比如說你這個工具的實現 它是需要非常多的領域的No號 或者說你的Evaluation是可能 一方產品根本不會考慮的東西 考慮不過來的東西 那我覺得是有機會 我覺得有像K2這樣的開源的模型 然後你就是說大家可以在上面去微調 讓你更容易產生出來 也有一些可能這種 Specialize Agent 垂直Agent的可能性 我覺得這個可能性還是 還是一定程度上可能會存在了 那要看你通用模型的通用到多少程度了 對 但你不管多通用就是說你總還是有一些工具你要做 所以你有可能也不一定是要去做的模型 而是說你把這個工具做得非常好 但這個工具你如果是做得太通用 你可能就會 就是跟一方的這個產品 overlap 到即會比較大 對 那這個就是可能你還是做垂直Agent 和優勢跟的 但是如果你這個工具是一個 我就是專門針對一個東西去做 然後甚至我這個工具是別人做不了的 比如說我今天如果掌握了一些線下服務的 入口 那我這個工具就是我這個 下訂單或者成交這個工具 是別人根本做不出來了 那你也有可能是 能產生一些獨特的價值 當然我覺得存在另外一種可能性 就是說當你這個一方產品 或者說你這個通用的Agent 它的流量或者3M是足夠成熟之後 那你很多這種專有的 本來壟斷的工具 它也會願意去接入進來 因為它的整體的3M效率會更高 對但3M效率的提升 我覺得是需要一些時間的 對 所以那在這個時間窗口內 你可能其實專有的Agent 也會有空間 對 對 就是但我覺得最終 就是通用的 通用就是Taiwan什麼 通用的工作是因為它整體的 3M效率會更高 所以今天甚至包括我覺得很多內容平台 你最終有可能你把內容 接到這個通用Agent裡面 你的3M效率是 會比今天更高 這個是有可能 大家可能要花很長時間 像Mindless這種公司 或許你的客戶還是你們經過對手 在生態上來說 我覺得它很早期 就是你很難 看著它到底有怎麼樣 而且可能 這個產品本身也會嚴禁 對 所以我覺得短期內 它可能更多的會是這種 合作的關係是可能是大於競爭的 但是未來它確實會嚴禁 所以像比如說 就有點像Claw的Cursor的關係 那Cursor它可能要動態的變化 它可能也得 在產品設備上有一些動態的調整 說它可能就是需要去 一方面是說能不能有一些模型的能力 我的技術研發的曲線還是很抖竅 另一方面就是說它能不能有一些 就是比別人做不到的工具 或者環境就是 但這個我覺得都是一些 現在沒有辦法直接回答的問題 但只能說現在看起來 我覺得一方的整合優勢 應該是存在的 你現在說Claw是哪個風 哪個山風 對Claw本來就是一個 可能是世界上最難判斷的山風 剛好這個名字有點重合 只是你威選的證明度 對 剛好也是Claw 對 就是我們也希望說 首先它不是中點的 因為它不是最高的山風 它可能是最難的 因為我覺得就是說你可能 因為現在有很多範疇的轉變 你可能從對話到這個Agent 然後可能你的Basemodel的Scal 進一步變大就是它本身 它肯定存在難度 所以剛好反而跟這個好像有點關聯 結果超出你預期的 差不多反而就因為基本上你這個模型訊 其實在過程中就已經知道了 就是它並不會說有一些驚喜或者驚訝 不是說你的AHA moment嗎 也還好因為很多東西它是可以被預測的 就是因為我覺得更重要的是 這個預測的能力 因為這個你去一次模型 一是需要週期二是需要的成本 所以我們希望在早期進行可能多的 就是把所有的預測都預測到 唯一的那個沒有預測到 就剛剛說那個Mex logic的問題 但那個確實沒辦法 就是因為你小規模它是預測不了 對 其他的我覺得都是 都是我們希望進行可能把來預測好 所以你說的東西都是在 都是驗證清楚的情況下 然後在Skylnesis scale的成功率是比較高的 你怎麼看張翔宇說 Nastoke and Prediction的本質缺陷 你得到這嗎 我不是太遠 他第一次就說隨著模型規模擴大 對話能力是量和情商的變強 但是推理能力遊戲數據的表現 是肩上升後頻緩 然後再擴大反而下降 所以他覺得就是更難模型 比如說做數據問題 心向於跳步不老實 他覺得這是Nastoke and Prediction的本質缺陷 對 但是可以對所以要搭配 我覺得就是確實如果你今天 不多強調學習他的模型 他很難說很聰明 會有一個像數學體這種 他不一定做得非常好 但確實我覺得更大的 Based他的強調學習 強調學習的上限還是會更高 對 就是因為他的知識更多 本質上是說去機會一個推理的 反正是要他能把那個知識接鎖出來 然後把那個對 就是 他上限的更高 但是你要搭配一個RL去機會 世界模型怎麼看 一種說說世界模型是造世界 做AZN是資料道人 所以最後 像我剛剛說的 因為AI訓了AI有一點這個意思 你有一個好好的世界模型 你就模擬這些東西 他就是用AI訓了AI的方式 他的範畫就有很多 就是我覺得這個可能是 去通往更好的範畫的一種可能性 你那個頭線說 第一次見你的時候 你就開始講GPT10可能長什麼樣 你現在覺得GPT10長什麼樣 還會有GP10嗎 我當然說了什麼 他對你講很深的原因 就是因為你第一次見他 你就開始說 你說GPT4GP5長什麼樣子 你說GP10長什麼 我不知道你還說什麼 對 現在你這樣深 OK 對 我覺得 但其實我覺得我們今天其實已經 已經好像實現了 之前預想了很多東西 比如說你真的能完成 幾個小時的這種任務 覺得這個發展還是很快的 對 然後 但我覺得整體就是 你就是逐漸 見得更多的 因為就是 逐漸見得更多的variation 然後然後去 突破這個範畫的過程 其實我倒是覺得這個好像 相對來說還是比較明確了 見一般日A.S.N.上面你們有獲得什麼 認知沒有 我們也在探索嘛 你剛剛說的時間 模型你可以認為它是這裡面的一部分 對 但是怎麼實現 我覺得現在還 還需要更多的實驗 對 過去年的組織 有新的想法 新的思考 好問題 我覺得現在就是 最近在想一個事情 有幾個東西它好像 有點聯繫在一起 就是如果你看我們去做科研或者說 創造新知識的過程 它很像一個強化學習的過程 就是說有一種理論 是叫經驗主義 說能得到新的知識 是從經驗來的 然後後來大家有很多觀點 就是認為不是這樣 就是其實人類在這個地球上 已經存在非常非常多年 但是可能你 但是百年之前沒有任何人 說其實地球是個球 就是一直在這個經驗裡 但是你並不知道事實是什麼樣 所以經驗並不能直接給你這個知識 而是你提出了這個猜想 就是說你觀察到一些東西 但你提出猜想說 我認為這個球可能是原來 然後我想各種辦法去驗證它 包括現在訓練這個神經網路 你可能觀察到 幾十萬個內科指標 你觀察到有一些內科指標 可能不太對 那你直接觀察 你並不能給你新的知識 你只是說我 我提出來一個猜想 他為什麼會這樣 然後我再設計一些實驗 去驗證它 所以這個是 現在可能我們覺得比較好的 當然就是可能所有好的 科研的方式都是這樣 但這幾個東西想要三方式相通 就是說因為你翻譯就是 你好像管理一個團隊 它也是這樣的方法 就是你是要 用I/O的方式去管理 對 當然這個是 這個是Tim天天跟我講的 就是說他 你覺得要用這個 I/O的方式去管理 而不是用SFT 對 當然現在你翻好的技術 就是說你做I/O的時候 你其實也希望加一部分SFT 因為SFT是很好的鮮艷 所謂的PTX loss 然後你不是希望這個模型 可能非太遠 對 但是你也要關注自己的手 就是說你不能SFT太多 SFT太多這個你的 其實是同學他就會失去這個 主觀的東西 然後就沒辦法創新了 這個點我現在反正我會再做一些實踐 就是好像看起來有一些效果 然後但是可惜是長為SFT和I/O的平衡 SFT就是你直接給他 就是說這個東西應該這樣這樣這樣做 I/O就是說你給他一個 手上的想 I/O就是給他一個獎勵 就是說如果做成這樣 那他可能就是好的 那可能跟很多時候 他就是反映在目標上 然後就我覺得這兩個東西 他可能需要一些挺恨 然後可能比如說以I/O為主 對 就是然後通過一部分 來 SFT去防止他 就是非太遠的 你還是要有一些鮮艷去控制 或者防止他以往你掉一些東西 我覺得這些好像 某種程度就是連接在一起 就是I/O好像是一個很本質的東西 就是好像你的組織在做創新 那本質上也是一個I/O 但這個其實就是說 你在I/O的觀眾 你在I/O觀眾你訂這個獎勵 或者訂這個指標 他並不是非常簡單的一個事情 比如說如果你只是最後 我就是要把所有的benchmark 做得很高 那你可能就會出現很多 overfeating的問題 就是因為你所有人 都會不折手段的把那個分 給弄下去 但是弄完之後你發現 這個模型好像還並沒有變好 也就是有可能會出現這樣的問題 所以這個獎勵的定義就很重要 對 或者說這個獎勵的定義也需要 你很了解這個 具體的細節是怎麼運作的 不然的話就他就會出現 reward hacking 什麼第一維握的 這個是一個很重要的客題 因為你想法沒 所以還是你建立更多觀測指標 然後進可能不要去過你了 對 所以就是 我覺得是一定程度有效 就這樣你才有更好的翻話 然後不會被 不會被hack 對 就是用I/O管理團隊的方式 最大的問題就是你容易被hack 就是就是你的hack的reward 大家看起來各種 好像結果都很好 但是實際上並沒有達到你 最後想要的 這個是他的風險 然後你用I/O管理團隊的風險 就是 就是 大家是去創造力 所以最後你是這個 幾個東西 他一定程度的這個balance 但這個我也在學習 我覺得今天肯定 不是說做到很完美的情況 但是可能也 也要逐漸去學習和理解這個事情 你過幾年很低落的時刻嗎 我覺得還好就是 跟多就有些東西會 我可有些東西不 work 會有寫決一些問題 會有新的問題產生 就像剛剛說了 所以我覺得就是不斷在這個過程中 我覺得只要你覺得這個東西 是有意思的 你就是 你就一直想去做下去 你的心又是一個 很微信的理解 我現在最新的理解 就是怎麼去把握這個 I/O管社會 還有我還挺你之前的挺 就是 對 我覺得這個可能很重要 其實過去年 Pinnie也是波風波谷 來回正當 你在這個取中你的心態是什麼樣的 你需要平衡自己的心態嗎 心態就是反正做時間的朋友吧 真實的心態不會這麼簡單的 我覺得就是你會有高點和低點像你剛剛說的 對嗎 然後我覺得 可能很專業的就是還是說 你就喜歡做這個事情 然後想把它做好 所以你也不用想別的東西 你就想怎麼把它做好 所以好像也比較簡單 我覺得沒有什麼特別複雜 很多複雜性都是 人為強行加上去的 實際上並沒有那麼複雜 但你對人性有多了理解嗎 我覺得這個東西也還是需要時間的打磨吧 我覺得就是 我覺得不敢說 其實有那麼深入 就你只能說是在自己的這個故事裡面 你不斷的感受 說自己到底是什麼樣的一個人 然後你希望 你為什麼要做這個事情 對吧 然後 我覺得可能是不斷去思考這些問題 你去有什麼樣的人 你為什麼要做這個話實際 就是我覺得有意思 對 就是 對 就是 就是我 我 但就是 是什麼有意思嗎 是做學校有意思 做課業有意思 就是做AI有意思 尋找這個真相的過程嗎 去不斷發現新的問題 解決它的這個過程 那你還可以解決別的問題 對 解決這個問題呢 對 因為這個問題他很重要 就或者說 哪個問題很重要 就是我覺得AI很重要 就是因為 這個問題我也問過Kimi 他要跟我說 這個東西是 他 他說這個東西是人類文明的放大器 我覺得很有道理就是 又回到那個的 Beginning of Infinity 就是 你從起模運動到現在的 人類一直在找到新的方法 去突破這個 支持的編輯 但是 可能下一個突破編輯的確實 就是你在以靠AI 因為它是一個巨大的槓桿 然後比如你今天在任何一個前學課 你要花幾十年的時間 二三十年時間 你才能學到最前學的支持 但是AI可能一夜之間 你才能學會 然後你就 往下去做新的突破 就是AI會從一個Mata的Science 我覺得這個是 這個是很重要 人類文明的放大器 我覺得 我大概有可能撤回人類文明嗎 我覺得這點上 我覺得還是 我覺得首先這個風險 肯定你不能說它不存在 但是我們可以有很多事情去做 就是你不管是說 更安全的對齊 還是說就是 更好的社會的機制 我覺得這東西都是 比如說就是 當然它可以做一些事情的時候 那它其實很有可能會 比如說創造出來一些新的工作 那我們需要有一些方法 去完成這個過度 那最終就是可能這個 技術的進步對 對我其實在比問題 就是說它雖然有這樣的一個風險 但是 但是我們可能不能放棄這個事情 因為你如果放棄這個事情 你就等於放棄了 人類文明的上線就是你不知道 它上線能做到什麼樣 對就是有一點EF-A-S 但是我成這樣就是說 我們得 做很多的事情去 特別是你今天其實看到很多AI能力 我覺得是有點震驚的 根本半年前你都想不到 現在能做到這樣的程度 需要做很多的事情 而且同時我認為 就是可能人的獨特價值 就人的體驗 人的情感 這些東西它是沒有辦法被AI去替代 所以就是可能會有不同的活法 但是 就是希望是應該是能活得更好 是怎麼樣不同的活法 我之前覺得人的一生 可能有幾個不同意義的 就是可能創造體驗和愛 然後 但這個每個人不一樣 這個是我對我來說 但我覺得創造可能創造裡面的 很大一部分 也許有可能AI是可以做的 我還是很享受這個過程 但是你不得不成 就是說有一天你可能會有很多的 創造性的工作者是AI去做 但是我覺得後兩條 就是說可能它還是會是以人為中心 但如果它創造拿走了的話 它其實把生產力拿走 所以我手會 因為人可以享受這個生產的結果 就是如果我們有一個好的機制的話 它需要改變社會的機制 對對 但它也是一個緩慢的過程 它不會是說你一兩年做完 它可能是要一二十年 逐漸地去調整 你會平凡地跟Kimi聊天嗎 當然 對我要測試模型 你會跟他聊一些很深刻的話題嗎 有時候會 或者很自我話題 有時候會 比如說會聊什麼 除了剛才說的那些 還好 還有一些是這個工作室的問題 你就今天Kimi的成功概率 是增大了還是Strekali增大 想必是什麼時候 想必於一年前 我覺得是增大了 因為我們 成功概率還是Strekali 成功概率 對 對 因為我覺得就是 就你只要 沒往上爬 你的成功概率都會變大 因為會有一些人 就不會是去爬 你再去恐懼掉下去 我覺得肯定 肯定會有恐懼 但是恐懼很多時候 它是會 更多的可能是 還是關注 就是你當前這部 然後 你能做什麼 有時候可能想這個問題 是更重要的 你覺得過去你也沒有走頒路 肯定有 就像我剛剛說的 就是你在這個過程中 會有很多很多決策 有一些是技術決策 有一些是 例如業務的決策 我覺得很重要的是 就是說 就是一個公司 在這個過程中 可能去組建 調整能力 就像比如說 支持創造也是 這樣的一個過程 就是你 你不可能 創造出來 支持所有的東西都是對 就是你會發現 有的東西 它也是錯的 但是它在一定時間內 可能是對的 然後 但它一定時間內 可能是錯的 但是它 但是它是錯的 你 你知道去做調整 比如說 像劉奔奔做的很多東西 但是它當時 是最好的理論 但是它不是完美的理論 它是猜有錯的 對吧 它在一些場景下 就是完全錯我的理論 你在這個萬永隱利 需要有一些別的解釋 需要有一些這種 相對論的解釋 有通過 這個失控的 有趣趣的解釋 我覺得是一樣 就是就是 我覺得組織的進化 或者一個公司的發展 它是一個動態的過程 然後任何來的中間點 在某些時間 是對的 有一些時間可能是錯的 這個也是KIMI告訴我的 就是說它 任何的中間狀態 都會成為 被批評的 對象或者這些 反而類似這個意思 就是說我覺得你總是會 有這個時代的局限性 然後可能更重要的是說 你怎麼在這個過程中去 我覺得意思是說 投入一些可能一定不變的 比如說你的人才要技術的積累 然後另一些就是說 在這個過程中 去取失硬它調整 就是你能夠針對 不管是說 就是這個反饋性好 或者你這個環境的狀態電話 然後去做解決設調整 我覺得這兩個東西是很重要的 到底做AI是在產品 是不是跟互動產品完全不一樣 因為互動產品就會通過頭流去 擴大跌擴大還是上規模 但是AI產品它很不一樣 就是它模型能力提高了 然後提高了那個BAR以後 它自然就可以獲刻 但是互動產品也不知道 用來看嘛 就是其實所以我們知道 這個這個平衡的 對它有時候也不一定那麼自然 我覺得取決兩個變量哪個大 但是你確實 如果你是在技術快速發展 你覺得你很難說 透過頭流的方式去 取贏的這個戰爭我覺得是很難的 對但它可能更多是一個輔助的手段 就是說你這個輔助手段跟你的主要的手段 之間它到底什麼樣的一個配比 它可能是需要動態調整的一個關係 然後也取決就是說 你現在的算話的進展 或者說你的這個PMF到底有多強 就是它可能不同時間點 它是有不同的策略 甚至這個策略也許你再過兩年 它又是一個好的策略 我覺得BD就是我覺得 我們是用更open的心態去看這個東西 但是可能在每個時間點是 我覺得最重要的看 哪個是最大的電量 我覺得這個是一個挺重要的事情 OK今天最大的電量依然是智能 對就是還是爬山 還是爬山 我一直問你各種的情緒 你都說愛好 所以你最近一次 或最近兩次 如那一次還是什麼情境 我想問你為什麼 我覺得它不已無息 不已幾杯 這是我等一下 你也說什麼 對 但是我覺得是避免一些情緒化的決策 所以你會情緒化嗎 可能多少 可能會因為你是一個人 但是就是說我是說 可能避免一些情緒化的決策 就是從落實到決策和執行上 還是要更理性一點 這大概成長了什麼樣 過幾年 我覺得是說認識到一個點 就是說問題是不可避免的 它會一直存在 然後持續解決新問題 我覺得最重要的可能也是最有意思 我覺得這個是一個心態上的一個變化 然後它當然它可能會改變 你很多做事情的方式 這是一種正面的方式 說我不知道怎麼理解 但是可能差不多 你這個你一年前跟新方嗎 對 因為我覺得 有兩名數一個是說 你方面也跟失應這種狀態 所以它會興奮之減少 但另一方面就是說你發現 AI的進展很快 就是你現在能力又提升了 所以興奮只有增加 所以我覺得基本上可能微食 在一個比較穩定的水平 我問你最後解塊塊答 一個請求範圍你喜歡的食物 食物 拉麵 為什麼 好吃 一個小人知道 但必須知道的知識點了 我好像不太擅長回答這種問題 其實所有讀過的書 推薦涼滿幣讀書 這個有一本我剛才在講了 對 推薦的最 新的中文是在AI進程的幾篇論文 這是什麼 最重要的 最重要的幾篇論文 最重要的幾篇論文 就是 back propagation 可能 cance formula我覺得可以算 然後可能 GPC GPC3 那,然後. 大家有一些是building block 我覺得也很重要 就是像be a restnet 我覺得也很重要 就是它可能是這個範圍的技術 然後add-m 但現在可能還有沒有 基於當下的認知一個最關鍵的bats 如果你的bats有範圍的 用innovations用L4做L3 這件豆腐是什麼 不知道 我感覺我腦子已經服了 我已經本來一年的話都講 大家把探機商務的局限也進行 好了 今天的節目就是這樣 這裡是商業訪談路 是一檔由語言及世界工作室 出品的深度訪談節目 你可以到公眾號關注我們的工作室 或取更多的信息 我們的公眾號是語言及世界 Language is world 我們希望和你一起從這裡探索新的世界 (音樂)

Podcast Summary

Key Points:

  1. 人工智慧發展如同攀登無盡的雪山,問題不可避免但總能解決,體現了「無限的開始」這一概念。
  2. KIMI K2模型的研發重點在於提升基礎模型能力與智慧代理的泛化性,並採用如Million優化器等技術提高數據使用效率。
  3. 智慧代理的未來發展關鍵在於提升推理能力、工具使用的通用性,並透過AI參與自身研發來實現創新。

Summary:

這段對話主要圍繞人工智慧的發展哲學與KIMI K2模型的技術實踐展開。受訪者楊智玲以「無限的開始」為喻,指出AI發展如同攀登一座沒有頂峰的雪山,問題會不斷產生,但也總能找到解決方案,這是一個動態且持續的過程。

在技術層面,K2模型的研發重點在於打造一個優秀的基礎模型,並提升其智慧代理能力。團隊透過如Million優化器等創新,大幅提高了模型的「token效率」,讓模型能更有效地從數據中學習。同時,他們也致力於解決智慧代理在泛化性上面臨的挑戰,避免模型過度擬合於特定任務或工具。

展望未來,對話指出強化學習、多輪推理與工具使用是智慧代理能力規模化的關鍵。真正的突破可能在於讓AI能參與自身的研發過程,實現「創新」。此外,長上下文處理能力與更通用的任務設計,也是提升代理能力的重要方向。整體而言,AI的發展路徑並非線性,而是一個各項能力持續疊加、相互促進的動態演進過程。

FAQs

核心概念是「問題不可避免,但問題總能被解決」。這代表社會從靜態轉為動態,知識不斷創造,解決舊問題的同時會產生新問題,形成無限進步的循環。

K2基於MoE架構,專注於提升token效率,例如使用Million優化器讓模型更有效吸收數據。同時強化Agentic能力,讓模型能與環境多輪互動,完成複雜任務。

可透過讓AI參與自身訓練過程(如用AI做研究),並設計更通用的工具環境來提升泛化。避免過度擬合單一任務,並持續用強化學習擴展能力邊界。

Agent具備多輪互動與使用工具的能力,能連接外部世界(如網路、代碼),執行複雜任務。其目標是通用智能,而非單純模仿人類行為。

不一定線性。例如推理(Reasoning)與Agent能力可並行發展,但若要達到Agent最佳表現,仍需強大推理支持。創新(Innovation)與組織(Organization)也可能同時發生。

優勢在於透過互動採樣提升泛化性,比單純SFT更適應動態環境。挑戰則是評估指標不足,容易過擬合特定任務,需更多AI參與訓練來突破限制。

Chat with AI

Loading...

Pro features

Go deeper with this episode

Unlock creator-grade tools that turn any transcript into show notes and subtitle files.