Deepseek v3.2...新的開源SOTA(12月1日)
精煉的資訊流 剛剛在地鐵上研究了deepseek的發佈...
下面快速整理了一下,
1/ Deepseek這次發佈,跑出來的效果是非常驚艷的好。
- 毫無疑問的開源sota;
- 各項能力基本上對標的也是閉源的前沿模型;
2/ 技術面不是說非常新,
- 還是沿用DSA + post train佔比超過10%也不是大新聞;
- 增量資訊是,用上次v3.2實驗版的這些東西,搞出來的效果這麼好,直接對標gemini3.0這種最新發佈的SOTA;
- 現在學術文獻已經不容易推動市場敘事;這次能力跑出來會更加直觀。
3/ 大家最擔心的算力塌縮?並不存在。
按照deepseek自己的說法,我們才和最前沿模型仍有差距。
換個角度看,模型層的「知識護城河」虛無縹緲,算力仍然是差異化因素。
Deepseek研究員Zhibin Gou的看法;gemini3證明pretrain..deepseek 3.2證明RL;
繼續在各個層面上做scaling;不要讓撞牆的噪音干擾。
更重的 RL、更長的 CoT、更多推理時計算力消耗;不會得出算力通縮的敘事。
4/ 從應用的角度看...肯定是利多的。引用星友的說法,
-
「對算力的需求永無止境,其實現在的token成本實用價值很低,只有通過硬體和模型創新把成本幾何級的降下去才能大規模應用」
-
對於想要靠「模型能力」建立應用護城河的公司(比如某OAI),倒是一個很大的敘事削弱。
5/ Deepseek自稱tokens的使用效率「inferior」...這裡在Speciale版本裡,用的tokens數量是更多了...(紅框那裡)..
6/ 彩蛋部分,Zhibin Gou說他們花了一年時間把v3推向極限...有些星球微信群友的看法是,把v3榨乾了,下一個版本終於要上v4了?
7/ 今天似乎是ChatGPT推出的3週年...
今晚市場應該會挺波動的...日本一些亂七八糟的宏觀因素+BTC攪亂;
下一個小的催化事件可能是亞馬遜的re:invent;早上群裡也做了一點點前瞻。
免責聲明:文章中的所有內容僅代表作者的觀點,與本平台無關。用戶不應以本文作為投資決策的參考。
您也可能喜歡
土耳其多管齊下緊急「滅火」:近200億美元基金清算、高管被捕、交易禁令
土耳其財長稱風險「暫時且可控」;監管方將清算七家資產管理公司管理的逾百隻基金,投資組合涉及逾35萬名投資者,對38人提出刑事指控,並對其實施為期兩年的交易禁令;多名金融機構高層遭逮捕、拘留或被限制出境;央行提高回購融資規模,放寬銀行資本要求,銀行間貨幣市場借款限額提高至此前十倍。土耳其銀行股指數週四一度上漲超過9%,大量中小型股票仍下跌。
黃仁勳:Nvidia明年芯片銷量將是今年兩倍,不能像管社群媒體那樣監管AI
黃仁勋反對照搬社交媒體監管,因為社群媒體是一種產品,而AI是支撐其他技術與產品的底層技術,監管應當落在產品,而非技術本身。他強調要嚴格測試,表示產品若不夠安全就應暫緩發佈,「AI安全至關重要」。
美聯儲升息後該買什麼?歷史上美股能源、科技表現優異,房地產落後,高盛:決定美股走勢的是升息速度
美聯儲首次加息後12個月美股表現:據杰富瑞,能源板塊平均回報22.4%居首、信息技術15.4%次之;據嘉信理財,房地產相對標普500落後4.3%,為11個板塊中最差。高盛表示,加息速度是影響美股的核心變數,目前若10年期美債收益率在一個月內上漲50個基點將構成「快速加息」壓力。
黃金大漲超2%,美元回吐美聯儲決議後的漲幅
