DeepSeek危險了?「AI教母」出手太震撼 頂尖AI模型花不到50美元

最高獎金
  • 首存1000即獲額外1000
  • 每日首存5000送88,10000送188
  • 每日流水10萬即送288
最高體驗金
  • 註冊送200,加入LINE@官方帳號,再贈168 體驗金
  • USDT 入金, 再贈388 體驗金
  • 儲值滿5,000即贈888
體驗金送168
  • 會員註冊及完成實名審核後,可申請體驗金168
  • 新會員首次儲值1000送1000
日本人團隊+送1000
  • 註冊即贈388電子體驗金
  • 新會員30天內儲值10000送888,50000送1888
  • 新會員儲值1000送1000
台網紅林倪安推薦
  • 台灣網紅、直播主林倪安(Nian)推薦
  • 首存100 USDT 即可申請 18 USDT
  • 台灣首選虛擬貨幣娛樂城(高匿名性)
Av界大金主
  • 常常在P站贊助(可在P站搜1win)
  • 500%首儲獎金,加密貨幣玩家首選
  • 巨無霸級的娛樂城, 提供超過 10,000 款遊戲
mydesign6368
6,635 瀏覽
「AI教母」李飛飛團隊用50美元復製DeepSeekR1。(示意圖/達志影像/shutterstock)

「AI教母」李飛飛團隊用50美元復製DeepSeekR1。(示意圖/達志影像/shutterstock)

DeepSeek強敵來了!被譽為「AI教母」的知名華裔美籍科學家李飛飛領導的團隊,以低於50美元(約台幣1600元)的雲端運算成本,成功訓練出名為「s1」的人工智慧推理模型。此模型在數學和編碼能力測驗中的表現,據稱媲美 OpenAI o1和DeepSeek R1等尖端推理模型。

科創板日報、新浪科技報導,李飛飛團隊的s1模型並非從頭訓練,而是建立在阿里巴巴的Qwen2.5 和 Google DeepMind的Gemini 2.0 Flash Thinking的基礎之上。他們蒐集了1000個精心挑選的問題及其解答,並透過記錄 Gemini 2.0 Flash 的思考過程,建立訓練資料集,利用這些資料,微調了Qwen2.5-32B-Instruct模型,創造出s1。

大陸某知名大模型公司CEO表示,李飛飛團隊的成就實際上是利用從 Google 模型中擷取的 1000 個樣本來微調通義千問模型。這種微調的成本固然低廉,但其優異表現仍有賴於既有模型的基礎。

上海交通大學人工智慧學院副教授謝偉迪指出,s1以通義千問模型為基礎,因此即使使用有限的樣本資料,也能產生新的推理模型。然而,如果更換其他基礎模型,新模型的效能並不會提升。因此,真正在背後發揮效能的關鍵是Qwen模型,而非 s1。

阿里雲證實,李飛飛團隊透過利用阿里開源的Qwen2.5-32B-Instruct模型進行監督微調,在16個輝達H100 GPU上僅花費26分鐘就訓練出s1-32B模型,其數學和編碼能力與OpenAI o1和DeepSeek R1 等尖端推理模型不相上下。

發表評論

相關報導