星空人工智能好色先生网站網

讓大模型少做重複計算,中科曙光發布ParaCache

8月28日,2026中國國際大數據產業博覽會期間,中科曙光發布新一代詞元加速方案ParaCache。該方案通過保存並複用大模型已經完成的計算結果,減少不同請求、不同計算節點之間的重複計算。測試顯示,在約12萬詞元輸入下,ParaCache可使模型開始回答前的等待時間最高降低98.5%;高並發場景下,係統每秒處理的詞元量最高達到原來的27倍。

少做重複計算,讓算過的直接複用
 
隨著大模型進入長文本、多輪對話、知識庫問答和智能體等場景,大量相同或相似內容被反複計算,不僅增加等待時間,也持續消耗算力資源。
 
ParaCache的思路很直接:把已經算過的結果長時間保存下來,下次需要時直接複用。
 
該方案統一管理GPU顯存、CPU內存、固態硬盤和分布式存儲,根據使用頻率對計算結果進行分層存放和智能調度,並支持在不同請求、不同計算節點之間共享,實現“一次計算、多次使用”。
 
ParaCache以曙光分布式存儲ParaStor為基礎,並融合集中式全閃存儲FlashNexus,將存儲能力從保存原始數據進一步延伸至保存和複用大模型計算結果,在減少重複計算的同時,降低對高成本顯存的占用。
 
“多快好省”,推理效率全麵提升
 
ParaCache帶來的價值,可以概括為“多、快、好、省”。
 
 
“多”:高並發場景下,係統每秒處理的詞元量最高達到原來的27倍,同樣的硬件資源能夠承接更多業務請求。
 
“快”:輸入約12萬詞元時,單輪對話開始回答前的等待時間可降至0.4秒;連續20輪對話中,這一時間由43.1秒降至4.9秒。
 
“好”:兼容主流推理框架和國產AI加速卡,可在現有係統基礎上接入,降低部署和遷移成本。
 
“省”:高頻內容保留在顯存,其他內容轉移至成本更低的存儲設備,減少對高成本顯存和新增硬件資源的依賴。
 
目前,ParaCache已在國內某頭部互聯網企業在線推理業務中落地,模型開始回答前的平均等待時間降低50%以上;在同等硬件條件下,係統可承載的業務請求也提升數倍。
 
同時,ParaCache已在全國產十萬卡AI超集群曙光8000上完成驗證,可麵向長文本對話、知識庫問答、智能客服、智能體及高並發推理等場景。
 
中科曙光分布式存儲產品部總經理石靜表示,ParaCache不是簡單提升單張GPU的性能,而是通過減少重複計算,把更多算力用於處理新的任務。
 
過去,存儲主要負責保存數據。ParaCache進一步將模型已經完成的計算結果納入存儲和複用體係。對於大模型推理而言,少一次重複計算,就意味著少一段等待,也少一份算力消耗。
 
圍繞本屆數博會“詞元——數據要素價值釋放新路徑”主題,ParaCache提供了一條更具體的好色先生网站路徑:不僅保存數據,也保存數據在計算過程中產生的結果,讓一次計算形成的價值被持續複用。
 

星空人工智能好色先生网站網 倡導尊重與保護知識產權。如發現本站文章存在版權等問題,煩請30天內提供版權疑問、身份證明、版權證明、聯係方式等發郵件至1851688011@qq.com好色先生APP下载將及時溝通與處理。!:首頁 > 星空人工智能產業 > AI大模型 » 讓大模型少做重複計算,中科曙光發布ParaCache

感覺不錯,很讚哦! ()
分享到:

相關推薦

留言與評論(共有 0 條評論)
   
驗證碼:
網站地圖