DeepSeek V4.1-Flash 透過縮減記憶體需求,鎖定更便宜的 AI 代理
DeepSeek 的 V4.1-Flash 為長上下文 AI 代理減少了 KV cache 記憶體與輸入運算量,但其基準測試結果仍然不一致。
KV 快取 的最新新聞與分析
DeepSeek 的 V4.1-Flash 為長上下文 AI 代理減少了 KV cache 記憶體與輸入運算量,但其基準測試結果仍然不一致。
Google Research 已公開發布 TurboQuant,一套免訓練的 AI 記憶體壓縮演算法套件,可將 KV 快取記憶體使用量減少 6 倍,並將注意力運算加速 8 倍,可能使企業 AI 推論成本降低超過 50%。