法國初創公司 Kog 宣布了一項提高普通數據中心 GPU 上 AI 推理速度的策略。Kog 採用了同時設計軟體和模型結構的方法,以提高 NVIDIA 和 AMD GPU 的使用效率。Kog 表示,為了改善 AI 代理對請求的響應速度,已將運行時、GPU 核心和模型架構整合為優化的管道。根據 5 月 28 日發布的 Kog 推理引擎技術預覽,8 顆 AMD MI300X GPU 每個請求每秒可處理 3000 個輸出標記,而在相同條件下的 8 顆 NVIDIA H200 GPU 則記錄了每秒 2100 個輸出標記。Kog 將 AI 編碼代理和代理型工作流程作為主要應用對象。6 月 24 日在 Hugging Face 上發布的 Laneformer 2B 模型擁有 23 億個參數,並顯示出 HumanEval+ 45.1% 和 MBPP+ 51.6% 的性能。Kog 在 8 月的 LinkedIn 貼文中表示,在實際演示中記錄了每秒 2857 個標記。然而,對於速度數據的解釋存在爭議,並且也指出根據模型大小和硬體進行比較的困難。Kog 的目標是在現有的 GPU 基礎設施上實現低延遲。
本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。























