Alloy Compute 拆分推理工作负载
Alloy Compute 声称构建了一套 AI 推理系统,该系统能够在 AMD 图形芯片与可编程加速器之间拆分语言模型任务,从而缩短响应时间。
该公司于 7 月 31 日将这一设计描述为一种解耦合架构——即把模型执行的每个阶段发送给最适合的处理器。大多数推理系统会在单一芯片类型上运行所有阶段。AMD 图形处理器负责提示预填充和注意力机制,而 FPGA 加速器则处理令牌解码和混合专家层。
Alloy Compute 尚未公布基准测试结果,并表示仍在整合系统,同时测量延迟、吞吐量、能耗以及两种芯片之间的数据传输。客户评估项目尚未启动。
Nour De Vos 支持延迟保障
创始人兼首席执行官 Nour de Vos 表示,预填充、注意力机制和令牌生成对硬件提出了不同的要求,因此在单一架构上运行整个模型会浪费算力。该公司称,其准备保证首次令牌响应低于 200 毫秒,但这仅适用于在模型、输入长度和并发性方面严格遵守设定限制的部署场景。早期工作涵盖量化后的 Qwen 模型。
De Vos 从大规模加密货币挖矿领域进入 AI 基础设施,在那个领域,利润取决于保持机器繁忙和降低电费。他曾表示,正是这种将芯片、内存、网络和软件视为一个整体的系统级思维,塑造了当前的设计。

交易所
交易所排行榜
24小时成交排行榜
人气排行榜
交易所比特币余额
交易所资产透明度证明
去中心化交易所
资金费率
资金费率热力图
爆仓数据
清算最大痛点
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
ETF追踪
索拉纳ETF
瑞波币ETF
香港ETF
比特币持币公司
加密资产反转
以太坊储备
HyperLiquid钱包分析
Hyperliquid鲸鱼监控
大额转账
链上异动
比特币回报率
稳定币市值
期权分析
新闻
文章
财经日历
专题
钱包
合约计算器
账号安全
资讯收藏
自选币种
我的关注