• 229 TOPS 算力
  • 16GB GDDR6 显存
  • 可以在本地运行 14B 以上的模型,可以同时运行 4-5 个 2B 的模型。
  • token 时延 0.058 秒,吞吐量美妙 88 个 token,大概 150 字。

#42how##英特尔#

via 42号车库的微博