Discussion about this post

User's avatar
Money Machine Newsletter's avatar

HBM solved a bandwidth problem. KV cache makes inference a capacity problem too, so HBF and pod-level context storage look more like new tiers than simple replacements.

No posts

Ready for more?