
OpenAI announced up to 300 tokens per second with Ultrafast. According to SemiAnalysis, it’s running on NVIDIA GPUs. That’s particularly interesting given its partnership with Cerebras specifically for ultra-low-latency inference. According to SemiAnalysis, OpenAI is using
