GPU训练集群中,IB(InfiniBand)vs RoCEv2 的网络选型大家怎么权衡的?我们实际落地时发现IB在大规模下稳定性确实好,但成本和交付周期压力大;RoCEv2在400G+场景下能不能真的跑到接近IB的all-reduce效率?有没有谁在生产环境跑过对比数据?
相似问题