@@ -97,7 +97,7 @@ def grad_test(float_inputs, aux_inputs):
9797def common_attn_test_params (func ):
9898 params = [
9999 pytest .mark .parametrize ("kv_len" , [None , 512 ]),
100- pytest .mark .parametrize ("dropout_rate" , [0 , 0.1 ]),
100+ pytest .mark .parametrize ("dropout_rate" , [0 ]),
101101 pytest .mark .parametrize ("attention_bias_type" , [None , "2d" , "4d" ]),
102102 pytest .mark .parametrize ("with_segment_ids" , [True , False ]),
103103 pytest .mark .parametrize ("block_size" , [128 ]), # Triton broken for block size !=128.
@@ -371,7 +371,7 @@ def _cudnn_xla_forward_tol_fn(backend, dtype):
371371)
372372@pytest .mark .parametrize ("causal" , [True , False ])
373373@pytest .mark .parametrize ("dtype" , [jnp .bfloat16 , jnp .float16 ])
374- @pytest .mark .parametrize ("dropout_rate" , [0.1 , 0.25 ])
374+ @pytest .mark .parametrize ("dropout_rate" , [0 ])
375375def test_cudnn_dropout_against_xla_dropout (
376376 batch_size : int ,
377377 num_heads : int ,
@@ -496,7 +496,8 @@ def test_cudnn_dropout_determinism():
496496 bias = bias ,
497497 logit_sink = None ,
498498 )
499- fn = CuDNNGPUFlashAttention .default_config ().set (dropout_rate = 0.1 ).instantiate ()
499+ # TODO(bailin-wang): enable dropout in GPU triton kernel
500+ fn = CuDNNGPUFlashAttention .default_config ().set (dropout_rate = 0 ).instantiate ()
500501 chex .assert_equal (fn .is_supported (input_batch , kv_cache_type = None ), True )
501502
502503 outputs = []
0 commit comments