Skip to content

Commit dc880ee

Browse files
author
Mark Saroufim
committed
Rename submission modes: benchmark→private, leaderboard→public
Updates all eval.py files to use new mode values: - mode == "benchmark" → mode == "private" - mode == "leaderboard" → mode == "public"
1 parent 64e88da commit dc880ee

11 files changed

Lines changed: 24 additions & 24 deletions

File tree

problems/amd/eval.py

Lines changed: 2 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -349,10 +349,10 @@ def main():
349349
with mp_context.Pool(1) as pool:
350350
if mode == "test":
351351
return run_testing(logger, pool, tests)
352-
if mode == "benchmark":
352+
if mode == "private":
353353
return run_benchmarking(logger, pool, tests)
354354

355-
if mode == "leaderboard":
355+
if mode == "public":
356356
# warmup
357357
run_single_benchmark(pool, tests[0], False, 100, 1e7)
358358
logger.log("benchmark-count", len(tests))

problems/amd/mla-decode/eval.py

Lines changed: 3 additions & 3 deletions
Original file line numberDiff line numberDiff line change
@@ -294,10 +294,10 @@ def main():
294294
if mode == "test":
295295
return run_testing(logger, tests)
296296

297-
if mode == "benchmark":
297+
if mode == "private":
298298
return run_benchmarking(logger, tests)
299-
300-
if mode == "leaderboard":
299+
300+
if mode == "public":
301301
warm_up(tests[0])
302302
result = benchmark(tests[-1], True, 100, 30e9)
303303
if isinstance(result, Stats):

problems/amd_distributed/eval.py

Lines changed: 2 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -546,10 +546,10 @@ def main():
546546
with mp_context.Pool(n_gpus) as pool:
547547
if mode == "test":
548548
return run_testing(logger, pool, tests)
549-
if mode == "benchmark":
549+
if mode == "private":
550550
return run_benchmarking(logger, pool, tests)
551551

552-
if mode == "leaderboard":
552+
if mode == "public":
553553
# warmup
554554
run_single_benchmark(pool, tests[0], False, 100, 1e7)
555555
logger.log("benchmark-count", len(tests))

problems/bioml/trimul/eval.py

Lines changed: 2 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -352,10 +352,10 @@ def main():
352352
with mp_context.Pool(1) as pool:
353353
if mode == "test":
354354
return run_testing(logger, pool, tests)
355-
if mode == "benchmark":
355+
if mode == "private":
356356
return run_benchmarking(logger, pool, tests)
357357

358-
if mode == "leaderboard":
358+
if mode == "public":
359359
# warmup
360360
run_single_benchmark(pool, tests[0], False, 100, 1e7)
361361
logger.log("benchmark-count", len(tests))

problems/nvidia/eval.py

Lines changed: 2 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -449,10 +449,10 @@ def main():
449449
with mp_context.Pool(1) as pool:
450450
if mode == "test":
451451
return run_testing(logger, pool, tests)
452-
if mode == "benchmark":
452+
if mode == "private":
453453
return run_benchmarking(logger, pool, tests)
454454

455-
if mode == "leaderboard":
455+
if mode == "public":
456456
run_single_benchmark(pool, tests[0], False, 1000, 5e8)
457457
logger.log("benchmark-count", len(tests))
458458
passed = True

problems/nvidia/eval_better_bench.py

Lines changed: 2 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -472,10 +472,10 @@ def main():
472472
with mp_context.Pool(1, initializer=_init_worker) as pool:
473473
if mode == "test":
474474
return run_testing(logger, pool, tests)
475-
if mode == "benchmark":
475+
if mode == "private":
476476
return run_benchmarking(logger, pool, tests)
477477

478-
if mode == "leaderboard":
478+
if mode == "public":
479479
# Warmup all test shapes to ensure consistent benchmarking
480480
for test in tests:
481481
run_single_benchmark(pool, test, False, 1000, 5e8)

problems/nvidia/eval_better_bench_grouped_gemm.py

Lines changed: 2 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -491,10 +491,10 @@ def main():
491491
with mp_context.Pool(1, initializer=_init_worker) as pool:
492492
if mode == "test":
493493
return run_testing(logger, pool, tests)
494-
if mode == "benchmark":
494+
if mode == "private":
495495
return run_benchmarking(logger, pool, tests)
496496

497-
if mode == "leaderboard":
497+
if mode == "public":
498498
# Warmup all test shapes to ensure consistent benchmarking
499499
for test in tests:
500500
run_single_benchmark(pool, test, False, 50, 5e8)

problems/nvidia/nvfp4_gemm/eval.py

Lines changed: 2 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -452,10 +452,10 @@ def build_test_string(tests: list[dict]):
452452
with mp_context.Pool(1) as pool:
453453
if mode == "test":
454454
return run_testing(logger, pool, tests)
455-
if mode == "benchmark":
455+
if mode == "private":
456456
return run_benchmarking(logger, pool, tests)
457457

458-
if mode == "leaderboard":
458+
if mode == "public":
459459
# Step 1: Compile kernel once (outside of timing)
460460
logger.log("compile", "start")
461461
compile_success, compile_error = pool.apply(_compile_kernel_once)

problems/nvidia/nvfp4_group_gemm/eval.py

Lines changed: 2 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -392,10 +392,10 @@ def main():
392392
with mp_context.Pool(1) as pool:
393393
if mode == "test":
394394
return run_testing(logger, pool, tests)
395-
if mode == "benchmark":
395+
if mode == "private":
396396
return run_benchmarking(logger, pool, tests)
397397

398-
if mode == "leaderboard":
398+
if mode == "public":
399399
# warmup
400400
run_single_benchmark(pool, tests[0], False, 100, 1e7)
401401
logger.log("benchmark-count", len(tests))

problems/pmpp/eval.py

Lines changed: 3 additions & 3 deletions
Original file line numberDiff line numberDiff line change
@@ -246,10 +246,10 @@ def main():
246246
if mode == "test":
247247
return run_testing(logger, tests)
248248

249-
if mode == "benchmark":
249+
if mode == "private":
250250
return run_benchmarking(logger, tests)
251-
252-
if mode == "leaderboard":
251+
252+
if mode == "public":
253253
warm_up(tests[0])
254254
result = benchmark(tests[-1], True, 100, 30e9)
255255
if isinstance(result, Stats):

0 commit comments

Comments
 (0)