defaults:
  modality: text_to_text
  server_engine: vllm
  benchmark_client: aiperf
  image: docker:vllm/vllm-openai:v0.21.0
  model_name: gpt-oss-120b
  model_path: openai/gpt-oss-120b
  num_gpus: 1
  gpu_type: H100
  n_trials: 1
  timeout_s: 1200
  server_endpoint: /v1/chat/completions
  parameter_space: vllm_default
  objective: e2e_output_token_throughput
  method: baseline
  setup_mode: uv_system_site_packages
  ignore_eos: true
  dataset_name: bailian_trace
  dataset_path: configs/qwen_bailian_traceA_B1_for_violin_tuner.jsonl
  vllm_server_args_config: gpt_oss_120b_fp4_h100_burstgpt_server_args.yaml
  default_extra_env:
    VLLM_DISABLE_COMPILE_CACHE: "1"
    PYTORCH_CUDA_ALLOC_CONF: "expandable_segments:True"
    PIP_CONSTRAINT: "benchmark_configs/skypilot/baselines/local/gpt_oss_120b_vllm_aiperf_constraints.txt"
  wandb_mode: disabled
  wandb_project: qwen-bailian
  wandb_entity: harmonic-labs
  wandb_tag:
    - vllm_gpt-oss-120b_qwen-bailian_traceA_B1_baseline_h100

sweep:
  seed: [0]
