defaults:
  modality: text_to_text
  server_engine: vllm
  benchmark_client: aiperf
  image: docker:vllm/vllm-openai:v0.21.0
  model_name: Qwen3-8B
  model_path: Qwen/Qwen3-8B
  num_gpus: 1
  gpu_type: H100
  n_trials: 1
  timeout_s: 1200
  server_endpoint: /v1/chat/completions
  parameter_space: vllm_default
  objective: e2e_output_token_throughput
  method: baseline
  setup_mode: uv_system_site_packages
  ignore_eos: true
  dataset_name: bailian_trace
  dataset_path: configs/qwen_bailian_traceA_B1_for_violin_tuner.jsonl
  vllm_server_args_config: qwen3_8b_h100_qwen_bailian_server_args.yaml
  default_extra_env:
    VLLM_DISABLE_COMPILE_CACHE: "1"
    PYTORCH_CUDA_ALLOC_CONF: "expandable_segments:True"
  wandb_mode: disabled
  wandb_project: qwen-bailian
  wandb_entity: harmonic-labs
  wandb_tag:
    - vllm_qwen3-8b_qwen-bailian_traceA_B1_baseline_h100

sweep:
  seed: [0]
