_target_:meds_torch.data.datamodule.MEDSDataModule.initializedataset_cls:meds_torch.data.components.pytorch_dataset.PytorchDataset# Path paramsdata_dir:${paths.data_dir}meds_cohort_dir:${paths.meds_cohort_dir}cache_dir:${paths.data_dir}/.pytorch_dataset_cache_dir/code_metadata_fp:${paths.data_dir}/metadata/codes.parquetschema_files_root:${paths.data_dir}/tokenization/schemastasks_root:${paths.meds_cohort_dir}/taskssplit_names:train:train# training data is in ${paths.data_dir}/${split_names.train}**/*.nrtvalidate:tuning# tuning data is in ${paths.data_dir}/${split_names.validate}/**/*.nrttest:held_out# held_out data is in ${paths.data_dir}/${split_names.test}/**/*.nrt# Prediction paramspredict_dataset:val# train, val, or test, which dataset to predict on# Task paramstask_root_dir:nulltask_name:nulltask_label_path:${data.task_root_dir}/${data.task_name}.parquettask_info_path:${data.task_root_dir}/${data.task_name}_info.json# Split paramstrain_subset_size:nulltrain_subset_seed:1# Tokenization paramscollate_type:triplettokenizer:"emilyalsentzer/Bio_ClinicalBERT"do_include_subject_id:falsedo_include_subsequence_indices:falsedo_include_start_time_min:falsedo_include_end_time:falsedo_include_prediction_time:falsedo_prepend_static_data:falsenum_value_code_quantiles:null# Sequence Paramsmax_seq_len:512min_seq_len:1subsequence_sampling_strategy:randomseq_padding_side:righttext_max_seq_len:8do_flatten_tensors:true# Data Loader paramsdataloader:batch_size:128# Needs to be divisible by the number of devices (e.g., if in a distributed setup)num_workers:0pin_memory:False# Tokenization paramsvocab_size:${get_vocab_size:${data.code_metadata_fp}, ${data.postpend_token}}eos_offset:1EOS_TOKEN_ID:${get_eos_token_id:${data.vocab_size}, ${data.eos_offset}}postpend_token:${model.backbone.postpend_token}