diff --git a/workflow/rules/sites.smk b/workflow/rules/sites.smk index 493d06c..9ff7739 100644 --- a/workflow/rules/sites.smk +++ b/workflow/rules/sites.smk @@ -31,8 +31,6 @@ rule filter_mpileup_all_sites: output: sites_pass = temp(OUTDIR / "all_sites" / "{sample}.filtered_sites.tsv"), sites_fail = temp(OUTDIR / "all_sites" / "{sample}.fail_sites.tsv"), - log: - LOGDIR / "filter_mpileup_all_sites" / "{sample}.txt" run: import pandas as pd df = pd.read_csv(input[0], sep="\t") diff --git a/workflow/scripts/calculate_dnds.R b/workflow/scripts/calculate_dnds.R index a0495cb..3e37a4d 100644 --- a/workflow/scripts/calculate_dnds.R +++ b/workflow/scripts/calculate_dnds.R @@ -19,7 +19,7 @@ variants <- read_delim( col_select = c( "SAMPLE", "VARIANT_NAME", - "REGION", + "CHROM", "ALT_FREQ", "SYNONYMOUS", "POS" diff --git a/workflow/scripts/fill_all_sites.R b/workflow/scripts/fill_all_sites.R index 3cb8d13..045ec61 100644 --- a/workflow/scripts/fill_all_sites.R +++ b/workflow/scripts/fill_all_sites.R @@ -17,26 +17,25 @@ variants <- read_tsv(snakemake@input[["variants"]]) # Create a mapping of variant names to their genomic position variant_coords <- variants %>% - select(VARIANT_NAME, REGION, POS) %>% + select(VARIANT_NAME, CHROM, POS) %>% distinct() log_info("Reading filtered sites") sites <- read_tsv(snakemake@input[["sites"]]) %>% - select(SAMPLE, POS) %>% # TODO: consider region/chrom - distinct() %>% + distinct(SAMPLE, POS) %>% # TODO: consider region/chrom mutate(FILTER_PASS = TRUE) log_info("Processing variants") all_variants <- variants %>% # Select minimal columns - select(VARIANT_NAME, REGION, SAMPLE, ALT_FREQ) %>% + distinct(VARIANT_NAME, CHROM, SAMPLE, ALT_FREQ) %>% # Handle duplicates - group_by(SAMPLE, VARIANT_NAME, REGION) %>% + group_by(SAMPLE, VARIANT_NAME, CHROM) %>% summarise(ALT_FREQ = sum(ALT_FREQ, na.rm = TRUE), .groups = "drop") %>% # Complete with NA - complete(SAMPLE, VARIANT_NAME, REGION) %>% + complete(SAMPLE, VARIANT_NAME, CHROM) %>% # Assign genomic positions for all combinations - left_join(variant_coords, by = c("REGION", "VARIANT_NAME")) %>% + left_join(variant_coords, by = c("CHROM", "VARIANT_NAME")) %>% # Merge filtered sites # TODO: consider region/chrom left_join(sites, by = c("SAMPLE", "POS")) %>% diff --git a/workflow/scripts/merge_annotation.R b/workflow/scripts/merge_annotation.R index 9c322c4..4e1ee2f 100644 --- a/workflow/scripts/merge_annotation.R +++ b/workflow/scripts/merge_annotation.R @@ -75,7 +75,8 @@ merged <- left_join( ) %>% mutate( SAMPLE = snakemake@params$sample - ) + ) %>% + rename(CHROM = REGION) log_info("Saving results") write_tsv( diff --git a/workflow/scripts/report/af_time_correlation_data.R b/workflow/scripts/report/af_time_correlation_data.R index 90daf30..ac7c6ff 100644 --- a/workflow/scripts/report/af_time_correlation_data.R +++ b/workflow/scripts/report/af_time_correlation_data.R @@ -19,14 +19,14 @@ variants <- read_delim( col_select = c( "VARIANT_NAME", "SAMPLE", - "REGION", + "CHROM", "ALT_FREQ", "POS" ) ) %>% # Fill positions without alt frequency with NA complete( - nesting(REGION, VARIANT_NAME, POS), + nesting(CHROM, VARIANT_NAME, POS), SAMPLE, fill = list(ALT_FREQ = NA) ) diff --git a/workflow/scripts/report/nv_panel_data.R b/workflow/scripts/report/nv_panel_data.R index 5cb6880..971062c 100644 --- a/workflow/scripts/report/nv_panel_data.R +++ b/workflow/scripts/report/nv_panel_data.R @@ -19,7 +19,7 @@ variants <- read_delim( snakemake@input$variants, col_select = c( "SAMPLE", - "REGION", + "CHROM", "POS", "ALT", "VARIANT_NAME", @@ -77,7 +77,7 @@ if (nrow(variants) == 0) { log_warning("No variants found, using an empty table") variants <- tibble( SAMPLE = date_order, - REGION = as.character(NA), + CHROM = as.character(NA), VARIANT_NAME = as.character(NA), ALT_FREQ = as.numeric(NA), EFFECT = as.character(NA), diff --git a/workflow/scripts/report/polymorphic_sites_over_time_data.R b/workflow/scripts/report/polymorphic_sites_over_time_data.R index 1100587..f48ccb1 100644 --- a/workflow/scripts/report/polymorphic_sites_over_time_data.R +++ b/workflow/scripts/report/polymorphic_sites_over_time_data.R @@ -42,7 +42,7 @@ if (nrow(sites) == 0) { log_warn("There are none, using an empty table and no linear regression") sites <- tibble( SAMPLE = date_order, - REGION = as.character(NA), + CHROM = as.character(NA), VARIANT_NAME = as.character(NA), ALT_FREQ = as.numeric(NA), EFFECT = as.character(NA),