cellink.resources.merge_1000g_plink_chromosomes#
- cellink.resources.merge_1000g_plink_chromosomes(plink_dir, prefix, output_prefix, chromosomes=None, plink_cmd='plink')#
Merge per-chromosome 1000G PLINK bfiles into a single genome-wide bfile.
Convenience wrapper for the standard PLINK merge workflow needed before passing a reference panel to
write_slurm_array_job(). The resulting.bed/.bim/.famfiles can be passed directly asplink_bfile.Skips the merge if the output
.bedfile already exists.- Parameters:
plink_dir (str or Path) – Directory containing the per-chromosome bfiles, as returned by
get_1000genomes_plink_files().prefix (str) – Filename prefix of the per-chromosome files (e.g.
"1000G.EUR.QC."so that chromosome 1 is1000G.EUR.QC.1.bed).output_prefix (str or Path) – Prefix for the merged output (e.g.
"data/1000G_EUR_merged"). PLINK appends.bed,.bim,.fam.chromosomes (list of int, optional) – Chromosomes to include. Defaults to autosomes 1-22.
plink_cmd (str, default="plink") – PLINK 1.9 executable name or full path.
- Return type:
- Returns:
Path
output_prefixas a Path (without extension).
Examples
>>> plink_dir, prefix = get_1000genomes_plink_files(population="EUR") >>> bfile = merge_1000g_plink_chromosomes(plink_dir, prefix, "data/1000G_EUR_merged") >>> # Pass bfile to write_slurm_array_job(plink_bfile=bfile, ...)