Skip to content

Instantly share code, notes, and snippets.

View d0choa's full-sized avatar
👨‍💻
Open Targets Platform Coordinator

David Ochoa d0choa

👨‍💻
Open Targets Platform Coordinator
View GitHub Profile
@d0choa
d0choa / metadata_SEO
Last active November 25, 2021 13:49
Some possible relevant fields for SEO
import pyspark.sql.functions as F
from pyspark import SparkConf
from pyspark.sql import SparkSession
sparkConf = SparkConf()
sparkConf = sparkConf.set('spark.hadoop.fs.gs.requester.pays.mode', 'AUTO')
sparkConf = sparkConf.set('spark.hadoop.fs.gs.requester.pays.project.id',
'open-targets-eu-dev')
# establish spark connection
@d0choa
d0choa / metrics_comparison.R
Created October 6, 2021 14:28
Compare AUCs and OR for 2 pipeline runs
library(tidyverse)
library(cowplot)
library(ggrepel)
df <- bind_rows(
read_csv("~/Projects/ot-release-metrics/data/21.06.5.csv"),
read_csv("~/Projects/ot-release-metrics/data/21.09.2.csv")
)
df %>%
@d0choa
d0choa / literatureFailedAndMatches.py
Last active August 27, 2021 19:45
Missing terms in the ontology (failed grounded entities) and the most frequently occurring terms on the same publications
import pyspark.sql.functions as F
from pyspark import SparkConf
from pyspark.sql import SparkSession
from pyspark.sql.window import Window
sparkConf = SparkConf()
sparkConf = sparkConf.set('spark.hadoop.fs.gs.requester.pays.mode', 'AUTO')
sparkConf = sparkConf.set('spark.hadoop.fs.gs.requester.pays.project.id',
'open-targets-eu-dev')
@d0choa
d0choa / otAnalytics.r
Last active September 29, 2021 15:37
Open Targets web accesses retrieved from Google Analytics API
library("tidyverse")
library("googleAnalyticsR")
library("zoo")
library("lubridate")
date_range <- c("2019-01-01", as.character(Sys.Date() - 1))
# Authorisation
ga_auth()
@d0choa
d0choa / nod2AF.py
Last active August 11, 2021 10:41
Overlay variants in NOD2 alphafold model
from pymol import cmd
cmd.load("/Users/ochoa/Downloads/AF-Q9HC29-F1-model_v1.cif")
cmd.bg_color("grey95")
cmd.set_color("veryHigh", [0, 83, 214])
cmd.set_color("confident", [101, 203, 243])
cmd.set_color("low", [255, 219, 19])
cmd.set_color("veryLow", [255, 125, 69])
@d0choa
d0choa / targetMissenseVariants.py
Last active September 15, 2021 17:24
Target specific (NOD2) coding variants (GWAS + ClinVar pathogenic)
import pyspark.sql.functions as F
from pyspark import SparkConf
from pyspark.sql import SparkSession
sparkConf = SparkConf()
spark = (
SparkSession.builder
.config(conf=sparkConf)
@d0choa
d0choa / NOD2_variants.py
Last active August 27, 2021 15:32
Pathogenic or L2G significant variants in L2G
import pyspark.sql.functions as F
from pyspark import SparkConf
from pyspark.sql import SparkSession
sparkConf = SparkConf()
sparkConf = sparkConf.set('spark.hadoop.fs.gs.requester.pays.mode', 'AUTO')
sparkConf = sparkConf.set('spark.hadoop.fs.gs.requester.pays.project.id', 'open-targets-eu-dev')
spark = (
SparkSession.builder
@d0choa
d0choa / newFingenSignals.py
Last active June 21, 2021 15:48
Interesting (validated by drug development) L2G signals found in Finngen but not available in previous sources. DISCLAIMER: No ontology expansion
import pyspark.sql.functions as F
from pyspark import SparkConf
from pyspark.sql import SparkSession
sparkConf = SparkConf()
spark = (
SparkSession.builder
.config(conf=sparkConf)
.master('local[*]')
@d0choa
d0choa / nonObviousTermSimilaritiesBasedOnW2V.py
Last active August 5, 2021 11:24
Find W2V similarities between terms in different EFO branches (e.g. disease. vs phenotype)
from pyspark.sql import SparkSession
from pyspark.context import SparkContext
from pyspark.sql import functions as F
from pyspark.ml.feature import Word2VecModel
from pyspark.sql.types import DoubleType
from pyspark.ml.feature import Normalizer
# establish spark connection
spark = (
SparkSession.builder
@d0choa
d0choa / knownDrugsForTargetGQL.py
Last active June 4, 2021 16:09
Querying the known drugs for a given target from Open Targets Platform GraphQL API
#!/usr/bin/env python3
# Import relevant libraries for HTTP request and JSON formatting
import requests
import json
# Set gene_id variable
gene_id = "ENSG00000244734"
# Build query string