Skip to content

Instantly share code, notes, and snippets.

@lgelape
lgelape / stopwords_pt.R
Last active March 7, 2023 18:45
Create a dataset with stopwords in Portuguese (from Stopwords ISO, tidytext and tm packages)
### STOPWORDS IN PORTUGUESE
## Create a unique dataset from several datasets with stopwords in Portuguese
# Lucas Gelape
# Packages
library(dplyr)
library(stringi)
library(readr)
<!DOCTYPE qgis_style>
<qgis_style version="2">
<symbols>
<symbol name="qartoon" force_rhr="0" clip_to_extent="1" alpha="1" type="fill">
<layer class="SimpleFill" enabled="1" locked="0" pass="0">
<prop v="3x:0,0,0,0,0,0" k="border_width_map_unit_scale"/>
<prop v="0,0,0,255" k="color"/>
<prop v="round" k="joinstyle"/>
<prop v="1,1" k="offset"/>
<prop v="3x:0,0,0,0,0,0" k="offset_map_unit_scale"/>
@sergiospagnuolo
sergiospagnuolo / coronavirus_rubrica_dados.R
Created April 13, 2020 14:49
pega dados do Portal da Transparência sobre coronavírus
library(tidyverse)
library(jsonlite)
library(lubridate)
library(deflateBR)
library(scales)
library(clipr)
# contexto: http://www.portaltransparencia.gov.br/comunicados/603503-portal-da-transparencia-divulga-gastos-federais-especificos-para-combate-ao-coronavirus
url <- "http://www.portaltransparencia.gov.br/despesas/consulta/resultado?paginacaoSimples=true&tamanhoPagina=500&offset=0&direcaoOrdenacao=desc&colunaOrdenacao=mesAno&de=01%2F01%2F2020&ate=30%2F04%2F2020&acao=00S4%2C21C2%2C21C0&colunasSelecionadas=linkDetalhamento%2CmesAno%2CorgaoSuperior%2CorgaoVinculado%2CunidadeGestora%2Cfuncao%2CsubFuncao%2Cprograma%2Cacao%2CprogramaGoverno%2CgrupoDespesa%2CelementoDespesa%2CmodalidadeDespesa%2CvalorDespesaEmpenhada%2CvalorDespesaLiquidada%2CvalorDespesaPaga%2CvalorRestoPago&_=1586706855177"
@sergiospagnuolo
sergiospagnuolo / analise_popularidade.R
Last active July 1, 2021 20:46
Código para captura de busca de tuítes
library(lubridate)
library(scales)
library(tidyverse)
# regulariza o formato da data do tweet, corrige para fuso certo
d$created_at <- as.POSIXct(strptime(d$created_at, "%Y-%m-%d %H:%M:%S"))
d$created_at <- d$created_at - hours(3)
d$dia <- as.POSIXct(strptime(d$created_at, "%Y-%m-%d"))
# cria coluna com minuto arredondado
library(tidyverse)
library(cepespR)
library(httr)
library(jsonlite)
library(knitr)
codmun <- read.csv("http://cepespdata.io/static/docs/cod_municipios.csv", header = T, sep = ";")
codmun <- codmun %>% filter(ANO_ELEICAO == 2016)
# do CEPESP: retorna apenas prefeitos eleitos em 2016
@sergiospagnuolo
sergiospagnuolo / beneficios.R
Last active January 31, 2020 20:45
Itera entre diversos anos para buscar resultados sobre benefícios pagos pelo governo federal
library(tidyverse)
library(jsonlite)
library(lubridate)
library(deflateBR)
library(scales)
# contexto: http://www.agricultura.gov.br/noticias/decreto-permite-pagamento-do-seguro-defeso-aos-pescadores-afetados-pelo-oleo
# http://www.portaltransparencia.gov.br/beneficios/consulta
url1 <- "http://www.portaltransparencia.gov.br/beneficios/consulta/resultado?paginacaoSimples=false&tamanhoPagina=250000&offset=0&direcaoOrdenacao=desc&colunaOrdenacao=mesAno&de="
url2 <- "&colunasSelecionadas=linkDetalhamento%2ClinguagemCidada%2CmesAno%2Cuf%2Cmunicipio%2Cvalor&_=1574703194664"
@mkearney
mkearney / impeachment-twitter-sentiment-plot.R
Last active October 12, 2020 20:52
Visualizing Sentiment Analysis of Tweets about the 2019 Impeachment Hearings
## install these if not already
pkgs <- c("remotes", "syuzhet", "tfse", "rtweet", "ggplot2", "dplyr", "tidyr")
if (length(pkgs <- pkgs[!pkgs %in% installed.packages("remotes")]) > 0) {
install.packages(pkgs)
}
## install from github
remotes::install_github("mkearney/dataviz")
remotes::install_github("mkearney/dict")
@sergiospagnuolo
sergiospagnuolo / notas.md
Last active April 29, 2020 01:33
Buscas no Twitter por minuto

Análise de buscas no Twitter no calor do momento

Este caderno contém funções para que seja possível medir o interesse de buscas no Twitter, com a finalidade de saber de algum assunto está realmente popular na rede social em certo momento. Por conta de limitações na API gratuita do Twitter, recomenda-se a utilização dessa metodologia para saber se um tópico foi popular no último dia ou período do dia.

Um exemplo de como isso foi usado pode ser visto neste tweet

Esta metodologia utiliza as bibliotecas de R Tidyverse e TwitteR para acessar os dados do Twitter.

Você também vai precisar de uma conta de desenvolvedor, a fim de conseguir todas as chaves de API para fazer as buscas (caso não tenha, garanto que é bem fácil).

# Regular modules for data science and visualization:
import numpy as np
import pandas
import seaborn as sns
import matplotlib.pyplot as plt
# Keras (2.2.4) and tensorflow (1.13).
import tensorflow as tf
import tensorflow_hub as hub
@sergiospagnuolo
sergiospagnuolo / cnpq_bolsas.R
Last active January 30, 2020 13:33
análises de bolsas CNPQ
# dados podem ser obtidos em: http://memoria.cnpq.br/painel-de-investimentos
library(tidyverse)
library(deflateBR)
library(lubridate)
d <- read.csv("cnpq_investimentos.csv", header = T)
d$Ano.Referência <- gsub("206", "2006", d$Ano.Referência)
d$ano <- as.Date(d$Ano.Referência, origin="2002-09-11", format = "%Y")