OpLexicon é um léxico de sentimento para a língua portuguesa, desenvolvido na PUCRS. Página original: https://www.inf.pucrs.br/linatural/wordpress/recursos-e-ferramentas/oplexicon/
oplexicon_v2.1/ ORIGINAL, somente leitura: nunca editar
lexico_v2.1txt léxico V2.1 (nome original, sem ponto antes de "txt")
SHA256SUMS
oplexicon_v3.0/ ORIGINAL, somente leitura: nunca editar
lexico_v3.0.txt léxico como distribuído (UTF-8, LF, sem cabeçalho)
README notas originais da versão 3.0
SHA256SUMS hashes que provam que o original está intacto
derivados/ GERADO por gerar.py: não editar à mão
oplexicon_v2.1.csv versões limpas, com cabeçalho, uma entrada por termo+classe
oplexicon_v3.0.csv
descartes_v2.1.csv cada linha removida, com nº da linha original e motivo
descartes_v3.0.csv
referencias/ artigos (PDF) e citações (BibTeX)
gerar.py original -> derivados/
validar.py verifica original e derivados
Use derivados/oplexicon_v3.0.csv para análises (ou oplexicon_v2.1.csv para reproduzir trabalhos com a V2.1). O original fica como referência e fonte.
- V2.1 (2012): lista de palavras com categoria morfológica e polaridade positiva, negativa ou neutra. Formato
termo,classe,polaridade, 31.149 entradas. - V3.0: polaridade de alguns adjetivos da V2.1 revisada por linguistas; adiciona o campo de origem da classificação.
O servidor original (ontolp.inf.pucrs.br) está fora do ar e o Wayback Machine só guardou redirecionamentos dos zips. Os arquivos vêm do pacote R sillasgonzaga/lexiconPT, que os baixou do servidor original em 2017:
| Zip | SHA-256 | Data interna |
|---|---|---|
oplexicon_v2.1.zip |
3f01ec65483c93597c68d099b4bc3f3b3373da9c5a0893c3b50bec748abead22 |
27/06/2012 |
oplexicon_v3.0.zip |
554cc8c66802a6f47a15756658b3765b3d32e6710b1862633af5ed74d0ffe8df |
lexico_v3.0.txt é idêntico (mesmo SHA-256) ao do zip do lexiconPT e ao do repositório do autor, marlovss/OpLexicon.
Uma entrada por linha, 4 campos separados por vírgula:
termo,classe,polaridade,origem
| Campo | Valores |
|---|---|
| termo | palavra, emoticon ou hashtag |
| classe | adj, vb, emot, htag, vb adj, vb adv, vb n prp, vb det n prp |
| polaridade | -1 negativa, 0 neutra, 1 positiva |
| origem | M revisada manualmente, A atribuída automaticamente |
O original tem duplicatas, termos com polaridades conflitantes e entradas espúrias. gerar.py aplica, em ordem:
- Descarta entradas espúrias: erros de planilha (
Erro:510,Erro:511) e codificação corrompida (¬). - Reduz duplicatas exatas a uma entrada.
- Em conflito de termo+classe, mantém a revisão manual (
M) e descarta a automática (A), já que a revisão é o propósito da V3.0. Ex.:fácil,adjfica1(M), não0(A). Não se aplica à V2.1, que não tem o campo de origem. - Conflito restante com a mesma origem é descartado (hoje não há nenhum).
Nada some sem registro: entradas + descartes = linhas do original.
python gerar.pypython validar.pyvalidar.py falha (código 1) se o original tiver sido alterado, se o formato fugir do esperado, se alguma linha não for contabilizada ou se derivados/ estiver desatualizado ou editado à mão.
Souza, M.; Vieira, R. Sentiment Analysis on Twitter Data for Portuguese Language. 10th International Conference on Computational Processing of the Portuguese Language (PROPOR), 2012. [pdf] [bib]
Souza, M.; Vieira, R.; Busetti, D.; Chishman, R.; Alves, I. M. Construction of a Portuguese Opinion Lexicon from multiple resources. 8th Brazilian Symposium in Information and Human Language Technology (STIL), 2011. [pdf] [bib]
- Léxico (
oplexicon_v2.1/,oplexicon_v3.0/,derivados/): © Souza, Vieira et al. (PUCRS), sob Creative Commons Atribuição-Uso Não-Comercial-Compartilhamento pela mesma Licença 2.5 Brasil, conforme a página de download original. Uso comercial não é permitido.derivados/é obra derivada e segue a mesma licença. - Artigos (
referencias/): pertencem aos autores e editoras; incluídos como estavam na página oficial. Solicitações de remoção serão atendidas. - Scripts (
gerar.py,validar.py,.github/): MIT.
Cada release traz os CSVs de derivados/ como anexos, gerados e validados pelo CI.