Ariani Di Felippo
LENomes em Citação: DI FELIPPO, Ariani; FELIPPO, ARIANI; FELIPPO, ARIANI DI; Di Felippo, A.
Departamento de Letras
Resumo do Currículo Lattes
Possui graduação em Licenciatura em Letras pela Universidade Federal de São Carlos (UFSCar) (2000), mestrado (2004) e doutorado (2008) em Linguística e Língua Portuguesa pela Universidade Estadual Paulista Júlio de Mesquita Filho (UNESP/Araraquara). Desde 2009, é docente do Departamento de Letras (DL) da UFSCar, onde atualmente ocupa o cargo de Professora Associada (Nível 4). Desde 2011, integra o corpo docente do Programa de Pós-Graduação em Linguística (PPGL/UFSCar), orientando pesquisas em diferentes áreas do Processamento de Línguas Naturais (PLN). É pesquisadora do Núcleo Interinstitucional de Linguística Computacional (NILC) o mais antigo e um dos maiores grupos de pesquisa em PLN no Brasil , que se aproxima de três décadas de atuação e reúne pesquisadores de diversas instituições. Realizou pós-doutorado (20152016) no Department of Computer and Information Science da Universidade da Pensilvânia (UPenn, Filadélfia/EUA), onde investigou questões de correferência aplicadas à Sumarização Automática Multidocumento. Coordenou projetos científicos com diferentes fontes de financiamento e, atualmente, integra um projeto de cooperação universidadeempresa em parceria com a Motorola. É também pesquisadora sênior do Centro de Inteligência Artificial da USP (C4AI), um Centro de Pesquisa em Engenharia financiado pela FAPESP e pela IBM. Participa ativamente da comunidade nacional e internacional de PLN, publicando regularmente nos principais eventos da Sociedade Brasileira de Computação (SBC), como o Simpósio em Tecnologia da Informação e da Linguagem Humana (STIL), o Encontro Nacional de Inteligência Artificial e Computacional (ENIAC) e workshops associados, bem como em fóruns da área de Linguística, como o Encontro de Linguística de Corpus (ELC) e a Jornada de Descrição do Português (JDP), sendo também membro frequente de seus comitês de programa. No cenário internacional, tem presença constante em eventos de destaque, como o International Conference on Computational Processing of Portuguese Language (PROPOR). Destaca-se, ainda, sua atuação na Comissão Especial de PLN da SBC, da qual fez parte por mais de um mandato., e na organização das primeiras edições de eventos que permanecem ativos até hoje, entre eles a JDP e o Workshop de Iniciação Científica em Tecnologia da Informação e da Linguagem Humana (TILic).
Painel de Gráficos e Inteligência de Produção
Análise cronológica da produção científica, intelectual e formação de recursos humanos ao longo dos anos.
Evolução da Produção por Categoria (Histórico Anual)
2000 - 2026Distribuição por Categoria
162 itens
Histórico de Orientações Concluídas por Nível
54 concluídas, 8 em andamento
Produção Científica Indexada em Bases Internacionais
Cruzamento entre os artigos publicados pelo docente, as revistas científicas e as bases internacionais de indexação.
Trabalhos por Base de Indexação
Distribuição dos artigos publicados pelo docente nas bases de dados indexadoras.
Evolução Temporal da Indexação por Base (2000–2026)
Histórico comparativo do número anual de artigos publicados em periódicos indexados.
Principais Colaboradores e Rede de Coautoria
Pesquisadores e docentes com maior volume de trabalhos e produções em parceria
Palavras-chave dos Trabalhos
Cadastradas pelo autor nos artigos e produções no Lattes
Temas e Termos Frequentes
Sintagmas e conceitos mais recorrentes nos títulos
Artigos em Periódicos (24)
DANTEStocks: A Multi-Layered Annotated Corpus of Stock Market Tweets for Brazilian Portuguese
The DANTEStocks Corpus: an analysis of the distribution of Universal Dependencies-based Part-of-Speech tags
Termos do mercado financeiro: um estudo do corpus DANTEStocks
The AMR-PT corpus and the semantic annotation of challenging sentences from journalistic and opinion texts
Evaluating a typology of signals for automatic detection of complementarity
An investigation of linguistic problems in automatic multi-document summaries / Uma investigação de problemas linguísticos em sumários automáticos multidocumento
CARACTERIZAÇÃO DA COMPLEMENTARIDADE TEMPORAL: SUBSÍDIOS PARA SUMARIZAÇÃO AUTOMÁTICA MULTIDOCUMENTO
Exploring content selection strategies for Multilingual Multi-Document Summarization based on the Universal Network Language (UNL)
The agility construct on project management theory
Anotação de Sentidos de Verbos em Textos Jornalísticos do Corpus CSTNews
A survey of automatic term extraction for Brazilian Portuguese
Manual Typification of Source Texts and Multi-document Summaries Alignments
As abordagens teóricas e os formalismos para o tratamento computacional do significado lexical
Uma metodologia para o desenvolvimento de Wordnets terminológicas em português do Brasil
A interlíngua e o alinhamento léxico-conceitual da base de dados bilíngue REBECA
O desenvolvimento de uma base léxico-conceitual bilíngue (inglês norte-americano/português brasileiro)
A interlíngua da base lexical bilíngue REBECA
O processamento automático de línguas naturais enquanto engenharia do conhecimento linguístico
Uma introdução à engenharia do conhecimento linguístico
Extração de informações lógico-conceituais de dicionários para a elaboração de léxicos computacionais
Os adjetivos valenciais do português e sua representação lingüístico-computacional
Representação formal dos adjetivos valenciais com vistas ao Processamento Automático do Português
Modelo lingüístico-computacional da estrutura argumental de adjetivos valenciais do português do Brasil
Aspectos da construção de um revisor gramatical automático para o português
Capítulos de Livros Publicados (12)
Applying Lexical-Conceptual Knowledge for Multilingual Multi-document Summarization
Corpus annotation of textual aspects in multi-document summaries
Manual Alignment of News Texts and their Multi-document Human Summaries
Alignment-Based Sentence Position Policy in a News Corpus for Multi-document Summarization
Anotação e descrição de corpus para a investigação de estratégias de sumarização humana multidocumento
Extração automática de termos a partir de corpus e sua validação para a construção de wordnets terminológicas em português do Brasil
O projeto do corpus para a construção de uma wordnet terminológica
Glossário de Revestimento Cerâmico
Processamento Automático das Línguas Naturais (PLN) para iniciantes
Ontologias lingüísticas aplicadas ao processamento automático das línguas naturais: o caso das redes wordnets
Compilação de corpus em língua portuguesa na área de Nanociência/Nanotecnologia: problemas e soluções.
Dos olhares sobre o léxico: diferenças e semelhanças
Trabalhos em Anais de Congressos & Apresentações (88)
Lexical and Orthographic Variation in Portuguese Financial Tweets: Annotation, Analysis, and Implications for Embedding Models
NounBank.DS: a Lexical Repository of Nominal Frames from Stock Market Tweets in Brazilian Portuguese
DANTEStocks-AMR em Construção: Avanços e Desafios na Anotação Semântica de Tweets Financeiros
Named Entities in Stock Market Tweets: A Fine-Grained and Linguistically-Motivated Annotation
Bringing Pragmatics to Porttinari - Adding Speech Acts to News Texts
A Corpus of Stock Market Tweets Annotated with Named Entities
Genipapo - a Multigenre Dependency Parsing for Brazilian Portuguese
A Dependency Treebank of Tweets in Brazilian Portuguese: Syntactic Annotation Issues and Approach
Em direção à anotação sintática-UD de tweets do mercado financeiro
Tipologia de fenômenos ortográficos e lexicais em CGU: o caso dos tweets do mercado financeiro
Implicit opinion aspect clues in Portuguese texts: analysis and categorization.
PorTinari - a large multi-genre treebank for Brazilian Portuguese
Descrição preliminar do corpus DANTEStocks: diretrizes de segmentação para anotação segundo Universal Dependencies
Learning rules for automatic identification of implicit aspects in Portuguese
Universal Dependencies for tweets in Brazilian Portuguese: Tokenization and Part of Speech Tagging.
Caracterização de desvios sintáticos em um corpus de redações: o processo de anotação
Enriquecendo o corpus CM2News: construção e anotação de coleções bilíngues de notícias
Violações linguísticas em referências a entidades do tipo ?pessoa? em extratos automáticos multidocumento
Subsídios linguístico-computacionais para a revisão gramatical de redações do ensino médio
Desempenho do corretor LanguageTool em um corpus de redações do ensino médio: o caso das regras da categoria ?gramática?
Desempenho do corretor LanguageTool em um corpus de redações do ensino médio: o caso das regras da categoria ?miscelânea?
Source Texts Annotation for Rewriting References to People in Automatic Multi-Document Extracts
The Coreference Annotation of the CSTNews Corpus
CM2News: Towards a Corpus for Multilingual Multi-document Summarization
Phrase Generalization: a Corpus Study in Multi-Document Abstracts and Original News Alignments
Qualitative analysis of a corpus of opinion summaries based on aspects
On strategies of Human Multi-Document Summarization
Em direção à caracterização da complementaridade no corpus multidocumento CSTNews
Explorando hierarquias conceituais para a seleção de conteúdo na sumarização automática multidocumento
Anotação de sentidos de verbos em notícias jornalísticas em Português do Brasil
O Corpus CSTNews e sua Complementaridade Temporal
Enriquecendo o corpus CSTNews - A criação de novos sumários multidocumento
Delimitação de subontologias com base na indexação léxico-ontológica: primeiras investigações
Em busca de métodos de detecção da complementaridade para a Sumarização Automática Multidocumento
Insights for better RST segmentation of texts in Portuguese?
Identificação da redundância na Sumarização Automática Multidocumento: explorando métodos superficiais
Estudo de métodos clássicos de sumarização no cenário multidocumento multilíngue.
Delineamento conceitual de corpus via indexação léxico-conceitual: primeiros resultados
Alinhamento manual de textos e sumários em um corpus jornalístico multidocumento
Analysis of ascpects in a corpus of human multi-document summaries of 'sport' news
Grupo de Linguagem Humana e Tecnologia ? LHTec
Anotação e descrição de corpus para a investigação de estratégias de Sumarização Humana Multidocumento
Descrição morfológica dos termos da Educação a Distância no projeto Terminet
Os termos nas wordnets: estratégias de identificação automática da sinonímia em corpus especializado
Terminologia baseada em corpus: a extração de candidatos a termo segundo a abordagem estatística no projeto TermiNet
A construção de wordnets terminológicas a partir de corpora e a extração automática de termos
CSTNews: A discourse-annotated corpus for single and multi-document summarization of news texts in Brazilian Portuguese
Em direção à caracterização de sumários humanos multidocumento
Investigação da Identificação da Redundância na Sumarização Multidocumento
Estudo de Métodos Clássicos de Sumarização no Cenário Multidocumento Multilíngue
Proposta de Delineamento Conceitual de Corpus Via Indexação Ontológica
O projeto TermiNet e a extração de candidatos a termos com base no paradigma linguístico
REBECA: Turning WordNet Databases into
The TermiNet Project: an Overview
Delimitação do domínio da Educação a Distância com vistas à construção da base lexical WordNet.EaD
A construção de wordnets terminológicas com base em corpus
An introduction to the TermiNet project
O Corpus.EaD no projeto TermiNet: estratégias de construção
Corpus.EaD: construção e descrição
O alinhamento léxico-conceitual na base de dados REBECA
Projetando o corpus para a construção de uma wordnet terminológica
O léxico sob o olhar do Processamento Automático das Línguas Naturais e o projeto TermiNet
The Automatic Mapping of Princeton WordNet Lexical-Conceptual Relations onto the Brazilian Portuguese WordNet Database
OntoMethodus - A Methodology to Build Domain-Specific Ontologies and its Use in a System to Support the Generation of Terminographic Products
A Base de dados lexical e a interface web do TeP 2.0 - Thesaurus Eletrônico para o Português do Brasil
REBECA ? uma Base de Dados Léxico-Conceitual Bilíngüe Inglês-Português
Towards an automatic strategy for acquiring the WordNet.Br hierarchical relations
Compilação de corpus em língua portuguesa na área de Nanociência/ Nanotecnologia: problemas e soluções
Metodologia semi-automática baseada em corpus para a construção de ontologias de domínio
Methods and Tools for Encoding the WordNet.Br Sentences, Concept Glosses, and Conceptual-Semantic Relations
Ontologias Lingüísticas aplicadas ao Processamento Automático de Líguas Naturais: o caso das redes wordnets
Padrões de lexicalização e a indexação da base da rede Wordnet.Br.
Proposta de uma metodologia para a identificação dos argumentos dos adjetivos de valência 1 da língua portuguesa a partir de córpus
Extração de informações semânticas de dicionários com vistas à elaboração de léxicos lingüístico- computacionais
Estudo e Mapeamento dos Padrões de Lexicalização de Conceitos Codificados em Nomes Concretos do Inglês e do Português
Inserção da estrutura de argumentos na rede Wordnet.Br
Modelo lingüístico-computacional da estrutura valencial de adjetivos do Português
Inclusão de informação semântica dos adjetivos na base da rede Wordnet para o português do Brasil
Edição de informações sintático-semânticas dos adjetivos na base da rede Wordnet.Br.
Classificações e Tipologias semânticas dos adjetivos: uma breve revisão comparativa
Representação linguístico-computacional dos adjetivos valenciais do português
Etiquetagem morfossintática de 1 milhão de palavras: relatos da experiência lingüística em um processo semi-automático
Concepções de léxico e o processamento automático das línguas naturais
Representação linguístico-computacional dos adjetivos valenciais no léxico do processamento automático do português
Representação lingüístico-computacional dos adjetivos valeciais no léxico do processamento automático do português
Tudo o que você sempre quis saber sobre a ferramenta de revisão gramatical do seu WORD e não tinha a oportunidade de perguntar
Representação lingiístico-computacional dos adjetivos valenciais no léxico para o processamento automático do português
Especificação dos traços semânticos dos itens lexicais
Trabalhos Técnicos, Pareceres e Consultorias (11)
Revisor de resumos submetidos ao 59o Seminário do Gel
Revisor de resumos submetidos ao X Encontro de Linguística de Corpus
Revisor de resumos submetidos à II Jornada de Descrição do Português
Revisor de resumos submetidos ao IX Encontro de Linguística de Corpus
Revisor de artigos submetidos à revista Estudos Linguísticos (volume 39)
Revisor de resumos submetidos ao 58o Seminário do Gel
Revisor de artigos submetidos ao 7th Brazilian Symposium in Information and Human Language Technology
Revisor de resumos submetidos à I Jornada de Descrição do Português
Revisor de artigos submetidos à revista Calidoscópio
Revisor de artigos submetidos ao V TIL (Workshop em Tecnologia da Informação e da Linguagem Humana)
Revisor de resumos submetidos ao VI EC (Encontro de Lingüística de Córpus)
Demais Tipos de Produção (27)
Guia de anotação de entidades nomeadas em tweets do mercado financeiro: adaptação da taxonomia hierárquica do segundo HAREM
Diretrizes de anotação de relações de dependência em tweets do mercado financeiro.
Manual de Anotação do corpus Porttinari-base com Atos de Fala
Diretrizes de anotação de PoS tags em tweets do mercado financeiro: orientações para anotação em língua portuguesa segundo a abordagem Universal Dependencies (UD)
CM3News: Corpus Multidocumento Trilíngue de Textos Jornalísticos
Identificação das operações linguísticas nos alinhamentos com especialização do corpus CSTNews
Anotação de sentidos de verbos no córpus CSTNews
Identificação das operações linguísticas nos alinhamentos com generalização do corpus CSTNews
Descrição de características lexicais estatísticas dos textos-fonte e sumários do corpus CSTNews
Geração de subsídios linguísticos para a detecção automática de aspectos informacionais
Primeiras investigações sobre o fenômeno da contradição no corpus CSTNews
Anotação de aspectos textuais em sumários do córpus CSTNews
Alinhamento manual dos sumários humanos e dos textos-fonte do corpus multidocumento CSTNews
Investigação do fenômeno da redundância na Sumarização Automática Multidocumento
Anotação de subtópicos do corpus multidocumento CSTNews
Aplicação de métodos clássicos de sumarização automática no contexto multidocumento multilíngue: primeiras aproximações
Em direção ao delineamento conceitual de corpus via indexação léxico-conceitual
Extração de conhecimento terminológico no projeto TermiNet
Descrição morfológica preliminar dos termos da Educação a Distância
Um exercício em Linguística de Corpus no âmbito do projeto TermiNet
Delimitação e alinhamento de conceitos lexicalizados no inglês norte-americano e no português brasileiro
Desenvolvimento de uma estrutura conceitual (ontologia) para a área de Nanociência e Nanotecnologia
Identificação das estruturas argumentais dos adjetivos: uma abordagem semi-automática baseada em corpus
Representação lingüístico-computacional dos adjetivos valenciais do Português
Modelo de entrada lexical (psico)linguístico-computacional
Projeto TraSem: A investigação empírica sobre o problema da ambiguidade categorial
Projeto TraSem: A investigação teórica sobre o problema da ambiguidade categorial
Orientações Concluídas (54)
2 Doutorado • 12 Mestrado • 17 TCC/Graduação • 17 PIBIC • 6 Outras
Gabriel Ceregatto
"Representação formal do significado: o caso dos tweets do mercado de ações em português"
Laís Piai
"Caracterização de entidades nomeadas em um corpus de tweets: contribuição para o processamento automático do português"
Isabela Santos de Freitas
"Refinamento da anotação sintática segundo o modelo Universal Dependencias do córpus DANTEStocks e investigação da relação de"
Clarissa Lenina Scandarolli
"Tweets do mercado financeiro: proposta de tipologia de fenômenos ortográficos e lexicais de CGU"
Gabriela Pinheiro de Oliveira
"Caracterização de aspectos ortográficos e lexicais de um corpus de tweets do mercado financeiro"
Bianca Couto Vincenzi
"Enriquecendo o corpus Portinari-base com anotação de entidades nomeadas clássicas"
Isabela Santos de Freitas
"Descrição da fragmentação estrutural de tweets do mercado financeiro via relação de ?parataxis? do modelo Universal Dependencies"
Breno da Costa Caricchio Aguiar
"Revisão da anotação sintática segundo modelo Universal Dependencies do corpus DANTEStocks e investigação da relação de "modificação nominal""
Bryan Khelven da Silva Barbosa
"Descrição sintático-semântica de nomes predicadores em tweets do mercado financeiro"
Lucas Lopes Ribeiro
"Análise de regras linguísticas para o aperfeiçoamento de anotação automática de part-of-speech"
Clarissa Lenina Scandarolli
"Descrição de fênomenos linguísticos em um corpus de tweets do mercado financeiro"
Gabriel Ceregatto
"Caracterização Morfossintática de um Corpus de Tweets e Análise Preliminar de Erros de Tagging"
Laura Santos Gazana
"DANTEStockes: um corpus de tweets em português da bolsa de valores anotado segundo o modelo Universal Dependencies"
Darlan Xavier Nascimento
"Explorando a avaliação de sumários automáticos multidocumento multilíngue"
Yasmin Vizeu
"Sumarização Automática Multilíngue Multidocumento: seleção de conteúdo e tratamento da redundância com base em conhecimento léxico-conceitual"
Renata Ramisch
"Caracterização de desvios sintáticos em redações de estudantes do ensino médio: subsídios para o Processamento Automático das Línguas Naturais"
Rejeane Cassia de Luca
"Aplicação de conhecimento léxico-conceitual na Sumarização Automática Multidocumento"
Jackson Wilke da Cruz Souza
"Aprofundamentos da descrição linguístico-computacional do fenômeno da complementaridade"
Bruna Franco
"Anotação de cadeias de correferência compostas por entidades do tipo ?organização? para a Sumarização Automática Multidocumento"
Lucas Lopes Ribeiro
"Aplicação do corretor LanguageTool em corpus de redações do ensino médio e proposta de refinamento se suas regras"
Milena Cardoso França
"Investigação de desempenho do LanguageTool em corpus de redações do ensino médio: as regras da categoria "miscelânea""
Milena Cardoso França
"Desempenho do corretor LanguageTool na análise gramatical de redações do ensino médio em português"
Débora Domiciano Garcia
"Modelagem linguístico-computacional da semântica das preposições do português"
Luana Fonseca Cristini
"Avaliação de Regras de Reescrita para Referências a Pessoas em Sumários Automáticos Multidocumento"
Felipe Lima Cury
"Investigação comparativa da complexidade textual entre originais e graded readers"
Pedro Ferreira Martins
"Análise de desempenho do corretor gramatical CoGroo quanto à concordância nominal em redações de ensino médio"
Pedro Ferreira Martins
"Investigação de desempenho do corretor gramatical CoGroo em corpus de redações do ensino médio"
Luana Fonseca Cristini
"Avaliação de Regras de Reescrita para Referências a Pessoas em Sumários Automáticos Multidocumento"
Jackson Wilke da Cruz Souza
"Investigação do fenômeno da complementaridade para a Sumarização Automática Multidocumento"
Marina Delege
"Estudo preliminar da operação de generalização na Sumarização Humana Multidocumento"
Vanessa Marcasso
"Descrição de características lexicais dos textos-fonte e sumários humanos multidocumento do corpus CSTNews"
Naira Licia da Silva
"Primeiras investigações sobre o fenômeno da contradição em um corpus multidocumento"
Fabricio Elder da Silva Tosta
"Aplicação de conhecimento léxico-conceitual na sumarização automática multidocumento multilíngue"
Matheus Rigobelo Chaud
"Investigação de Estratégias de Sumarização Automática Multidocumento Multilíngue Baseadas em Interlíngua"
Andressa Caroline Inácio Zacarias
"Investigação de Métodos de Sumarização Automática Multidocumento Baseados em Hierarquias Conceituais"
Vinícius Felix dos Santos
"Análise linguística de aspectos textuais para a Sumarização Automática Multidocumento"
Marina Delege
"Análise linguística da operação de generalização na Sumarização Humana Multidocumento"
Vanessa Marcasso
"Caracterização linguística de sumários humanos multidocumento: explorando o nível lexical"
Carla Chuman
"Análise linguística da operação de especialização na Sumarização Humana Multidocumento"
Naira Lícia da Silva
"Descrição e análise do fenômeno da contradição para a Sumarização Automática Multidocumento"
Renata Tironi Camargo
"Investigação de estratégias de sumarização humana multidocumento"
Andressa Caroline Inácio Zacarias
"Delineamento conceitual de corpora via delimitação de subontologias"
Andressa Caroline Inácio Zacarias
"Delineamento conceitual de corpus via indexação léxico-conceitual: primeiros resultados"
Jackson Wilke da Cruz Souza
"Investigação de métodos de identificação de redundância para Sumarização Multidocumento"
Fabrício Elder da Silva Tosta
"Investigação de métodos clássicos de sumarização no cenário multidocumento multilíngue"
Arthur Pompílio Astrogildo da Silva
"Extração semiautomática da relação de hiponímia no projeto TermiNet"
Ana Catarina Gianoti
"Descrição e Análise Morfológica da Terminologia do Domínio da ?Educação à Distância?"
Jackson Wilke da Cruz Souza
"Identificação da redundância com base em conhecimento linguístico profundo para a Sumarização Automática Multidocumento"
Arthur Pompilio Astrogildo da Silva
"Refinamento da hierarquia conceitual da base de dados lexicais Wordnet.EaD"
Andressa Caroline Inácio Zacarias
"Delimitação de subontologias a partir da indexação de unidades lexicais provenientes de corpora"
Leonardo Sameshima Taba
"Extração automática de termos e de relações semânticas e conceituais para o desenvolvimento de wordnets terminológicas em português do Brasil"
Ana Catarina Gianoti
"Extração automática de termos segundo o paradigma linguístico no projeto TermiNet"
Fernanda Cristina Guerra
"Praticando as ênfases do Bacharelado em Linguística"
Jackson Wilke da Cruz Souza
"Construção do corpus para o desenvolvimento de uma wordnet terminológica em português do Brasil"
Orientações em Andamento (8)
2 Doutorado • 4 TCC/Graduação • 2 PIBIC
Isabela Cristina Rodrigues
"Anotação Semiautomática de Metáforas em Saúde Mental com LLMs"
Isabella de Sousa Monteiro
"Argumentos modificadores em tweets do mercado financeiro: mapeamento sintático-semântico."
Pedro Henrique Silva
"Avaliação da concordância na anotação de argumentos modificadores em predicações nominais de tweets do mercado financeiro em português"
Breno da Costa Caricchio Aguiar
"Identificação de emoções e sinalizadores linguísticos em mídias sociais do domínio esportivo"
Maria Julia Bernardo Comarim
"Exploração de Métodos Automáticos para Anotação de Corpus segundo o modelo Abstract Meaning Representation"
Pedro Henrique Silva
"Anotação de papéis semânticos em tweets do mercado financeiro: definição de formatos e reutilização de recurso lexical"
Isabella de Sousa Monteiro
"Anotação de papéis semânticos no corpus DANTEStocks: os argumentos modificadores em tweets do mercado financeiro"
Bryan Khelven da Silva Barbosa
"NomBank.Br: um Banco de Proposições Nominais para o Português"
Projetos de Pesquisa, Extensão & Desenvolvimento (28)
TraSem - Especificação de Traços Semânticos dos Itens Lexicais
Investigação e especificação dos traços semânticos dos itens lexicais com vistas ao aprimoramento do Revisor Gramatical - ReGra.
POeTiSA - POrtuguese processing - Towards Syntactic Analysis and parsing
POeTiSA is a long term project that aims at growing syntax-based resources and developing related tools and applications for Brazilian Portuguese language, looking to achieve world state-of-the-art results in this area. On the resource side, we focus on the production of a large and comprehensive multi-genre corpus of Universal Dependencies-based part of speech and syntactically annotated texts, including mainly news texts and user-generated content (tweets and online comments). Regarding the tools, we aim to investigate recent neural and distributional-based methods for training robust parsing models for Portuguese. The project also envisions the production of applications on opinion mining and sentiment analysis tasks that may benefit from syntactic knowledge, as opinion summarization, helpfulness prediction, aspect idetification, deception detection and emotion classification. This project is part of the Natural Language Processing initiative (NLP2) of the Center for Artificial Intelligence (C4AI) of the University of São Paulo, sponsored by IBM and FAPESP (grant #2019/07665-4). The center is part of the FAPESP Engineering Research Centers Program and is committed to state-of-the-art research in Artificial Intelligence, exploring both foundational issues and applied research.
Computação Heterogênea para Visão Computacional e Processamento de Linguagem Natural
Trata-se de um projeto de pesquisa no âmbito das Ciências da Computação, em subáreas inter-relacionadas de grande destaque atual e de interesse acadêmico e industrial, a saber: Processamento de Imagens e Processamento de Língua Natural. Com a análise, a modelagem e o tratamento computacional de dados de imagens e de língua, prevê-se o avanço da fronteira de conhecimento nessas frentes e, consequentemente, das aplicações relacionadas a essas duas modalidades complementares de dados.
Python para Processamento de Linguagem Natural: Edição Comemorativa dos 50 anos do ICMC
O curso foi inteiramente virtual, com aulas transmitidas ao vivo pelo canal do ICMC no Youtube (http://tv.icmc.usp.br/), com os links para as gravações sendo disponibilizados posteriormente na página a seguir (https://cursosextensao.usp.br/course/view.php?id=2721). O curso teve 12.500 inscritos e 2.500 aprovados. A mesa de abertura teve mais de 14.000 visualizações.
Sucinto - summarization for clever information access
The sucinto project aims at investigating and exploring generic and topic-focused multi-document summarization strategies for providing a more feasible and intelligent access to on-line information provided by news agencies. This commitment brings back old and well-known scientific challenges from the first studies in summarization in the 50s as well as introduces several new and exciting challenges, e.g., to deal with redundant, complementary and contradictory information, to normalize different writing styles and referring expression choices, to balance different perspectives and sides of the same events and facts, to properly deal with evolving events and their narration in different moments, and to arrange information pieces from different texts to produce coherent and cohesive summaries, among several others. An ultimate goal of this project is to pull the developed tools together as on-line applications for final users. This project takes into consideration not only classical approaches to single and multi-document summarization, but also new ones, following different paradigms and using knowledge of varied nature ranging from empirical and statistical data to semantic and discourse models. Research interests include (i) the modeling of the summarization process (content selection, planning, aggregation, generalization, substitution, information ordering, etc.) by means of Cross-document Structure Theory (CST), Rhetorical Structure Theory (RST), ontologies, and language and summarization statistical models, (ii) the investigation of related tasks as discourse parsing, topic detection, temporal annotation and resolution, coreference resolution, text-summary alignment, and multilingual processing, and (iii) the linguistic characterization of multi-document summaries and their manual production.
TermiNet - Instanciação e Aplicação de uma Metodologia para o Desenvolvimento de Wordnets Terminológicas em Português do Brasil
Neste documento, propõe-se uma pesquisa no âmbito do Processamento Automático das Línguas Naturais (PLN), área interdisciplinar que busca desenvolver sistemas que processam as línguas naturais (p.ex.: sistemas de sumarização). Para o desenvolvimento de vários sistemas de PLN, são necessários certos recursos lingüísticos (os lingwares) que desempenham papel central na arquitetura dos sistemas, p.ex.: as ?bases de conhecimento lexical?. Dada a necessidade crescente de se processar textos especializados, bases de conhecimento lexical especializado (ou terminológico) passaram a ser desenvolvidas para várias línguas, principalmente no formato wordnet. Embora exista um número razoável de wordnets terminológicas em diversas línguas, observa-se a carência de uma metodologia suficientemente clara que facilite e, sobretudo, estimule a criação dessas bases. Para o português do Brasil (PB), aliás, não há bases de conhecimento especializado no formato wordnet. Assim, propõe-se (i) a instanciação de uma metodologia para o desenvolvimento de wordnets terminológicas e (ii) a sua aplicação na construção de uma base desse tipo em PB. Tal metodologia, proposta para a realização de quaisquer pesquisas no PLN, destaca-se por conciliar a face lingüística e a computacional dessa área. Com isso, acredita-se que o projeto pode beneficiar não só o PLN, mas também a Terminologia/ Terminografia em PB, pois o formato wordnet é um modelo elegante e eficaz para a representação do conhecimento léxico-conceitual, fundamental também para o desenvolvimento de produtos terminográficos tradicionais.
Sustento1 - Geração de conhecimento linguístico para a Sumarização Automática Multidocumento
Dada a grande quantidade de informação disponível em várias línguas, sobretudo na web, a Sumarização Automática Multidocumento (SAM) tem ocupado lugar de centralidade no Processamento Automático das Línguas Naturais (PLN) na medida em que facilita o acesso à informação. Originada em meados de 1990, a SAM objetiva produzir automaticamente um único sumário (resumo) a partir de uma coleção de textos sobre um mesmo tópico. Para o português do Brasil (PB), as pesquisas começaram somente nos últimos anos. Apesar de incipientes, os sistemas/métodos que envolvem o PB igualam-se ao estado da arte e, em alguns casos, superam os resultados obtidos para outras línguas. Mesmo diante de cenário tão promissor, a SAM, de um modo geral, carece de subsídios linguísticos que permitam aproximar a tarefa automática à humana. Assim, neste projeto, objetiva-se gerar subsídios linguísticos para avançar o estado da arte em SAM, principalmente que envolve o PB. Para tanto, investigar-se-ão 3 frentes de pesquisa correlatas: (i) caracterização linguística de sumários multidocumento produzidos por humanos, (ii) investigação aprofundada dos fenômenos multidocumento (p.ex.: redundância), e (iii) descrição e formalização de conhecimento semântico-conceitual. As frentes (i) e (ii) justificam-se pelo fato de que a SAM, ao contrário da monodocumento, pauta-se apenas em indícios sobre a sumarização humana (multidocumento) e em estudos superficiais de seus fenômenos. A frente (iii) justifica-se pelo fato de que os métodos de SAM para o PB poderão ser enriquecidos ou totalmente baseados nesse tipo de conhecimento. Tendo em vista a geração de descrições e formalizações linguísticas nas três frentes, acredita-se que este projeto tem potencial para contribuir com a SAM e a Linguística Descritiva. Ademais, salienta-se a formação de recursos humanos no PLN, área ainda pequena no Brasil.
Ancora - Desenvolvimento de Algortimo de Interpretação de Escrita no Contexto de Avaliação, alinhada à Base Nacional Comum Curricular
O objetivo do projeto é desenvolver anotação e análise de corpus, regras e modelos de linguagem que subsidiem a construção de uma ferramenta de devolutiva pedagógica em tempo real e um algoritmo de avaliação alinhado aos critérios da matriz de avaliação da Base Nacional Comum Curricular. O produto do projeto será incorporado a um serviço pedagógico de escrita e letramento a ser oferecido a alunos e professores de escolas públicas e privadas como um componente-chave para a avaliação e melhoria do letramento no Brasil.
Sustento2 - Geração de conhecimento linguístico para a Sumarização Automática
Dada a grande quantidade de informação disponível em várias línguas, sobretudo na web, a Sumarização Automática Multidocumento (SAM) tem ocupado lugar de centralidade no Processamento Automático das Línguas Naturais (PLN) na medida em que facilita o acesso à informação. Originada em meados de 1990, a SAM objetiva produzir automaticamente um único sumário (resumo) a partir de uma coleção de textos sobre um mesmo tópico. Para o português do Brasil (PB), as pesquisas começaram somente nos últimos anos. Apesar de incipientes, os sistemas/métodos que envolvem o PB igualam-se ao estado da arte e, em alguns casos, superam os resultados obtidos para outras línguas. Mesmo diante de cenário tão promissor, a SAM, de um modo geral, carece de subsídios linguísticos que permitam aproximar a tarefa automática à humana. Assim, neste projeto, objetiva-se gerar subsídios linguísticos para avançar o estado da arte em SAM, principalmente que envolve o PB. Para tanto, investigar-se-ão 3 frentes de pesquisa correlatas: (i) caracterização linguística de sumários multidocumento produzidos por humanos, (ii) investigação aprofundada dos fenômenos multidocumento (p.ex.: redundância), e (iii) descrição e formalização de conhecimento semântico-conceitual. As frentes (i) e (ii) justificam-se pelo fato de que a SAM, ao contrário da monodocumento, pauta-se apenas em indícios sobre a sumarização humana (multidocumento) e em estudos superficiais de seus fenômenos. A frente (iii) justifica-se pelo fato de que os métodos de SAM para o PB poderão ser enriquecidos ou totalmente baseados nesse tipo de conhecimento. Tendo em vista a geração de descrições e formalizações linguísticas nas três frentes, acredita-se que este projeto tem potencial para contribuir com a SAM e a Linguística Descritiva. Ademais, salienta-se a formação de recursos humanos no PLN, área ainda pequena no Brasil.
AIM-Health - AI-Based Support for Mental Health Communication
Depression is a mental health disorder that affects a large portion of the global population, being the second largest contributor to decrease in healthy life expectancy. Depression is characterized by a clinically significant form of psychological suffering that leads to significant impairment in someone's functionality, reduced quality of life and, in severe cases, can lead to death due to the risk of suicide. However, according to the World Health Organization, only a quarter of individuals suffering from mental health disorders receive proper care. Advances in Artificial Intelligence (AI) and Natural Language Processing (NLP) research have been developed to a level that can be used for proposing computational solutions that assist in the detection and intervention in mental health conditions. AI and NLP based solutions that aid in the identification of signs of depression can be useful both in individual treatment and in making public policy decisions. Similarly, solutions that offer autonomous, ethical, reliable, controlled, and engaging intervention, in real time, can help mitigate the damage caused by depression. This project works on proposing and developing AI and NLP based solutions for the detection and intervention of mental health conditions that can have a broader reach and allow mental health support to individuals and populations that would not otherwise have access to it. Furthermore, as social determinants are frequently mentioned as risk factors for mental health conditions, this project also aims at furthering the understanding about them in two contexts (Brazil and the United Kingdom). This project aims to address scientific challenges that are still present and very relevant in this context: (i) dealing with more abstract language (such as figurative language) commonly used in mental health self-narratives, and (ii) outputting personalized interventions suitable for an individual's context. (AU)
I Seminário de Estudos do Léxico (SELEX)
O Seminário de Estudos do Léxico (SELEX) foi proposto com o objetivo de reunir as pesquisaores, docentes e alunos da UFSCar, interessados no léxico sob diferentes perpectivas.
I Olimpíada Brasileira de Linguística Computacional (OlinCom)
A I Olimpíada Brasileira de Linguística Computacional (OlinCom) é uma competição acadêmica voltada à promoção do interesse e do conhecimento em Processamento de Linguagem Natural (PLN), reunindo estudantes para resolver desafios relacionados à análise automática da linguagem, como interpretação semântica, modelagem linguística e uso de recursos computacionais aplicados à língua.
I Workshop de Iniciação Científica em Tecnologia da Informação e da Linguagem Humana (TILic)
O I Workshop de Iniciação Científica em Tecnologia da Informação e da Linguagem Humana, o TILic, será o primeiro workshop de Iniciação Científica (IC) que busca agregar alunos de graduação das áreas de Ciências da Computação, de Lingüística, de Ciências da Informação e outras, engajados em pesquisas relacionadas ao processamento das línguas naturais. Tal evento integra o Simpósio Brasileiro de Tecnologia da Informação e da Linguagem Humana (STIL 2009), que será realizado entre os dias 7 e 11 de setembro de 2009 no Instituto de Ciências Matemáticas e de Computação (ICMC) da USP/São Carlos.
II Jornada de Descrição do Português (JDP)
A Jornada de Descrição do Português visa aproximar linguistas e pesquisadores da área de computação, integrando mais efetivamente essas duas áreas que precisam atuar de forma interdisciplinar para promover avanços no processamento automático da língua portuguesa.A Linguística Descritiva, em especial, tem enorme potencial para aportar conhecimentos ao Processamento Automático de Língua Natural (PLN), de maneira a colocar a língua portuguesa numa posição de destaque no cenário mundial, fazendo frente às demais línguas (inglês, francês, espanhol, etc.) que vislumbraram essa interdisciplinaridade já na década de 1960.
I Universal Dependencies Brazilian Festival (UDFest-BR)
O Universal Dependencies Brazilian Festival (UDFest-BR), realizado no âmbito do PROPOR 2022, é um fórum voltado à discussão do modelo Universal Dependencies (UD) e sua adaptação ao português. O UD é um modelo internacional de anotação gramatical que apoia estudos contrastivos e o desenvolvimento de tecnologias multilíngues em PLN. Apesar de sua ampla adoção com centenas de corpora anotados em mais de 100 línguas e de suas vantagens para aplicações como tradução automática e extração de informação, o uso do UD no português ainda é incipiente. O evento busca, assim, ampliar a visibilidade da área, promover boas práticas e incentivar colaborações e novas pesquisas.
16a Jornada de Letras da UFSCar
Brasileiras em Processamento da Linguagem Natural
O "Brasileiras em PLN" (BPLN: https://brasileiraspln.com) é um grupo criado em 2020 e atualmente (2025) é formado por cerca de 260 pessoas que se identificam com o gênero feminino, brasileiras, interessadas ou trabalhando ativamente na área de Processamento de Linguagem Natural (PLN) em diversos estados do Brasil e no exterior. O BPLN tem a missão de fortalecer a presença das mulheres no PLN no Brasil, destacando suas contribuições, promovendo a disseminação do conhecimento e inspirando e capacitando mais pessoas para trabalharem e pesquisarem nesta área. Neste sentido, este projeto visa abarcar atividades de divulgação científica (palestras), educação (cursos) e parcerias científicas (projetos e orientações) das integrantes atuais e futuras do BPLN.
II Jornada de Estudos Descritivos
O objetivo do evento é reunir os grupos de pesquisa dos/as docentes da linha de pesquisa Descrição, Análise e Processamento de Línguas Naturais do Programa de Pós-Graduação da UFSCar. Haverá apresentação dos grupos de pesquisa e dos trabalhos de pós-graduandas/os atuais e egressos. Além disso, está prevista uma sessão de apresentação de trabalhos de pós-graduandas/os de outras universidades, caso haja inscrições.
III Jornada de Estudos Descritivos
A III Jornada de Estudos Descritivos é um evento promovido pelo PPGL-UFSCar, Programa de Pós-Graduação em Linguística da Universidade Federal de São Carlos, e ocorrerá nos dias 21 e 22 de abril de 2026, com as inscrições abertas de 16 de março a 17 de abril do mesmo ano.O evento será realizado de forma presencial e tem como proposta a apresentação de pesquisas relacionadas à Linguagem, especificamente na linha de pesquisa descritiva.A linha de pesquisa dos trabalhos apresentados no evento tem como foco a investigação da forma e função de construções linguísticas, visando a explicação e compreensão da linguagem.A investigação é realizada através de diversos modelos teóricos que permitem a análise dos fenômenos linguísticos, sendo utilizadas por áreas que analisam, por exemplo, a fonética, semântica, pragmática e dados sociofuncionais das línguas humanas.
Lumos - Natural Language Processing for Social Media Monitoring
This project aims to develop Natural Language Processing (NLP) technologies for social listening monitoring, with a focus on social media and sports-related posts. The proposal integrates language technologies such as linguistic resources (lexicons and annotated corpora) and computational approaches based on symbolic and Large Language Model methods, targeting tasks such as sentiment analysis, topic identification, and named entity recognition. Ultimately, the project seeks to contribute to a better understanding of perceptions and trends in digital environments, as well as to advance robust NLP solutions tailored to Portuguese.
Lumos - Natural Language Processing for Social Media Monitoring
This project aims to develop Natural Language Processing (NLP) technologies for social listening and monitoring, with a focus on social media and sports-related posts. The proposal integrates language technologies such as linguistic resources (lexicons and annotated corpora) and computational approaches based on symbolic and Large Language Model-based methods, targeting tasks such as sentiment analysis, topic identification, and named entity recognition. Ultimately, the project seeks to contribute to a better understanding of perceptions and trends in digital environments, as well as to advance robust NLP solutions tailored to Portuguese.
SAPPo - Towards Semantic Analysis and Parsing for Portuguese
The interpretation of natural language is essential in a wide range of Natural Language Processing (NLP) applications, involving tasks such as Named Entity Recognition (NER), Semantic Role Labeling (SRL), and the representation of sentence meaning through formalisms such as Abstract Meaning Representation (AMR). Although extensively studied for standard English, these tasks remain challenging even in the presence of large annotated corpora for model development and evaluation. NER faces issues such as semantic ambiguity, entity boundaries, nested entities, and coreference; SRL must deal with syntactic ambiguity, polysemy, the distinction between arguments and adjuncts, and implicit arguments; and AMR, while inheriting these challenges, also involves graph-structuring, coreference, non-literal meaning, and typological variation across languages, given that it was originally designed for English. These problems are further exacerbated in user-generated content (UGC) (e.g., tweets, posts), which is characterized by non-standard language. Despite some important initiatives, resources for NER, SRL, and AMR in Portuguese remain limited, and annotation is still largely manual, time-consuming, and costly. Considering these three tasks, this project aims to create annotated corpora and lexical repositories and to develop automatic methods for both formal Portuguese and/or UGC. To this end, we propose to explore classical symbolic approaches, current techniques based on Large Language Models (LLMs), and/or hybrid methods that combine the interpretability of symbolic approaches with the generalization capacity of pre-trained neural models (LLMs), aiming at more robust and adaptable solutions.
NanoTerm - Terminologia em Língua Portuguesa da Nanociência e Nanotecnologia: Sistematização do Repertório Vocabular e Elaboração de Dicionário-Piloto
A Nanotecnologia é atualmente uma das áreas centrais das atividades de pesquisa, desenvolvimento e inovação nos países industrializados. Investimentos aplicados nessa área de conhecimento por esses países têm sido crescentes e atingiram, em 2002, cerca de cinco bilhões de dólares. A previsão é de que, entre 2010 e 2015, o mercado mundial envolvendo a Nanotecnologia será de um trilhão de dólares. O cenário no Brasil para pesquisas em Nanociência e Nanotecnologia (NN) já é promissor, entretanto, ainda há uma grande defasagem dos países do Hemisfério Sul em relação aos países desenvolvidos, como mostra documento da OEA intitulado "Ciência, Tecnologia, Engenharia e Inovação para o Desenvolvimento: uma visão para as Américas no Século XXI" (nov/2005). Para acompanhar esse desenvolvimento científico e tecnológico que se deseja, é preponderante a sistematização de repertórios vocabulares em língua portuguesa. Sistematizar terminologias significa criar termos fiáveis de forma a facilitar a comunicação especializada, além de demonstrar que a língua portuguesa está apta para nomear conceitos técnicos e científicos. Em outras palavras, ao mesmo tempo em que se promove a disseminação de conhecimentos e de tecnologias, fomenta-se a língua nacional, posto que não há ainda qualquer glossário e/ou dicionário de NN em língua materna. O que se observa é presença maciça de produtos terminológicos em língua inglesa, mas, ainda assim, limitados em abrangência e profundidade. Esta proposta tem como objetivos: 1) constituição de um corpus em língua portuguesa; 2) busca de equivalentes em português - língua de chegada (LC) - a partir de uma nomenclatura em inglês - língua de partida (LP); 3) proposta de uma ontologia em língua portuguesa da área de NN; 4) elaboração do primeiro dicionário-piloto em NN em língua materna.Financiado pelo edital MCT/CNPq 61/2005 (Ciências Humanas, Sociais e Sociais Aplicadas). Vigência: jul/2006 a jul/2008). Valor concedido: R$ 7.000,00.
III Jornada de Descrição do Português (JDP)
A Jornada de Descrição do Português visa aproximar linguistas e pesquisadores da área de computação, integrando mais efetivamente essas duas áreas que precisam atuar de forma interdisciplinar para promover avanços no processamento automático da língua portuguesa.A Linguística Descritiva, em especial, tem enorme potencial para aportar conhecimentos ao Processamento Automático de Língua Natural (PLN), de maneira a colocar a língua portuguesa numa posição de destaque no cenário mundial, fazendo frente às demais línguas (inglês, francês, espanhol, etc.) que vislumbraram essa interdisciplinaridade já na década de 1960.
Glosagem da Base da WordNet.Br e sua Indexação à WordNet de Princeton
Neste projeto, propõe-se, especificamente, a ampliação qualitativa dessa base de verbos. Como na WordNet de Princeton em que se inspira, a base de verbos da WordNet.Br deverá conter a especificação de glosas (isto é, uma definição do significado do conceito implicitamente codificado em cada synset, que constitui também a definição de um ontologia recortada por uma língua natural) e das relações lógico-conceituais e hierárquicas que se estabelecem entre os synsets de verbos. Para isso, estabelece-se um dos seus objetivos: fazer a interligação entre a base da Wordnet.Br e a base da WordNet de Princeton, que se concretiza por meio da especificação da coindexação entre os synsets de verbos da base da WordNet.Br e os synsets de verbos semanticamente (quase-)equivalentes da Wordnet de Princeton.
Revisa - Knowledge-based Revision for Transforming Multi-Document Extracts into Abstracts
Given the large volume of information available in multiple languages, particularly on the Web, Multi-Document Summarization (MDS) has become an important approach to mitigating information overload. Since its emergence in the mid-1990s, MDS has been an active research area within Natural Language Processing (NLP), aiming to automatically generate a single summary from a collection of documents describing the same topic. Research on MDS for Brazilian Portuguese began in 2011, and the resulting methods and systems have achieved, and in some cases surpassed, the state of the art for the language.Most MDS systems generate extractive summaries, i.e., summaries composed of sentences (or, more rarely, phrases or paragraphs) selected from the source documents. Although extractive approaches have achieved substantial improvements, the resulting summaries often suffer from limited informativeness and reduced linguistic quality.This project investigates, from a corpus-based perspective, rewriting strategies for automatic summary revision. The goal is to formulate rewriting rules that generalize and specialize the content of extractive summaries during a post-editing stage. These operations vary widely in scope (intra- and inter-sentential), linguistic level (lexical, phrasal, clausal, and sentential), and underlying mechanisms (e.g., lexical substitution and insertion, syntactic transformations, and discourse-level operations). By introducing an abstraction layer over extractive summaries, the project moves beyond purely extractive MDS toward partially abstractive summarization, producing summaries that are more natural, more informative, and linguistically more fluent.
Converseiro - Linguistic Description and Automatic Processing of Social Media Content
The different genres of content produced on social media also referred to as user-generated content (UGC) are of particular interest due to the opinions, evaluations, and interactions they express, as well as the linguistic specificities associated with digital communication. This project is dedicated to the linguistic investigation of texts circulating primarily on the X platform (formerly Twitter). In this context, the project aims to describe different linguistic aspects of the tweet genre, covering lexical, morphosyntactic, syntactic, and semantic-discursive phenomena. The goal is to support the development of linguistic-computational resources (lingware) for the automatic processing of this type of UGC in Portuguese, including treebanks (i.e., linguistically annotated corpora), lexicons, and computational grammars.
C4AI - Centro de Inteligência Artificial
Esta proposta descreve um Centro de Pesquisa de Engenharia em Inteligência Artificial (IA) empenhado em conduzir pesquisas em tópicos centrais de IA e em aplicar técnicas de IA em áreas de aplicação selecionadas --- a saber, indústria de óleo e gás, agronegócios e saúde. O Centro também dará suporte a estudos sobre o impacto social e econômico da IA e conduzirá atividades de transferência de tecnologia e difusão do conhecimento. O Centro será construído com a convicção de que os próximos dez anos trarão avanços sem precedentes em IA, os quais dependerão da colaboração tanto entre áreas centrais da IA como destas áreas com as aplicações. O "Center for Artificial Intelligence" consistirá de dois grupos interligados de pesquisadores, ambos distribuídos na instituição anfitriã e em instituições associadas. Um grupo de pesquisadores, com significativa projeção internacional na comunidade de IA, cobrirá tópicos centrais de IA, de representação de conhecimento a aprendizado de máquina, com ênfase em processamento de texto e linguagem natural, particularmente em Português. Tendências da pesquisa internacional corrente sugerem que a próxima década testemunhará uma interação crescente entre representação de conhecimento, tomada de decisão e aprendizado de máquina; o "Center for Artificial Intelligence" focará sua atenção na combinação destas áreas da IA, já que elas não são tão intimamente conectadas quanto deveriam ser --- o Centro se posicionará como um participante fundamental na colaboração entre os principais tópicos da IA. Um segundo grupo de pesquisadores do Centro focará em três áreas de aplicação onde existe significativa experiência na instituição anfitriã: óleo e gás, agronegócio, e saúde. A conexão entre pesquisa em tópicos centrais da IA e áreas de aplicação ocorrerá em dupla direção: pesquisa em IA básica abordará problemas de grande escala nas áreas de aplicação selecionadas, e será direcionada pelos desafios nestas áreas de aplicação. Um pequeno grupo de pesqu
Atuação Profissional e Vínculos Institucionais
Cargo / Enquadramento: Pesquisador
Vínculo: COLABORADOR (20h semanais)
Cargo / Enquadramento: OUTRO
Vínculo: COLABORADOR
Cargo / Enquadramento: Professor Associado 4
Vínculo: Servidor público (40h semanais)
Dedicação Exclusiva (DE)
Cargo / Enquadramento: OUTRO
Vínculo: COLABORADOR
Vínculo: Revisor de periódico
Vínculo: Revisor de periódico
Cargo / Enquadramento: Pós-doutoranda
Vínculo: Pesquisador visitante
Dedicação Exclusiva (DE)
Formação Acadêmica / Titulação & Pós-Doutorado
Licenciatura em Letras
Linguística e Língua Portuguesa
Título: "Representação lingüístico-computacional dos adjetivos valenciais do português"
Linguística e Língua Portuguesa
Título: "Delimitação e alinhamento de conceitos lexicalizados no inglês norte-americano e no português brasileiro"
University of Pennsylvania
Formação Complementar & Cursos de Extensão
Insvestigações sem., gram. e computacionais
Introdução ao R e algumas aplicações para LC
Carga horária: 3h
Aprendizado de máquina para tarefas de PLN
Carga horária: 4h
Automatic Speech Recognition
Carga horária: 4h
La terminología en las universidades españolas
Carga horária: 4h
Robust Wide-Coverage Parsing: Evaluations, Represe
Carga horária: 2h
Metáfora
Carga horária: 1h
Getting to grips with key words and key clusters
Carga horária: 2h
Terminologia
Carga horária: 2h
Fast and Practical Corpus Processing using Standar
Carga horária: 2h
Approaches to Statistical Machine Translation
Carga horária: 4h
Complexidade de Textos
Carga horária: 3h
Recursos para o processamento de línguas naturais
Workshop de Lexicologia/Lexicografia e Córpus
Corpus-based approaches to lexicon development
Workshop em Semântica Lexical
Machine Learning for Natural Languages
Workshop de Ontologias
Anotação semântica na prática
Carga horária: 3h
Participação em Bancas Julgadoras e Comissões (38)
Candidato(a): Cláudia Dias de Barros
"Antonímia nos adjetivos descritivos do português do Brasil: uma proposta de análise"
Universidade Federal de São Carlos
Candidato(a): Douglas Henrique Perez Pino
"Terminologia do Biodiesel: aspectos semânticos e morfológicos"
Universidade Federal de São Carlos
Candidato(a): Cláudia Dias de Barros
"Antonímia nos adjetivos descritivos do português do Brasil: uma proposta de análise"
Universidade Federal de São Carlos
Candidato(a): Érick Galani Maziero
"Detecção automática de relações multidocumento para o Português do Brasil"
Iinstituto de Ciências Matemáticas e de Computação
Candidato(a): Maria Paula Fiorim Piruzelli
"Estudo exploratório das ambiguidades linguísticas no inglês e de como elas podem comprometer a adequação da TA do inglês para o português"
Universidade Estadual Paulista Júlio de Mesquita Filho
Candidato(a): Maria Paula Fiorim Piruzelli
"Ambiguidades linguísticas no inglês e a tradução automática inglês-português: um estudo exploratório"
Universidade Estadual Paulista Júlio de Mesquita Filho
Candidato(a): Veronica Agostini
"Alinhamento Automático de Textos e Sumários Multidocumento"
Iinstituto de Ciências Matemáticas e de Computação
Candidato(a): Bianca Franco Pasqualini
"Medidas de complexidade textual e a tradução de contos em inglês para leitores brasileiros com nível de letramento básico"
Universidade Federal do Rio Grande do Sul
Candidato(a): Raphael Mendes
"Aspectos comparativos da regência verbal em português e inglês para a elaboração de um dicionário bilíngue"
Instituto de Biociências, Letras e Ciências Exatas
Candidato(a): Alessandro Yovan Bokan Garay
"Sumarização multidocumento com base em aspectos informativos"
Iinstituto de Ciências Matemáticas e de Computação
Candidato(a): Georges Basile Stávracas Neto
"Reescrita sentencial baseada em traços de personalidade"
Escola de Artes, Ciências e Humanidades
Candidato(a): Lucas Pimenta Porto
"Pós-processamento de textos de tradução automática baseado em teoria de grafos"
Universidade de São Paulo
Candidato(a): Andressa Vieira
"Um modelo de classificação para o Reconhecimento de Entidades Nomeadas"
Faculdade de Filosofia, Letras e Ciências Humanas
Candidato(a): Marcio Lima Inacio
"Sumarização de Opinião com base em Abstract Meaning Representation"
Iinstituto de Ciências Matemáticas e de Computação
Candidato(a): Matheus José Garcia Fagundes
"Combinando características léxicas e morfossintáticas para a detecção de notícias falsas em português"
Escola de Artes, Ciências e Humanidades
Candidato(a): Diego Pedro Gonçalves da Silva
"Indução gramatical automática para o português"
Iinstituto de Ciências Matemáticas e de Computação
Candidato(a): Germano Antonio Zani Jorge
"An Investigation of Multilingual and Multigenre Summarization Methods"
Iinstituto de Ciências Matemáticas e de Computação
Candidato(a): Erick Galani Maziero
"Identificação automática de relações multidocumento"
Iinstituto de Ciências Matemáticas e de Computação
Candidato(a): Valdirene Pereira da Conceição
"Modelagem léxico-ontológica do domínio "patrimônio cultural de São Luís do Maranhão""
Universidade Estadual Paulista Júlio de Mesquita Filho
Candidato(a): Felipe Iszlaji de Albuquerque
"Modelagem linguístico-computacional para o Dicionário Analógico Digital do Dicionário Criativo"
Universidade Estadual Paulista Júlio de Mesquita Filho
Candidato(a): Cláudia Dias de Barros
"Descrição e classificação de predicados nominais com verbo fazer no português"
Universidade Federal de São Carlos
Candidato(a): Merley da Silva Conrado Laguna
"Extração automática de termos baseada em Aprendizado de Máquina"
Iinstituto de Ciências Matemáticas e de Computação
Candidato(a): Dayse Simon Landim Kamikawachi
"Identificação e extração semiautomática de contextos definitórios em corpus com vistas à redação da definição terminológica: proposta de sistematização linguística para a língua portuguesa"
Universidade Federal de São Carlos
Candidato(a): Maria Lucía del Rosario Castro Jorge
"Modelagem gerativa para sumarização automática multidocumento"
Iinstituto de Ciências Matemáticas e de Computação
Candidato(a): Valdirene Pereira da Conceição
"Modelagem léxico-ontológica do "Patrimônio Cultural""
Universidade Estadual Paulista Júlio de Mesquita Filho
Candidato(a): Merley da Silva Conrado
"Método híbrido de extração de termos aplicado na mineração de textos"
Iinstituto de Ciências Matemáticas e de Computação
Candidato(a): Paula C. F. Cardoso
"Exploração de métodos de Sumarização Automática Multidocumento com base em conhecimento semântico-discursivo"
Iinstituto de Ciências Matemáticas e de Computação
Candidato(a): Felipe Iszlaji de Albuquerque
"Modelo para um dicionário analógico digital disponível na Internet"
Universidade Estadual Paulista Júlio de Mesquita Filho
Candidato(a): Fábio Henrique de Carvalho Bertonha
"Proposta lexicográfica sinonímica: locuções adverbais e preposicionais em "a", "de" e "em""
Universidade Estadual Paulista Júlio de Mesquita Filho
Candidato(a): Marco Antonio Sobrevilla Cabezudo
"Geração de língua natural por meio de representação semântica abstrata para o português brasileiro"
Iinstituto de Ciências Matemáticas e de Computação
Candidato(a): Diego Pedro Gonçalves da Silva
"Indução gramatical automática para o português"
Iinstituto de Ciências Matemáticas e de Computação
Candidato(a): Germano Antonio Zani Jorge
"An Investigation of Multilingual and Multigenre Summarization Methods"
Iinstituto de Ciências Matemáticas e de Computação
Candidato(a): Elvis Alves de Souza
"Investigação de métodos para a anotação automática de Dependências Universais Aprimoradas para o português"
Iinstituto de Ciências Matemáticas e de Computação
Candidato(a): Luiz Carlos Alves Junior
"Avaliação do uso de Inteligência Artificial Generativa na validação de colocações: um estudo descritivo com ChatGPT"
Universidade Estadual Paulista
Candidato(a): Márcio Lima Inácio
"Sumarização de Opinião com base em Abstract Meaning Representation"
Iinstituto de Ciências Matemáticas e de Computação
Candidato(a): Fernando de Paula Alves
"O ambiente computacional e-Termos como recurso para a elaboração da definição do Biodiesel"
Universidade Federal de São Carlos
Candidato(a): Arthur Pompilio Astrogildo da Silva
"A identificação semiautomática da hiponímia para a construção da hierarquia conceitual em wordnets terminológicas"
Universidade Federal de São Carlos
Candidato(a): Tiago Pereira Rodrigues
"A tradução de variantes da fala não-padrão na legendação de filmes"
Universidade Federal de São Carlos
Participação em Eventos, Congressos e Exposições (81)
V Workshop em Tecnologia da Informação e da Linguagem Humana (TIL)
Apresentação: "Towards an Automatic Strategy for Acquiring the WordNert.Br Hierarchical Relations"
XI Simpósio Nacional de Letras e Lingüística/ / I Simpósio Internacional de Letras e Lingüística (SILEL)
Apresentação: "Ontologias Lingüísticas aplicadas ao Processamento Automático de Línguas Naturais: o caso das redes wordnets"
IX Encontro de Linguística de Corpus (ELC)
Apresentação: "O Corpus.EaD no projeto TermiNet: estratégias de construção"
11th International Conference on Computational Processing of Portuguese
I Workshop on Tools and Resources for Automatically Processing Portuguese and Spanish
X Jornada de Descrição do Português (JDP)
Apresentação: "DANTEStocks-AMR em Construção: Avanços e Desafios na Anotação Semântica de Tweets Financeiros"
X Jornada de Descrição do Português (JDP)
Apresentação: "Named Entities in Stock Market Tweets: A Fine-Grained and Linguistically-Motivated Annotation"
35th Brazilian Conference on Intelligent Systems (BRACIS)
I Congresso Internacional de Estudos do Léxico (CIEL)
Apresentação: "Os termos nas wordnets: estratégias de identificação automática da sinonímia em corpus especializado"
XI Encontro de Linguística de Corpus (XI ELC)
Apresentação: "Analysis of Aspects in a Corpus of Human Multi-document Summaries of Sports News"
XI Encontro de Linguística de Corpus (XI ELC)
Apresentação: "Alinhamento manual de textos e sumários em um corpus jornalístico multidocumento"
10th Linguistic Annotation Workshop (LAW)
Apresentação: "Phrase Generalization: a Corpus Study in Multi-Document Abstracts and Original News Alignments"
6th Workshop on Portuguese Description (JDP)
Apresentação: "Subsídios linguístico-computacionais para a revisão gramatical de redações do ensino médio"
12th Brazilian Symposium in Information and Human Language Technology
IV Workshop on MSc Dissertation and PhD Thesis in Artificial Intelligence (WTDIA)
Apresentação: "REBECA ? uma Base de Dados Léxico-Conceitual Bilíngüe Inglês-Português"
VI Workshop em Tecnologia da Informação e da Linguagem Humana (TIL)
Apresentação: "OntoMethodus - A methodology to build domain-specific ontologies and its use in a system to generation of terminographic products"
59o Seminário do Grupo de Estudos Linguísticos do Estado de São Paulo (Gel)
Apresentação: "Terminologia baseada em corpus: a extração de candidatos a termo segundo a abordagem estatística no projeto TermiNet"
58o Seminário do Grupo de Estudos Linguísticos do Estado de São Paulo (Gel)
Apresentação: "Delimitação do domínio da Educação a Distância com vistas à construção da base lexical WordNet.EaD"
18o Intercâmbio de Pesquisas em Linguística Aplicada (Inpla)
Apresentação: "A construção de wordnets terminológicas a partir de corpora e a extração automática de termos"
Groupe de Linguistique Appliqué des Telecommunications (GLAT)
Apresentação: "An introduction ot the TermiNet project"
9th International Conference on Computational Processing of the Portuguese Language (PROPOR)
Young Investigators Workshop on Computational Approaches to Languages of the Americas
Apresentação: "The TermiNet project: an overview"
Student Workshop on Information and Human Language Technology (TILic)
Apresentação: "Identificação da redundância na Sumarização Automática Multidocumento: explorando métodos superficiais"
IX Brazilian Symposium in Information and Human Language Technology
The International Joint Conference IBERAMIA/SBIA/SBRN
4a Jornada Científica da UFSCAR - encontro de conhecimentos diálogo e saberes
Apresentação: "Representação lingüístico-computacional dos adjetivos valeciais no léxico do processamento automático do português"
12o Intercâmbio de Pesquisas em Lingüística Aplicada (Inpla)
Apresentação: "Etiquetagem morfossintática de 1 milhão de palavras: relatos da experiência lingüística em um processo semi-automático"
VIII Congresso de Iniciação Científica da UFSCar
Apresentação: "Especificação dos traços semânticos dos itens lexicais"
I Encontro de Estudos Diacrônicos do Português (EDiP)
7th Iberoamerican Conference on Artificial Inteligence (IBERAMIA)
15th Brazilian Conference on Artificial Inteligence (SBIA)
II Encontro de Estudos Diacrônicos do Português (EDiP)
15o Intercâmbio de Pesquisas em Lingüística Aplicada (Inpla)
Apresentação: "Extração de informações semânticas de dicionários com vistas à elaboração de léxicos lingüístico-computacionais"
VIII Encontro de Linguística de Corpus (ELC)
Apresentação: "Projetando o corpus para a construção de uma wordnet terminológica"
II Jornada de Descrição do Português (JDP)
8th Brazilian Symposium in Information and Human Language Technology (STIL)
III Jornada de Descrição do Português
VIII Jornada de Descrição do Português (JDP)
Apresentação: "Tipologia de fenômenos ortográficos e lexicais em CGU: o caso dos tweets do mercado financeiro"
VII Workshop on Portuguese Description (JDP)
Apresentação: "Descrição preliminar do corpus DANTEStocks: diretrizes de segmentação para anotação segundo Universal Dependencies"
XIV Symposium in Information and Human Language (STIL)
12th Brazilian Conference on Intelligent Systems (BRACIS)
14th Symposium in Information and Human Language Technology (STIL)
10th Brazilian Conference on Intelligent System (BRACIS)
2nd Edition of the Universal Dependencies Brazilian Festival (UDFest-BR)
IX Jornada de Descrição do Português (JDP)
15th Symposium in Information and Human Language Technology (STIL)
Apresentação: "A dependency treebank of tweets in Brazilian Portuguese: syntactic annotation issues and approach"
34th Brazilian Conference on Intelligent Systems (BRACIS)
16th Brazilian Symposium on Information and Human Language Technology (STIL 2025)
Apresentação: "NounBank.DS: a Lexical Repository of Nominal Frames from Stock Market Tweets in Brazilian Portuguese"
17th International Conference on Computational Processing of Portuguese (PROPOR)
Apresentação: "Lexical and Orthographic Variation in Portuguese Financial Tweets: Annotation, Analysis, and Implications for Embedding Models"
57o Seminário do Grupo de Estudos Linguísticos do Estado de São Paulo (Gel)
Apresentação: "O alinhamento léxico-conceitual na base de dados REBECA"
I Seminário de Pesquisa do Porgrama de Pós-Graduação em Lingüística e Língua Portuguesa da FCL/UNESP/Ar.
Apresentação: "Representação lingüístico-computacional dos adjetivos valeciais"
II Seminário de Pesquisa do Porgrama de Pós-Graduação em Lingüística e Língua Portuguesa da FCL/UNESP/Ar.
Apresentação: "Representação lingüístico-computacional dos adjetivos valeciais"
III Seminário de Pesquisa do Programa de Pós-graduação em Lingüística e Língua Portuguesa da FCL - UNESP/Ar.
Apresentação: "Representação lingüístico-computacional dos adjetivos valeciais"
II Worshop em Tecnologia da Informação e da Linguagem Humana (TIL)
Apresentação: "Edição de informações sintático-semânticas dos adjetivos na base da rede Wordnet.Br"
XLIX Seminário do Grupo de Estudos Lingüísticos do Estado de São Paulo (Gel)
Apresentação: "Tudo o que você sempre quis saber sobre a ferramenta de revisão gramatical do seu WORD e não tinha a oportunidade de perguntar"
50o Seminário do Grupo de Estudos Lingüísticos do Estado de São Paulo (Gel)
Apresentação: "Concepções de léxico e o processamento automático das línguas naturais"
XLVIII Seminário do Grupo de Estudos Lingüísticos do Estado de São Paulo (GEL)
Apresentação: "Especificação dos traços semânticos dos itens lexicais"
51o Seminário do Grupo de Estudos Lingüísticos do Estado de São Paulo (Gel)
Apresentação: "Classificações e Tipologias semânticas dos adjetivos: uma breve revisão comparativa"
XLVII Seminário do Grupo de Estudos Lingüísticos do Estado de São Paulo (GEL)
I Workshop em Tecnologia da Informação e da Linguagem Humana (TIL)
53o Seminário do Grupo de Estudos Lingüísticos do Estado de São Paulo (Gel)
III Workshop em Tecnologia da Informação e da Linguagem Humana (TIL)
V Seminário de Pesquisa do Programa de Pós-Graduação em Lingüística e Língua Portugesa
Apresentação: "Estudo e Mapeamento dos Padrões de Lexicalização de Conceitos Codificados em Nomes Concretos do Inglês e do Português"
52o Seminário do Grupo de Estudos Lingüísticos do Estado de São Paulo (Gel)
Apresentação: "Modelo lingüístico-computacional da estrutura valencial de adjetivos do português do Brasil"
I Seminário de Estudos do Léxico (SELEX)
Apresentação: "O léxico sob o olhar do Processamento Automático das Línguas Naturais e o projeto TermiNet"
I Seminário de Produção em Linguística
Apresentação: "Grupo de Linguagem Humana e Tecnologia (LHTec)"
7th Brazilian Symposium in Information and Human Language Technology (STIL)
4 Workshop em Tecnologia da Informação e da Linguagem Humana (TIL)
Apresentação: "Metodologia semi-automática baseada em corpus para a construção de ontologias de domínio"
I Worskhop do Núcleo Interinstitucional de Linguística Computacional
Apresentação: "Trabalhos em Lexicografia e Terminografia Computacional"
V Encontro para o Processamento Computacional da Língua Portuguesa Escrita e Falada (PROPOR)
I Encontro dos alunos de Pós-Graduação em Lingüística Informática (ENAPOLINF)
IV Encontro de Corpora
V Encontro de Corpora
Apresentação: "Proposta de uma metodologia para a identificação dos argumentos dos adjetivos de valência 1 da língua portuguesa a partir de córpus"
7th Workshop on Computational Processing of Written and Spoken Language (PROPOR)
Apresentação: "Methods and Tools for Encoding the WordNet.Br Sentences, Concept Glosses, and Conceptual-Semantic Relations"
Tarde de Semântica
Apresentação: "O corpus DanteStocks e as suas várias anotações semânticas"
Painel "Pesquisas em sintaxe de dependências"
Apresentação: "Construção de Tweetbanks segundo o modelo Universal Dependencies: desafios de anotação"
VI Escola Brasileira de Linguística Computacional
Workshop Comemorativo de 25 anos do NILC
Apresentação: "O Projeto SUSTENTO"
IV Escola de Linguística Computacional (EBRALC)
III Escola Brasileira de Linguística Computacional (EBRALC)
1a Semana das Ciências da Linguagem (SeCiL)
Apresentação: "Minicurso "Linguística e IA: anotação de corpus na era dos LLMs""
Prêmios e Distinções
Prêmio de 2o melhor artigo no 10th Symposium in Information and Human Language Technology (STIL 2015).
2015Sociedade Brasileira de Computação
Prêmio de 3o melhor artigo no 6th Workshop of Portuguese Description (collocated event of the 12th Brazilian Symposium in Information and Human Language Technology (STIL 2019)
2019Sociedade Brasileira de Computação
Prêmio de 3o melhor artigo no 16th Symposium in Information and Human Language Technology (STIL 2025)
2025Sociedade Brasileira de Computação
Áreas de Atuação do CNPq
Lingüística
Lingüística
Subárea: Teoria e Análise Lingüística
Especialidade: Processamento Automático das Línguas Naturais