| Nome: | Descrição: | Tamanho: | Formato: | |
|---|---|---|---|---|
| 5.01 MB | Adobe PDF |
Autores
Orientador(es)
Resumo(s)
This thesis addresses the challenges of language assessment and placement in Developmental Education (DevEd) for native English (L1) speakers, stemming from the limitations of automated systems such as Accuplacer. At Tulsa Community College (TCC), where the study was conducted, writing proficiency is assessed through Accuplacer, and students not deemed college-ready are placed in DevEd courses to strengthen their skills before advancing to collegelevel coursework. This thesis draws on nine peer-reviewed papers organized into four thematic sections and integrates Corpus Linguistics, Machine Learning (ML), and Natural Language Processing (NLP) to address these limitations. Section 1 lays the groundwork by mapping the linguistic landscape of developing writers through an annotation framework with 21 lexical, syntactic, and discourse features tailored to the DevEd context (DES). This framework is tested, refined, and applied to a newly created and publicly documented corpus of DevEd writing samples. The framework’s adaptability is further demonstrated through a cross-linguistic extension to Spanish. Building on this foundation, Section 2 integrates the 21 DES features with 436 linguistic features automatically extracted from NLP tools (Coh-Metrix, CTAP) to create a richer, more comprehensive feature set. This set is used to train and test supervised ML models against a human-produced gold standard, evaluating whether these models can replicate, and potentially improve upon, Accuplacer’s placement accuracy. The findings from these ML classification experiments lead to the questions of fairness and validity, which are addressed in Section 3. This section examines whether Accuplacer’s classifications reflect students’ actual
writing performance and whether placement outcomes are equitable across different gender and race groups. Finally, Section 4 investigates the use of Large Language Models (LLMs) as complementary tools for writing placement. Through prompt engineering and comparative evaluation, this section explores how LLMs can offer adaptive, linguistically sensitive, and more transparent alternatives to current automated classification systems. In the conclusion, this thesis synthesizes these findings, outlining key contributions, broader implications, and future research directions, all of which advocate for more linguistically informed placement practices.
Esta tese aborda os desafios da avaliação da proficiência linguística e da colocação de estudantes em programas de Developmental Education (DevEd)—termo utilizado no ensino superior dos Estados Unidos norte-americanos para designar cursos de apoio pré-universitários destinados a colmatar lacunas académicas em inglês, noutras disciplinas como a matemática — dirigidos a falantes nativos de inglês (L1), onde esta língua é também o principal veículo de instrução e avaliação. Tais desafios resultam das limitações dos sistemas automáticos de classificação. No Tulsa Community College (TCC), onde este estudo foi realizado, os estudantes demonstram a sua proficiência escrita em inglês através de um exame de admissão administrado por um destes sistemas automáticos, concretamente, o Accuplacer. Aqueles que não são considerados preparados para o ensino superior são colocados em cursos DevEd para assim reforçarem as suas competências até atingirem o nível exigido para prosseguir para unidades curriculares do nível do ensino superior (College). Entre as limitações dos sistemas de colocação automática, a precisão da colocação constitui uma questão central. Esta tese tem por base nove artigos publicados em revistas e conferências internacionais com revisão por pares, organizados em quatro secções temáticas. Nela se integram metodologias da Linguística de Corpus, de Processamento de Linguagem Natural (NLP) e de Aprendizagem Automática (ML) com o objetivo de responder a estas limitações, aumentando a transparência da avaliação, melhorando a precisão da colocação e assegurando que as decisões reflitam de forma mais rigorosa a real proficiência escrita dos estudantes em língua inglesa. A Secção 1 reúne três artigos que mapeiam o panorama linguístico de estudantes enquanto escritores em desenvolvimento, através de um quadro de anotação adaptado à proficiência em língua materna. O primeiro artigo apresenta a construção de um corpus de 100 redações de estudantes de DevEd, retiradas da base de dados do TCC e classificadas pelo Accuplacer nos níveis DevEd 1 e 2. Uma anotação-piloto produziu um conjunto específico de 21 características de DevEd (DES), abrangendo padrões ortográficos, gramaticais, lexicais e discursivos, captando tanto fragilidades como pontos fortes. Este quadro serviu de base para a elaboração de diretrizes de anotação, a formação de anotadores e o controlo da qualidade da anotação. O segundo artigo desenvolve estes resultados centrando-se em expressões multipalavra (ing., multiword expressions, MWE), através de um esquema de anotação específico, com o qual se categorizaram diferentes tipos deMWEem todo o corpus. Este recurso foi utilizado para treinar e testar diversos modelos de ML na plataforma de mineração de dados (ing., data mining) Orange. O objetivo consistiu em avaliar se a presença e o tipo de MWE tinham valor preditivo nas decisões de colocação. O terceiro artigo estendeu o quadro de anotação de MWE a um corpus de textos em espanhol, produzidos por falantes nativos e não nativos num curso de desenvolvimento de escrita (em espanhol), realizado no TCC. Procurou-se verificar se estas expressões funcionavam como indicadores fiáveis de proficiência para além do inglês.As experiências de ML no Orange testaram ainda o valor preditivo de categorias específicas de MWE e exploraram as respetivas implicações pedagógicas. A Secção 2 desloca o foco da anotação para a avaliação, com três artigos baseados no corpus de inglês (L1) e no respetivo quadro de características. O primeiro artigo apresenta um estudo em que os mesmos 100 textos iniciais foram também avaliados por dois anotadores humanos, seguindo os descritores propostos pelo Accuplacer. Como estes descritores não especificam as características linguísticas em causa nem o peso atribuído a cada uma, foi calculado o acordo interavaliador e, no caso de haver discrepâncias, estas resolvidas por um terceiro avaliador, o que constituiu um primeiro passo para estabelecer um padrão de referência validado para a classificação da escrita em DevEd. O segundo estudo ampliou a análise ao combinar as 21 características DES da Secção 1 com 436 métricas extraídas automaticamente de ferramentas de NLP (Coh-Metrix, CTAP), criando um conjunto de 457 características. As experiências deML foram conduzidas com o corpus de 100 textos, recorrendo tanto aos textos integrais (de tamanhos variáveis) como aos textos segmentados em blocos de 100 palavras, a fim de analisar o impacto da extensão textual na precisão da colocação. Quatro desenhos experimentais forneceram perspetivas complementares: (1) estabelecer linhas de base (ing., baselines) para cada conjunto de características isoladamente; (2) testar as principais características de cada fonte (Coh-Metrix, CTAP e DES), classificadas pelos índices de Ganho de Informação (ing., Information Gain) e Qui-quadrado, disponíveis na plataforma Orange; (3) aplicar o método de validação cruzada leave-one-out (LOO) para determinar a contribuição de agrupamentos de características lexicais, semânticos e discursivos; e (4) combinar as características mais informativas de todas as fontes em conjuntos progressivos de dez até a estabilização do desempenho. O terceiro artigo procurou combinar marcadores linguísticos interpretáveis, concebidos por humanos, com características extraídas automaticamente por NLP. Para isso, o corpus foi expandido de 100 para 300 redações, e as 200 novas amostras foram anotadas pelos mesmos avaliadores humanos que anotaram o conjunto inicial de 100 textos. Com recurso ao índice de Ganho de Informação, o conjunto de 457 características foi refinado para 445, tendo-se avaliado se as características mais relevantes mantinham o poder preditivo e se o conjunto atualizado aumentava a precisão dos modelos de ML. As experiências foram ainda organizadas em dois cenários: (1) corpus classificado automaticamente pelo Accuplacer; e (2) corpus classificado por anotadores humanos, replicando a abordagem incremental do estudo anterior. A Secção 3 apresenta dois artigos dedicados à validade e à equidade da colocação. O primeiro estudou se as classificações do Accuplacer refletem efetivamente o desempenho e a proficiência na escrita dos estudantes, aplicando os descritores refinados da Secção 2 ao corpus e comparando a precisão das classificações automáticas e humanas em diferentes experiências de ML.Osegundo artigo analisou se variáveis sociodemográficas, nomeadamente, o género e a raça, influenciavam os resultados da colocação. Num subconjunto de 210 redações, representativo dos estudantes do TCC, foram aplicados três testes estatísticos: (1) ANOVA (para diferenças entre grupos), (2) Tukey’s HSD (para localizar diferenças específicas) e (3) Qui-quadrado (para determinar as associações entre variáveis sociodemográficas e resultados de colocação). A Secção 4 explora em que medida Modelos de Linguagem de Grande Escala (LLMs) podem servir como ferramentas complementares de colocação. Com um corpus expandido de 450 redações, balanceado por níveis DevEd e universitário, alguns modelos, como o ChatGPT, o Claude e o Gemini, foram comparados com a classificação produzida pelo Accuplacer e com a classificação de referência, produzida por avaliadores humanos. Adotaram-se duas estratégias de classificação: (1) classificação multinível num único passo (três níveis: DevEd 1, DevEd 2, Ensino Superior); e (2) classificação em dois passos, separando primeiro os níveis DevEd do Ensino Superior, e, depois, subdividindo os níveis DevEd em Nível 1 e Nível 2. Foram testadas quatro condições de instrução (prompting): Zero-shot (sem exemplos), Few-shot (com poucos exemplos), Enhanced (instruções detalhadas) e Enhanced+ (instruções detalhadas com reforço adicional). O objetivo desta estratégia foi avaliar se a inclusão de marcadores linguísticos detalhados permitia aumentar a precisão de classificação. Esta tese conclui com uma síntese das principais contribuições dos estudos apresentados, destacando as suas implicações mais amplas e indicando direções futuras de investigação, defendendo práticas de colocação que combinem características linguísticas interpretáveis, com recurso a Processamento Computacional de Linguagem Natural (NLP), Aprendizagem Automática (ML) e Modelos de Língua de Grande Escala (LLM), de modo a apoiar de forma mais justa e eficaz o sucesso académico dos estudantes no ensino superior.
Esta tese aborda os desafios da avaliação da proficiência linguística e da colocação de estudantes em programas de Developmental Education (DevEd)—termo utilizado no ensino superior dos Estados Unidos norte-americanos para designar cursos de apoio pré-universitários destinados a colmatar lacunas académicas em inglês, noutras disciplinas como a matemática — dirigidos a falantes nativos de inglês (L1), onde esta língua é também o principal veículo de instrução e avaliação. Tais desafios resultam das limitações dos sistemas automáticos de classificação. No Tulsa Community College (TCC), onde este estudo foi realizado, os estudantes demonstram a sua proficiência escrita em inglês através de um exame de admissão administrado por um destes sistemas automáticos, concretamente, o Accuplacer. Aqueles que não são considerados preparados para o ensino superior são colocados em cursos DevEd para assim reforçarem as suas competências até atingirem o nível exigido para prosseguir para unidades curriculares do nível do ensino superior (College). Entre as limitações dos sistemas de colocação automática, a precisão da colocação constitui uma questão central. Esta tese tem por base nove artigos publicados em revistas e conferências internacionais com revisão por pares, organizados em quatro secções temáticas. Nela se integram metodologias da Linguística de Corpus, de Processamento de Linguagem Natural (NLP) e de Aprendizagem Automática (ML) com o objetivo de responder a estas limitações, aumentando a transparência da avaliação, melhorando a precisão da colocação e assegurando que as decisões reflitam de forma mais rigorosa a real proficiência escrita dos estudantes em língua inglesa. A Secção 1 reúne três artigos que mapeiam o panorama linguístico de estudantes enquanto escritores em desenvolvimento, através de um quadro de anotação adaptado à proficiência em língua materna. O primeiro artigo apresenta a construção de um corpus de 100 redações de estudantes de DevEd, retiradas da base de dados do TCC e classificadas pelo Accuplacer nos níveis DevEd 1 e 2. Uma anotação-piloto produziu um conjunto específico de 21 características de DevEd (DES), abrangendo padrões ortográficos, gramaticais, lexicais e discursivos, captando tanto fragilidades como pontos fortes. Este quadro serviu de base para a elaboração de diretrizes de anotação, a formação de anotadores e o controlo da qualidade da anotação. O segundo artigo desenvolve estes resultados centrando-se em expressões multipalavra (ing., multiword expressions, MWE), através de um esquema de anotação específico, com o qual se categorizaram diferentes tipos deMWEem todo o corpus. Este recurso foi utilizado para treinar e testar diversos modelos de ML na plataforma de mineração de dados (ing., data mining) Orange. O objetivo consistiu em avaliar se a presença e o tipo de MWE tinham valor preditivo nas decisões de colocação. O terceiro artigo estendeu o quadro de anotação de MWE a um corpus de textos em espanhol, produzidos por falantes nativos e não nativos num curso de desenvolvimento de escrita (em espanhol), realizado no TCC. Procurou-se verificar se estas expressões funcionavam como indicadores fiáveis de proficiência para além do inglês.As experiências de ML no Orange testaram ainda o valor preditivo de categorias específicas de MWE e exploraram as respetivas implicações pedagógicas. A Secção 2 desloca o foco da anotação para a avaliação, com três artigos baseados no corpus de inglês (L1) e no respetivo quadro de características. O primeiro artigo apresenta um estudo em que os mesmos 100 textos iniciais foram também avaliados por dois anotadores humanos, seguindo os descritores propostos pelo Accuplacer. Como estes descritores não especificam as características linguísticas em causa nem o peso atribuído a cada uma, foi calculado o acordo interavaliador e, no caso de haver discrepâncias, estas resolvidas por um terceiro avaliador, o que constituiu um primeiro passo para estabelecer um padrão de referência validado para a classificação da escrita em DevEd. O segundo estudo ampliou a análise ao combinar as 21 características DES da Secção 1 com 436 métricas extraídas automaticamente de ferramentas de NLP (Coh-Metrix, CTAP), criando um conjunto de 457 características. As experiências deML foram conduzidas com o corpus de 100 textos, recorrendo tanto aos textos integrais (de tamanhos variáveis) como aos textos segmentados em blocos de 100 palavras, a fim de analisar o impacto da extensão textual na precisão da colocação. Quatro desenhos experimentais forneceram perspetivas complementares: (1) estabelecer linhas de base (ing., baselines) para cada conjunto de características isoladamente; (2) testar as principais características de cada fonte (Coh-Metrix, CTAP e DES), classificadas pelos índices de Ganho de Informação (ing., Information Gain) e Qui-quadrado, disponíveis na plataforma Orange; (3) aplicar o método de validação cruzada leave-one-out (LOO) para determinar a contribuição de agrupamentos de características lexicais, semânticos e discursivos; e (4) combinar as características mais informativas de todas as fontes em conjuntos progressivos de dez até a estabilização do desempenho. O terceiro artigo procurou combinar marcadores linguísticos interpretáveis, concebidos por humanos, com características extraídas automaticamente por NLP. Para isso, o corpus foi expandido de 100 para 300 redações, e as 200 novas amostras foram anotadas pelos mesmos avaliadores humanos que anotaram o conjunto inicial de 100 textos. Com recurso ao índice de Ganho de Informação, o conjunto de 457 características foi refinado para 445, tendo-se avaliado se as características mais relevantes mantinham o poder preditivo e se o conjunto atualizado aumentava a precisão dos modelos de ML. As experiências foram ainda organizadas em dois cenários: (1) corpus classificado automaticamente pelo Accuplacer; e (2) corpus classificado por anotadores humanos, replicando a abordagem incremental do estudo anterior. A Secção 3 apresenta dois artigos dedicados à validade e à equidade da colocação. O primeiro estudou se as classificações do Accuplacer refletem efetivamente o desempenho e a proficiência na escrita dos estudantes, aplicando os descritores refinados da Secção 2 ao corpus e comparando a precisão das classificações automáticas e humanas em diferentes experiências de ML.Osegundo artigo analisou se variáveis sociodemográficas, nomeadamente, o género e a raça, influenciavam os resultados da colocação. Num subconjunto de 210 redações, representativo dos estudantes do TCC, foram aplicados três testes estatísticos: (1) ANOVA (para diferenças entre grupos), (2) Tukey’s HSD (para localizar diferenças específicas) e (3) Qui-quadrado (para determinar as associações entre variáveis sociodemográficas e resultados de colocação). A Secção 4 explora em que medida Modelos de Linguagem de Grande Escala (LLMs) podem servir como ferramentas complementares de colocação. Com um corpus expandido de 450 redações, balanceado por níveis DevEd e universitário, alguns modelos, como o ChatGPT, o Claude e o Gemini, foram comparados com a classificação produzida pelo Accuplacer e com a classificação de referência, produzida por avaliadores humanos. Adotaram-se duas estratégias de classificação: (1) classificação multinível num único passo (três níveis: DevEd 1, DevEd 2, Ensino Superior); e (2) classificação em dois passos, separando primeiro os níveis DevEd do Ensino Superior, e, depois, subdividindo os níveis DevEd em Nível 1 e Nível 2. Foram testadas quatro condições de instrução (prompting): Zero-shot (sem exemplos), Few-shot (com poucos exemplos), Enhanced (instruções detalhadas) e Enhanced+ (instruções detalhadas com reforço adicional). O objetivo desta estratégia foi avaliar se a inclusão de marcadores linguísticos detalhados permitia aumentar a precisão de classificação. Esta tese conclui com uma síntese das principais contribuições dos estudos apresentados, destacando as suas implicações mais amplas e indicando direções futuras de investigação, defendendo práticas de colocação que combinem características linguísticas interpretáveis, com recurso a Processamento Computacional de Linguagem Natural (NLP), Aprendizagem Automática (ML) e Modelos de Língua de Grande Escala (LLM), de modo a apoiar de forma mais justa e eficaz o sucesso académico dos estudantes no ensino superior.
Descrição
Palavras-chave
Developmental Education (DevEd) Colocação em Escrita Proficiência na Escrita em Língua Materna Aprendizagem Automática Processamento de Linguagem Natural Modelos de Linguagem de Grande Escala
