<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>KG-Quizzer: Refinamento de Prompts via Grafos de Conhecimento para a Geração Automática de Questionários em Português</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>Davisson Medeiros</string-name>
          <email>dvsmedeiros.research@gmail.com</email>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Gabriel Leite</string-name>
          <email>gabriel.dfleite@gmail.com</email>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>André Gomes Regino</string-name>
          <email>aregino@cti.gov.br</email>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Victor Jesus Sotelo Chico</string-name>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Ferrucio de Franco Rosa</string-name>
          <email>ferrucio.rosa@cti.gov.br</email>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Julio Cesar dos Reis</string-name>
          <email>jreis@ic.unicamp.br</email>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <aff id="aff0">
          <label>0</label>
          <institution>Center for Technology Information Renato Archer</institution>
          ,
          <country country="BR">Brazil</country>
        </aff>
        <aff id="aff1">
          <label>1</label>
          <institution>Instituto de Computação, Universidade Estadual de Campinas</institution>
          ,
          <addr-line>UNICAMP</addr-line>
          ,
          <country country="BR">Brazil</country>
        </aff>
      </contrib-group>
      <pub-date>
        <year>2026</year>
      </pub-date>
      <fpage>38</fpage>
      <lpage>50</lpage>
      <kwd-group>
        <kwd>eol&gt;Knowledge Graphs</kwd>
        <kwd>Text Generative Models</kwd>
        <kwd>Verbalization</kwd>
        <kwd>Questionnaire Generation</kwd>
        <kwd>LLMs</kwd>
      </kwd-group>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>1. Introdução</title>
      <p>
        A falta de acesso à educação de qualidade no Brasil é um desafio social crítico, afetando principalmente
professores e alunos de escolas públicas em regiões de baixa renda. Obstáculos como a superlotação das
salas e a falta de materiais didáticos adequados dificultam o ensino personalizado e podem comprometer
o desempenho acadêmico dos estudantes [
        <xref ref-type="bibr" rid="ref1">1</xref>
        ]. Nesse cenário, questionários surgem como uma ferramenta
valiosa para avaliação contínua e formativa [
        <xref ref-type="bibr" rid="ref2">2</xref>
        ], mas sua elaboração e correção manual demandam um
tempo e esforço que sobrecarregam ainda mais os professores, tornando sua implementação um desafio.
      </p>
      <p>
        A criação automática de questionários eficazes apresenta desafios, como a garantia de alinhamento
com os objetivos pretendidos, a formulação clara de perguntas e a adaptação às diversas necessidades
dos respondentes [
        <xref ref-type="bibr" rid="ref3">3</xref>
        ]. Esses desafios são potencializados pela crescente demanda por personalização no
ensino e relevância das avaliações, que precisam ser adaptadas a diferentes níveis de conhecimento [
        <xref ref-type="bibr" rid="ref4">4</xref>
        ].
      </p>
      <p>Nesse cenário, o problema central consiste em como desenvolver métodos e ferramentas
computacionais de apoio na construção de avaliações educacionais, em específico, questionários, que sejam
efetivos, personalizáveis e adaptáveis aos diferentes níveis de conhecimento dos alunos, tendo potencial
de contribuir para diminuir a sobrecarga de trabalho dos professores. O processo de criação
manual de questionários se demonstra oneroso, dificultando o processo de acompanhamento contínuo e
individualizado dos alunos.</p>
      <p>Esta pesquisa objetiva especificar, desenvolver e avaliar um framework computacional (KG-Quizzer)
para a geração automática de questionários (pares de pergunta e resposta). Assumimos que ao combinar
dados estruturados provenientes de Grafos de Conhecimentos (KGs) pode beneficiar o refinamento de
prompts em Modelos de Linguagem de Grande Escala (LLMs). Neste trabalho, o termo KGs é empregado
para se referir a bases de conhecimento representadas por triplas RDF, com foco específico na DBpedia.
Nossa solução visa efetuar uma integração dessas tecnologias, pois os KGs atuam como conhecimento
externo estruturado sobre o tema das questões a serem geradas. Em nossa solução, KGs beneficiam
como meio de minimizar a alucinação (fenômeno no qual o texto gerado pelo LLM contêm imprecisões
ou não faz sentido) dos modelos LLM e melhor contextualizar o tema na geração do questionário.</p>
      <p>
        Mais especificamente, visamos verificar qual a influência da utilização de triplas RDFs, extraídas de
KGs, na qualidade da geração das perguntas e respostas por LLMs, assim como, qual a diferença de
efetividade (qualidade dos resultados) ao fornecer as triplas em formato RDF bruto em comparação com
a sua forma verbalizada em linguagem natural. Verificamos igualmente qual o ganho de qualidade dos
resultados obtidos ao se empregar a técnica de Few-shot Learning [
        <xref ref-type="bibr" rid="ref5">5</xref>
        ] para guiar o LLM na geração de
perguntas e respostas.
      </p>
      <p>Os resultados experimentais revelam uma forte dependência da qualidade da geração em relação às
estratégias de tratamento de dados e ao modelo de linguagem utilizado. Evidenciou-se que a aplicação
de técnicas de engenharia de prompt, como a verbalização de triplas de conhecimento, melhora
signiifcativamente a legibilidade e a simplicidade do texto gerado, priorizando a qualidade linguística. A
utilização das triplas em formato RDF resulta em textos mais bem estruturados, priorizando a corretude.
Constatou-se que a qualidade textual é aprimorada pela contextualização do prompt. Dentre as
abordagens avaliadas, a técnica Few-shot Learning se mostrou como a mais efetiva, alcançando um padrão
de qualidade superior na geração dos questionários. Esses achados reforçam que uma estratégia de
interação bem definida é fundamental para a geração de conteúdo confiável e de alto valor.</p>
      <p>A contribuição central desta investigação materializa-se na proposição do nosso framework para a
construção de questionários educacionais, fundamentado na sinergia entre KG e LLM. Nosso estudo
oferece contribuições específicas ao investigar sistematicamente o impacto que o uso de triplas de
conhecimento, provindas de um KG, exerce sobre a qualidade da geração de questionários. Nossa
pesquisa contribui ao avaliar comparativamente os ganhos de se utilizar as triplas em seu formato
RDF bruto em contraste com uma representação verbalizada. Avançamos em se analisar originalmente
o impacto da técnica Few-shot Learning na efetividade da produção dos questionários em português,
buscando otimizar a interação com o LLM e a relevância das perguntas geradas.</p>
      <p>O restante desse artigo está estruturado da seguinte maneira: a Seção 2 apresenta os trabalhos
relacionados; a Seção 3 apresenta o Framework proposto; a Seção 4 descreve a metodologia experimental;
a Seção 5 descreve os resultados; a Seção 6 discute nossos achados. A Seção 7 conclui o artigo.</p>
    </sec>
    <sec id="sec-2">
      <title>2. Trabalhos Relacionados</title>
      <p>A aplicação de LLMs para gerar e avaliar conteúdo educacional tornou-se uma área de pesquisa
proeminente. Analisamos trabalhos recentes que exploram o uso de LLMs na Geração Automática de Questões
e no desenvolvimento de novos paradigmas de avaliação.</p>
      <p>
        He et al. [
        <xref ref-type="bibr" rid="ref6">6</xref>
        ] analisaram o uso do modelo de linguagem ChatGLM na geração de questões para o
currículo de tecnologia da informação no ensino médio. Compararam questões geradas por humanos e
pela IA, avaliadas por especialistas segundo critérios como relevância, dificuldade e imparcialidade. O
ChatGLM apresentou desempenho comparável ao dos humanos na maioria dos critérios, evidenciando
potencial para reduzir a carga de trabalho docente. Contudo, demonstrou limitações na formulação de
questões que exigem aplicação prática, revelando desafios persistentes dos LLMs em traduzir
conhecimento teórico para contextos reais.
      </p>
      <p>
        Kido et al. [
        <xref ref-type="bibr" rid="ref7">7</xref>
        ] investigaram a geração de questões de múltipla escolha para o Exame Nacional de
Enfermagem Japonês, com foco na criação de distratores, identificada como a parte mais desafiadora. Os
autores utilizaram dados de exames anteriores e avaliaram quatro LLMs: GPT-4, ChatGPT (utilizando as
técnicas de Fine-Tuning e Few-Shot) e o Japanese Stable LM (JSLM). Efetuaram o ajuste fino de ChatGPT
e JSLM com somente 193 questões, enquanto GPT-4 e ChatGPT usaram aprendizado em contexto
(FewShot). Introduziram novas métricas de avaliação com base em similaridade semântica, complementadas
por avaliação humana. O ChatGPT ajustado teve melhor efetividade em precisão e recuperação, e o
GPT-4 gerou distratores mais aceitos por especialistas, apesar de menos correspondentes ao conjunto de
referência. As métricas de similaridade mostraram-se mais adequadas que as tradicionais para avaliar
distratores com equivalência semântica. Os resultados indicaram que o ajuste fino pode ser mais eficaz
que Few-shot Learning em tarefas específicas de Geração Automática de Questões (GAQ), mesmo com
conjuntos de dados pequenos.
      </p>
      <p>
        Karvinen [
        <xref ref-type="bibr" rid="ref8">8</xref>
        ] propuseram um sistema que usa o GPT-3.5-Turbo para gerar pré-questões de múltipla
escolha com base em livros didáticos, voltado a alunos do ensino superior. Para lidar com a limitação
de tokens dos LLMs e evitar alucinações, o sistema segmenta o conteúdo dos livros e aplica busca por
similaridade (usando FAISS com embeddings da OpenAI) para selecionar partes relevantes conforme
o termo de busca. As questões geradas foram avaliadas manualmente quanto à fundamentação no
material, legibilidade, variedade e falhas. O sistema teve melhor desempenho que o ChatGPT em relação
à fundamentação (94,9% vs. 72,6%) e gerou questões com legibilidade adequada. A arquitetura baseada
em segmentação e recuperação de contexto se demonstrou eficaz para garantir precisão factual. O
estudo destacou o uso das questões como ferramenta pedagógica para engajamento e aprendizagem,
ampliando o papel dos LLMs na educação para além da avaliação.
      </p>
      <p>
        Chico et al. [
        <xref ref-type="bibr" rid="ref9">9</xref>
        ] propuseram uma estrutura baseada em IA generativa para a criação automática
de quizzes de múltipla escolha (MCQs) a partir de textos em linguagem natural em português, com
foco em contextos educacionais. A abordagem considerou modelos de linguagem do tipo
encoderdecoder, como o T5 e sua variante ajustada para o português (PTT5), combinando técnicas de
finetuning e engenharia de prompts. Para avaliar a qualidade das questões geradas, exploraram métricas
automáticas de legibilidade, complexidade sintática e diversidade lexical (Brunet, Yngve), além de análises
qualitativas. Os resultados indicaram que modelos refinados, especialmente o PTT5, apresentaram
melhor desempenho em legibilidade e diversidade em comparação às variantes do Flan-T5. Revelaram
que a engenharia de prompts, embora menos custosa computacionalmente, gerou resultados comparáveis
ao fine-tuning em diversos cenários. A proposta amplia o uso de LLMs na educação, não somente como
suporte à avaliação, mas também como ferramenta ativa na geração de atividades que promovem o
engajamento e o aprendizado dos estudantes.
      </p>
      <p>
        Nossa abordagem, denominada KG-Quizzer, concentra-se na definição de um pipeline para a geração
de pares de pergunta e resposta em português via LLMs, fundamentados em conhecimento estruturado
via KGs. Utilizamos LLMs para gerar e validar os pares de pergunta e resposta, tendo como fonte de
conhecimento KGs e técnicas de engenharia de prompt, como Few-shot. O foco na automação da criação
de conteúdo avaliativo alinha-se com He et al. [
        <xref ref-type="bibr" rid="ref6">6</xref>
        ], que também visam reduzir o esforço humano via
assistência das LLMs. Semelhante a Kido et al. [
        <xref ref-type="bibr" rid="ref7">7</xref>
        ] e Karvinen [
        <xref ref-type="bibr" rid="ref8">8</xref>
        ], o KG-Quizzer envolve a definição e a
geração de questões a partir de uma base de conhecimento específica, no nosso caso a DBpedia.
      </p>
      <p>
        A literatura aborda desafios centrais, como garantir a fidelidade factual do conteúdo gerado e a
dificuldade dos modelos em criar questões que exijam aplicação prática do conhecimento.
Adicionalmente, a avaliação da qualidade e da imparcialidade dos LLMs emerge como um campo crítico, uma vez
que um questionário mal formulado representa um risco ao aprendizado do aluno. Embora trabalhos
relacionados (por exemplo, He et al.[
        <xref ref-type="bibr" rid="ref6">6</xref>
        ], Kido et al.[
        <xref ref-type="bibr" rid="ref7">7</xref>
        ], Karvinen [
        <xref ref-type="bibr" rid="ref8">8</xref>
        ]) se concentrem em gerar questões a
partir de fontes de texto em linguagem natural, nossa abordagem é específica para investigar
sistematicamente como a qualidade da geração é impactada pela integração de conhecimento estruturado
de KGs. Diferentemente de Karvinen [
        <xref ref-type="bibr" rid="ref8">8</xref>
        ], que utiliza LLMs para geração baseada na recuperação de
trechos de texto, nossa proposta se concentra na injeção de triplas RDF ou verbalizadas extraídas de
KGs, permitindo um controle mais rigoroso da proveniência factual.
      </p>
      <p>
        Adicionalmente, enquanto Kido et al. [
        <xref ref-type="bibr" rid="ref7">7</xref>
        ] exploraram métricas automatizadas e He et al.[
        <xref ref-type="bibr" rid="ref6">6</xref>
        ] dependem
de especialistas humanos para avaliação, nossa abordagem emprega uma LLM como validador em um
pipeline de duas etapas, inspirado no conceito de LLM-as-a-Judge e a utilização de métricas textuais
Nilcmetrix [
        <xref ref-type="bibr" rid="ref10">10</xref>
        ], para uma filtragem automática. Isso distingue nosso trabalho de He et al. [
        <xref ref-type="bibr" rid="ref6">6</xref>
        ]e se alinha
mais com a ênfase na sinergia homem-máquina de Kido et al.[
        <xref ref-type="bibr" rid="ref7">7</xref>
        ] para otimizar a qualidade da geração.
      </p>
      <p>
        Uma distinção fundamental é que, enquanto os trabalhos de Kido et al. [
        <xref ref-type="bibr" rid="ref7">7</xref>
        ] e Karvinen [
        <xref ref-type="bibr" rid="ref8">8</xref>
        ] operam
sobre fontes de dados textuais, nosso escopo atual atua na integração e análise do impacto direto dos
KGs. Embora nossa abordagem compartilhe estratégias baseadas em LLM com outros trabalhos, nossa
investigação se distingue por seu foco na análise comparativa do uso de conhecimento estruturado
(triplas RDF vs. verbalizações) e técnicas de aprendizado em contexto para a tarefa de geração de
questionários. Apesar do considerável número de estudos sobre o uso de LLMs no suporte à criação de
conteúdo educacional, a literatura carece de pesquisas sobre o refinamento da geração de questionários
através da injeção controlada de conhecimento estruturado de KGs no contexto de Língua Portuguesa.
      </p>
    </sec>
    <sec id="sec-3">
      <title>3. KG-Quizzer</title>
      <p>KG-Quizzer é um framework desenvolvido para automatizar a geração de pares pergunta-resposta em
linguagem natural na língua portuguesa, combinando a capacidade generativa dos LLMs com dados
estruturados extraídos de KGs. A proposta central do framework é enriquecer (refinar) semanticamente os
prompts utilizados na geração, por meio da incorporação controlada de conhecimento factual e exemplos,
visando a produção de questionários mais relevantes, coerentes e semanticamente consistentes.</p>
      <p>A Figura 1 apresenta o funcionamento do framework com um diagrama de arquitetura conceitual. O
diagrama apresenta os módulos principais do framework, suas entradas e saídas, descrevendo o fluxo
completo desde a entrada de um tópico, tema do questionário, até a validação final dos pares gerados.
Figura 1: Arquitetura Conceitual do KG-Quizzer.</p>
      <p>O processo se inicia a partir de um tópico de entrada (I1), que representa o conceito central a
ser explorado. Esse tópico é utilizado como chave para recuperação de informação estruturada,
processadas pelo Módulo (A1), que reúne dados provenientes de três fontes principais: triplas
extraídas de KGs por meio de consultas1 2SPARQL, como a consulta de abstracts e a consulta de triplas
relacionadas) (1 = { 1,  2, . . . ,  }, onde cada   é uma tripla RDF extraída do grafo de
conhecimento), exemplos de pares pergunta-resposta representativos do domínio selecionado pelo tópico
(2 = {(1, 1), (2, 2), . . . , (, )}, onde  é uma pergunta e  sua respectiva resposta) e versões
verbalizadas das triplas (3 = {1, 2, . . . , }, onde cada  é uma sentença em linguagem natural
correspondente à tripla  ).</p>
      <p>As triplas obtidas podem ser utilizadas diretamente ou processadas pelo Módulo (A2), responsável
por sua verbalização. Esse processo transforma representações formais (como RDF) em sentenças em
linguagem natural, facilitando a integração com os modelos de linguagem. O Módulo (A3) realiza a
montagem da instrução (prompt) 3 4 5, organizando os elementos disponíveis: tópico, contexto
estruturado, exemplos, fatos e instruções, conforme o cenário configurado, utilizando três variantes principais
de prompts: um zero-shot, outro zero-shot com triplas, e um few-shot com triplas e exemplos. A
construção da instrução é flexível e parametrizável, permitindo diferentes estratégias de contextualização e
orientação da geração.</p>
      <p>O prompt estruturado é enviado ao Módulo (A4), responsável pela geração dos pares
perguntaresposta com apoio de um modelo de linguagem. A saída é armazenada como artefato intermediário
(1 = {(1′, ′1), (2′, ′2), . . . , (′, ′)}, em que cada par é produzido por um modelo de linguagem).</p>
      <p>Na sequência, os pares são submetidos ao Módulo (A5), que realiza uma validação automática via um
segundo modelo de linguagem. Essa etapa visa julgar a qualidade das perguntas e respostas quanto à
completude, clareza, consistência, adequação linguística e correção gramatical, gerando um artefato de
avaliação (2 = {1, 2, . . . , }, em que  representa o resultado da avaliação do par (′, ′)).</p>
      <p>
        A última etapa do processo é conduzida pelo Módulo (A6), que executa o pós-processamento dos
pares gerados. Isso inclui tarefas como normalização textual, cálculo de métricas como as fornecidas
pelo pacote NILC-Metrix [
        <xref ref-type="bibr" rid="ref10">10</xref>
        ], capazes de refletir a coesão, coerência e nível de complexidade textual,
ifltragem de pares malformados e organização dos resultados. O produto dessa etapa (F1) é um conjunto
consolidado e validado de pares pergunta-resposta (3 = {(1′′, ′1′), . . . , (′′, ′′)}).
      </p>
    </sec>
    <sec id="sec-4">
      <title>4. Metodologia da Avaliação Experimental</title>
      <p>A arquitetura conceitual de KG-Quizzer foi instanciada em um protocolo experimental sistemático,
ilustrado na Figura 2, no qual cada componente da arquitetura foi operacionalizado ao longo das etapas
de ponta a ponta.O experimento foi conduzido visando mensurar o impacto de diferentes estratégias de
enriquecimento semântico na qualidade dos pares pergunta-resposta produzidos pelo KG-Quizzer.</p>
      <sec id="sec-4-1">
        <title>4.1. Protocolo Experimental</title>
        <p>O Protocolo Experimental para avaliação do KG-Quizzer (Figura 2) representa a instanciação da
arquitetura do KG-Quizzer no experimento conduzido. Cada módulo foi operacionalizado com artefatos
concretos e fontes reais de dados, seguindo a mesma estrutura modular apresentada na Figura 1.</p>
        <p>
          Os tópicos (E1) foram extraídos da versão em português do Stanford Question Answering Dataset
(SQuAD) [
          <xref ref-type="bibr" rid="ref11">11</xref>
          ], o qual consiste de um dataset de compreensão de leitura com perguntas sobre artigos da
Wikipédia, onde a resposta para cada pergunta é um trecho de texto extraído da própria passagem de
leitura, e enviados ao módulo de consulta (A1), que coleta: a) dados estruturados da DBpedia [
          <xref ref-type="bibr" rid="ref12">12</xref>
          ] (E2),
b) exemplos Few-shot do próprio SQuAD (E3) e; c) as verbalizações disponíveis para predicados RDF
(E4). Esses dados são processados para retornar triplas RDF e gerar suas versões verbalizadas (A2).
1https://github.com/dvsmedeiros/kg-quizzer/blob/main/queries/abstract.txt
2https://github.com/dvsmedeiros/kg-quizzer/blob/main/queries/triplas-relacionadas.txt
3https://github.com/dvsmedeiros/kg-quizzer/tree/main/prompts/zero-shot.txt
4https://github.com/dvsmedeiros/kg-quizzer/tree/main/prompts/zero-shot-triplas.txt
5https://github.com/dvsmedeiros/kg-quizzer/tree/main/prompts/few-shot-triplas.txt
Figura 2: Protocolo Experimental para Avaliação do KG-Quizzer.
        </p>
        <p>Com os dados processados, os prompts são compostos (A3) conforme cinco estratégias experimentais
distintas, que combinam a presença ou ausência de exemplos (Zero-shot ou Few-shot) com diferentes
formas de expressão do conhecimento (RDF ou verbalizada). A Tabela 1 apresenta um resumo conceitual
desses cinco cenários de geração.</p>
        <p>Tabela 1
Descrição dos cenários experimentais para geração de questões.  refere-se a um dos  = 35 tópicos e  a um
dos  = 18 modelos utilizados. Foram definidos cinco tipos de cenário: C0 corresponde ao zero-shot simples,
enquanto C1 a C4 envolvem triplas RDF em diferentes combinações de técnica e representação. Cada conjunto
com triplas (zero-shot ou few-shot) soma 1.260 cenários considerando ambos os formatos (verbalizado e RDF),
totalizando 3.150 combinações conforme:  ×  + 2 ×  × ( ×  ).</p>
        <p>Identificador</p>
        <p>Tópico</p>
        <p>Modelo</p>
        <p>Técnica de Prompt</p>
        <p>Representação da Tripla</p>
        <p>Nº de Cenários</p>
        <p>A aplicação sistemática desses cinco cenários a todos os 35 tópicos e 18 modelos de linguagem resultou
em um total de 3.150 combinações experimentais. Apresentamos a decomposição dessa quantidade
com base nos tipos de estratégias e formatos empregados.</p>
      </sec>
      <sec id="sec-4-2">
        <title>4.2. Seleção dos Tópicos e Consulta ao Grafo de Conhecimento</title>
        <p>Os tópicos utilizados no experimento foram selecionados a partir da versão em português do conjunto
de dados SQuAD, amplamente reconhecido por sua variedade temática e relevância educacional. Todos
os 35 tópicos disponíveis foram incorporados, garantindo diversidade e equilíbrio entre diferentes
domínios do conhecimento. A seleção contempla áreas como ciência, história, geografia e tecnologia
(e.g., “Sistema Imunitário”, “Peste Negra” e “Teoria da Complexidade Computacional”). Cada tópico foi
utilizado como base para a recuperação de conhecimento estruturado na DBpedia e também para a
seleção de exemplos Few-shot.</p>
      </sec>
      <sec id="sec-4-3">
        <title>4.3. Representações Semânticas e Construção de Prompts</title>
        <p>O protocolo experimental foi elaborado para avaliar de forma sistemática o impacto de diferentes
estratégias de prompt e representações semânticas na qualidade dos pares pergunta-resposta gerados
pelo framework. A construção dos prompts considerou três fatores principais: (a) o tipo de estratégia
de geração (zero-shot ou few-shot), (b) a forma de expressão do conhecimento (sem triplas, com triplas
RDF ou verbalizadas); e (c) a presença ou não de exemplos. Essas combinações resultaram em cinco
cenários experimentais: zero-shot sem conhecimento adicional, zero-shot com triplas RDF, zero-shot
com triplas verbalizadas, few-shot com triplas RDF e few-shot com triplas verbalizadas.</p>
        <p>As triplas RDF foram extraídas da DBpedia em inglês, devido à maior cobertura e disponibilidade de
resultados. Após a recuperação, foram aplicados filtros para remover predicados semanticamente
irrelevantes, como metadados técnicos, links externos ou descritores genéricos. O predicado dbo:abstract
também foi excluído, pois seu conteúdo é consultado separadamente e incorporado ao contexto textual.
Para facilitar a interpretação pelos modelos, as triplas RDF foram verbalizadas em linguagem natural6.
Cada predicado foi mapeado manualmente para expressões equivalentes em português, adotando como
critério de tradução a preservação do sentido semântico original. Por exemplo, dbo:capital foi
representado como “tem como capital” ou “has as capital”. Uma tripla como Brazil dbo:capital
Brasília resultou em uma sentença mais legível: “O Brasil tem como capital Brasília”.</p>
        <p>Nos cenários com triplas, a quantidade incluída no prompt foi ajustada com base na capacidade de
contexto dos modelos de linguagem. Embora alguns suportem até 128.000 tokens, o limite foi fixado
em 8.000 tokens para compatibilidade geral. Parte desse espaço foi reservada para instruções, resumo
do tópico e formatação; o restante foi utilizado para triplas. Se a quantidade de triplas excedesse o
espaço disponível, aplicava-se um corte sequencial conforme a ordem da consulta SPARQL. Os exemplos
Few-shot foram obtidos a partir do SQuAD em português, considerando somente aqueles relacionados
ao mesmo tópico e com perguntas válidas e respondidas. O número máximo por prompt foi de dez
exemplos, valor alinhado ao número de pares avaliados posteriormente, assegurando consistência entre
geração e avaliação.</p>
      </sec>
      <sec id="sec-4-4">
        <title>4.4. LLMs Utilizados e Configuração de Geração</title>
        <p>Foram selecionados 18 LLMs com base em critérios que asseguram diversidade arquitetural, adequação à
tarefa e viabilidade de execução local. Os modelos abrangem diferentes famílias, como Deepseek, Gemma,
Granite, Phi4 e Qwen, permitindo comparações entre arquiteturas distintas e evitando viés associado a
uma única arquitetura. Para contemplar diferentes capacidades, os modelos foram categorizados por
porte: pequeno (até 4 bilhões de parâmetros), médio (entre 5B e 14B) e grande (entre 15B e 32B).</p>
        <p>Somente modelos com janelas de contexto de pelo menos 8.000 tokens foram incluídos, garantindo que
prompts extensos, compostos por conhecimento factual e exemplos, fossem processados integralmente.
Por outro lado, modelos com mais de 32B de parâmetros foram descartados devido a limitações práticas de
execução local e custo computacional. Todos os modelos selecionados estavam disponíveis para execução
em ambiente controlado (sem necessidade de uso de API externa), favorecendo a reprodutibilidade e o
controle sobre o ambiente experimental. A Tabela ?? apresenta os LLMs utilizados, com suas respectivas
famílias, tamanhos (porte) e janelas de contexto.</p>
        <p>A geração dos pares pergunta-resposta foi conduzida com um perfil padronizado de hiperparâmetros,
definido a partir de experimentos preliminares: temperature de 0.7, top-k de 40 e top-p de 0.95. Essa
configuração buscou um equilíbrio entre coerência, diversidade lexical e fluência nas respostas geradas.
6https://github.com/dvsmedeiros/kg-quizzer/blob/main/resources/predicados_verbalizados_pt_en.csv</p>
      </sec>
      <sec id="sec-4-5">
        <title>4.5. Avaliação dos Pares Gerados</title>
        <p>A avaliação da qualidade dos pares pergunta-resposta gerados foi conduzida por meio de duas abordagens
complementares: (a) análise “quantitativa”, baseada em métricas linguísticas; e (b) avaliação “qualitativa”,
automatizada por modelo de linguagem (LLM-as-a-Judge). Essa combinação permitiu analisar os pares
tanto sob aspectos formais quanto sob critérios semânticos e linguísticos.</p>
        <p>
          Na avaliação quantitativa, utilizamos as métricas fornecidas pelo pacote NILC-Metrix [
          <xref ref-type="bibr" rid="ref10">10</xref>
          ], com foco
em complexidade textual e diversidade lexical. As principais métricas foram simple_word_ratio [
          <xref ref-type="bibr" rid="ref13">13</xref>
          ],
brunet [
          <xref ref-type="bibr" rid="ref14">14</xref>
          ] e Yngve [
          <xref ref-type="bibr" rid="ref15">15</xref>
          ]. A Métrica brunet [
          <xref ref-type="bibr" rid="ref14">14</xref>
          ] mede a legibilidade, no qual que valores maiores
indicam maior acessibilidade textual. A métrica Yngve [
          <xref ref-type="bibr" rid="ref15">15</xref>
          ] avalia a complexidade sintática das sentenças,
na qual valores mais altos indicam um texto mais complexo e difícil.. A Métrica simple_word_ratio
[
          <xref ref-type="bibr" rid="ref13">13</xref>
          ] representa a proporção de palavras simples, refletindo a facilidade de leitura. Esses indicadores
foram utilizados para verificar se os pares gerados apresentam linguagem acessível, comparável a
questionários educacionais destinados a públicos diversos. Os valores de referência utilizados têm como
base estudos prévios como [
          <xref ref-type="bibr" rid="ref5">5</xref>
          ] e [
          <xref ref-type="bibr" rid="ref16">16</xref>
          ].
        </p>
        <p>A avaliação qualitativa foi conduzida com o modelo Sabia-3, especializado na língua portuguesa.
Esse modelo é de uma família distinta dos usados na tarefa de geração. Cada par pergunta-resposta foi
avaliado com base em cinco dimensões: i) Complexidade - considera se o par exige raciocínio, síntese ou
inferência, indo além da simples memorização, e se possui uma estrutura válida de pergunta e resposta;
ii) Completude - avalia se a resposta abrange adequadamente todos os aspectos solicitados na pergunta,
evitando omissões relevantes; iii) Corretude - analisa se a resposta está de fato correta e coerente com a
pergunta e o contexto, verificando a ausência de contradições ou inconsistências; iv) Fluidez - examina
se o par apresenta clareza na leitura e estrutura linguística natural em português, sem trechos truncados
ou confusos; e v) Qualidade - observa se há correção gramatical e ortográfica no texto, garantindo
que a linguagem esteja adequada considerando um falante nativo de português. Cada dimensão foi
pontuada pelo modelo em uma escala de 1 a 5, em que 1 representa desempenho insatisfatório e 5 indica
excelência. O modelo atribui notas individualizadas para cada dimensão e calcula uma média final por
par. Ele também foi instruído 7 a produzir uma justificativa textual que explica os motivos das avaliações
atribuídas, promovendo transparência e interpretabilidade ao processo de julgamento.</p>
        <p>O julgamento foi realizado com base em uma execução que gerou 6.300 arquivos, correspondentes a
3.150 cenários. Para cada cenário, foi produzido um arquivo de texto contendo a resposta do modelo
e um arquivo em formato de valores separados por vírgula (CSV) com os pares extraídos. Casos não
extraídos foram automaticamente tratados manualmente ou com apoio de LLMs para recuperação dos
dados. Após o processamento, 3.137 cenários foram considerados válidos para avaliação, representando
99,59% do total. Os demais foram descartados por ausência de pares, falhas de extração ou problemas
de formatação. Um total de 31.737 pares pergunta-resposta foi avaliado, uma vez que alguns cenários
produziram mais do que os 10 pares solicitados.</p>
      </sec>
    </sec>
    <sec id="sec-5">
      <title>5. Resultados Experimentais</title>
      <p>Esta seção apresenta os resultados experimentais. A Subsecao 5.1 reporta a análise quantitativa e
qualitativa com LLM-as-a-Judge da qualidade das gerações. A Subseção 5.2 relata uma seleção de
exemplos positivos e negativos. Resultados completos e análises suplementares, como a de custo
computacional8 estão disponíveis no repositório9.</p>
      <sec id="sec-5-1">
        <title>5.1. Resultados da Avaliação dos Pares</title>
        <p>A Tabela 2 apresenta que ambas as estratégias (RDF e Verbalização) de triplas afetam positivamente
a construção de pares pergunta-resposta, como demonstrado nos resultados de todas as métricas em
relação ao cenário sem triplas (None). Observamos que a utilização de triplas RDF resulta em pares
mais bem estruturados, refletido pelos valores superiores de Complexidade, Completude e Corretude.
A estratégia de triplas verbalizadas resulta em pares com melhor qualidade linguística, refletido pelos
valores superiores de fluência e qualidade de português.</p>
        <p>Tabela 2
Resultados da Análise de Estratégias de tratamento das triplas aplicando LLM-as-a-Judge. 1 = Complexidade,
2 = Completude, 3 = Corretude, 4 = Fluência, 5 = Qualidade do Português e 6 = Média de Avaliação.</p>
        <p>None
RDF
Verbalizado
Total</p>
        <p>
          A Tabela 3 apresenta que as respostas produzidas utilizando a estratégia de triplas verbalizadas
possuem menor complexidade sintática (porém, menor legibilidade), evidenciado pelos valores de
A-yngve e A-brunet comparados às outras abordagens. Além disso, a estratégia de verbalização
também se sobressai em relação ao BeQuizzer [
          <xref ref-type="bibr" rid="ref9">9</xref>
          ], sugerindo que um modelo de linguagem geral, quando
alimentado com dados bem pré-processados (neste caso, verbalizados), pode superar ferramentas
especializadas na criação de texto acessível.
        </p>
        <p>
          Tabela 3
Resultados da Análise de Estratégias de tratamento das triplas relativo às métricas do Nilcmetrix [
          <xref ref-type="bibr" rid="ref10">10</xref>
          ].
        </p>
        <p>Q-yngve</p>
        <p>Q-brunet</p>
        <p>Q-swr</p>
        <p>A Tabela 4 apresenta que a utilização de contexto afetou positivamente na construção de pares
pergunta-resposta, como mostrado através de valores de métricas superiores quando inserido contexto.
Nota-se que o cenário que gera a melhor efetividade em todas as métricas é a utilização de Few-shot,
reforçando o impacto positivo dessa técnica.</p>
        <p>Tabela 4
Resultados da Análise de Estratégias de Contextualização aplicando LLM-as-a-Judge. 1 = Complexidade, 2 =
Completude, 3 = Corretude, 4 = Fluência, 5 = Qualidade do Português e 6 = Média de Avaliação.</p>
        <p>Sem Contexto
Zero Shot
Few Shot
Total
1</p>
        <p>A Tabela 5 apresenta que as respostas produzidas utilizando Few-shot possuem menor complexidade
sintática, porém, com menor legibilidade, evidenciado pelos valores de A-yngve e A-brunet
comparados às outras abordagens. As métricas para as Perguntas (Q-) mostram menos variação entre as
estratégias abordadas, sugerindo que o principal impacto da estratégia de contextualização estaria na
qualidade da resposta gerada, e não na pergunta.
Sem Contexto
Zero Shot
Few Shot
BeQuizzer
Adapt2Kids
Leg2Kids
Total</p>
        <p>A Tabela 6 apresenta que a família de modelos qwen3 demonstra os melhores resultados, com destaque
para o modelo qwen3:32b. Há uma tendência de modelos maiores obterem resultados melhores, mas a
arquitetura do modelo é mais decisiva que o tamanho do modelo, segundo os nossos experimentos.
Tabela 6
Resultados da Análise Comparativa entre Modelos de Linguagem aplicando LLM as a Judge. 1 = Complexidade,
2 = Completude, 3 = Corretude, 4 = Fluência, 5 = Qualidade do Português e 6 = Média de Avaliação. Os
modelos estão ordenados relativo à Média de Avaliação.</p>
        <p>qwen3:32b
qwen3:14b
qwen3:8b
gemma3:27b
phi4:14b
qwen3:30b
deepseek-r1:32b
qwen2.5:14b
qwen2.5:32b
qwen3:4b
deepseek-r1:14b
granite3.1-dense:8b
gemma3:4b
deepseek-r1:8b
gemma3:12b
qwen2.5:3b
deepseek-r1:7b
deepseek-r1:1.5b
Total
1</p>
        <p>A Tabela 7 mostra que os modelos que têm uma menor complexidade sintática e menor legibilidade
(evidenciado pelos valores de A-yngve e A-brunet) são os pertencentes às famílias gemma e qwen.
Mais especificamente, os modelos gemma3:27b e qwen3:32b, como pode ser visto no repositório 10.</p>
      </sec>
      <sec id="sec-5-2">
        <title>5.2. Exemplos de Resultado Positivo e Negativo</title>
        <p>
          A Figura 3 apresenta um exemplo de resultado com as melhores estratégias identificadas na Seção 5.1,
utilização de triplas em formato RDF e Few-shot com o modelo qwen3:32b. Nota-se que o resultado
exibe uma pergunta conceitualmente rica e uma resposta tecnicamente precisa. Isso justifica sua
avaliação “quase perfeita” e valida os altos scores do modelo em corretude e fluência. Um exemplo de
10https://github.com/dvsmedeiros/kg-quizzer/blob/main/anexo/nilcmetrix_por_modelo.png
Tabela 7
Resultados da Análise Comparativa entre Modelos de Linguagem relativo às métricas do Nilcmetrix [
          <xref ref-type="bibr" rid="ref10">10</xref>
          ].
        </p>
        <p>Q-yngve
resultado com as piores estratégias é mostrado no repositório 11.</p>
        <p>Pergunta: Por que o número 1 não é considerado primo?
Resposta: Para preservar a unicidade da fatoração em números primos no teorema fundamental da
aritmética.</p>
        <p>Critérios de Avaliação
• Complexidade: 4
• Completude: 5</p>
        <p>Corretude: 5
Fluência: 5
Qualidade do Português: 5</p>
        <p>Média de Avaliação: 4.8
Justificativa: A pergunta exige uma compreensão conceitual sobre números primos e a importância
do teorema fundamental da aritmética, o que confere uma complexidade elevada. A resposta é
completa, correta e precisa, abordando exatamente o motivo pelo qual o número 1 não é considerado
primo. A fluidez e a qualidade do português são excelentes, sem erros gramaticais ou ortográficos e
com uma estrutura clara e natural.</p>
        <p>Figura 3: Par pergunta-resposta gerado e avaliação realizada pelo LLM-as-a-Judge utilizando a estratégia de
triplas RDF, com Few-shot e modelo qwen3:32b para o tópico "Número primo".</p>
      </sec>
    </sec>
    <sec id="sec-6">
      <title>6. Discussão</title>
      <p>A utilização de triplas RDF para incrementar o contexto do prompt resultou em textos com melhor
estrutura linguística, estando conforme a influência originalmente esperada da utilização de triplas RDF
para incrementar o prompt, visto que se trata de um conhecimento estruturado.</p>
      <p>Relativo à utilização de triplas verbalizadas, esperava-se que os textos gerados tivessem um
comportamento linguístico mais próximo do humano, visto que esse é o objetivo da verbalização. Os resultados
se evidenciaram em concordância com o esperado, através da melhora textual, na qualidade linguística
e na facilitação da legibilidade dos textos gerados.</p>
      <p>A melhora na efetividade dos resultados foi guiada pela hipótese de que os resultados se tornassem
progressivamente melhores à medida que o contexto no prompt fosse enriquecido. A análise dos
resultados demonstrou que essa expectativa se concretizou empiricamente. Partindo de uma base com
somente o tópico, em que as respostas são frequentemente genéricas e “imprevisíveis”, a introdução
da técnica Zero-shot representa um salto de qualidade significativo ao fornecer um objetivo explícito,
direcionando o modelo sobre o que fazer. Os melhores resultados observados foram com a abordagem
Few-shot, que além de fornecer o objetivo, incorpora exemplos práticos diretamente no prompt. Essa
transição — de um comando vago para uma instrução explícita e, por fim, para uma tarefa demonstrada
com exemplos — representa um caminho claro para maximizar a precisão, o controle e a confiabilidade
das gerações textuais na tarefa estudada.</p>
      <p>Com relação aos diversos modelos open-source utilizados, dois pontos merecem destaque.
Primeiramente, confirmamos a expectativa de que modelos com maior número de parâmetros geram textos de
11https://github.com/dvsmedeiros/kg-quizzer/blob/main/anexo/caso_qualitativo_ruim.png
qualidade superior, conforme observado na Tabela 6. O fator mais notável foi o impacto preponderante
da arquitetura do modelo no resultado. Isso se torna evidente com os modelos da família qwen, que,
mesmo possuindo casos de menor número de parâmetros, apresentaram uma efetividade superior ao de
outros modelos teoricamente mais potentes.</p>
      <p>Os resultados através do framework KG-Quizzer indicaram que, embora ele consiga produzir
perguntas com uma estrutura sintática adequada e relevante para crianças de 4 a 11 anos, refletido pelos
valores de yngve, o vocabulário utilizado é excessivamente complexo. As métricas de legibilidade, brunet
e simple_word_ratio, apontaram que a dificuldade de leitura das perguntas é de duas a três vezes
superior ao nível considerado ideal para essa faixa etária. Essa complexidade textual pode se tornar um
obstáculo para potenciais alunos, sobretudo para as crianças com menor proficiência de leitura.</p>
      <p>O framework proposto é suficientemente genérico para ser adaptado a diferentes domínios, idiomas
e modelos, mantendo a separação entre os componentes de recuperação, construção de prompt, geração
e avaliação. Essa modularidade favorece tanto extensões quanto sua aplicação em diferentes contextos.</p>
      <p>Expandir esta investigação para incluir a geração de distratores (alternativas incorretas à questão)
é um passo relevante para viabilizar a construção completa de questionários de múltipla escolha.
Distratores bem elaborados aumentam a complexidade das questões e permitem avaliar com mais
precisão o conhecimento dos alunos, promovendo um aprendizado mais desafiador. Essa extensão pode
utilizar métricas de redes complexas para identificar nós semanticamente semelhantes às perguntas,
gerando distratores plausíveis. Esse é um caminho de pesquisa futura.</p>
    </sec>
    <sec id="sec-7">
      <title>7. Conclusão</title>
      <p>A geração automática com qualidade de perguntas e respostas em Português para fins educativos ainda
é um desafio em aberto. Este estudo propôs e avaliou um framework que combina dados estruturados
via KGs com prompts na geração de questionários. Nossos resultados demonstraram que a utilização de
triplas no formato RDF se apresentou mais efetiva quando o foco é a estrutura textual. Verbalizar as
triplas se apresentou útil quando se deseja qualidade linguística e facilidade de leitura dos questionários
produzidos, ou seja, mais próxima da linguagem humana. Constatou-se a melhora progressiva na
geração de perguntas através do enriquecimento de contexto. A utilização de Zero-shot mostrou-se mais
efetiva que a baseline (sem contexto enriquecido), e Few-shot apresentou os melhores resultados. Como
trabalhos futuros, planejamos a simplificação do vocabulário e a adaptação dos prompts para reduzir
a complexidade textual. Visamos ainda explorar diferentes abordagens de verbalização e outros KG
públicos, como Wikidata e YAGO, assim como desenvolver um KG próprio para o framework proposto.
Visamos ainda definir e implementar métricas mais refinadas e específicas para validar a coerência
semântica.</p>
    </sec>
    <sec id="sec-8">
      <title>Declaration on Generative AI</title>
      <p>During the preparation of this work, the authors used ChatGPT-4 and Gemini in order to assist with
the following tasks, as defined in the CEUR-WS GenAI Usage Taxonomy: “Paraphrase and reword”,
“Improve writing style”, and “Grammar and spelling check”. These contributions were limited to the
revision and refinement of existing content. After using these tools, the authors reviewed and edited
the content as needed and takes full responsibility for the publication’s content.</p>
    </sec>
    <sec id="sec-9">
      <title>Agradecimentos</title>
      <p>Agradecemos ao Conselho Nacional de Desenvolvimento Científico e Tecnológico (CNPq), Brasil, projeto
#301337/2025-0. Assim como o apoio fornecido pela BTG Pactual e Coordenação de Aperfeiçoamento
de Pessoal de Nível Superior - Brasil (CAPES) - Código de Financiamento 001.</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          [1]
          <string-name>
            <surname>M. H. D. SILVA</surname>
          </string-name>
          ,
          <article-title>Déficit de aprendizagem causado pela super lotação na sala de aula</article-title>
          ,
          <source>Amazon Live Journal</source>
          v.
          <volume>6</volume>
          (
          <issue>2024</issue>
          )
          <fpage>1</fpage>
          -
          <lpage>15</lpage>
          . URL: https://zenodo.org/records/13230100. doi:
          <volume>10</volume>
          .5281/zenodo. 13230100.
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          [2]
          <string-name>
            <given-names>C.</given-names>
            <surname>Kivunja</surname>
          </string-name>
          ,
          <article-title>Why Students Don't Like Assessment and How to Change Their Perceptions in 21st Century Pedagogies, Creative Education 6 (</article-title>
          <year>2015</year>
          )
          <fpage>2117</fpage>
          -
          <lpage>2126</lpage>
          . URL: https://www.scirp.org/journal/ paperinformation?paperid=61373. doi:
          <volume>10</volume>
          .4236/ce.
          <year>2015</year>
          .
          <volume>620215</volume>
          , number: 20 Publisher: Scientific Research Publishing.
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          [3]
          <string-name>
            <given-names>G.</given-names>
            <surname>Kurdi</surname>
          </string-name>
          ,
          <string-name>
            <given-names>J.</given-names>
            <surname>Leo</surname>
          </string-name>
          ,
          <string-name>
            <given-names>B.</given-names>
            <surname>Parsia</surname>
          </string-name>
          ,
          <string-name>
            <given-names>U.</given-names>
            <surname>Sattler</surname>
          </string-name>
          ,
          <string-name>
            <given-names>S.</given-names>
            <surname>Al-Emari</surname>
          </string-name>
          ,
          <article-title>A Systematic Review of Automatic Question Generation for Educational Purposes</article-title>
          ,
          <source>Int J Artif Intell Educ</source>
          <volume>30</volume>
          (
          <year>2020</year>
          )
          <fpage>121</fpage>
          -
          <lpage>204</lpage>
          . URL: https: //doi.org/10.1007/s40593-019-00186-y. doi:
          <volume>10</volume>
          .1007/s40593-019-00186-y.
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          [4]
          <string-name>
            <given-names>B. P.</given-names>
            <surname>Solis Trujillo</surname>
          </string-name>
          ,
          <string-name>
            <given-names>D.</given-names>
            <surname>Velarde-Camaqui</surname>
          </string-name>
          ,
          <string-name>
            <given-names>C. A.</given-names>
            <surname>Gonzales Nuñez</surname>
          </string-name>
          ,
          <string-name>
            <given-names>E. V.</given-names>
            <surname>Castillo Silva</surname>
          </string-name>
          ,
          <string-name>
            <given-names>M. d. P.</given-names>
            <surname>Gonzalez Said de la Oliva</surname>
          </string-name>
          ,
          <article-title>The current landscape of formative assessment and feedback in graduate studies: a systematic literature review</article-title>
          ,
          <source>Front. Educ</source>
          .
          <volume>10</volume>
          (
          <year>2025</year>
          ). URL: https://www.frontiersin.org/journals/ education/articles/10.3389/feduc.
          <year>2025</year>
          .1509983/full. doi:
          <volume>10</volume>
          .3389/feduc.
          <year>2025</year>
          .
          <volume>1509983</volume>
          , publisher: Frontiers.
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          [5]
          <string-name>
            <given-names>T.</given-names>
            <surname>Brown</surname>
          </string-name>
          ,
          <string-name>
            <given-names>B.</given-names>
            <surname>Mann</surname>
          </string-name>
          ,
          <string-name>
            <given-names>N.</given-names>
            <surname>Ryder</surname>
          </string-name>
          ,
          <string-name>
            <given-names>M.</given-names>
            <surname>Subbiah</surname>
          </string-name>
          ,
          <string-name>
            <given-names>J. D.</given-names>
            <surname>Kaplan</surname>
          </string-name>
          ,
          <string-name>
            <given-names>P.</given-names>
            <surname>Dhariwal</surname>
          </string-name>
          ,
          <string-name>
            <given-names>A.</given-names>
            <surname>Neelakantan</surname>
          </string-name>
          ,
          <string-name>
            <given-names>P.</given-names>
            <surname>Shyam</surname>
          </string-name>
          ,
          <string-name>
            <given-names>G.</given-names>
            <surname>Sastry</surname>
          </string-name>
          ,
          <string-name>
            <given-names>A.</given-names>
            <surname>Askell</surname>
          </string-name>
          , et al.,
          <article-title>Language models are few-shot learners</article-title>
          ,
          <source>Advances in neural information processing systems</source>
          <volume>33</volume>
          (
          <year>2020</year>
          )
          <fpage>1877</fpage>
          -
          <lpage>1901</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          [6]
          <string-name>
            <given-names>L.</given-names>
            <surname>He</surname>
          </string-name>
          ,
          <string-name>
            <given-names>Y.</given-names>
            <surname>Chen</surname>
          </string-name>
          ,
          <string-name>
            <given-names>X.</given-names>
            <surname>Hu</surname>
          </string-name>
          ,
          <article-title>Application of large language models in automated question generation: A case study on chatglm's structured questions for national teacher certification exams</article-title>
          ,
          <source>arXiv preprint arXiv:2408.09982</source>
          (
          <year>2024</year>
          ).
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          [7]
          <string-name>
            <given-names>Y.</given-names>
            <surname>Kido</surname>
          </string-name>
          ,
          <string-name>
            <given-names>H.</given-names>
            <surname>Yamada</surname>
          </string-name>
          ,
          <string-name>
            <given-names>T.</given-names>
            <surname>Tokunaga</surname>
          </string-name>
          ,
          <string-name>
            <given-names>R.</given-names>
            <surname>Kimura</surname>
          </string-name>
          ,
          <string-name>
            <given-names>Y.</given-names>
            <surname>Miura</surname>
          </string-name>
          ,
          <string-name>
            <given-names>Y.</given-names>
            <surname>Sakyo</surname>
          </string-name>
          ,
          <string-name>
            <given-names>N.</given-names>
            <surname>Hayashi</surname>
          </string-name>
          ,
          <article-title>Automatic question generation for the japanese national nursing examination using large language models</article-title>
          .,
          <source>in: CSEDU (1)</source>
          ,
          <year>2024</year>
          , pp.
          <fpage>821</fpage>
          -
          <lpage>829</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          [8]
          <string-name>
            <given-names>L.</given-names>
            <surname>Karvinen</surname>
          </string-name>
          ,
          <article-title>Using a large language model-based system to generate pre-questions in a quiz format for students focused in self-directed learning</article-title>
          ,
          <source>Master's thesis</source>
          , Itä-Suomen yliopisto,
          <year>2023</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          [9]
          <string-name>
            <given-names>V. J. S.</given-names>
            <surname>Chico</surname>
          </string-name>
          ,
          <string-name>
            <given-names>J. F.</given-names>
            <surname>Tessler</surname>
          </string-name>
          ,
          <string-name>
            <given-names>R.</given-names>
            <surname>Bonacin</surname>
          </string-name>
          ,
          <string-name>
            <given-names>J. C.</given-names>
            dos
            <surname>Reis</surname>
          </string-name>
          , Bequizzer:
          <article-title>Ai-based quiz automatic generation in the portuguese language</article-title>
          , in: A.
          <string-name>
            <surname>Rapp</surname>
            ,
            <given-names>L. Di</given-names>
          </string-name>
          <string-name>
            <surname>Caro</surname>
            ,
            <given-names>F.</given-names>
          </string-name>
          <string-name>
            <surname>Meziane</surname>
          </string-name>
          , V. Sugumaran (Eds.),
          <source>Natural Language Processing and Information Systems</source>
          , Springer Nature Switzerland, Cham,
          <year>2024</year>
          , pp.
          <fpage>237</fpage>
          -
          <lpage>248</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref10">
        <mixed-citation>
          [10]
          <string-name>
            <given-names>S. E.</given-names>
            <surname>Leal</surname>
          </string-name>
          ,
          <string-name>
            <given-names>M. S.</given-names>
            <surname>Duran</surname>
          </string-name>
          ,
          <string-name>
            <given-names>C. E.</given-names>
            <surname>Scarton</surname>
          </string-name>
          ,
          <string-name>
            <given-names>N. S.</given-names>
            <surname>Hartmann</surname>
          </string-name>
          ,
          <string-name>
            <given-names>S. M.</given-names>
            <surname>Aluísio</surname>
          </string-name>
          ,
          <article-title>NILC-Metrix: assessing the complexity of written and spoken language in Brazilian Portuguese</article-title>
          ,
          <source>Lang Resources &amp; Evaluation</source>
          <volume>58</volume>
          (
          <year>2024</year>
          )
          <fpage>73</fpage>
          -
          <lpage>110</lpage>
          . URL: https://doi.org/10.1007/s10579-023-09693-w. doi:
          <volume>10</volume>
          .1007/ s10579-023-09693-w.
        </mixed-citation>
      </ref>
      <ref id="ref11">
        <mixed-citation>
          [11]
          <string-name>
            <given-names>P.</given-names>
            <surname>Rajpurkar</surname>
          </string-name>
          ,
          <string-name>
            <given-names>J.</given-names>
            <surname>Zhang</surname>
          </string-name>
          ,
          <string-name>
            <given-names>K.</given-names>
            <surname>Lopyrev</surname>
          </string-name>
          ,
          <string-name>
            <given-names>P.</given-names>
            <surname>Liang</surname>
          </string-name>
          , Squad:
          <volume>100</volume>
          ,000+
          <article-title>questions for machine comprehension of text</article-title>
          ,
          <source>in: Proceedings of the 2016 Conference on Empirical Methods in Natural Language Processing (EMNLP)</source>
          ,
          <year>2016</year>
          , pp.
          <fpage>2383</fpage>
          -
          <lpage>2392</lpage>
          . doi:
          <volume>10</volume>
          .18653/v1/
          <fpage>D16</fpage>
          -1264.
        </mixed-citation>
      </ref>
      <ref id="ref12">
        <mixed-citation>
          [12]
          <string-name>
            <given-names>S.</given-names>
            <surname>Auer</surname>
          </string-name>
          ,
          <string-name>
            <given-names>C.</given-names>
            <surname>Bizer</surname>
          </string-name>
          , G. Kobilarov,
          <string-name>
            <given-names>J.</given-names>
            <surname>Lehmann</surname>
          </string-name>
          ,
          <string-name>
            <given-names>R.</given-names>
            <surname>Cyganiak</surname>
          </string-name>
          ,
          <string-name>
            <given-names>Z.</given-names>
            <surname>Ives</surname>
          </string-name>
          ,
          <article-title>Dbpedia: A nucleus for a web of open data</article-title>
          , in: international semantic web conference, Springer,
          <year>2007</year>
          , pp.
          <fpage>722</fpage>
          -
          <lpage>735</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref13">
        <mixed-citation>
          [13]
          <string-name>
            <surname>M. T. C. Biderman</surname>
          </string-name>
          , Dicionário Didático de Português, Editora Ática, São Paulo,
          <year>1998</year>
          .
        </mixed-citation>
      </ref>
      <ref id="ref14">
        <mixed-citation>
          [14]
          <string-name>
            <given-names>C.</given-names>
            <surname>Thomas</surname>
          </string-name>
          ,
          <string-name>
            <given-names>V.</given-names>
            <surname>Keselj</surname>
          </string-name>
          ,
          <string-name>
            <given-names>N.</given-names>
            <surname>Cercone</surname>
          </string-name>
          ,
          <string-name>
            <given-names>K.</given-names>
            <surname>Rockwood</surname>
          </string-name>
          , E. Asp,
          <article-title>Automatic detection and rating of dementia of Alzheimer type through lexical analysis of spontaneous speech</article-title>
          ,
          <source>in: IEEE International Conference Mechatronics and Automation</source>
          ,
          <year>2005</year>
          , volume
          <volume>3</volume>
          ,
          <year>2005</year>
          , pp.
          <fpage>1569</fpage>
          -
          <lpage>1574</lpage>
          Vol.
          <volume>3</volume>
          . URL: https://ieeexplore.ieee.org/document/1626789. doi:
          <volume>10</volume>
          .1109/ICMA.
          <year>2005</year>
          .
          <volume>1626789</volume>
          , iSSN:
          <fpage>2152</fpage>
          -
          <lpage>744X</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref15">
        <mixed-citation>
          [15]
          <string-name>
            <given-names>V. H.</given-names>
            <surname>Yngve</surname>
          </string-name>
          ,
          <article-title>A model and an hypothesis for language structure</article-title>
          ,
          <source>Proceedings of the American Philosophical Society</source>
          <volume>104</volume>
          (
          <year>1960</year>
          )
          <fpage>444</fpage>
          -
          <lpage>466</lpage>
          . URL: http://www.jstor.org/stable/985230.
        </mixed-citation>
      </ref>
      <ref id="ref16">
        <mixed-citation>
          [16]
          <string-name>
            <given-names>A.</given-names>
            <surname>Holtzman</surname>
          </string-name>
          ,
          <string-name>
            <given-names>J.</given-names>
            <surname>Buys</surname>
          </string-name>
          ,
          <string-name>
            <given-names>L.</given-names>
            <surname>Du</surname>
          </string-name>
          ,
          <string-name>
            <given-names>M.</given-names>
            <surname>Forbes</surname>
          </string-name>
          ,
          <string-name>
            <surname>Y. Choi,</surname>
          </string-name>
          <article-title>The curious case of neural text degeneration</article-title>
          ,
          <source>in: International Conference on Learning Representations (ICLR)</source>
          ,
          <year>2020</year>
          . URL: https://openreview.net/ forum?id=rygGQyrFvH.
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>