Endre søk
RefereraExporteraLink to record
Permanent link

Direct link
Referera
Referensformat
  • apa
  • ieee
  • modern-language-association-8th-edition
  • vancouver
  • Annet format
Fler format
Språk
  • de-DE
  • en-GB
  • en-US
  • fi-FI
  • nn-NO
  • nn-NB
  • sv-SE
  • Annet språk
Fler språk
Utmatningsformat
  • html
  • text
  • asciidoc
  • rtf
Minor changes make a difference: a case study on the consistency of UD-based dependency parsers
KTH, Skolan för elektroteknik och datavetenskap (EECS), Intelligenta system, Tal, musik och hörsel, TMH.ORCID-id: 0000-0001-7327-3059
KTH, Skolan för elektroteknik och datavetenskap (EECS), Intelligenta system, Tal, musik och hörsel, TMH.ORCID-id: 0000-0003-2600-7668
2021 (engelsk)Inngår i: Proceedings of the Fifth Workshop on Universal Dependencies (UDW, SyntaxFest 2021), Association for Computational Linguistics (ACL) , 2021, s. 96-108Konferansepaper, Publicerat paper (Fagfellevurdert)
Abstract [en]

Many downstream applications are using dependency trees, and are thus relying on dependencyparsers producing correct, or at least consistent, output. However, dependency parsers are trainedusing machine learning, and are therefore susceptible to unwanted inconsistencies due to biasesin the training data. This paper explores the effects of such biases in four languages – English,Swedish, Russian, and Ukrainian – though an experiment where we study the effect of replacingnumerals in sentences. We show that such seemingly insignificant changes in the input can causelarge differences in the output, and suggest that data augmentation can remedy the problems.

sted, utgiver, år, opplag, sider
Association for Computational Linguistics (ACL) , 2021. s. 96-108
HSV kategori
Forskningsprogram
Datalogi
Identifikatorer
URN: urn:nbn:se:kth:diva-326888Scopus ID: 2-s2.0-85138675937OAI: oai:DiVA.org:kth-326888DiVA, id: diva2:1756785
Konferanse
UDW 2021 - 5th Workshop on Universal Dependencies, Proceedings - To be held as part of SyntaxFest 2021, Sofia, 21-25 March 2021
Forskningsfinansiär
Vinnova, 2019-02997
Merknad

Part of proceedings ISBN 978-195591717-9 

QC 20230515

Tilgjengelig fra: 2023-05-15 Laget: 2023-05-15 Sist oppdatert: 2025-02-07bibliografisk kontrollert
Inngår i avhandling
1. Ask and distract: Data-driven methods for the automatic generation of multiple-choice reading comprehension questions from Swedish texts
Åpne denne publikasjonen i ny fane eller vindu >>Ask and distract: Data-driven methods for the automatic generation of multiple-choice reading comprehension questions from Swedish texts
2023 (engelsk)Doktoravhandling, med artikler (Annet vitenskapelig)
Alternativ tittel[sv]
Fråga och distrahera : Datadrivna metoder för automatisk generering av flervalsfrågor för att bedöma läsförståelse av svenska
Abstract [en]

Multiple choice questions (MCQs) are widely used for summative assessment in many different subjects. The tasks in this format are particularly appealing because they can be graded swiftly and automatically. However, the process of creating MCQs is far from swift or automatic and requires a lot of expertise both in the specific subject and also in test construction.

This thesis focuses on exploring methods for the automatic MCQ generation for assessing the reading comprehension abilities of second-language learners of Swedish. We lay the foundations for the MCQ generation research for Swedish by collecting two datasets of reading comprehension MCQs, and designing and developing methods for generating the whole MCQs or its parts. An important contribution is the methods (which were designed and applied in practice) for the automatic and human evaluation of the generated MCQs.

The best currently available method (as of June 2023) for generating MCQs for assessing reading comprehension in Swedish is ChatGPT (although still only around 60% of generated MCQs were judged acceptable). However, ChatGPT is neither open-source, nor free. The best open-source and free-to-use method is the fine-tuned version of SweCTRL-Mini, a foundational model developed as a part of this thesis. Nevertheless, all explored methods are far from being useful in practice but the reported results provide a good starting point for future research.

Abstract [sv]

Flervalsfrågor används ofta för summativ bedömning i många olika ämnen. Flervalsfrågor är tilltalande eftersom de kan bedömas snabbt och automatiskt. Att skapa flervalsfrågor manuellt går dock långt ifrån snabbt, utan är en process som kräver mycket expertis inom det specifika ämnet och även inom provkonstruktion.

Denna avhandling fokuserar på att utforska metoder för automatisk generering av flervalsfrågor för bedömning av läsförståelse hos andraspråksinlärare av svenska. Vi lägger grunden för forskning om generering av flervalsfrågor för svenska genom att samla in två datamängder bestående av flervalsfrågor som testar just läsförståelse, och genom att utforma och utveckla metoder för att generera hela eller delar av flervalsfrågor. Ett viktigt bidrag är de metoder för automatisk och mänsklig utvärdering av genererade flervalsfrågor som har utvecklats och tillämpats i praktiken.

Den bästa för närvarande tillgängliga metoden (i juni 2023) för att generera flervalsfrågor som testar läsförståelse på svenska är ChatGPT (dock bedömdes endast cirka 60% av de genererade flervalsfrågorna som acceptabla). ChatGPT har dock varken öppen källkod eller är gratis. Den bästa metoden med öppen källkod som är också gratis är den finjusterade versionen av SweCTRL-Mini, en “foundational model” som utvecklats som en del av denna avhandling. Alla utforskade metoder är dock långt ifrån användbara i praktiken, men de rapporterade resultaten ger en bra utgångspunkt för framtida forskning.

sted, utgiver, år, opplag, sider
KTH Royal Institute of Technology, 2023. s. viii, 67
Serie
TRITA-EECS-AVL ; 2023:56
Emneord
multiple choice questions, question generation, distractor generation, reading comprehension, second-language learners, L2 learning, Natural Language Generation, flervalsfrågor, frågegenerering, distraktorsgenerering, läsförståelse, andraspråkslärande, L2-inlärning, Natural Language Generation
HSV kategori
Forskningsprogram
Tal- och musikkommunikation
Identifikatorer
urn:nbn:se:kth:diva-336531 (URN)978-91-8040-661-1 (ISBN)
Disputas
2023-10-17, F3, Lindstedtsvägen 26, Stockholm, 14:00 (engelsk)
Opponent
Veileder
Merknad

QC 20230915

Tilgjengelig fra: 2023-09-15 Laget: 2023-09-14 Sist oppdatert: 2025-02-07bibliografisk kontrollert

Open Access i DiVA

fulltext(453 kB)80 nedlastinger
Filinformasjon
Fil FULLTEXT01.pdfFilstørrelse 453 kBChecksum SHA-512
7ea8d3391836467f2b607d0a8fd4a54d872b4384d6bad636cc17c54de87e80cc7840b5d1a9e6bd69b15cb7b535d987f6e0ea5f31447d507618d4139543d7b693
Type fulltextMimetype application/pdf

Andre lenker

Scopushttps://aclanthology.org/2021.udw-1.8/

Person

Kalpakchi, DmytroBoye, Johan

Søk i DiVA

Av forfatter/redaktør
Kalpakchi, DmytroBoye, Johan
Av organisasjonen

Søk utenfor DiVA

GoogleGoogle Scholar
Totalt: 81 nedlastinger
Antall nedlastinger er summen av alle nedlastinger av alle fulltekster. Det kan for eksempel være tidligere versjoner som er ikke lenger tilgjengelige

urn-nbn

Altmetric

urn-nbn
Totalt: 274 treff
RefereraExporteraLink to record
Permanent link

Direct link
Referera
Referensformat
  • apa
  • ieee
  • modern-language-association-8th-edition
  • vancouver
  • Annet format
Fler format
Språk
  • de-DE
  • en-GB
  • en-US
  • fi-FI
  • nn-NO
  • nn-NB
  • sv-SE
  • Annet språk
Fler språk
Utmatningsformat
  • html
  • text
  • asciidoc
  • rtf