<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta>
      <journal-title-group>
        <journal-title>Cohen</journal-title>
      </journal-title-group>
    </journal-meta>
    <article-meta>
      <title-group>
        <article-title>Inter-Annotator Agreement in linguistica: una rassegna critica</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>Gloria Gagliardi</string-name>
          <email>gloria.gagliardi2@unibo.it</email>
          <xref ref-type="aff" rid="aff0">0</xref>
        </contrib>
        <aff id="aff0">
          <label>0</label>
          <institution>FICLIT - Università di Bologna</institution>
          ,
          <country country="IT">Italy</country>
        </aff>
      </contrib-group>
      <pub-date>
        <year>1960</year>
      </pub-date>
      <volume>37</volume>
      <abstract>
        <p>Italiano. I coefficienti di Inter-Annotator Agreement sono ampiamente utilizzati in Linguistica Computazionale e NLP per valutare il livello di “affidabilità” delle annotazioni linguistiche. L'articolo propone una breve revisione della letteratura scientifica sull'argomento.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>
        “Because the categorizing of the units is a
consequence of some complex judgment process
performed by a ‘two-legged meter’ [...], it
becomes important to determine the extent to
which these judgments are reproducible, i.e.,
reliable.”
È convinzione abbastanza diffusa che un alto
livello di Inter-Annotator Agreement (da ora in
poi: I.A.A.) tra gli annotatori sia indice della
bontà e della riproducibilità di un paradigma di
annotazione. Come sottolinea Di Eugenio:
“This raises the question of how to evaluate the
‘goodness’ of a coding scheme. One way of
doing so is to assess its reliability, namely, to
assess whether different coders can reach a
satisfying level of agreement with each other when
they use the coding manual on the same data.”
        <xref ref-type="bibr" rid="ref16">(Di Eugenio, 2000: 441)</xref>
        L’assunto di base è dunque che i dati siano
considerabili “attendibili” se due o più annotatori
sono in accordo nell’individuare un fenomeno
linguistico oppure nell’assegnare una categoria
all’item in analisi. In tale prospettiva, la
reliability si configura perciò come prerequisito per
dimostrare la validità di uno schema di codifica, e
un ampio consenso tra gli annotatori viene
assunto a garanzia della precisione intrinseca del
processo di annotazione
        <xref ref-type="bibr" rid="ref39">(Warrens, 2010)</xref>
        .
      </p>
      <p>“The main reason for the analysis of annotation
quality is to obtain a measure of the
‘trustworthiness’ of annotations. […] Only if we can trust
that annotations are provided in a consistent
and reproducible manner, can we be sure that
conclusions drawn from such data are likewise
reliable and that the subsequent usage of
annotations is not negatively influenced by
inconsistencies and errors in the data. Inter-annotator
(or inter-coder) agreement has become the
quasi-standard procedure for testing the accuracy
of manual annotations.”</p>
      <p>
        <xref ref-type="bibr" rid="ref4">(Bayerl &amp; Paul, 2011: 700)</xref>
        In ambito computazionale l’I.A.A. è usato come
veicolo per passare dal materiale annotato ad un
gold standard, ovvero un insieme di dati
sufficientemente noise-free che serva per training e
testing di sistemi automatici. Di prassi i
coefficienti di agreement vengono usati per assicurare
la bontà della procedura di annotazione e del
materiale annotato: un alto livello di I.A.A. fa sì che
il fenomeno sia considerato consistente e
sistematico, e che la risorsa validata sia idonea per
addestrare un sistema automatico che svolga il
medesimo compito del linguista.
      </p>
      <p>In realtà, l’idea che l’I.A.A. possa indicare in
senso assoluto la qualità del dataset come risorsa
di riferimento è fallace: due osservatori possono,
pur sbagliando entrambi, essere in perfetto
accordo nel valutare un evento:
“However, it is important to keep in mind that
achieving good agreement cannot ensure
validity: two observers of the same event may well
share the same prejudice while still being
objectively wrong.”</p>
      <p>
        <xref ref-type="bibr" rid="ref3">(Artstein &amp; Poesio, 2008: 557)</xref>
        È inoltre opportuno considerare che l’agreement
raggiunto abitualmente dagli annotatori varia in
relazione al livello di esperienza: l’I.A.A. in
gruppi omogenei è comparabile a prescindere dai
livelli di esperienza, ma si abbassa qualora
vengano formati gruppi misti di esperti e non esperti:
“Implicit in discussions of inter-annotator
agreement is that coders not only agree on
which unit belongs to which category, but that if
they agree these decisions are also correct with
respect to the phenomenon under scrutiny [...].
In our study, this assumption left us with a
dilemma. Our data showed that experts and
nonexperts could achieve comparable levels of
agreement, whereas the average agreement for
mixed groups was significantly lower. In other
words, experts and novices were equally
reliable, yet did not agree with each other.”
      </p>
      <p>
        <xref ref-type="bibr" rid="ref4">(Bayerl &amp; Paul, 2011: 721)</xref>
        Non tutti i task di annotazione linguistica sono
valutabili secondo le stesse procedure; dal punto
di vista qualitativo, si possono individuare
almeno due tipologie generali
        <xref ref-type="bibr" rid="ref30">(Mathet, Widlöcher, A.
&amp; Métivier, 2015)</xref>
        :
• “individuazione di unità” o “unitizing”
        <xref ref-type="bibr" rid="ref26">(Krippendorff, 1980)</xref>
        , in cui l’annotatore,
dato un testo scritto o parlato, deve
identificare posizione e confine degli elementi
linguistici (es. identificazione di unità
prosodiche o gestuali, topic segmentation);
• “categorizzazione”: l’annotatore deve
attribuire un tag a oggetti linguistici
preidentificati (es. PoS Tagging, Word Sense
Disambiguation).
      </p>
      <p>Il paper si propone di presentare una breve
rassegna critica delle metriche utilizzate in questa
seconda tipologia di task, in particolare ponendo
attenzione al calcolo dei coefficienti e alla loro
interpretazione.
2</p>
    </sec>
    <sec id="sec-2">
      <title>I coefficient di agreement</title>
      <p>
        Adottando la notazione proposta da
        <xref ref-type="bibr" rid="ref3">Artstein &amp;
Poesio (2008)</xref>
        , ogni studio di I.A.A per i task di
categorizzazione deve prevedere:
• un insieme di item {i | i ∈ I};
• un insieme di categorie assegnabili agli item
{c | c ∈ C};
• un insieme di annotatori, che assegnano
ciascun item ad una categoria {r | r ∈ R}.
      </p>
      <p>
        Verrà convenzionalmente indicato con A
l’agreement e con D il disagreement. Allo scopo
di illustrare le modalità di calcolo dei
coefficienti, è stato creato ad hoc un esempio fittizio: la
situazione immaginata prevede che due
annotatori assegnino 20 item a 3 categorie.
L’indice più rudimentale è quello percentuale,
detto anche “Index of crude agreement”
        <xref ref-type="bibr" rid="ref21">(Goodman &amp; Kruskal, 1954)</xref>
        o “Observed
Agreement” (Ao): la misura corrisponde,
banalmente, al rapporto tra il numero di item su cui i
rater sono d’accordo ed il numero totale di item.
Nell’esempio proposto in tab.1, Ao ha un valore
di 0.85.
      </p>
      <p>
        La misura non solo non tiene in
considerazione il ruolo che potrebbe giocare il caso, per cui i
rater potrebbero trovarsi in accordo “tirando ad
indovinare”, ma deve fare i conti con un
fenomeno già notato in
        <xref ref-type="bibr" rid="ref33">Scott (1955)</xref>
        e
        <xref ref-type="bibr" rid="ref3">Artstein &amp;
Poesio (2008)</xref>
        : dati due diversi schemi di
codifica per lo stesso task, quello con il minor numero
di categorie registrerebbe una più alta
percentuale di I.A.A. Il valore è fortemente influenzato
anche dal problema della “prevalenza”, ovvero la
maggior concentrazione di item in una delle
categorie: come avremo modo di discutere in §
2.2.1, una simile distribuzione influenza in
negativo la possibilità di raggiungere alti livelli di
I.A.A., indipendentemente dalla grandezza del
campione.
Il livello di I.A.A. nell’espressione di giudizi
categoriali deve perciò necessariamente essere
esplicitato nei termini di eccedenza rispetto
all’accordo ottenibile casualmente, pena la
mancanza di effettiva informatività. In ambito
psicometrico sono stati introdotti numerosi
coefficienti statistici in grado di correggere tale
aspetto: questi indici, a cui si farà riferimento con il
nome di “misure kappa”, si fondano su tre
assunti
        <xref ref-type="bibr" rid="ref35">(Soeken &amp; Prescott, 1986)</xref>
        :
• gli item soggetti a valutazione sono
indipendenti l’uno dall’altro;
• i rater che giudicano gli item operano in
autonomia ed in modo completamente
indipendente;
• le categorie usate sono mutualmente
esclusive ed esaustive.
2.2.1
      </p>
      <p>
        2 rater
Il caso base è rappresentato dai coefficienti per la
valutazione dei giudizi prodotti da due soli rater,
indice noto ai più come “k di Cohen”. Prima di
passare alla presentazione della misura è però
necessaria una piccola premessa terminologica. Il
celebre articolo di
        <xref ref-type="bibr" rid="ref10">Carletta (1996)</xref>
        , a cui va il
merito di aver stabilito la valutazione
dell’agreement come standard de facto in LC, ha
introdotto una piccola inconsistenza in letteratura
        <xref ref-type="bibr" rid="ref3">(Artstein &amp; Poesio, 2008)</xref>
        : la studiosa, nel
suggerire l’utilizzo di un coefficiente definito “kappa”,
fa infatti riferimento non all’originale k proposta
in
        <xref ref-type="bibr" rid="ref13">Cohen (1960)</xref>
        , ma ad una misura molto simile,
introdotta cinque anni prima da Scott. La
questione non si esaurisce in un mero problema
terminologico: esistono infatti tre indici che, pur
condividendo la medesima formula, sono fondati
su ipotesi diverse riguardo la distribuzione degli
item nelle categorie, ovvero S di Bennett et al.,
π di Scott e k di Cohen. Le differenti ipotesi
soggiacenti comportano diverse modalità di
calcolo e quindi risultati non coincidenti, seppure in
misura minima. La formula di base è la seguente:
1) , ,  =   !!!!! !!!!
dove Ae è l’agreement dovuto al caso (“Expected
Agreement by chance”); Ao− Ae stima perciò
l’agreement effettivamente raggiunto al di sopra
della soglia della casualità, mentre 1 − Ae misura
quanto accordo eccedente il caso è ottenibile.
Mentre Ao è estremamente semplice da calcolare
(§ 2.1) e ha lo stesso valore nelle tre misure, Ae
richiede invece un modello del comportamento
degli annotatori. Tutti i coefficienti assumono
l’indipendenza dei due annotatori che valutano
gli item: la probabilità che due rater (r1 ed r2)
siano d’accordo su una determinata categoria c è
dunque data dal prodotto della probabilità che
ciascun rater assegni un item a quella categoria,
ovvero:
      </p>
      <p>2)   1 ∙   2  
Ae è dato dalla sommatoria di tale probabilità
congiunta per tutte le categorie dello schema di
codifica.</p>
      <p>3) !! = !! = !! =
!∈!   ! ∙   !
La differenza tra S, π e k risiede negli assunti che
sono alla base del calcolo di   ! .</p>
      <p>
        S
        <xref ref-type="bibr" rid="ref6">(Bennett et al., 1954)</xref>
        assume che
un’annotazione totalmente casuale determini una
distribuzione uniforme degli item nelle categorie,
ovvero che tutte le categorie dello schema di
codifica siano ugualmente probabili; la probabilità
che ogni rater assegni un item alla categoria c è
dunque 1/c.
      </p>
      <p>4) !! =</p>
      <p>!∈! !! ∙ !! =  ∙ !! ! = !!
Nell’esempio di tab.1 A!!=0.333 e S=0.775.
L’assunto dell’uniformità è un prerequisito
estremamente vincolante: per tale ragione non
risultano, ad oggi, studi di I.A.A. in LC in cui sia
stato impiegato questo coefficiente. In aggiunta,
come è stato notato da Scott (1955: 322-323) e
riportato da Artstein &amp; Poesio (2008: 561), il
valore dell’indice può essere aumentato
semplicemente inserendo nello schema di codifica
categorie vuote.</p>
      <p>
        Il coefficiente π
        <xref ref-type="bibr" rid="ref33">(Scott, 1955)</xref>
        , noto anche col
nome di K di
        <xref ref-type="bibr" rid="ref34">Siegel &amp; Castellan (1988)</xref>
        , assume
che se l’attribuzione degli item alle categorie
avviene in modo casuale, la distribuzione sarà
uguale per entrambi gli annotatori.   !
corrisponderà perciò al rapporto tra il numero totale di
assegnazioni alla categoria c da parte di entrambi
i rater , nc , e il numero totale di assegnazioni
compiute, 2i.
      </p>
      <p>5) !! =</p>
      <p>
        !! !
!∈! !!
Nel caso in oggetto, A!! = 0.414 e π=0.744.
k
        <xref ref-type="bibr" rid="ref13">(Cohen, 1960)</xref>
        prevede infine una distribuzione
degli item nelle categorie distinta ed unica per
ciascun annotatore, rappresentata nelle frequenze
marginali della tabella di contingenza.
      </p>
      <p>6)   ! =   !!!!</p>
      <p>!
7) !! =   ! ∈! !!!!! ∙ !!!!!
Nell’esempio oggetto di discussione, pertanto,
A!!=0.41 e k=0.764.</p>
      <p>
        La corretta scelta dell’indice non può prescindere
dalla considerazione che i coefficienti sono
fortemente influenzati da disomogeneità nella
distribuzione dei dati
        <xref ref-type="bibr" rid="ref12 ref12 ref17 ref19 ref19 ref3">(Feinstein &amp; Cicchetti, 1990;
Cicchetti &amp; Feinstein 1990; Di Eugenio &amp; Glass,
2004; Artstein &amp; Poesio, 2008)</xref>
        , classificabili in
due tipologie principali: la già ricordata
“prevalenza” (tab. 2) e il “bias”, cioè il grado con cui
gli annotatori sono in accordo/disaccordo nelle
loro valutazioni complessive, ossia le loro
“tendenze” nell’esprimere giudizi (tab. 3 e 4).
rater
2
rater 1
c1 c2
c1 18 0
c2 0 0
c3 1 0
tot 19 0
      </p>
      <p>Nell’esempio di tab. 2, la forte prevalenza in
favore della categoria c1 fa sì che A!! = A!! = 0.905.
Di conseguenza, nonostante Ao sia molto alto
(0.9), π = k = -0.053, al di sotto della soglia della
pura casualità.</p>
      <p>Si confrontino quindi i dati delle tabelle 3 e 4:
sebbene entrambe registrino un Ao di 0.55, nel
caso in cui le distribuzioni marginali siano molto
simili (tab.3) A!! = 0.335, A!!= 0.336, π = 0.322, k
= 0.323; l’effetto di bias (tab.4), invece, affligge
la k di Cohen, in ragione delle modalità di
calcolo di   ! : A!! = 0.334, A!!= 0.287, π = 0.326, k
= 0.368. La differenza tra π e k è empiricamente
minima: A!! ≥ A!!, perciò π ≤ k. I due coefficienti
assumono lo stesso valore nel caso (limite) in cui
le distribuzioni marginali dei due rater siano
identiche, come in tab. 2.</p>
      <p>
        A fronte di ciò, laddove non sia possibile
effettuare uno studio che coinvolga più di due rater,
sembrerebbe pertanto da preferire il coefficiente
π di Scott, in grado di generalizzare il
comportamento dei singoli annotatori. In letteratura sono
state fatte varie proposte riguardo la modalità di
presentazione dei risultati dell’I.A.A per due
annotatori: allo stato dell’arte sembrerebbe
preferibile adottare la soluzione suggerita da
        <xref ref-type="bibr" rid="ref9">Byrt et al.
(1993)</xref>
        e adottata da Di Eugenio &amp; Glass (2004),
ovvero presentare congiuntamente diversi
coefficienti:
• k, che in linea di principio meglio si adatta
alla valutazione di annotazioni che
coinvolgono dati linguistici, e rende conto di
eventuali tendenze dei rater;
• π, immune all’effetto di bias;
• una terza misura, 2Ao-1, in grado di
neutralizzare l’effetto di prevalenza
        <xref ref-type="bibr" rid="ref9">(Byrt et
al., 1993)</xref>
        .
Sono state proposte moltissime generalizzazioni
dei coefficienti presentati, per assicurare
maggiore flessibilità ed adattabilità agli specifici task:1
tra le più note vi è la “weighted kappa”
        <xref ref-type="bibr" rid="ref14">(Cohen,
1968)</xref>
        , k(w), indice che consente di esprimere
delle gradazioni di disaccordo mediante una tabella
di “pesi” di valore compresi tra 0 e 1 (“weighting
scheme”), come nell’esempio:
Ao(w) e Ae(w) vengono calcolati in modo affine
alla k di
        <xref ref-type="bibr" rid="ref13">Cohen (1960)</xref>
        , moltiplicando però, in
aggiunta, ogni cella della tabella di contingenza
per il corrispettivo peso.
      </p>
      <p>
        8) (!) =   !!!(!!) !!!!(!!()!)
Se applicata ai dati di Tab.1, k(w) = 0.774.
Sono stati inoltre introdotti indici in grado di
quantificare l’I.A.A. tra tre o più annotatori: in
primis la cosiddetta k di
        <xref ref-type="bibr" rid="ref20">Fleiss (1971)</xref>
        , che
estende l’indice π di Scott (“multi-π ”), ed il
coefficiente presentato in
        <xref ref-type="bibr" rid="ref15">Davies &amp; Fleiss (1982)</xref>
        che
generalizza la k di Cohen (“multi-k”);2 ma
soprattutto il coefficiente α di
        <xref ref-type="bibr" rid="ref26">Krippendorff
(1980)</xref>
        , che esprime l’I.A.A. in termini di
disagreement, osservato (Do) e dovuto al caso (De):
9)
      </p>
      <p>
        = 1 −   !!!!
La formula, pur essendo stata derivata dalla
misura della varianza, non fa esplicito riferimento
alle medie dei campioni e può pertanto essere
generalizzata ad una moltitudine di schemi di
codifica in cui le categorie non siano
interpretabili come valori numerici; come per la weighted
kappa si possono inoltre attribuire pesi alle
di1 Alcune estensioni delle misure “kappa”, troppo complesse
per essere descritte esaurientemente in questa sede,
consentono ad esempio di valutare l’I.A.A nel caso in cui i rater
effettuino osservazioni multiple, e non necessariamente di
ugual numero, oppure di gestire gli schemi di annotazione
che prevedono la possibilità di attribuire più di una
classificazione agli item
        <xref ref-type="bibr" rid="ref25">(Kraemer, 1980)</xref>
        .
2 Le modalità di calcolo sono affini ai coefficienti già
descritti. Per i dettagli si rinvia perciò a
        <xref ref-type="bibr" rid="ref20">Fleiss (1971)</xref>
        ,
        <xref ref-type="bibr" rid="ref15">Davies
&amp; Fleiss (1982)</xref>
        e all’ottima sintesi di
        <xref ref-type="bibr" rid="ref3">Artstein &amp; Poesio
(2008)</xref>
        e
        <xref ref-type="bibr" rid="ref2">Artstein (2017)</xref>
        . Si noti che Ao non potrà essere
definito come “percentuale di item su cui c’è accordo”,
visto che con altissima probabilità ci saranno nei dati item
su cui alcuni rater saranno d’accordo e altri no: la soluzione
proposta in letteratura a partire da
        <xref ref-type="bibr" rid="ref20">Fleiss (1971)</xref>
        è di
misurare l’I.A.A. “pairwise”, ovvero “a coppie”.
verse tipologie di disagreement, utilizzando
weighting scheme oppure introducendo nel
calcolo delle metriche, ad esempio l’indice statistico
MASI
        <xref ref-type="bibr" rid="ref18 ref31">(Passonneau, 2006; Dorr et al., 2010)</xref>
        .3 α
è equivalente a multi-π per campioni numerosi,
ma è in grado, non imponendo un numero
minimo di item, di mitigare gli effetti statistici di
dataset a bassa numerosità campionaria; inoltre,
consentendo la gestione di dataset incompleti, è
utilizzabile (o addirittura preferibile) nel caso in
cui l’annotazione si svolga in maniera
collaborativa e distribuita, ad esempio su piattaforme di
crowdsourcing.
3
      </p>
      <p>
        Reliability: agreement o correlazione?
In letteratura, in particolare in ambito clinico
        <xref ref-type="bibr" rid="ref22 ref29 ref38 ref7">(Bishop &amp; Baird, 2001; Van Noord &amp; Prevatt,
2002; Massa et al., 2008; Gudmundsson &amp;
Gretarsson, 2009)</xref>
        , non è infrequente che, nella stima
dell’I.A.A, vengano preferiti o affiancati alle
misure presentate la statistica χ2 oppure gli indici
statistici di correlazione (coefficiente R di
Pearson in primis, ma anche i non parametrici ρ di
Spearman e τ di Kendall).
      </p>
      <p>
        Come già notato da
        <xref ref-type="bibr" rid="ref13">Cohen (1960)</xref>
        , l’utilizzo del
χ2 è una prassi da considerarsi scorretta, poiché
la statistica, applicata alla tavola di contingenza,
misura casualità e grado di associazione tra i set
di giudizi, non l’agreement
        <xref ref-type="bibr" rid="ref5">(Banerjee et al.,
1999)</xref>
        .
      </p>
      <p>
        “[...] Many investigators have computed χ2 over
the table for use as a test of the hypothesis of
chance agreement, and some have gone on to
compute the contingency coefficient (C) as a
measure of degree of agreement. [...] It is
readily demonstrable that the use of χ2 (and therefore
the C which is based on it) for the evaluation of
agreement is indefensible. When applied to a
contingency table, χ2 tests the null hypothesis
with regard to association, not agreement.
        <xref ref-type="bibr" rid="ref13">(Cohen, 1960: 38)</xref>
        Altrettanto scorretta dal punto di vista
metodologico è l’applicazione di coefficienti di
correlazione inter-/intra- classe, che ugualmente non
quantificano l’I.A.A. ma la forza di associazione
tra gruppi di valori
        <xref ref-type="bibr" rid="ref24 ref37 ref8">(Bland &amp; Altman, 1986;
Kottner et al., 2011; Stolarova et al., 2014)</xref>
        . Si
noti inoltre che, dal punto di vista empirico,
un’ottima correlazione tra annotazioni può essere
raggiunta anche in caso di completa mancanza di
3 MASI è basato sul coefficiente di
        <xref ref-type="bibr" rid="ref23">Jaccard (1908)</xref>
        e quindi
stabilisce la somiglianza/diversità tra insiemi campionari in
termini di distanza.
accordo, se due set di giudizi differiscono
sistematicamente.
      </p>
      <p>
        La ragione di tali fraintendimenti deve
probabilmente essere rintracciata nell’uso
sostanzialmente sinonimico dei termini “reliability” e
“agreement”
        <xref ref-type="bibr" rid="ref36">(Stemler, 2004)</xref>
        ; come puntualizzato da
        <xref ref-type="bibr" rid="ref27">Krippendorff (2004)</xref>
        , in realtà:
“To be clear, agreement is what we measure;
reliability is what we wish to infer from it.”
      </p>
      <p>
        <xref ref-type="bibr" rid="ref27">(Krippendorff, 2004: 413)</xref>
        Le correlazioni statistiche possono senza dubbio
costituire un’informazione interessante nella
valutazione globale dell’affidabilità di un dataset, a
patto però che tale nozione sia tenuta distinta
dall’I.A.A. in senso stretto.
4
      </p>
    </sec>
    <sec id="sec-3">
      <title>La valutazione dei coefficienti</title>
      <p>
        La valutazione dei valori assunti dai coefficienti
chance-corrected rappresenta, ad oggi, un
aspetto critico: gli indici possono assumere valori
compresi tra -1 e 1, dove k = 1 corrisponde ad un
I.A.A. perfetto, k = 0 ad un I.A.A.
completamente casuale e k = -1 ad un perfetto disaccordo.
Non è però soddisfacente sapere che k abbia un
valore superiore alla totale casualità, ma occorre
assicurarsi, piuttosto, che gli annotatori non si
discostino troppo dall’agreement assoluto
        <xref ref-type="bibr" rid="ref13 ref26">(Cohen, 1960; Krippendorff, 1980)</xref>
        .
      </p>
      <p>
        A prescindere dal mero valore numerico, va
rilevato come i vari studiosi che hanno tentato di
indicare delle soglie di riferimento abbiano
sottolineato l’arbitrarietà delle loro proposte: in primis
        <xref ref-type="bibr" rid="ref28">Landis &amp; Koch (1977)</xref>
        , a cui si deve la più nota
griglia per l’interpretazione dei coefficienti:
      </p>
      <p>Così anche Krippendorff, la cui proposta di
rifiutare valori di k inferiori a 0.67, accettare quelli
superiori a 0.8 e considerare incerti quelli
compresi nel range costituisce uno dei principali
punti di riferimento in letteratura sull’argomento.
“Except for perfect agreement, there are no
magical numbers, however.”</p>
      <p>
        <xref ref-type="bibr" rid="ref27">(Krippendorff, 2004: 324)</xref>
        Va infine rilevato come il disagreement non sia
necessariamente indice di bassa qualità
dell’annotazione, scarso training degli
annotatori o di guideline mal definite
        <xref ref-type="bibr" rid="ref1">(Aroyo &amp; Welty,
2015)</xref>
        , soprattutto nei task di natura semantica;
ed anche che, per aumentare l’affidabilità del
dataset annotato, non debba necessariamente
essere evitato o eliminato: in LC la sua presenza
può infatti essere sfruttata esplicitamente, per
migliorare le performance di sistemi automatici
        <xref ref-type="bibr" rid="ref11 ref32">(come ad esempio in Chklovski &amp; Mihalcea,
2003; Plank, Hovy &amp; Søgaard, 2014)</xref>
        .
5
      </p>
    </sec>
    <sec id="sec-4">
      <title>Conclusioni</title>
      <p>Come suggerito nei paragrafi iniziali, un alto
livello di I.A.A. non costituisce un risultato in sé,
ma soltanto uno fra gli indicatori della reale
affidabilità dell’annotazione sottoposta a
validazione. È perciò auspicabile che un sempre maggior
numero di dati sull’I.A.A. nei diversi task di
annotazione sia condiviso dai ricercatori, in modo
da facilitare l'emergere per confronto dei valori
di riferimento.</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          <string-name>
            <surname>Aroyo</surname>
            ,
            <given-names>L.</given-names>
          </string-name>
          &amp;
          <string-name>
            <surname>Welty</surname>
            ,
            <given-names>C.</given-names>
          </string-name>
          (
          <year>2015</year>
          ).
          <article-title>Truth Is a Lie: Crowd Truth and the Seven Myths of Human Annotation</article-title>
          .
          <source>AI Magazine</source>
          ,
          <volume>36</volume>
          (
          <issue>1</issue>
          ):
          <fpage>15</fpage>
          -
          <lpage>24</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          <string-name>
            <surname>Artstein</surname>
            ,
            <given-names>R.</given-names>
          </string-name>
          (
          <year>2017</year>
          ).
          <article-title>Inter-annotator Agreement</article-title>
          . In: Ide,
          <string-name>
            <given-names>N.</given-names>
            &amp;
            <surname>Pustejovsky</surname>
          </string-name>
          ,
          <string-name>
            <surname>J</surname>
          </string-name>
          . (eds.),
          <source>Handbook of Linguistic Annotation</source>
          . Springer, Dordrecht, pp.
          <fpage>297</fpage>
          -
          <lpage>314</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          <string-name>
            <surname>Artstein</surname>
            ,
            <given-names>R.</given-names>
          </string-name>
          &amp;
          <string-name>
            <surname>Poesio</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          (
          <year>2008</year>
          ).
          <article-title>Inter-Coder Agreement for Computational Linguistics</article-title>
          .
          <source>Computational Linguistics</source>
          ,
          <volume>34</volume>
          (
          <issue>4</issue>
          ):
          <fpage>555</fpage>
          -
          <lpage>596</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          <string-name>
            <surname>Bayerl</surname>
            ,
            <given-names>P. S.</given-names>
          </string-name>
          &amp;
          <string-name>
            <surname>Paul</surname>
            ,
            <given-names>K. I.</given-names>
          </string-name>
          (
          <year>2011</year>
          ).
          <article-title>What determines Inter-Coder Agreement in manual annotations? A meta-analytic investigation</article-title>
          .
          <source>Computational Linguistics</source>
          ,
          <volume>37</volume>
          (
          <issue>4</issue>
          ):
          <fpage>699</fpage>
          -
          <lpage>725</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          <string-name>
            <surname>Banerjee</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Capozzoli</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>McSweeney</surname>
            ,
            <given-names>L.</given-names>
          </string-name>
          &amp;
          <string-name>
            <surname>Sinha</surname>
            ,
            <given-names>D.</given-names>
          </string-name>
          (
          <year>1999</year>
          ).
          <article-title>Beyond Kappa: A Review of Interrater Agreement Measures</article-title>
          .
          <source>The Canadian Journal of Statistics / La Revue Canadienne de Statistique</source>
          ,
          <volume>27</volume>
          (
          <issue>1</issue>
          ):
          <fpage>3</fpage>
          -
          <lpage>23</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          <string-name>
            <surname>Bennett</surname>
            , Alpert,
            <given-names>R.</given-names>
          </string-name>
          &amp;
          <string-name>
            <surname>Goldstein</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          (
          <year>1954</year>
          ).
          <article-title>Communications through limited response questioning</article-title>
          .
          <source>Public Opinion Quarterly</source>
          ,
          <volume>18</volume>
          :
          <fpage>303</fpage>
          -
          <lpage>308</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          <string-name>
            <surname>Bishop</surname>
            ,
            <given-names>D.V.</given-names>
          </string-name>
          &amp;
          <string-name>
            <surname>Baird</surname>
            ,
            <given-names>G.</given-names>
          </string-name>
          (
          <year>2001</year>
          ).
          <article-title>Parent and teacher report of pragmatic aspects of communication: use of the children's communication checklist in a clinical setting</article-title>
          .
          <source>Developmental medicine and child neurology</source>
          ,
          <volume>43</volume>
          :
          <fpage>809</fpage>
          -
          <lpage>818</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          <string-name>
            <surname>Bland</surname>
            ,
            <given-names>M. J.</given-names>
          </string-name>
          &amp;
          <string-name>
            <surname>Altman</surname>
            ,
            <given-names>D.</given-names>
          </string-name>
          (
          <year>1986</year>
          ).
          <article-title>Statistical methods for assessing agreement between two methods of clinical measurement</article-title>
          .
          <source>Lancet</source>
          ,
          <volume>327</volume>
          :
          <fpage>307</fpage>
          -
          <lpage>310</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          <string-name>
            <surname>Byrt</surname>
            ,
            <given-names>T.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Bishop</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          &amp;
          <string-name>
            <surname>Carlin</surname>
            ,
            <given-names>J. B.</given-names>
          </string-name>
          (
          <year>1993</year>
          ).
          <article-title>Bias, prevalence and kappa</article-title>
          .
          <source>Journal of Clinical Epidemiology</source>
          ,
          <volume>46</volume>
          (
          <issue>5</issue>
          ):
          <fpage>423</fpage>
          -
          <lpage>9</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref10">
        <mixed-citation>
          <string-name>
            <surname>Carletta</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          (
          <year>1996</year>
          ).
          <article-title>Assessing agreement on classification tasks: the kappa statistic</article-title>
          .
          <source>Computational Linguistics</source>
          ,
          <volume>22</volume>
          (
          <issue>2</issue>
          ):
          <fpage>249</fpage>
          -
          <lpage>254</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref11">
        <mixed-citation>
          <string-name>
            <surname>Chklovski</surname>
            ,
            <given-names>T.</given-names>
          </string-name>
          &amp;
          <string-name>
            <surname>Mihalcea</surname>
            ,
            <given-names>R.</given-names>
          </string-name>
          (
          <year>2003</year>
          ).
          <article-title>Exploiting Agreement and Disagreement of Human Annotators for Word Sense Disambiguation</article-title>
          .
          <source>In: Proceedings of the Conference on Recent Advances in Natural Language Processing (RANLP</source>
          <year>2003</year>
          ).
        </mixed-citation>
      </ref>
      <ref id="ref12">
        <mixed-citation>
          <string-name>
            <surname>Cicchetti</surname>
            ,
            <given-names>D.V.</given-names>
          </string-name>
          &amp;
          <string-name>
            <surname>Feinstein</surname>
            ,
            <given-names>A.R.</given-names>
          </string-name>
          (
          <year>1990</year>
          ).
          <article-title>High Agreement but low Kappa: II. Resolving the paradoxes</article-title>
          .
          <source>Journal of Clinical Epidemiology</source>
          ,
          <volume>43</volume>
          :
          <fpage>551</fpage>
          -
          <lpage>558</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref13">
        <mixed-citation>
          <string-name>
            <surname>Cohen</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          (
          <year>1960</year>
          ).
          <article-title>A Coefficient of Agreement for Nominal Scales</article-title>
          .
          <source>Educational and Psychological Measurement</source>
          ,
          <volume>20</volume>
          (
          <issue>1</issue>
          ):
          <fpage>37</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref14">
        <mixed-citation>
          <string-name>
            <surname>Cohen</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          (
          <year>1968</year>
          ).
          <article-title>Weighted kappa: Nominal scale agreement with provision for scaled disagreement or partial credit</article-title>
          .
          <source>Psychological Bulletin</source>
          ,
          <volume>70</volume>
          (
          <issue>4</issue>
          ):
          <fpage>213</fpage>
          -
          <lpage>220</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref15">
        <mixed-citation>
          <string-name>
            <surname>Davies</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          &amp;
          <string-name>
            <surname>Fleiss</surname>
            ,
            <given-names>J. L.</given-names>
          </string-name>
          (
          <year>1982</year>
          ).
          <article-title>Measuring Agreement for Multinomial Data</article-title>
          . Biometrics,
          <volume>38</volume>
          (
          <issue>4</issue>
          ):
          <fpage>1047</fpage>
          -
          <lpage>1051</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref16">
        <mixed-citation>
          <string-name>
            <given-names>Di</given-names>
            <surname>Eugenio</surname>
          </string-name>
          ,
          <string-name>
            <surname>B.</surname>
          </string-name>
          (
          <year>2000</year>
          ).
          <article-title>On the usage of Kappa to evaluate agreement on coding tasks</article-title>
          . In: Calzolari N. et al. (eds):
          <source>Proceedings of the Second International Conference on Language Resources and Evaluation (LREC</source>
          <year>2000</year>
          ), ELRA - European Language Resources Association, Paris, pp.
          <fpage>441</fpage>
          -
          <lpage>444</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref17">
        <mixed-citation>
          <string-name>
            <given-names>Di</given-names>
            <surname>Eugenio</surname>
          </string-name>
          ,
          <string-name>
            <given-names>B.</given-names>
            &amp;
            <surname>Glass</surname>
          </string-name>
          ,
          <string-name>
            <surname>M.</surname>
          </string-name>
          (
          <year>2004</year>
          ).
          <article-title>The Kappa statistic: a second look</article-title>
          .
          <source>Computational Linguistics</source>
          ,
          <volume>30</volume>
          (
          <issue>1</issue>
          ):
          <fpage>95</fpage>
          -
          <lpage>101</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref18">
        <mixed-citation>
          <string-name>
            <surname>Dorr</surname>
            ,
            <given-names>B.J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Passonneau</surname>
            ,
            <given-names>R.J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Farwell</surname>
            ,
            <given-names>D.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Green</surname>
            ,
            <given-names>R.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Habash</surname>
            ,
            <given-names>N.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Helmreich</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Hovy</surname>
            ,
            <given-names>E.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Levin</surname>
            ,
            <given-names>L.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Miller</surname>
            ,
            <given-names>K. J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Mitamura</surname>
            ,
            <given-names>T.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Rambow</surname>
            ,
            <given-names>O.</given-names>
          </string-name>
          &amp;
          <string-name>
            <surname>Siddharthan</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          (
          <year>2010</year>
          ).
          <article-title>Interlingual annotation of parallel text corpora: A new framework for annotation and evaluation</article-title>
          .
          <source>Journal of Natural Language Engineering</source>
          ,
          <volume>16</volume>
          (
          <issue>3</issue>
          ):
          <fpage>197</fpage>
          -
          <lpage>243</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref19">
        <mixed-citation>
          <string-name>
            <surname>Feinstein</surname>
            ,
            <given-names>A.R.</given-names>
          </string-name>
          &amp;
          <string-name>
            <surname>Cicchetti</surname>
            ,
            <given-names>D.V.</given-names>
          </string-name>
          (
          <year>1990</year>
          ).
          <article-title>High agreement but low kappa: I. The problems of two paradoxes</article-title>
          .
          <source>Journal of Clinical Epidemiology</source>
          ,
          <volume>43</volume>
          :
          <fpage>543</fpage>
          -
          <lpage>549</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref20">
        <mixed-citation>
          <string-name>
            <surname>Fleiss</surname>
            ,
            <given-names>J. L.</given-names>
          </string-name>
          (
          <year>1971</year>
          ).
          <article-title>Measuring nominal scale agreement among many raters</article-title>
          .
          <source>Psychological Bulletin</source>
          ,
          <volume>76</volume>
          (
          <issue>5</issue>
          ):
          <fpage>378</fpage>
          -
          <lpage>382</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref21">
        <mixed-citation>
          <string-name>
            <surname>Goodman</surname>
            ,
            <given-names>L. A.</given-names>
          </string-name>
          &amp;
          <string-name>
            <surname>Kruskal</surname>
            ,
            <given-names>W. H.</given-names>
          </string-name>
          (
          <year>1954</year>
          ).
          <article-title>Measures of association for cross classifications</article-title>
          .
          <source>Journal of the American Statistical Association</source>
          ,
          <volume>49</volume>
          (
          <issue>268</issue>
          ):
          <fpage>732</fpage>
          -
          <lpage>764</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref22">
        <mixed-citation>
          <string-name>
            <surname>Gudmundsson</surname>
            ,
            <given-names>E.</given-names>
          </string-name>
          &amp;
          <string-name>
            <surname>Gretarsson</surname>
            ,
            <given-names>S. J.</given-names>
          </string-name>
          (
          <year>2009</year>
          ).
          <article-title>Comparison of mothers' and fathers' ratings of their children's verbal and motor development</article-title>
          .
          <source>Nordic Psycholgy</source>
          ,
          <volume>61</volume>
          :
          <fpage>14</fpage>
          -
          <lpage>25</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref23">
        <mixed-citation>
          <string-name>
            <surname>Jaccard</surname>
            ,
            <given-names>P.</given-names>
          </string-name>
          (
          <year>1908</year>
          ).
          <article-title>Nouvelles recherches sur la distribution florale</article-title>
          .
          <source>Bulletin de la Société Vaudoise des Sciences Naturelles</source>
          ,
          <volume>44</volume>
          :
          <fpage>223</fpage>
          -
          <lpage>270</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref24">
        <mixed-citation>
          <string-name>
            <surname>Kottner</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Audige</surname>
            ,
            <given-names>L.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Brorson</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Donner</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Gajewski</surname>
            ,
            <given-names>B.J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Hróbjartsson</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Roberts</surname>
            ,
            <given-names>C.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Shoukri</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          &amp;
          <string-name>
            <surname>Streiner</surname>
            ,
            <given-names>D.L.</given-names>
          </string-name>
          (
          <year>2011</year>
          ).
          <article-title>Guidelines for reporting reliability and agreement studies (GRRAS) were proposed</article-title>
          .
          <source>International journal of nursing studies</source>
          ,
          <volume>48</volume>
          :
          <fpage>661</fpage>
          -
          <lpage>671</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref25">
        <mixed-citation>
          <string-name>
            <surname>Kraemer</surname>
            ,
            <given-names>H. C.</given-names>
          </string-name>
          (
          <year>1980</year>
          ).
          <article-title>Extension of the kappa coefficient</article-title>
          .
          <source>Biometrics</source>
          ,
          <volume>36</volume>
          (
          <issue>2</issue>
          ):
          <fpage>207</fpage>
          -
          <lpage>16</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref26">
        <mixed-citation>
          <string-name>
            <surname>Krippendorff</surname>
            ,
            <given-names>K.</given-names>
          </string-name>
          (
          <year>1980</year>
          ).
          <article-title>Content Analysis: an introduction to its Methodology</article-title>
          .
          <source>Sage Publications</source>
          , Thousand Oaks, CA.
        </mixed-citation>
      </ref>
      <ref id="ref27">
        <mixed-citation>
          <string-name>
            <surname>Krippendorff</surname>
            ,
            <given-names>K.</given-names>
          </string-name>
          (
          <year>2004</year>
          ).
          <article-title>Reliability in content analysis: Some common misconceptions and recommendations</article-title>
          .
          <source>Human Communication Research</source>
          ,
          <volume>30</volume>
          (
          <issue>3</issue>
          ):
          <fpage>411</fpage>
          -
          <lpage>433</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref28">
        <mixed-citation>
          <string-name>
            <surname>Landis</surname>
            ,
            <given-names>J. R.</given-names>
          </string-name>
          &amp;
          <string-name>
            <surname>Koch</surname>
            ,
            <given-names>G. G.</given-names>
          </string-name>
          (
          <year>1977</year>
          ).
          <article-title>The Measurement of Observer Agreement for Categorical Data</article-title>
          . Biometrics,
          <volume>33</volume>
          (
          <issue>1</issue>
          ):
          <fpage>159</fpage>
          -
          <lpage>174</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref29">
        <mixed-citation>
          <string-name>
            <surname>Massa</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Gomes</surname>
            ,
            <given-names>H.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Tartter</surname>
            ,
            <given-names>V.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Wolfson</surname>
            ,
            <given-names>V.</given-names>
          </string-name>
          &amp;
          <string-name>
            <surname>Halperin</surname>
            ,
            <given-names>J.M.</given-names>
          </string-name>
          (
          <year>2008</year>
          ).
          <article-title>Concordance rates between parent and teacher clinical evaluation of language fundamentals observational rating scale</article-title>
          .
          <source>International Journal of Language &amp; Communication Disorders</source>
          ,
          <volume>43</volume>
          :
          <fpage>99</fpage>
          -
          <lpage>110</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref30">
        <mixed-citation>
          <string-name>
            <surname>Mathet</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Widlöcher</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          &amp;
          <string-name>
            <surname>Métivier</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          (
          <year>2015</year>
          ).
          <article-title>The Unified and Holistic Method Gamma (γ) for InterAnnotator Agreement Measure and Alignment</article-title>
          .
          <source>Computational Linguistics</source>
          ,
          <volume>41</volume>
          (
          <issue>3</issue>
          ):
          <fpage>437</fpage>
          -
          <lpage>479</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref31">
        <mixed-citation>
          <string-name>
            <surname>Passonneau</surname>
            ,
            <given-names>R.</given-names>
          </string-name>
          (
          <year>2006</year>
          ).
          <article-title>Measuring agreement on setvalued items (MASI) for semantic and pragmatic annotation</article-title>
          .
          <source>In: Proceedings of the fifth International Conference on Language Resources and Evaluation (LREC</source>
          <year>2006</year>
          ).
          <source>ELRA European Language Resources Association</source>
          , Paris.
        </mixed-citation>
      </ref>
      <ref id="ref32">
        <mixed-citation>
          <string-name>
            <surname>Plank</surname>
            ,
            <given-names>B.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Hovy</surname>
            ,
            <given-names>D.</given-names>
          </string-name>
          &amp;
          <string-name>
            <surname>Søgaard</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          (
          <year>2014</year>
          ).
          <article-title>Learning part-of-speech taggers with inter-annotator agreement loss</article-title>
          .
          <source>In: Proceedings of the 14th Conference of the European Chapter of the Association for Computational Linguistics</source>
          , pp.
          <fpage>742</fpage>
          -
          <lpage>751</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref33">
        <mixed-citation>
          <string-name>
            <surname>Scott</surname>
            ,
            <given-names>W.A.</given-names>
          </string-name>
          (
          <year>1955</year>
          ).
          <source>Reliability of Content Analysis: The Case of Nominal Scale Coding. Public Opinion Quarterly</source>
          ,
          <volume>19</volume>
          (
          <issue>3</issue>
          ):
          <fpage>321</fpage>
          -
          <lpage>325</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref34">
        <mixed-citation>
          <string-name>
            <surname>Siegel</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          &amp;
          <string-name>
            <surname>Castellan</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          (
          <year>1988</year>
          ).
          <article-title>Nonparametric statistics for the behavioral sciences</article-title>
          .
          <source>McGraw-Hill</source>
          , Boston, MA.
        </mixed-citation>
      </ref>
      <ref id="ref35">
        <mixed-citation>
          <string-name>
            <surname>Soeken</surname>
            ,
            <given-names>K.L.</given-names>
          </string-name>
          &amp;
          <string-name>
            <surname>Prescott</surname>
            ,
            <given-names>P.A.</given-names>
          </string-name>
          (
          <year>1986</year>
          ).
          <article-title>Issues in the use of kappa to estimate reliability</article-title>
          .
          <source>Medical Care</source>
          ,
          <volume>24</volume>
          (
          <issue>8</issue>
          ):
          <fpage>733</fpage>
          -
          <lpage>41</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref36">
        <mixed-citation>
          <string-name>
            <surname>Stemler</surname>
            ,
            <given-names>S.E.</given-names>
          </string-name>
          (
          <year>2004</year>
          ).
          <article-title>A Comparison of Consensus, Consistency, and Measurement Approaches to Estimating Interrater Reliability</article-title>
          . Practical Assessment, Research &amp; Evaluation,
          <volume>9</volume>
          :
          <fpage>66</fpage>
          -
          <lpage>78</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref37">
        <mixed-citation>
          <string-name>
            <surname>Stolarova</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Wolf</surname>
            ,
            <given-names>C.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Rinker</surname>
            ,
            <given-names>T.</given-names>
          </string-name>
          &amp;
          <string-name>
            <surname>Brielmann</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          (
          <year>2014</year>
          ).
          <article-title>How to assess and compare inter-rater reliability, agreement and correlation of ratings: an exemplary analysis of mother-father and parentteacher expressive vocabulary rating pairs</article-title>
          . Frontiers in psychology,
          <volume>5</volume>
          ,
          <fpage>509</fpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref38">
        <mixed-citation>
          <string-name>
            <surname>Van Noord</surname>
            ,
            <given-names>R.G.</given-names>
          </string-name>
          &amp;
          <string-name>
            <surname>Prevatt</surname>
            ,
            <given-names>F.F.</given-names>
          </string-name>
          (
          <year>2002</year>
          ).
          <article-title>Rater agreement on IQ and achievement tests: effect on evaluations of learning disabilities</article-title>
          .
          <source>Journal of School Psychology</source>
          ,
          <volume>40</volume>
          (
          <issue>2</issue>
          ):
          <fpage>167</fpage>
          -
          <lpage>176</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref39">
        <mixed-citation>
          <string-name>
            <surname>Warrens</surname>
            ,
            <given-names>M. J.</given-names>
          </string-name>
          (
          <year>2010</year>
          ).
          <article-title>Inequalities between multirater kappas</article-title>
          .
          <source>Advances in Data Analysis and Classification</source>
          ,
          <volume>4</volume>
          (
          <issue>4</issue>
          ):
          <fpage>271</fpage>
          -
          <lpage>286</lpage>
          .
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>