<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Повышение качества классификации текстов путем модификации обучающего множества</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>Ярославль kolesov.ay@ya.ru</string-name>
        </contrib>
      </contrib-group>
      <fpage>338</fpage>
      <lpage>339</lpage>
      <abstract>
        <p>Аннотация Автоматическую классификацию текстов часто используют для структурирования больших объемов данных. В этой работе предложен новый метод повышения качества классификации путем модификации обучающего множества. Метод опробован на общедоступной коллекции текстов, где один документ может относится к нескольким классам.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>
        В этой работе мы, во-первых, смоделируем
ситуацию неполноты меток на хорошо размеченной
коллекции биомедицинских исследовательских
статей, представленной на конкурсе JRS'12 [
        <xref ref-type="bibr" rid="ref3">2</xref>
        ] и
доступной на сайте конкурса. Тем самым еще раз
покажем, что методы из статьи [
        <xref ref-type="bibr" rid="ref2">1</xref>
        ] хорошо
работают. Во-вторых, исходя из результатов
экспериментов, предложим метод повышения
качества классификации для multi-label задач без
предположения неполноты данных (т. е. для хорошо
размеченных данных).
2 Материалы и методы
2.1 Данные JRS'12
      </p>
      <p>
        Коллекция данных JRS'12 представляет из себя
набор из 20000 биомедицинских статей, доступных
на PubMed Central [
        <xref ref-type="bibr" rid="ref4">3</xref>
        ]. Каждая из статей была
размечена экспертами Pubmed в области
биомедицины по MeSH (Medical Subject Headings) [
        <xref ref-type="bibr" rid="ref1 ref5">4</xref>
        ]. Каждый документ имеет 25640 атрибутов,
Труды 14-й Всероссийской научной конференции
«Электронные библиотеки: перспективные методы и
технологии, электронные коллекции» — RCDL-2012,
Переславль-Залесский, Россия, 15-18 октября 2012 г.
2.2 Предобработка данных
      </p>
      <p>Данные представляют из себя матрицу документ
— вес атрибута. Веса атрибутов предоставлены
организаторами JRS'12. Для проведения
экспериментов мы нормировали строки матрицы по
норме l2.
2.3 Метрики качества классификации</p>
      <p>Пусть N — количество тестовых документов.</p>
      <p>TrueTopicsi — множество верных (отмеченных
экспертом) меток рубрик для i-ого документа.</p>
      <p>PredTopicsi — множество меток рубрик,
которые выдает классификатор для i-ого документа.
Определим следующие метрики качества
классификации, подсчитываемые для i-ого
документа:</p>
      <p>Precisioni=
Recalli=
Fscorei =2⋅
∣TrueTopicsi∩ PredTopicsi∣</p>
      <p>∣PredTopicsi∣
∣TrueTopicsi∩ PredTopicsi∣</p>
      <p>∣TrueTopicsi∣</p>
    </sec>
    <sec id="sec-2">
      <title>Precisioni⋅Recalli</title>
    </sec>
    <sec id="sec-3">
      <title>Precisioni+ Recall i</title>
      <p>Для каждой метрики будем
усредненные метрики:
рассчитывать
AvgMetric = i =1</p>
      <p>N
∑ Metric i</p>
      <p>N
Подставляя вместо</p>
      <p>Metrici соответствующую
определенную выше метрику (например,</p>
      <p>Fscorei ), получаем ее усреднение по тесту.
2.4 Эксперименты</p>
      <p>
        Установки экспериментов классификации точно
такие же как в работе [
        <xref ref-type="bibr" rid="ref2">1</xref>
        ]. Здесь приведены
результаты только с использованием модификации
обучаюПараметры w-kNN
      </p>
      <p>До модификации обучающего множества После модификации обучающего множества
Optimal k Optimal T precision
recall</p>
      <p>F-score
precision
Доля
удаленных
меток</p>
      <p>0
0,1
0,2
0,4
0,6
щего множества на основе метода k-взвешенных
ближайших соседей (w-kNN).</p>
      <p>Опишем, как мы моделировали неполноту меток
в обучении. Для этого задается доля удаляемых
меток. Затем случайным образом отбирается
заданное количество меток, но так, чтобы ни один
документ не остался без меток и ни одна рубрика не
осталась без документов. Затем проводится
обучение/классификация на полученном
обучающем множестве и на его модификации.
3 Результаты</p>
      <p>
        В Таблице 1 представлены результаты
экспериментов. В ячейке первого столбца указана
доля удаленных меток при моделировании.
Например, 0,2 — означает, что 20% исходных меток
(т. е. пар документ-рубрика были удалены из
обучающего множества). Во втором и третьем
столбце указаны подобранные (см. [
        <xref ref-type="bibr" rid="ref2">1</xref>
        ]) оптимальные
значения для алгоритма w-kNN, где k — количество
используемых ближайших соседей, T — порог
принадлежности рубрики документу. В следующих
столбцах содержатся значения метрик до и после
модификации обучающего множества.
      </p>
      <p>Как и ожидалось при удалении меток результаты
по F-мере ухудшаются (чем больше меток удаляем,
тем хуже качество классификации). После
модификации обучающего множества F-мера значительно
увеличивается. Более того, для значений доли
удаленных меток 0,1 и 0,2 усредненная F-мера
превосходит усредненную F-меру при
классификации по исходному обучающему множеству.</p>
      <p>
        Таким образом, метод, предлагаемый для
улучшения качества классификации, заключается в
следующем. Удаляем случайным образом
небольшое количество меток из обучающего множества.
Применяем метод модификации обучающего
множества (из работы [
        <xref ref-type="bibr" rid="ref2">1</xref>
        ]). Обучаемся на
модифицированном обучающем множестве.
0,5151
0,508
0,4788
0,5387
recall
      </p>
      <p>F-score
.</p>
      <p>
        Также мы подтвердили результаты работы [
        <xref ref-type="bibr" rid="ref2">1</xref>
        ]
путем моделирования на хорошо размеченной
коллекции данных.
Литература
      </p>
      <p>Improvement of text classification
performance by modifying the training set</p>
      <p>Anton Kolesov</p>
      <p>Automatic data classification methods are
frequently employed for structuring large amounts of
data. In this paper, we propose a new method to increase
the performance of classification of data by modifying
the training set. The method is tested on publicly
available multi-label collection of texts.</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          <article-title>4 Выводы Применение предложенного метода повышения качества классификации позволило улучшить результаты по F-мере с</article-title>
          <volume>52</volume>
          ,35% до 54,43%, т. е.
          <source>В относительном выражении на 4%. Отметим, что значение 54</source>
          ,43% превосходит лучший результат участников конкурса JRS'
          <volume>12</volume>
          (
          <issue>53</issue>
          ,579%).
          <article-title>Описанный в работе эффект требует дополнительного изучения. Требуется определить правило для вычисления, какую долю меток удалять. Работает ли этот метод на multi-class задачах? Это дело дальнейшей работы</article-title>
          .
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          [1]
          <string-name>
            <surname>Колесов</surname>
            <given-names>А.Ю.</given-names>
          </string-name>
          <article-title>Методы классификации в усло- виях противоречивого обучающего множества. Труды 13-й Всероссийской научной конферен- ции «Электронные библиотеки: перспективные методы и технологии, электронные коллекции» - RCDL-2011</article-title>
          . Воронеж:
          <year>2011</year>
          , с.
          <fpage>140</fpage>
          -
          <lpage>146</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          [2]
          <string-name>
            <given-names>JRS</given-names>
            <surname>2012 Data Mining</surname>
          </string-name>
          <article-title>Competition: Topical Classification of Biomedical Research Papers</article-title>
          . Http:// tunedit.org/challenge/JRS12Contest/JRS12Contest
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          [3]
          <string-name>
            <surname>Home - PubMed - NCBI</surname>
          </string-name>
          . http://www.ncbi.nlm.nih.gov/pubmed
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          [4]
          <string-name>
            <given-names>Medical</given-names>
            <surname>Subject Headings - Home Page</surname>
          </string-name>
          . http://www.nlm.nih.gov/mesh/
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>