<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Использование семантического анализа текстов для поиска специалистов</article-title>
      </title-group>
      <contrib-group>
        <aff id="aff0">
          <label>0</label>
          <institution>Higher School of Economics</institution>
          ,
          <addr-line>Moscow</addr-line>
          ,
          <country country="RU">Russia</country>
        </aff>
      </contrib-group>
      <fpage>187</fpage>
      <lpage>191</lpage>
      <abstract>
        <p>Аннотация В работе предложен метод семантического поиска специалистов по набору составленных ими текстов. Описан формат запросов, позволяющий определять набор искомых компетенций. Разработаны алгоритмы построения и сравнения семантических представлений фрагментов текстов на естественном языке. На основе предложенной модели разработан и испытан прототип поисковой системы ExpSearch-1 (Experts Search, версия 1). Ключевые слова: поиск специалистов, семантический анализ, теория K-представлений, естественно-языковые запросы.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>-</title>
      <p>– при поиске не будут учтены смысловые отношения между словами;
– поисковая выдача будет различаться для запросов с одинаковым
значением, но составленных по-разному (даже при учете синонимии понятий);
– оказывается невозможным алгоритмически определить, является ли
конкретный пункт выдачи действительно релевантным запросу.</p>
      <p>Структура разработанной системы
Для реализации нового подхода к семантическому поиску специалистов
была разработана система-прототип ExpSearch-1 (Experts Search, версия 1).
Ее структура изображена на рис. 1.</p>
      <p>Рис. 1. Схема разработанной системы семантического поиска
В систему загружаются полные тексты с информацией о специалистах
(анкеты, резюме, профессиональная переписка и т.п.), которые
группируются по принадлежности к соответствующим специалистам.</p>
      <p>
        Для поиска пользователь вводит запрос в виде набора словосочетаний,
каждое из которых определяет одну искомую компетенцию [
        <xref ref-type="bibr" rid="ref2">2</xref>
        ]. Запрос
состоит из существительных с возможным использованием предлогов,
прилагательных и числительных. Запрос такого вида позволяет задать, например:
– область знания (эпизодическая логика, управление рисками);
– модель, теорию, понятие (модель Эрроу-Дебре, дефлятор ВВП);
– инструментальное средство (среда SPSS, пакет MatLab);
– умение или навык (обработка древесины, разработка под iOS).
      </p>
      <p>Система ищет специалистов, у которых в связанных с ними текстах
присутствуют релевантные словосочетания. Чем большему числу
критериев удовлетворяет специалист, тем выше он располагается в ранжировании,
выдаваемом системой.
3</p>
      <p>
        Алгоритм построения семантических представлений
В основе работы системы лежит модифицированный алгоритм
построения семантических представлений (далее – СП) и модель лингвистической
базы данных, предложенные в книгах [
        <xref ref-type="bibr" rid="ref3">3,4</xref>
        ].
      </p>
      <p>Построение СП фрагмента текста начинается с определения
морфологических свойств его слов и приведения их к начальной форме. Затем к
существительным применяется лексико-семантический словарь. По начальной
форме слова он сопоставляет ему семантическое значение sem (для
равнозначных с точки зрения системы слов оно совпадает) и набор
характеристик st1, . . . , stk. Словарь содержит записи вида (lec, sem, st1, . . . , stk), где
lec – базовая форма слова; sem – строка, обозначающая семантическое
значение лексемы lec; st1, . . . , stk – различные семантические характеристики
сущности, связанные с понятием sem; k – наибольшее возможное их число.</p>
      <p>Далее к существительным применяется словарь предложных
семантикосинтаксических фреймов, задающий связи между семантическими
единицами, выделенными на предыдущем этапе. Он содержит записи вида (prep, st1,
st2, grc, rel), где prep – необходимый предлог (может быть пустым); st1, st2 –
семантические характеристики, которые можно связать с первым и вторым
существительным в лингвистически правильном словосочетании ¾сущ.1 +
prep + сущ.2¿ соответственно; grc (grammatic case) – обозначение падежа
второго существительного; rel – обозначение смыслового отношения.
Существительные попарно проверяются на соответствие следующим условиям:
первому существительному сопоставлен сорт sr1, второму – sr2, зависимое
существительное находится в падеже grc, и между ними есть предлог prep.
При удовлетворении всех условий для одной записи словаря считается, что
между существительными установлено смысловое отношение rel из этой
записи, дальнейшая сверка по словарю для этой пары прекращается.</p>
      <p>Заметим, что на предыдущих шагах обрабатывались только
существительные. Если имеется прилагательное или слово, ведущее себя как
прилагательное, рассматриваются существительные, между которыми оно
расположено. При совпадении с одним из них по роду, числу и падежу оно
обозначается зависимым от него. При совпадении с обоими существительными
прилагательное считается зависимым от последнего из них по порядку. В
данных случаях устанавливается отношение rel – ¾свойство¿, а значение
sem зависимой единицы – как начальная форма зависимого слова.</p>
      <p>В результате выполнения алгоритма получается СП фрагмента текста
– ориентированное дерево, в вершинах которого находятся семантические
единицы sem, а ребра заданы отношениями rel.
4</p>
      <p>Алгоритм поиска
Задачей алгоритма поиска является нахождение фрагментов в текстах
о специалистах, имеющих СП (семантические представления), схожие с СП
поискового запроса. Поэтому при поиске сначала строится СП запроса, а
затем для каждого введенного пользователем словосочетания система
составляет набор слов, парные вхождения которых в текст могут
потенциально содержать между собой отношения как в СП запроса. Для этого в
список включаются все слова из лексико-семантического словаря, которым
могут быть сопоставлены единицы sem из СП запроса. Например, для
словосочетания ¾маркетинг сбыта¿ может быть составлен следующий набор
ключевых слов: ¾маркетинг¿, ¾маркетолог¿, ¾анализ рынка¿,
¾исследование рынка¿, ¾сбыт¿, ¾продажа¿.
По текстам, содержащимся в базе знаний, производится поиск по
составленному набору ключевых слов. При нахождении хотя бы одного слова
строится СП фрагмента текста вокруг него (границы определяются по
таким символам, как точка, точка с запятой, табуляция, перенос строки и
т.п.). Полученные представления группируются по специалистам, к текстам
которых они относятся. Такой подход позволяет сохранить общую
вычислительную сложность алгоритма низкой, так как процедура построения СП
запускается только на предположительно релевантных фрагментах текстов.</p>
      <p>
        Каждое СП можно упрощенно представить в виде набора триплетов
вида (sem1, rel, sem2), то есть пар связанных семантических значений. Пусть
A – набор триплетов, представляющих поисковый запрос, а B –
аналогичный набор, представляющий СП, выделенные в текстах, связанных с
одним специалистом. Тогда мерой релевантности специалиста будет величина
score = |A∩B| , находящаяся в отрезке [
        <xref ref-type="bibr" rid="ref1">0, 1</xref>
        ]. Для получения
результирующе|A|
го ранжирования специалисты упорядочиваются по убыванию показателя
score, и их список возвращается пользователю как результат поиска.
5
      </p>
      <p>Заключение
На основе предложенной модели на языке программирования Python
был разработан прототип поисковой системы ExpSearch-1. В качестве
тестовых данных в систему была загружена текстовая информация о более
чем 7000 сотрудниках Высшей школы экономики (НИУ ВШЭ), взятая с
официального сайта. В ходе испытаний система успешно выполнила поиск
по набору тестовых запросов и дала по ним релевантные результаты.</p>
      <p>В качестве направлений для продолжения работы предполагается
усложнение формата поддерживаемых запросов и совершенствование алгоритма
сравнения семантических представлений.
Список литературы</p>
      <p>Igor Zahlebin
Abstract. This paper presents a semantic method for searching for the
experts. The method operates over a set of texts authored by themselves.
The query format allowing one to define a set of the selected skills, and
the algorithms for constructing and comparing the semantic
representations are also presented. The ExpSearch-1 (Experts Search, version 1)
system which is based on the present method has been developed and
evaluated.</p>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          1.
          <string-name>
            <surname>Xiaodan</surname>
          </string-name>
          <article-title>Song и др</article-title>
          .
          <source>ExpertiseNet: Relational and Evolutionary Expert Modeling</source>
          . // SmallBlue Internet Edition (alpha) [
          <article-title>Электронный ресурс]</article-title>
          . URL: http:// smallblue.research.ibm.com/publications/ExpertiseNet_UM.
          <source>pdf (дата обра- щения: 10.03</source>
          .
          <year>2014</year>
          ).
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          2.
          <string-name>
            <surname>Arjen P. de Vries</surname>
          </string-name>
          . Expert Finding = Finding People + Assessing Expertise // Future Challenges in Expertise Retrieval, SIGIR 2008 Workshop, Singapore [Элек- тронный ресурс]. URL: https://app.box.
          <source>com/s/9yqrk9zs6lc38gqpsi2j (дата об- ращения: 10.03</source>
          .
          <year>2014</year>
          ).
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          4.
          <string-name>
            <surname>Fomichov</surname>
            <given-names>V.A.</given-names>
          </string-name>
          <string-name>
            <surname>Semantics-Oriented Natural</surname>
          </string-name>
          Language Processing:
          <source>Mathematical Models and Algorithms. Series: IFSR International Series on Systems Science and Engineering</source>
          , Vol.
          <volume>27</volume>
          . Springer: New York, Dordrecht, Heidelberg, London,
          <year>2010</year>
          .
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>