<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Archiving and Interchange DTD v1.0 20120330//EN" "JATS-archivearticle1.dtd">
<article xmlns:xlink="http://www.w3.org/1999/xlink">
  <front>
    <journal-meta />
    <article-meta>
      <title-group>
        <article-title>Fouille de données biologiques : vers une représentation booléenne des règles d'association.</article-title>
      </title-group>
      <contrib-group>
        <contrib contrib-type="author">
          <string-name>Abdelhak MANSOUL</string-name>
          <xref ref-type="aff" rid="aff0">0</xref>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <contrib contrib-type="author">
          <string-name>Baghdad ATMANI</string-name>
          <email>atmani.baghdad@gmail.com</email>
          <xref ref-type="aff" rid="aff0">0</xref>
          <xref ref-type="aff" rid="aff1">1</xref>
        </contrib>
        <aff id="aff0">
          <label>0</label>
          <institution>Equipe de recherche « Simulation, Intégration et Fouille de données (SIF) » Département Informatique, Faculté des Sciences</institution>
          ,
          <addr-line>Université d'Oran BP 1524, El M'Naouer, Es Senia, 31 000 Oran, Algérie</addr-line>
        </aff>
        <aff id="aff1">
          <label>1</label>
          <institution>Mots clés: Automate cellulaire, Fouille de données biologiques, Induction de règles</institution>
          ,
          <addr-line>Motif, Itemset</addr-line>
          ,
          <institution>Règle d'association</institution>
          ,
          <addr-line>Mycobacterium Tuberculosis, Tuberculose, Epidémie, Génome, Biologie</addr-line>
        </aff>
      </contrib-group>
      <abstract>
        <p>Résumé. L'avènement des biotechnologies nouvelles a permis, au cours des dernières années, d'accumuler des données sur les génomes des agents pathogènes épidémiologiques. Par contre l'exploitation des données génomiques n'as pas suivi le rythme des découvertes, alors la fouille de données biologiques, particulièrement à caractère épidémiologique s'est imposée d'elle-même afin d'aider à trouver des éléments de réponse aux questions que se pose l'épidémiologiste concernant des pathologies particulières. D'où, la problématique abordée par cette étude qui est la fouille de données biologiques du Mycobacterium Tuberculosis responsable de la tuberculose. Nous proposons un processus de fouille de données assez novateur pour générer des connaissances qui vont êtres profitables et exploitables à deux niveaux : • Profitables au spécialiste du domaine, à travers l'extraction de motifs en particulier les règles d'association qui aident à mieux comprendre la pathologie. • Ensuite, ces règles d'association extraites sont modélisées par le principe booléen adopté par la machine cellulaire CASI (Cellular Automaton for Symbolic Induction). Le but de cette modélisation par le principe booléen étant de réduire la complexité de stockage et le temps de réponse.</p>
      </abstract>
    </article-meta>
  </front>
  <body>
    <sec id="sec-1">
      <title>1 Introduction</title>
      <p>
        La biotechnologie a permis, au cours des dernières années, d'améliorer les
connaissances sur le génome des agents pathogènes épidémiologiques, et de
développer des moyens de lutte efficace contre ces épidémies. Actuellement, des
dizaines de génomes ont été révélés et ont permis de constituer des banques de données
biologiques énormes. De ce fait, les quantités de données brutes disponibles sont déjà
trop importantes pour pouvoir être analysées manuellement par les méthodes
épidémiologiques de surveillance et d’analyse. Du fait de l’inefficacité de ces méthodes
due à la variété des données biologiques, et à la nature même des épidémies, une
nouvelle approche est utilisée : c’est la fouille de données biologiques relatives aux
épidémies [
        <xref ref-type="bibr" rid="ref2">2</xref>
        ], [
        <xref ref-type="bibr" rid="ref6">6</xref>
        ]. Cette fouille permet d’extraire des connaissances qui serviront à
mieux connaître les agents pathogènes, interpréter au mieux les phénomènes
biologiques liés à une épidémie particulière, et ainsi permettre la mise en oeuvre de
mesures de prévention et de lutte, par des traitements appropriés, des vaccinations, .etc.
      </p>
      <sec id="sec-1-1">
        <title>Problématique</title>
        <p>
          Sur un terrain, purement épidémiologique, il y a une pathologie qui continue à faire
des ravages et se trouve classée deuxième en mortalité après le sida : c’est la
Tuberculose. Elle est l’un des plus grands fléaux de l'humanité qui entraîna en l'an
2000 près de 10 millions de nouveaux cas et plus de trois millions de morts chaque
année dans le monde [
          <xref ref-type="bibr" rid="ref19">19</xref>
          ].
        </p>
        <p>
          En effet, cette maladie infectieuse est provoquée par la pénétration dans l’organisme
d’une bactérie appelée Mycobacterium Tuberculosis. Dans la pratique, il existe un
Complexe Tuberculosis dont le Mycobacterium Tuberculosis est l’agent typique
responsable de la tuberculose humaine [
          <xref ref-type="bibr" rid="ref5">5</xref>
          ].
        </p>
        <sec id="sec-1-1-1">
          <title>Complexe Tuberculosis</title>
          <p>M. M.</p>
          <p>Tuberculosis Africanum</p>
          <p>M.</p>
          <p>Bovis</p>
          <p>M. M.</p>
          <p>Bovis BCG Canetti</p>
          <p>M.</p>
          <p>Microti</p>
          <p>
            En 1998, la première séquence complète du génome de Mt H37RV a été réalisée et a
permis de dégager des caractéristiques propres aux mycobactéries dont les plus
importantes sont les suivantes [
            <xref ref-type="bibr" rid="ref5">5</xref>
            ], [
            <xref ref-type="bibr" rid="ref14">14</xref>
            ], [
            <xref ref-type="bibr" rid="ref18">18</xref>
            ]:
51 % des gènes sont dupliqués;
10 % du génome code pour 2 familles de gènes qui codent eux même pour 2
protéines nommées PE et PPE;
forte présence de séquences répétées d’ADN, en particulier une séquence
nommée IS6110 (16 copies), riches en particularités sur le génome ;
présence de 65 copies de MIRU (Mycobacterial Interspaced Repetitive
Unit) ;
présence de répétitions directes RD (appelées aussi régions de différences),
ces séquences répétées sont riches en particularités sur le génome.
          </p>
          <p>
            Tous ces éléments descriptifs de ce génome sont autant chacun un gisement qu’on
exploite en fouille de données [
            <xref ref-type="bibr" rid="ref8">8</xref>
            ],[
            <xref ref-type="bibr" rid="ref9">9</xref>
            ],[
            <xref ref-type="bibr" rid="ref20">20</xref>
            ] afin d’essayer d’apporter des éléments de
réponses à certains phénomènes liés au complexe Mycobacterium Tuberculosis, et
trouver des solutions médicales afin de stopper la diffusion de la bactérie et par
conséquent stopper l’épidémie par des vaccins, ou antibiotiques.
d’association.
          </p>
          <p>3</p>
          <p>Donc, la problématique abordée dans ce papier, est la fouille de données biologiques
se rapportant au Mycobactérium Tuberculosis à l’aide de tous les éléments
d’informations cités auparavant à savoir : les gènes, les protéines, les RD, et les MIRU.
Cette fouille se veut d’être une fouille de données hétérogènes.</p>
          <p>Cette étude prendra en compte toutes les souches de la bactérie dont l’annotation a
été complètement finie ou en projet de séquençage. Ce gisement de données sera plus
conséquent s’il renfermera d’avantage de souches annotées, ce qui supposera par la
suite, que toute souche nouvellement annotée, alimentera le processus de fouille de
données envisagé.</p>
        </sec>
      </sec>
    </sec>
    <sec id="sec-2">
      <title>2 Etat de l’art de la fouille de données biologiques</title>
      <p>
        Depuis les premiers projets de séquençage des bactéries, les dispositifs
expérimentaux tels que les séquenceurs automatiques, puces à ADN et autres, ont
permis de constituer des bases de données de séquences de génomes complets. Il fallait
donc exploiter ces données, identifier les gènes, les protéines qu’ils produisent, et
identifier leurs fonctions, pour comprendre les mécanismes de la bactérie. De plus, la
variété et la disponibilité des données biologiques (séquences ADN, Protéines, Puce
ADN, ….) et par la même des banques de données biologiques (NCBI, EMBL,
GenBank….), ont incité à les valoriser. Différents travaux promoteurs et novateurs, en
fouilles de données biologiques ont été faits en se basant essentiellement sur les
génomes et les cohortes [
        <xref ref-type="bibr" rid="ref13">13</xref>
        ], les uns ont un rapport direct avec l’épidémiologie alors
que d’autres la touchent indirectement (génomique et protéomique), mais sont d’un
grand apport pour la compréhension des maladies et par la même des phénomènes
épidémiologiques. Nous présentons quelques uns, mais la liste n’est pas exhaustive.
      </p>
      <p>
        En génomique : Pour identifier des gènes, comparer des séquences (rechercher des
similarités) [
        <xref ref-type="bibr" rid="ref7">7</xref>
        ], rechercher et extraire des motifs fréquents [
        <xref ref-type="bibr" rid="ref16">16</xref>
        ], différentes approches
ont été utilisées comme l’extraction des séquences répétées (n-grammes) [
        <xref ref-type="bibr" rid="ref15">15</xref>
        ] ou les
modèles de Markov cachés (HMM) [
        <xref ref-type="bibr" rid="ref11">11</xref>
        ],[
        <xref ref-type="bibr" rid="ref16">16</xref>
        ]. Ces modèles (HMM) interviennent aussi
dans l'analyse de séquences pour la détection de répétitions [
        <xref ref-type="bibr" rid="ref10">10</xref>
        ] ou encore la recherche
de mots exceptionnels [
        <xref ref-type="bibr" rid="ref11">11</xref>
        ], la recherche de gènes candidats, la recherche de séquences
exogènes ou hétérogènes pouvant renseigner sur un pathogène impliqué dans une
maladie [
        <xref ref-type="bibr" rid="ref12">12</xref>
        ]. L’utilisation des modèles de Markov cachés a permis aussi d’identifier
les séquences exogènes [
        <xref ref-type="bibr" rid="ref12">12</xref>
        ] susceptibles de contenir des gènes de virulence ou des
gènes d’adaptation, ce genre de recherche améliore la compréhension du phénomène de
résistance aux antibiotiques. Plusieurs travaux sur les séquences biologiques ont donné
naissance à des programmes dont les plus connus et les plus utilisés par les biologistes
sont les logiciels FASTA et BLAST [
        <xref ref-type="bibr" rid="ref7">7</xref>
        ].
      </p>
      <p>
        En fouille de cohortes : Les cohortes ont souvent été utilisées dans le cas des
épidémies [
        <xref ref-type="bibr" rid="ref13">13</xref>
        ], elles fournissent un tas de données médicales (cliniques, biologiques,
et génétiques) sur des cas réels (sujets exposés, non exposés). Ces fouilles permettent
de renseigner sur le rôle des facteurs génétiques et environnementaux d’une maladie.
Les méthodes de classification, les règles d’association ont étés utilisées dans ce cas
pour permettre la détection des relations gène-gène et gène-environnement [
        <xref ref-type="bibr" rid="ref21">21</xref>
        ].
      </p>
    </sec>
    <sec id="sec-3">
      <title>3 Contribution</title>
      <p>Nous nous proposons d’étudier les aspects physiologiques fondamentaux liés à la
génomique de cette bactérie modèle, le Mycobacterium Tuberculosis. Ensuite étudier
les outils de fouille de données pour l’extraction des connaissances et d’en dégager une
approches expérimentable.</p>
      <p>En premier, nous avons établi un état de l’art de la fouille des données avec certains
détails d’une technique à une autre et qui ne sont pas forcement en rapport direct avec
notre étude. Ensuite, une étude comparative des différents outils et méthodes existants
a été faite afin d’utiliser la plus adaptée à l’objet de notre étude.</p>
      <p>Deuxièmement, nous avons abordé l’étude de l’agent pathogène, afin de cerner la
nature et le type de données biologiques qui nous intéressent et ainsi pouvoir localiser
nos sources de données expérimentales.</p>
      <p>
        Troisièmement, nous avons établi notre propre démarche expérimentale par un
processus de fouille de données pour la génération des connaissances à partir de
données biologiques. Ces connaissances vont êtres profitables et exploitables à deux
niveaux :
1. En premier, profitables au spécialiste du domaine pour la compréhension de
la pathologie.
2. En second, exploitables par la machine cellulaire CASI [
        <xref ref-type="bibr" rid="ref4">4</xref>
        ] pour l’inférence
et la déduction.
      </p>
      <p>
        Ce processus informatique ainsi établi procède en deux étapes, une fouille de données
est faite dans un premier temps en utilisant l’algorithme Apriori et donnera des règles
d’association, ensuite et dans un deuxième temps produire des règles booléennes
inductives qui vont alimenter la base de connaissances de la machine cellulaire CASI,
cette machine développée pour l’acquisition automatique incrémentale de
connaissances par induction et la prédiction par déduction [
        <xref ref-type="bibr" rid="ref4">4</xref>
        ].
      </p>
      <p>Ainsi, notre contribution a adopté la démarche suivante :
1. Etude et sélection des données biologiques relatives au Mycobactérium</p>
      <p>Tuberculosis ;
2. Extraction des motifs fréquents et des règles d’association respectives ;
3. Production des règles booléennes inductives pour la machine cellulaire</p>
      <p>CASI.</p>
    </sec>
    <sec id="sec-4">
      <title>4 Conception du système</title>
      <p>Notre système est composé de deux grands modules, le premier produit des règles
d’association et les transmet au deuxième module (BRI) pour générer des règles
booléennes basées sur le principe de la machine cellulaire CASI.</p>
      <sec id="sec-4-1">
        <title>Fouille de données biologiques : vers une représentation booléenne des règles</title>
        <p>d’association. 5</p>
        <p>NCBI
SANGER
……</p>
        <p>Gènes
associés
Protéines
associées
RD
MIRU</p>
        <p>Données
structurées</p>
        <p>Règles
d’association</p>
        <p>Règles.</p>
        <p>Transitoires</p>
        <p>Graphe
d’induction</p>
        <p>Boolean Rules Induction</p>
        <p>FAITS
CELFACT
REGLES
CELRULE</p>
        <p>CASI
Knowledge</p>
        <p>Base
PSrééletrcatiitoenm, ent .Transformation PErvoadluuacttiioonn. Transformation dPG’rrioandpduhucecttiioonn
Représentation Intégration
Cellulaire</p>
      </sec>
      <sec id="sec-4-2">
        <title>4.1 Production des règles booléennes pour la machine cellulaire CASI</title>
        <p>Les règles d’association produites sont transformées selon le principe suivant :
Les items de Antécédent vont servir à constituer la Prémisse de la règle ;
Les items de Conséquent vont servir à créer la Conclusion de la règle.</p>
        <p>Cette transformation sert à produire des règles transitoires nécessaires à la production
d’un graphe d’induction selon le principe suivant : Un sommet désigne un noeud sur
lequel on fait un test, avec les résultats possibles binaires ou à valeurs multiples.
Ainsi le graphe d’induction permettra de produire les règles cellulaires sous la forme :</p>
        <p>Ri : Si Prémissei Alors Conclusioni
Avec une représentation cellulaire selon le principe suivant :
les items de Prémissei et Conclusioni vont constituer les faits : FAITS.
les Ri vont constituer les règles : REGLES.</p>
        <p>Ces règles produites seront intégrées dans la base de connaissances de CASI pour
exploitation en inférence.</p>
      </sec>
      <sec id="sec-4-3">
        <title>4.2 La machine cellulaire CASI [1]</title>
        <p>CASI (Induction Symbolique par Automate Cellulaire) est un automate cellulaire qui
simule le principe de fonctionnement de base d’un Moteur d’Inférence en utilisant deux
couches finies d’automates finis. La première couche, CELFACT, pour la base des
faits et, la deuxième couche, CELRULE, pour la base de règles. Chaque cellule au
temps t+1 ne dépend que de l’état des ses voisines et du sien au temps t. Dans chaque
couche, le contenu d’une cellule détermine si et comment elle participe à chaque étape
d’inférence : à chaque étape, une cellule peut être active (1) ou passive (0), c’est-à-dire
participe ou non à l’inférence. Le principe adopté est simple :</p>
        <p>Toute cellule i de la première couche CELFACT est considérée comme fait
établi si sa valeur est 1, sinon, elle est considérée comme fait à établir. Elle se
présente sous trois états : état d’entrée (EF), état interne (IF) et état de sortie
(SF).</p>
        <p>Toute cellule j de la deuxième couche CELRULE est considérée comme une
règle candidate si sa valeur est 1, sinon, elle est considérée comme une règle
qui ne doit pas participer à l’inférence. Elle se présente sous trois états : état
d’entrée (ER), état interne (IR) et état de sortie (SR). Les matrices d’incidence
RE et RS représentent la relation entrée/sortie des Faits et sont utilisées en
chaînage avant et en chaînage arrière en inversant leur ordre.</p>
        <p>La dynamique de l’automate cellulaire, pour simuler le fonctionnement d’un Moteur
d’Inférence, utilise deux fonctions de transitions δfact et δrule, où δfact correspond à la
phase d’évaluation, de sélection et de filtrage, et δrule correspond à la phase
d’exécution.</p>
        <p>La fonction de transition δfact :</p>
        <p>δfact (EF, IF, SF, ER, IR, SR) = (EF, IF, EF, ER+(RET.EF), IR, SR)
La fonction de transition δrule :
δrule (EF, IF, SF, ER, IR, SR) = (EF+(RS.ER), IF, SF, ER, IR,^ER), où la
matrice RET désigne la transposée de RE et ^ER désigne la négation du
vecteur booléen ER.</p>
      </sec>
      <sec id="sec-4-4">
        <title>4.3 Les étapes du processus adopté</title>
        <p>Le processus de fouille de données adopté par notre système est composé de 6 étapes
majeures :</p>
      </sec>
    </sec>
    <sec id="sec-5">
      <title>1ere étape : Sélection et prétraitement des données</title>
      <p>
        A partir des banques de données (NCBI, ...), il y’a récupération des informations
biologiques relatives aux souches mentionnées ci-dessous, sous leurs formats
originaux. Les agents pathogènes (souches) ciblés par cette étude sont ceux dont
l’annotation a été finie à savoir : Mt H37Rv, Mt CDC1551, Mt F11, Mt H37Ra [
        <xref ref-type="bibr" rid="ref17">17</xref>
        ].
Un nettoyage, une mise en forme et une caractérisation sont effectués afin de dégager
des descripteurs « attributs » possibles.
      </p>
    </sec>
    <sec id="sec-6">
      <title>2eme étape : Transformation des données</title>
      <p>La transformation des données du format original vers un formalisme base de données
(attribut, valeur), est faite. De plus à partir des informations relatives aux RD et MIRU
des séquences en question, il est défini d’autres caractéristiques calculables ou non,
s’en suivra alors une «binarisation».</p>
    </sec>
    <sec id="sec-7">
      <title>3eme étape : Production et évaluation des règles d’associations</title>
      <p>
        La recherche des Items, des Itemsets et des règles d’association, est faite par
l’algorithme Apriori [
        <xref ref-type="bibr" rid="ref22">22</xref>
        ] avec calcul systématique du support et de la confiance pour
chaque règle pour ne retenir que celles ayant le support et la confiance dépassant les
valeurs fixées par l’utilisateur.
d’association.
      </p>
      <p>7</p>
    </sec>
    <sec id="sec-8">
      <title>4eme étape : Transformation</title>
      <p>Les règles trouvées sont transformées puis représentées selon un formalisme transitoire
aidant à la production d’un graphe d’induction. Ainsi la règle d’association Ri se verra
traduite en une règle booléenne transitoire selon le principe suivant :
(Ri, Antécédent, Conséquent, support, confiance, note)
(Ri , Prémissei (Antécédent ) , Conclusioni ( Conséquent ))</p>
    </sec>
    <sec id="sec-9">
      <title>5eme étape : Production du graphe d’induction</title>
      <p>Un graphe d’induction est construit selon le principe suivant : Un sommet désigne un
noeud sur lequel on fait un test, avec les résultats possibles binaires ou à valeur
multiple.</p>
    </sec>
    <sec id="sec-10">
      <title>6eme étape : Représentation Cellulaire</title>
      <p>Génération des règles cellulaires à partir du graphe d’induction sous la
forme :</p>
      <p>Ri : Si Prémisse (Antécédent) alors Conclusion (Conséquent)
où Prémisse est composée des items (Itemset) de l’Antécédent de la règle
d’association et la conclusion est composée des items (Itemset) de Conséquent
de la règle d’association.</p>
      <p>Représentation cellulaire : Les règles générées auparavant (6.1) sont
représentées en couches cellulaires. Schématiquement nous aurons :
{Ri} REGLES et {Prémissei , Conclusioni } FAITS</p>
    </sec>
    <sec id="sec-11">
      <title>7eme étape : Intégration</title>
      <p>Ainsi, la machine cellulaire intégrera et exploitera la représentation cellulaire et les
matrices d’E/S à travers une inférence en chaînage avant pour enrichir la base de
connaissances.</p>
      <p>La dynamique de la machine cellulaire utilise les deux fonctions de transition citées
auparavant (4.2).</p>
    </sec>
    <sec id="sec-12">
      <title>5 Exemple d’illustration inductives. de l’induction des règles booléennes</title>
      <p>Le processus général que notre système d’apprentissage applique à un échantillon est
illustré par un exemple à partir de la 3ème étape. Nous supposons avoir obtenu les 4
règles d’association suivantes, avec les gènes (aceA, pstS, rpsG, aroK,…..etc) :
3eme étape : Production des règles d’associations
(R1,{aceA-2=1}, {pstS-3=0}, 45%,77%)
(R2,{aceA-2=0}, {rpsG=1, aroK=1}, 80%,95%)
(R3,{aceA-2=0, phhB=1}, {argK=1}, 80%,70%)</p>
      <p>(R4,{aceA-2=0, phhB=0}, {argK=0}, 45%,77%)
4eme étape : Transformation</p>
      <p>R1,{aceA-2=1}, {pstS-3=0}
R2,{aceA-2=0}, {rpsG=1, aroK=1}
R3,{aceA-2=0, phhB=1}, {argK=1}</p>
      <p>R4,{aceA-2=0, phhB=0}, {argK=0}
5eme étape : Production du graphe d’induction
s0</p>
      <p>aceA-2
s1
pstS-3=0
ahpC
s2
rpsG=1
aroK=1
phhB
s3
argk=1
s4
argk=0
folC
6eme étape : Représentation Cellulaire</p>
      <p>Génération des règles cellulaires
R1: Si {s0} Alors {pstS-3=0, s1}
R2: Si {s0} Alors {rpsG=1, aroK=1, s2}
R3: Si {s2} Alors {argK=1, s3}</p>
      <p>R4: Si {s2} Alors {argK=0, s4}
Représentation des règles cellulaires</p>
      <p>Les couches CELFACT et CELRULE.</p>
      <p>CELFACT</p>
      <p>Pour CELRULE :
Toute cellule de CELRULE est considérée règle candidate, c'est-à-dire
participe à l’inférence si sa valeur=1, sinon, si sa valeur=0.</p>
      <p>Les matrices d’E/S
RE
s0
pstS-3=0
s1
rpsG=1
aroK=1
s2
argK=1
s3
argK=0
s4</p>
      <p>R1
1</p>
      <p>R2
1</p>
      <p>R3</p>
      <p>R4
1
1</p>
      <p>RS
s0
pstS-3=0
s1
rpsG=1
aroK=1
s2
argK=1
s3
argK=0
s4</p>
      <p>R1</p>
      <p>R2</p>
      <p>R3</p>
      <p>R4
Pour les matrices d’E/S :</p>
      <p>La matrice d’entrée RE : si le fait i∈ à Prémisse de Rj alors RE(i,j) =1</p>
      <p>La matrice de sortie RS : si le fait i∈ à Conclusion de Rj alors RS(i,j) =1</p>
    </sec>
    <sec id="sec-13">
      <title>6 Implémentation</title>
      <p>Le schéma illustré par la figure 3, montre le système en termes de fonctionnalités sans
pour autant fixer une quelconque chronologie pour les opérations.</p>
      <p>BIODM</p>
      <p>Frame.One
Explore_
Biological_Data</p>
      <p>Experiment
Cellular_Rules_
Production</p>
      <p>Find_Association_
Rules</p>
      <p>Save_
Experimentation
Boolean_Rules_ Graph_Induction_ Cellular_Rules_
Induction Creation Generation</p>
      <p>Data_Base_
Procedures</p>
      <p>Association_</p>
      <p>Rules_Procedures</p>
      <p>Fig. 3 : Architecture du système</p>
      <sec id="sec-13-1">
        <title>1. Classe BIODM</title>
        <p>C’est la classe qui lance toute l’application. Elle ne contient qu’une instance de la classe
FRAME_ONE.</p>
      </sec>
      <sec id="sec-13-2">
        <title>2. Classe FRAME_ONE</title>
        <p>C’est la fenêtre principale de l’application. C’est la classe la plus importante car elle
gère toutes les opérations que l’on peut effectuer.</p>
      </sec>
      <sec id="sec-13-3">
        <title>3. Classe EXPLORE_BIOLOGICAL_DATA</title>
        <p>Visualise les données expérimentales pour une possible vérification visuelle avant de
lancer l’expérimentation.</p>
      </sec>
      <sec id="sec-13-4">
        <title>4. Classe EXPERIMENT</title>
        <p>Démarre l’expérimentation en demandant à l’utilisateur de sélectionner les fichiers
nécessaires. Elle fait appel à des méthodes stockées telles que
LECTURE_FICHIER_SEQUENCE, et CALCUL_FREQUENCE, pour le calcul des
évaluations des règles.</p>
      </sec>
      <sec id="sec-13-5">
        <title>5. Classe FIND_ASSOCIATION_RULES</title>
        <p>Recherche les règles d’associations. Elle fait appel à des méthodes stockées dans la
classe DATA_BASE_PROCEDURES, et la classe ASSOCIATION_RULES
_PROCEDURES. Elle présente les résultats sous la forme textuelle, et permet de
sauvegarder l’expérimentation par le biais de la classe SAVE_EXPERIMENT.</p>
      </sec>
      <sec id="sec-13-6">
        <title>6. Classe SAVE_EXPERIMENT</title>
        <p>Sauvegarde les résultats de l’expérimentation.</p>
      </sec>
      <sec id="sec-13-7">
        <title>7. Classe DATA_BASE_PROCEDURES</title>
        <p>Regroupe toutes les méthodes de gestion de la base de données, telles que la création
d’une connexion, l’écriture dans une table, les requêtes sur les différentes tables, etc.</p>
      </sec>
      <sec id="sec-13-8">
        <title>8. Classe ASSOCIATION_RULES _PROCEDURES</title>
        <p>Recherche les itemsets, calcule les supports et les fréquences, et produit les règles
d’association.</p>
      </sec>
      <sec id="sec-13-9">
        <title>9. Classe CELLULAR_RULE_PRODUCTION</title>
        <p>Produit les règles cellulaires et utilisant au besoin les méthodes de stockage des classes
GRAPHE_INDUCTION_CREATION et CELLULAR_RULES_GENERATION.</p>
        <p>10. Classe BOOLEAN_RULES_INDUCTION
Produit les règles booléennes inductives, en utilisant au préalable des méthodes pour la
transformation des règles d’association trouvées.</p>
        <p>11. Classe GRAPHE_INDUCTION_CREATION
Crée le graphe d’induction à l’aide d’un algorithme approprié et des règles
d’associations produites à l’étape 9. Ce graphe sera le paramètre d’entrée de la classe
CELLULAR_RULES_GENERATION.</p>
        <p>12. Classe CELLULAR_RULES_GENERATION
Produit les règles cellulaires et les intègre dans la base de connaissances de la machine
cellulaire CASI. Cette classe regroupe toutes les méthodes de création des couches
CELFACT et CELRULE.</p>
      </sec>
    </sec>
    <sec id="sec-14">
      <title>7 Expérimentation</title>
      <p>En se basant sur les données expérimentales des souches citées auparavant (4.3 1iere
étape), les différentes expériences nous donnent des résultats intéressants qui resterons à
consolider avec de nouvelles souches en cours de séquençage et qui seront prises en
considération par notre système au fur et mesure de leur publication définitive sur leurs
sites d’origines (NCBI, …). Pour le reste, c’est à dire la représentation booléenne
(CASI), elle va certainement changer ou plus tôt « évoluer » en fonction des résultats
(i.e. règles d’association produites).</p>
    </sec>
    <sec id="sec-15">
      <title>8 Conclusion</title>
      <p>
        Notre étude se voulait être assez novatrice, dans la mesure où nous avons été incités à
utiliser des techniques prouvées de la machine cellulaire CASI [
        <xref ref-type="bibr" rid="ref1">1</xref>
        ], [
        <xref ref-type="bibr" rid="ref3">3</xref>
        ], [
        <xref ref-type="bibr" rid="ref4">4</xref>
        ], combinées à
une fouille de données. De ce fait, deux objectifs nous ont guidés dans la proposition
d’un automate cellulaire pour l’optimisation, la génération, la représentation et
l’utilisation d’une base de règles d’association. En effet, le premier c’est d’avoir une
base de règles optimisée et des temps de traitements assez réduits grâce aux principes de
représentation cellulaire, et le deuxième c’est d’apporter une contribution à la
construction des systèmes à base de connaissances en adoptant une nouvelle technique
cellulaire. Ainsi, les avantages de notre méthode basée sur la machine cellulaire CASI
peuvent être récapitulés comme suit :
      </p>
      <p>Un prétraitement simple et minimal de la base de règles d’association, pour sa
transformation en matrice binaire selon le principe de couches cellulaires.
La facilité d’implémentation des fonctions de transitions δfact et δrule qui sont de basses
complexités, efficaces et robustes et concernent des valeurs extrêmes, et bien adaptées
aux situations avec beaucoup d’attributs.</p>
      <p>La possibilité de description de l’état initial mais aussi de classifier en vu de produire
des résultats simples à être insérés et utilisés à nouveau par un système expert
classique, grâce notamment au système de prédiction de CASI, composé d’un
ensemble de fonctions de transitions et de règles de production simples, et aussi à une
facilité de transformation et de simplification des règles à travers la matrice
d’incidence RE.</p>
    </sec>
    <sec id="sec-16">
      <title>Références</title>
    </sec>
  </body>
  <back>
    <ref-list>
      <ref id="ref1">
        <mixed-citation>
          [1]
          <string-name>
            <surname>Atmani</surname>
            ,
            <given-names>B.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Beldjilali</surname>
            ,
            <given-names>B.</given-names>
          </string-name>
          (
          <year>2007</year>
          ).
          <article-title>Knowledge Discovery in Database : Induction Graph</article-title>
          and
          <string-name>
            <given-names>Cellular</given-names>
            <surname>Automaton</surname>
          </string-name>
          .
          <source>Computing and Informatics Journal</source>
          , Vol.
          <volume>26</volume>
          N°
          <volume>2</volume>
          <fpage>171</fpage>
          -
          <lpage>197</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref2">
        <mixed-citation>
          [2]
          <string-name>
            <surname>Abbello</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Cormode</surname>
            ,
            <given-names>G.</given-names>
          </string-name>
          (
          <year>2006</year>
          ).
          <article-title>Mining and Epidemiolgy (DIMACS Workshops)</article-title>
          .
        </mixed-citation>
      </ref>
      <ref id="ref3">
        <mixed-citation>
          [3]
          <string-name>
            <surname>Abdelouhab</surname>
            ,
            <given-names>F.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Atmani</surname>
            ,
            <given-names>B.</given-names>
          </string-name>
          (
          <year>2008</year>
          ).
          <article-title>Intégration automatique des données semi-structurées dans un entrepôt cellulaire, Troisième atelier sur les systèmes décisionnels</article-title>
          ,
          <volume>10</volume>
          et 11 octobre
          <year>2008</year>
          , Mohammadia - Maroc, pp.
          <fpage>109</fpage>
          -
          <lpage>120</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref4">
        <mixed-citation>
          [4]
          <string-name>
            <surname>Benamina</surname>
            ,
            <given-names>B.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Atmani</surname>
            ,
            <given-names>B.</given-names>
          </string-name>
          (
          <year>2008</year>
          ).
          <article-title>WCSS: un système cellulaire d'extraction et de gestion des connaissances, Troisième atelier sur les systèmes décisionnels</article-title>
          ,
          <volume>10</volume>
          et 11 octobre
          <year>2008</year>
          , Mohammadia - Maroc, pp.
          <fpage>223</fpage>
          -
          <lpage>234</lpage>
          .
        </mixed-citation>
      </ref>
      <ref id="ref5">
        <mixed-citation>
          [5]
          <string-name>
            <surname>Carbonnelle</surname>
            ,
            <given-names>B.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Dailloux</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Lebrun</surname>
            ,
            <given-names>L.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Maugein</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Pernot</surname>
            ,
            <given-names>C.</given-names>
          </string-name>
          (
          <year>2003</year>
          ).
          <article-title>Cahier de formation en biologie médicale N°29.</article-title>
        </mixed-citation>
      </ref>
      <ref id="ref6">
        <mixed-citation>
          [6]
          <string-name>
            <surname>Chen</surname>
            ,
            <given-names>H.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Fuller</surname>
            ,
            <given-names>S.S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Friedman</surname>
            ,
            <given-names>C.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Hersh</surname>
            ,
            <given-names>W.</given-names>
          </string-name>
          (
          <year>2003</year>
          ).
          <article-title>Knowledge management, data mining, and text mining in medical informatics (Medical Informatics</article-title>
          , volume
          <volume>8</volume>
          ,
          <string-name>
            <surname>Springer</surname>
            <given-names>US</given-names>
          </string-name>
          ).
        </mixed-citation>
      </ref>
      <ref id="ref7">
        <mixed-citation>
          [7]
          <string-name>
            <surname>Chervitz</surname>
            ,
            <given-names>S.A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Hester</surname>
            ,
            <given-names>E.T.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Ball</surname>
            ,
            <given-names>C.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Dolinski</surname>
            ,
            <given-names>K.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Dwight</surname>
            ,
            <given-names>S.S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Haris</surname>
            ,
            <given-names>M.A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Juvik</surname>
            ,
            <given-names>G.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Malekian</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Roberts</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Roe</surname>
            <given-names>T.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Scafe</surname>
            ,
            <given-names>C.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Shroeder</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Sherlock</surname>
            ,
            <given-names>G.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Weng</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Zhu</surname>
            ,
            <given-names>Y.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Cherry</surname>
            ,
            <given-names>J.M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Botstein</surname>
            ,
            <given-names>D.</given-names>
          </string-name>
          (
          <year>1999</year>
          ).
          <article-title>Using the Sacharomyces genome databases (SGD) for analysis of protein similarities and structure (</article-title>
          <source>Nucleic Acids Research</source>
          , Vol
          <volume>27</volume>
          N° 1).
        </mixed-citation>
      </ref>
      <ref id="ref8">
        <mixed-citation>
          [8]
          <string-name>
            <surname>Fleiishman</surname>
            ,
            <given-names>R.D</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Alland</surname>
            ,
            <given-names>D.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Eisen</surname>
            ,
            <given-names>J.A</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Carpenter</surname>
            ,
            <given-names>L.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>White</surname>
            ,
            <given-names>O.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Petersen</surname>
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Deboy</surname>
            ,
            <given-names>R.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Dodson</surname>
            ,
            <given-names>R. Gwinn M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Haft</surname>
            ,
            <given-names>D.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Hickey</surname>
            ,
            <given-names>E.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Kolonay</surname>
            ,
            <given-names>J.F.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Nelson</surname>
            ,
            <given-names>W.C.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Umayam</surname>
            ,
            <given-names>L.A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Ermolayeva</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Salzberg</surname>
            ,
            <given-names>S.L.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Delcher</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Utterback</surname>
            ,
            <given-names>T.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Weidman</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Khouri</surname>
            ,
            <given-names>H.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Gill</surname>
            ,
            <given-names>J.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Mikula</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Bishai</surname>
            ,
            <given-names>W.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Jacobs</surname>
            ,
            <given-names>W.R.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Venter</surname>
            ,
            <given-names>J.C.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Fraser</surname>
            ,
            <given-names>C.M.</given-names>
          </string-name>
          (
          <year>2008</year>
          ).
          <article-title>WholeGenome comparaison of Mycobacterium Tuberculosis clinical and laboratory stains. (BMC Medical Genomics)</article-title>
          .
        </mixed-citation>
      </ref>
      <ref id="ref9">
        <mixed-citation>
          [9]
          <string-name>
            <surname>Ferdinand</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Valetudi</surname>
            ,
            <given-names>G.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Sola</surname>
            ,
            <given-names>C.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Rastogi</surname>
            ,
            <given-names>N.</given-names>
          </string-name>
          (
          <year>2004</year>
          ).
          <article-title>Data mining of Mycobacterium Tuberculosis complexe genotyping results using mycobacterial intersepted repetitive units validates the clonal structure of spolygotyping-defined families</article-title>
          .
        </mixed-citation>
      </ref>
      <ref id="ref10">
        <mixed-citation>
          [10]
          <string-name>
            <surname>Hergalant</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Aigle</surname>
            ,
            <given-names>B.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Leblond</surname>
            ,
            <given-names>P.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Mari</surname>
            ,
            <given-names>J.F.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Decaris</surname>
            ,
            <given-names>B.</given-names>
          </string-name>
          (
          <year>2002</year>
          ). Fouille de données à l'aide de HMM :
          <article-title>application à la détection de réitérations intragénomiques (jobim).</article-title>
        </mixed-citation>
      </ref>
      <ref id="ref11">
        <mixed-citation>
          [11]
          <string-name>
            <surname>Hergalant</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Aigle</surname>
            ,
            <given-names>B.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Leblond</surname>
            ,
            <given-names>P.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Mari</surname>
            ,
            <given-names>J.F.</given-names>
          </string-name>
          (
          <year>2005</year>
          ).
          <article-title>Fouille de données du génome à l'aide de modèles de Markov Cachées (EGC).</article-title>
        </mixed-citation>
      </ref>
      <ref id="ref12">
        <mixed-citation>
          [12]
          <string-name>
            <surname>Hergalant</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Eng</surname>
            ,
            <given-names>C.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Thibessar</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Leblond</surname>
            ,
            <given-names>P</given-names>
          </string-name>
          , Mari,
          <string-name>
            <surname>J.</surname>
          </string-name>
          (
          <year>2005</year>
          ).
          <article-title>Data mining using Hidden Markov Models ( HMM2) to detect heterogeneicities into bacterial genome</article-title>
          .
          <source>(Jobim).</source>
        </mixed-citation>
      </ref>
      <ref id="ref13">
        <mixed-citation>
          [13]
          <article-title>Loria équipe Orpailleur Inserm U525 Equipe 4</article-title>
          . (
          <year>2005</year>
          ).
          <article-title>Combinaison de méthodes symboliques-numériques de fouilles de données pour l'étude et l'analyse de la cohorte Stanislas (jobim).</article-title>
        </mixed-citation>
      </ref>
      <ref id="ref14">
        <mixed-citation>
          [14]
          <string-name>
            <surname>Labie</surname>
            ,
            <given-names>D.</given-names>
          </string-name>
          (
          <year>2003</year>
          ).
          <article-title>Le génome des mycobactéries : étude biologique et interprétation évolutive (M/S n° 3</article-title>
          , vol.
          <volume>19</volume>
          ).
        </mixed-citation>
      </ref>
      <ref id="ref15">
        <mixed-citation>
          [15]
          <string-name>
            <surname>Mhamdi</surname>
            ,
            <given-names>F.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Elloumi</surname>
            ,
            <given-names>M.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Rakotomalala</surname>
            ,
            <given-names>R.</given-names>
          </string-name>
          (
          <year>2006</year>
          ).
          <article-title>Extraction et sélection des n-grammes pour le classement des protéines (EGC).</article-title>
        </mixed-citation>
      </ref>
      <ref id="ref16">
        <mixed-citation>
          [16]
          <string-name>
            <surname>Maumus</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Napoli</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Szathmary</surname>
            ,
            <given-names>L.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Visvikis-Siest</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          (
          <year>2005</year>
          ). Fouille de données biomédicales complexes : Extraction de règles et de profils génétiques dans le cadre de l'
          <article-title>étude du syndrome métabolique (Jobim).</article-title>
        </mixed-citation>
      </ref>
      <ref id="ref17">
        <mixed-citation>
          [17]
          <article-title>National Center for Biotechnolgy Information</article-title>
          . : http://www.ncbi.nlm.nih.gov
        </mixed-citation>
      </ref>
      <ref id="ref18">
        <mixed-citation>
          [18]
          <string-name>
            <surname>Niyaz</surname>
            ,
            <given-names>A.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Hasnain</surname>
            ,
            <given-names>S.E.</given-names>
          </string-name>
          (
          <year>2004</year>
          ).
          <article-title>Genomics of Mycobacterium Tuberculosis: Old threats newtrends</article-title>
          (
          <source>Indian Journal Med Res 120</source>
          , pp
          <fpage>207</fpage>
          -
          <lpage>212</lpage>
          ).
        </mixed-citation>
      </ref>
      <ref id="ref19">
        <mixed-citation>[19] Organisation Mondiale de la santé. : http://www.who.int/fr/</mixed-citation>
      </ref>
      <ref id="ref20">
        <mixed-citation>
          [20]
          <string-name>
            <surname>Yokoyama</surname>
            ,
            <given-names>E.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Kishida</surname>
            ,
            <given-names>K.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Ishinohe</surname>
            ,
            <given-names>S.</given-names>
          </string-name>
          (
          <year>2007</year>
          ).
          <article-title>Improved Molecular Epidemiological nalysis of Mycobacterium Tuberculosis Strains Using Multi-Locus Variable Number of Tandem Repeats typing(Jpn</article-title>
          . J. Infect.
          <volume>60</volume>
          ).
        </mixed-citation>
      </ref>
      <ref id="ref21">
        <mixed-citation>
          [21]
          <string-name>
            <surname>Zaki</surname>
            ,
            <given-names>MJ.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Wang</surname>
            ,
            <given-names>J.T.L.</given-names>
          </string-name>
          ,
          <string-name>
            <surname>Toivonen</surname>
          </string-name>
          , H.T.T. (
          <year>2002</year>
          ).
          <article-title>Recent Advances in Data Mining for Bioinformatics (BIOKDD).</article-title>
        </mixed-citation>
      </ref>
      <ref id="ref22">
        <mixed-citation>
          [22]
          <string-name>
            <surname>Zucker</surname>
            ,
            <given-names>J.D.</given-names>
          </string-name>
          (
          <year>2008</year>
          ).
          <article-title>Introduction à la fouille de données en bioinformatique (cours master EID-P13</article-title>
          .
          <source>IRD UR GEODES).</source>
        </mixed-citation>
      </ref>
    </ref-list>
  </back>
</article>