Epigenetic factors optimize the application of gene editing tools in eukaryotic cells

By introducing epigenetic factors SOX2, SETD2, and METTL3 into the gene editing system, a recombinant gene editing system was constructed, which solved the problem of low gene editing efficiency in eukaryotic cells and achieved a more efficient gene editing effect.

CN115678913BActive Publication Date: 2026-02-17TIANJIN INST OF IND BIOTECH CHINESE ACADEMY OF SCI
View PDF 1 Cites 0 Cited by

Patent Information

Application Number
CN202111281795.4
Authority / Receiving Office
CN · China
Patent Type
Patents(China)
Current Assignee / Owner
Filing Date
2021-11-01
Publication Date
2026-02-17
Estimated Expiration
2041-11-01

AI Technical Summary

Technical Problem

Existing gene editing systems are inefficient in eukaryotic cells, mainly because the complex chromatin environment of eukaryotic cells creates barriers to the binding of targeted genomic proteins to DNA sequences, thus affecting the effectiveness of gene editing.

Method used

By introducing epigenetic factors, such as chromatin remodeling factor SOX2, histone modification factor SETD2, and RNA modification factor METTL3, into gene editing systems, recombinant gene editing systems can be constructed and gene editing tools can be optimized.

Benefits of technology

This improved the efficiency and scope of gene editing, resulting in more effective gene editing.

✦ Generated by Eureka AI based on patent content.

Smart Images

  • Figure BDA0003331360480000051
    Figure BDA0003331360480000051
  • Figure BDA0003331360480000071
    Figure BDA0003331360480000071
  • Figure HDA0003331360490000011
    Figure HDA0003331360490000011
Patent Text Reader

Abstract

The application discloses an application of an epigenetic factor in optimizing a gene editing tool in eukaryotic cells. A recombinant gene editing system to be protected by the application is obtained by modification on the basis of a gene editing system, the recombinant gene editing system expresses a fusion protein, the fusion protein contains a sequence-specific binding protein, a genome modification factor and an epigenetic factor; and the gene editing efficiency of the recombinant gene editing system is higher than that of the gene editing system. The recombinant gene editing system can be a vector, an mRNA or a DNA molecule. The recombinant gene expression system, the epigenetic factor, the fusion protein and / or a biological material related to the fusion protein can be applied to optimizing gene editing, in actual production, the gene editing efficiency can be improved, new editing types can be realized and emerging gene editing tools can be established.
Need to check novelty before this filing date? Find Prior Art

Description

Technical Field

[0001] This invention relates to the field of biotechnology, specifically to methods and applications of optimizing gene editing tools in eukaryotic cells using epigenetic factors. Background Technology

[0002] Gene editing systems refer to a class of protein systems that specifically target the genome and induce genomic mutations. Existing gene editing systems mainly consist of sequence-specific binding proteins (Cas9 proteins, zinc finger nucleases, transcription activator-like effector nucleases, etc.) and genomic modification-inducing factors (deaminases, transposases, reverse transcriptases, etc.), capable of inducing mutations, insertions, and deletions in the genome, bringing hope for the treatment of diseases caused by gene mutations. Currently, optimization efforts for these gene editing systems mainly focus on the evolution of genome-binding proteins and inducing factors. For example, the shift of genome-targeting proteins from zinc finger nucleases to Cas9 proteins; in addition, the number of genomic modification-inducing factors has increased from the initial lack to include deaminases, transposases, etc. For example, in base editing systems, the CBE gene editing system is a cytosine base editing system. The cytidine deaminase in CBE can directly convert the target cytidine into uridine, and then, under the action of uracil glycosylase inhibitors and DNA replication, uracil is converted into thymine, completing the CT base conversion without cutting the DNA double strand. The GBE base editing system, under the action of uracil carbonylase, removes uridine, and then, through the cell's own DNA repair mechanism, achieves the CG base conversion. However, currently, few studies explore the impact of changes in the external genomic environment on the function of gene editing systems, especially in eukaryotic cells. In eukaryotic cells, the basic structure of the genome is a nucleosome composed of intertwined DNA and histones. This tight chromatin structure creates a significant barrier to the binding of targeted genomic proteins to the DNA sequence, greatly affecting the efficiency of gene editing systems.

[0003] Furthermore, the chromatin environment of eukaryotic cells includes not only the binding of DNA and histones, but also the amino acids at the tails of histones and the chemical modifications of DNA itself; these two factors together constitute a complex chromatin environment. It is foreseeable that the complex chromatin environment of eukaryotic cells will have a significant impact on the function of gene editing systems.

[0004] Currently, epigenetics involves factors such as chromatin remodeling factors, histone modification factors, DNA and RNA modification factors, miRNAs, and lncRNAs. Chromatin remodeling factors are complexes that interact with histones, thereby inducing changes in the chromatin environment. Histone modification factors are the main proteins involved in post-translational modifications of histones, including methylation, acetylation, and ubiquitination, which have a significant impact on gene transcription regulation and DNA strand breakage repair. DNA and RNA modifications are chemical modifications that occur within DNA and RNA themselves, commonly including cytosine methylation and adenine methylation, which also affect gene transcription regulation and DNA repair processes. Summary of the Invention

[0005] The technical problem to be solved by this invention is how to optimize gene editing systems and / or how to optimize gene editing systems using epigenetic factors.

[0006] To address the aforementioned technical problems, this invention first provides a recombinant gene editing system. This recombinant gene editing system can be modified from a standard gene editing system. The recombinant gene editing system can express a fusion protein. The fusion protein may contain sequence-specific binding proteins, induced genome modification factors, and epigenetic factors. The gene editing efficiency of this recombinant gene editing system is higher than that of the standard gene editing system.

[0007] The recombinant gene editing system described above can be a vector, mRNA, or DNA molecule.

[0008] The gene editing system may contain genes encoding sequence-specific binding proteins and genes encoding genomic modification factors. The gene editing system may express a fusion protein containing both sequence-specific binding proteins and genomic modification factors.

[0009] In the recombinant gene editing system described above, the gene editing system can be a base editing system. The base editing system can be a CBE base editing system or a GBE base editing system. The CBE base editing system can be a BE4max base editing system. The gene editing system can also be other gene editing systems, such as a leader editor or a transposase-based gene editing system. The recombinant gene editing system described above can be a recombinant base editing system.

[0010] In the recombinant gene editing system described above, the sequence-specific binding protein can be the Cas9 protein. The induced genome modification factor can be a deaminase.

[0011] In the recombinant base editing system described above, the sequence-specific binding protein may also be a zinc finger nuclease or a transcription activator-like effector nuclease. The induced genome modification factor may also be a transposase or a reverse transcriptase.

[0012] In the recombinant gene editing system described above, the epigenetic factors may be chromatin remodeling factors, histone modification factors, and / or RNA modification factors.

[0013] In the recombinant gene editing system described above, the gene editing system can be a CBE base editing system or a GBE base editing system. The deaminase can be cytidine deaminase. The Cas9 protein can be nCas9.

[0014] In the recombinant gene editing system described above, the Cas9 protein can also be other Cas9 proteins. The deaminase can also be other deaminases. The fusion protein can also contain other proteins. These other proteins can be uracil glycosylase inhibitor protein (UGI) and / or uracil glycosylase (UDG). The amino acid sequence of the uracil glycosylase inhibitor protein can be positions 2006-2088 of Sequence 1 in the sequence listing. The amino acid sequence of the uracil glycosylase can be positions 1993-2224 of Sequence 3 in the sequence listing.

[0015] In the recombinant gene editing system described above, the amino acid sequence of the cytidine deaminase can be positions 20-247 of Sequence 1 in the sequence listing. The amino acid sequence of the nCas9 protein can be positions 629-1995 of Sequence 1 in the sequence listing.

[0016] In the recombinant gene editing system described above, the chromatin remodeling factor can be SOX2. The histone modifying factor can be SETD2. The RNA modifying factor can be METTL3.

[0017] The SOX2 can be any one of A1), A2), A3), A4), or A5):

[0018] A1) The amino acid sequence is positions 280-596 of sequence 1 in the sequence listing.

[0019] A2) A protein encoded by the nucleotide sequence of sequence 6 in the sequence listing, specifically positions 838-1053.

[0020] A3) A protein encoded by the nucleotide sequence of sequence 7 in the sequence listing, from position 838 to 1188.

[0021] A4) Proteins derived from or having the same function as proteins shown in A1), A2), or A3), obtained by substituting and / or deleting and / or adding one or more amino acid residues of the amino acid sequence shown in A1), A2), or A3), or having more than 80% identity with and having the same function as proteins shown in A1), A2), or A3).

[0022] A5) is a fusion protein obtained by attaching a protein tag to the N-terminus and / or C-terminus of A1), A2), A3) or A4).

[0023] In the recombinant gene editing system described above, SETD2 can be any one of B1), B2), or B3):

[0024] B1) A protein encoded by the nucleotide sequence of sequence 9 in the sequence listing, from position 25 to 915. The amino acid sequence of SETD2 consists of 297 amino acid residues.

[0025] B2) A protein derived from B1) or having more than 80% identity with and functioning the same amino acid sequence shown in B1) by substitution and / or deletion and / or addition of one or more amino acid residues.

[0026] B3) is a fusion protein obtained by attaching a protein tag to the N-terminus and / or C-terminus of B1) or B2).

[0027] In the recombinant gene editing system described above, METTL3 can be any one of C1), C2), or C3):

[0028] C1) is a protein encoded by the nucleotide sequence from position 25 to 1761 of sequence 10 in the sequence listing. The amino acid sequence of METTL3 consists of 579 amino acid residues.

[0029] C2) A protein derived from C1) or having more than 80% identity with and functioning the same amino acid sequence shown in C1) by substitution and / or deletion and / or addition of one or more amino acid residues.

[0030] C3) is a fusion protein obtained by attaching a protein tag to the N-terminus and / or C-terminus of C1) or C2).

[0031] In the recombinant gene editing system described above, the fusion protein can be any one of D1), D2), D3), D4), D5), and D6.

[0032] D1) The amino acid sequence is that of the protein in sequence 1 of the sequence listing.

[0033] D2) The amino acid sequence is the protein of sequence 3 in the sequence listing.

[0034] D3) is a protein encoded by the nucleotide sequence from position 1 to 5871 of sequence 6 in the sequence listing. The amino acid sequence of the fusion protein consists of 1957 amino acid residues.

[0035] D4) is a protein encoded by the nucleotide sequence of sequence 7 in the sequence listing, positions 1-6006. The amino acid sequence of the fusion protein consists of 2002 amino acid residues.

[0036] D5) is a protein encoded by the nucleotide sequence from position 1 to 6072 of sequence 8 in the sequence listing. The amino acid sequence of the fusion protein consists of 2024 amino acid residues.

[0037] D6) is a protein encoded by the nucleotide sequence of sequence 9 in the sequence listing, positions 1-6612. The amino acid sequence of the fusion protein consists of 2224 amino acid residues.

[0038] D7) is a protein encoded by the nucleotide sequence from position 1 to 7458 of sequence 10 in the sequence listing. The amino acid sequence of the fusion protein consists of 2486 amino acid residues.

[0039] D8) A protein that has the same function as or has more than 80% identity with the protein shown in D1), D2), D3), D4), D5), D6), or D7) obtained by substituting and / or deleting and / or adding one or more amino acid residues of the amino acid sequence shown in D1), D2), D3), D4), D5), D6), or D7) through substitution and / or deletion and / or addition of one or more amino acid residues.

[0040] D9) is a fusion protein obtained by attaching a protein tag to the N-terminus and / or C-terminus of D1), D2), D3), D4), D5), D6), D7), or D8).

[0041] The protein tag refers to a polypeptide or protein that is fused with a target protein using in vitro DNA recombination technology for expression, detection, tracing, and / or purification of the target protein. The protein tag may be a Flag tag, His tag, MBP tag, HA tag, myc tag, GST tag, and / or SUMO tag, etc.

[0042] The fusion protein or related biomaterials described above also fall within the scope of protection of this invention. The biomaterials may be any of the following:

[0043] E1) encodes the nucleic acid molecule of the fusion protein described above.

[0044] E2) contains an expression cassette containing the nucleic acid molecules described in E1).

[0045] E3) A recombinant vector containing the nucleic acid molecule described in E1) or a recombinant vector containing the expression cassette described in E2).

[0046] E4) Recombinant microorganisms containing the nucleic acid molecules described in E1), or recombinant microorganisms containing the expression cassette described in E2), or recombinant microorganisms containing the recombinant vector described in E3).

[0047] E5) A transgenic plant cell line containing the nucleic acid molecule described in E1), or a transgenic cell line containing the expression cassette described in E2), or a transgenic cell line containing the recombinant vector described in E3).

[0048] E6) Transgenic plant tissue containing the nucleic acid molecules described in E1), or transgenic tissue containing the expression cassette described in E2), or transgenic tissue containing the recombinant vector described in E3).

[0049] E7) A transgenic animal organ containing the nucleic acid molecule described in E1), or a transgenic animal organ containing the expression cassette described in E2), or a transgenic animal organ containing the recombinant vector described in E3).

[0050] In the biological materials described above, the nucleic acid molecule described in B1) can be any of the following:

[0051] The E11 coding sequence is the DNA molecule of sequence 2 in the sequence listing.

[0052] The E12 coding sequence is the DNA molecule of sequence 4 in the sequence listing.

[0053] The E13 coding sequence is the DNA molecule of sequence 6 in the sequence listing.

[0054] The E14 coding sequence is the DNA molecule at sequence 7 in the sequence listing.

[0055] The E15 coding sequence is the DNA molecule at sequence 8 in the sequence listing.

[0056] The E16 coding sequence is the DNA molecule at sequence 9 of the sequence listing.

[0057] The E17 coding sequence is the DNA molecule of sequence 10 in the sequence listing.

[0058] To address the aforementioned technical problems, this invention also provides the application of the epigenetic factors described above in improving the gene editing efficiency of gene editing systems.

[0059] To address the aforementioned technical problems, the present invention also provides the application of the epigenetic factors and / or the fusion proteins and / or their related biological materials in gene editing.

[0060] The purpose of the application may be for disease diagnosis, disease prognosis and / or disease treatment, or it may be for non-disease diagnosis, non-disease prognosis and non-disease treatment purposes; the direct purpose of the application may be to obtain information on intermediate results of disease diagnosis, disease prognosis and / or disease treatment, or the direct purpose of the application may be for non-disease diagnosis, non-disease prognosis and / or non-disease treatment purposes.

[0061] This invention introduces the encoding gene of an epigenetic factor into the CBE and GBE base editing systems to obtain a recombinant base editing system expressing a fusion protein containing the epigenetic factor. The plasmid of this recombinant base editing system and a gRNA plasmid targeting a specific gene were co-transfected into HEK293T cells for base editing efficiency analysis. The results showed that, compared to the CBE and GBE base editing systems, the recombinant base editing system can improve the editing range and efficiency of bases to varying degrees. The recombinant gene editing system and / or epigenetic factors provided by this invention, when applied to optimize gene editing systems, can improve gene editing efficiency in actual production, achieve new editing effects, and establish new gene editing tools. Attached Figure Description

[0062] Figure 1 Diagram of the pioneer factor fusion base editing system.

[0063] Figure 2 The result of editing the Pioneer Factor Protein Fusion Editor.

[0064] Figure 3 This is a schematic diagram of cell transfection and screening.

[0065] Figure 4 The effect of fusing the pioneer factor SOX2 protein on CBE(A) and GBE(B) editing results in HEK293T (293T) cells. (A) The ordinate represents the efficiency of base CT conversion, and the abscissa represents the position of cytosine in the preseptal motif frame; (B) The ordinate represents the efficiency of base CG conversion.

[0066] Figure 5 The editing efficiency of the MYC termination mutation target site C (A) and the editing efficiency of the C11 induced final mutation (B) are shown. The ordinate of (A) is the efficiency of base CT conversion; the ordinate of (B) is the CT conversion efficiency of cytosine at position 11.

[0067] Figure 6The effect of SOX2 domain splitting on the editing efficiency of CBE(A) and GBE(B). In (A), the ordinate represents the efficiency of base CT conversion, and the abscissa represents the position of cytosine in the prespace motif frame; in (B), the ordinate represents the efficiency of base CG conversion, and the abscissa represents GBE and GBE constructed based on different domains of the SOX2 protein.

[0068] Figure 7 The effect of SETD2 and METTL3 proteins on GBE editing efficiency. The vertical axis represents the efficiency of CG base conversion. Detailed Implementation

[0069] The present invention will now be described in further detail with reference to specific embodiments. The given embodiments are merely illustrative of the invention and not intended to limit its scope. The embodiments provided below can serve as a guide for further improvements by those skilled in the art and do not constitute a limitation on the invention in any way.

[0070] Unless otherwise specified, the experimental methods used in the following examples are conventional methods, performed according to the techniques or conditions described in the literature in this field or according to the product instructions. Unless otherwise specified, the materials and reagents used in the following examples are commercially available.

[0071] In this embodiment of the invention, the BE4max base editing system expression plasmid was derived from Addgene (#112093). The GBE base editing system expression plasmid (APOBEC-nCas9-Ung) and the gRNA expression plasmid backbone (RNF2 sgRNA) were preserved in the laboratory (related literature: Zhao D, Li J, Li S, et al. New base editors change C to A in bacteria and C to G in mammalian cells[J]. Nature Biotechnology, 2021, 39(1)., which are available to the public from the applicant and are used only for replicating this invention). HEK293T cells (293T) and cervical cancer cells (HeLa) were donated by Professor Shang Yongfeng of Peking University School of Medicine (related literature: Yang C, Wu J, Liu X, et al. Circadian Rhythm Is Disrupted by ZNF704 in Breast Carcinogenesis[J]. Cancer Research, 2020, 80(19):canres.0493.2020.).

[0072] Example 1: Screening and optimizing a class of epigenetic factor-pioneer protein for base editing systems

[0073] 1. Testing Pioneer Factors

[0074] Pioneer factors are a class of chromatin remodeling factors. The screening criteria include: ① the function of pioneer factors has been reported in the literature; ② the gene coding sequence length is between 500bp and 2000bp; ③ the functional domains of pioneer factors are clearly defined.

[0075] The following pioneer factor proteins will be screened for verification: PAX7 (NG_023262), PBX1 (NG_028246), FOXA1 (NG_033028), and SOX2 (NG_009080, amino acid sequence of sequence 1 in the sequence listing, positions 280-596).

[0076] 2. Constructing a recombinant gene editing system containing pioneer factor proteins

[0077] 2.1 Primer design and PCR amplification

[0078] RNA was extracted from 293T (HEK293T) cells using an RNA extraction kit, and a cDNA library was obtained by reverse transcription using the extracted RNA as a template.

[0079] Based on the pioneer factor gene sequences obtained in step 1, upstream and downstream primers were designed (Table 1). The obtained cDNA library was used as a template for PCR amplification to obtain the gene sequences of the pioneer factors PAX7, PBX1, FOXA1, and SOX2 (nucleotide sequences are positions 838-1788 of sequence 2 in the sequence listing).

[0080] Table 1. List of PCR amplification primers

[0081]

[0082] 2.2 Construction of Editing System Expression Plasmids with Different Combinations of Pioneer Factors

[0083] The BE4max base editing system (a CBE base editing system) can express the fusion protein APOBEC1-nCas9-2xUGI; the GBE base editing system can express the fusion protein APOBEC1-nCas9-UNG.

[0084] APOBEC1 is cytidine deaminase (amino acid sequence is position 20-247 of sequence 1 in the sequence listing), nCas9 is Cas9 protein (amino acid sequence is position 629-1995 of sequence 1 in the sequence listing), UGI is uracil glycosylation inhibitor protein (amino acid sequence is position 2006-2088 of sequence 1 in the sequence listing), and UNG is uracil glycosylation enzyme (amino acid sequence is position 1993-2224 of sequence 3 in the sequence listing).

[0085] Based on the BE4max and GBE base editing systems, the gene sequences of the four different pioneer factors amplified in step 2.1 were integrated into the BE4max base editing system plasmid and the GBE base editing system plasmid respectively using the seamless cloning kit (Beyotime, catalog number: D7010S) via gene recombination.

[0086] Furthermore, considering that the different insertion positions of the pioneer factor gene sequences into the plasmids of the base editing system lead to variations in the arrangement of the pioneer factor protein with deaminase and Cas protein in the resulting recombinant base editing system fusion protein, affecting the editing effect of the system, this invention uses a seamless cloning kit to insert the PAX7, PBX1, FOXA1, and SOX2 pioneer factor gene sequences into different positions of the APOBEC1 gene coding sequence and the nCas9 gene protein coding sequence on the CBE and GBE base editing system plasmids, respectively, obtaining pioneer factor protein expression in various positions as shown in the diagram. Figure 1 The fusion proteins APOBEC1-nCas9-2xUGI or APOBEC1-nCas9-UNG are novel fusion proteins with the amino-terminal position (NH3) of APOBEC1, the middle position (i.e., the position between APOBEC1 and nCas9), and the carboxyl-terminal position (COOH) of nCas9, as shown, to verify the editing effect.

[0087] Experimental results confirm that the recombinant base editing system SoxM-CBE (which inserts the coding sequence of the pioneer factor protein SOX2 into the middle position of the BE4max base editing system plasmid) was obtained by inserting the coding sequence of SOX2 into the middle position of the BE4max base editing system plasmid. Figure 2 The base editing efficiency of the SOX2-middle-CBE system (A) is higher than that of the BE4max base editing system (B). Figure 2 The BE4max system (based on the A protein) and a recombinant base editing system obtained by inserting the coding sequences of three other pioneer factor proteins into the middle position of the BE4max base editing system plasmid (the BE4max base editing system plasmid) Figure 2 The PAX7-middle-CBE, PBX1-middle-CBE, and FOXA1-middle-CBE of the middle A group; the recombinant base editing system SoxN-GBE (SOX2-NH3-GBE) was obtained by inserting the coding sequence of the pioneer factor protein SOX2 into the amino terminus of the GBE base editing system plasmid. Figure 2 The base editing efficiency of SOX2-GBE(N) in the middle B group is higher than that of the GBE base editing system at the RP11 site. Figure 2 The recombinant base editing system (GBE) obtained by inserting the coding sequences of three other pioneer factor proteins into the amino terminus of the GBE base editing system plasmid (GBE base editing system plasmid) Figure 2PAX7-GBE(N), PBX1-GBE(N) and FOXA1-GBE(N) in B).

[0088] The SoxM-CBE recombinant base editing system plasmid obtained based on the BE4max base editing system contains the recombinant gene APOBEC1-SOX2-nCas9-2xUGI, whose nucleotide sequence is sequence 2 in the sequence listing, and can express the fusion protein APOBEC1-SOX2-nCas9-2xUGI, whose amino acid sequence is sequence 1 in the sequence listing.

[0089] The fusion protein APOBEC1-SOX2-nCas9-2xUGI consists of, from N-terminus to C-terminus, cytidine deaminase 1 (APOBEC1), the pioneer factor SOX2, Cas9 protein (nCas9), and uracil glycosylation inhibitor protein (UGI). Nucleotides 58-741 of sequence 2 in the sequence listing are the coding sequence for the APOBEC1 gene, nucleotides 1885-5985 of sequence 2 are the coding sequence for the nCas9 gene, and nucleotides 6016-6264 of sequence 2 are the coding sequence for the UGI gene.

[0090] The SoxN-GBE recombinant base editing system plasmid obtained based on the GBE base editing system contains the recombinant gene SOX2-APOBEC1-nCas9-UNG with the nucleotide sequence of sequence 4 in the sequence listing, and can express the fusion protein SOX2-APOBEC1-nCas9-UNG with the amino acid sequence of sequence 3 in the sequence listing.

[0091] The fusion protein SOX2-APOBEC1-nCas9-UNG consists of, from N-terminus to C-terminus, the forerunner factor SOX2, cytidine deaminase 1 (APOBEC1), Cas9 protein (nCas9), and uracil glycosylation enzyme (UNG). Nucleotides 5977-6672 of sequence 4 in the sequence listing are the coding sequence for the UNG gene.

[0092] Example 2: Validating the optimization effect of pioneer factors on the base editing system in 293T cells

[0093] 1. Construction of gRNA recombinant expression plasmid

[0094] Based on the characteristics of the GBE and BE4max base editing systems, gRNA expression plasmids were constructed, with 10 gRNA expression plasmids constructed for each base editing system (Table 2).

[0095] Table 2. Primers for sgRNA cloning and deep sequencing

[0096]

[0097] Specifically, using the RNF2 sgRNA sequence as a template, upstream and downstream primers were designed (the names of the target genomic sites and their corresponding amplification primers are shown in Table 2). The primers were annealed to form the double-stranded DNA encoding the gRNA. The double-stranded DNA encoding the gRNA was then ligated to the gRNA expression plasmid backbone (RNF2 sgRNA) using the goldengate method (BsaI enzyme, Thermo). A total of 18 gRNA expression plasmids were obtained.

[0098] 2. Recombinant plasmid transfection into 293T cells

[0099] The plasmids of the recombinant base editing system SoxM-CBE or SoxN-GBE obtained in Example 1 and the 18 kinds of gRNA recombinant expression plasmids obtained in step 1 of Example 2 were transformed into Escherichia coli Trans5α (Transgene) for amplification. The recombinant base editing system plasmids and gRNA expression plasmids were obtained by using a plasmid extraction kit (Tiangen).

[0100] 293T cells with 90% confluence were passaged and cultured in 24-well plates. On the second day, plasmid transfection experiments were performed. 600 ng of SoxM-CBE or SoxN-GBE plasmids and 300 ng of each gRNA expression plasmid (SoxN-GBE + gRNA, SoxM-CBE + gRNA) were transfected. PEI (Polysciences, USA) transfection reagent (1 μg: 3 μL) and Opti-MEM medium (Gibco) (1 μg: 100 μL) were added. After thorough mixing and standing for 15 min, the mixture was added to the 293T cells for transfection. Transfection was carried out for 24 h. 24 h after transfection, the transfected cells were replaced with Gibco medium containing puromycin (Sigma) (1:2500) for a total of 6 days, with the medium changed every two days. Figure 3 ).

[0101] 3. Verification of the editing efficiency of the recombinant base editing system incorporating the pioneer factor SOX2

[0102] In step 2, transfected cells were collected 6 days after transfection. After washing with PBS, an appropriate amount of cell lysis buffer was added to extract genomic DNA. Using the genomic DNA of the transfected cells as a template, PCR amplification was performed to obtain the target fragment, which was then recovered using a purification kit for deep sequencing analysis. The deep sequencing data were analyzed using CRISPResso2 software under Linux to statistically analyze and compare the editing efficiency and edit frame of different pioneer factor fusion base editing systems. Figure 4The results showed that the BE4max base editing efficiency range was 4-9 positions, while the optimized recombinant base editing system SoxM-CBE had an efficiency range of 5-16 positions, demonstrating a wider editing range. Figure 4 The average editing efficiency of the GBE base editing system was 13.73%, while the average editing efficiency of the optimized recombinant base editing system SoxN-GBE was 28.32%, demonstrating higher editing efficiency. Figure 4 (B)

[0103] Example 3: Induction of termination mutation of proto-oncogene MYC in cervical cancer cells using the SoxM-CBE system

[0104] 1. SoxM-CBE base editing system plasmid transfection of cervical cancer cells

[0105] HeLa cervical cancer cells were passaged and cultured. When the confluence reached 90%, the cells were passaged into 24-well plates. The next day, plasmid transfection experiments were performed. The recombinant base editing system plasmid obtained in Example 1 (SoxM-CBE 600ng) and a gRNA recombinant plasmid obtained in step 1 of Example 2 (gRNA target site sequence: 5'-CACGGCCGACCAGCTGGAGA-3', target gene is MYC gene (MYC-site in Table 2)) 300ng were transfected. PEI transfection reagent (the ratio of transfection plasmid to PEI was 1μg:3μL) and Opti-MEM medium (the ratio of transfection plasmid to medium was 1μg:100μL) were added. After thorough mixing, the mixture was allowed to stand for 15 min and then added to the cells to be transfected. 24 h after transfection, the medium was replaced with puromycin (ratio 1:2500) selection medium and cultured for a total of 6 days, with the selection medium being replaced every two days.

[0106] 2. Editing efficiency analysis of the recombinant base editing system

[0107] The transfected cells collected in step 1 were washed once with PBS, and an appropriate amount of cell lysis buffer was added to extract genomic DNA. Primers for the MYC gene target site DNA sequence were designed (F: 5'-CCCTCCTACGTTGCGGTCA-3', R: 5'-CGAGAAGCCGCTCCACAT-3'). Using the extracted genomic DNA as a template, PCR amplification was performed to obtain the PCR product (sequence 5 in the sequence listing). The PCR product fragment was recovered using a purification kit and subjected to deep sequencing analysis to analyze the MYC gene target site DNA sequence stop codon induction editing efficiency. Figure 5The results showed that, compared with the control BE4max base editing system, the recombinant base editing system SoxM-CBE exhibited a base conversion efficiency of nearly 30% CT at the 11th position of cytosine C11 in the editing frame.

[0108] In summary, this invention demonstrates that recombinant base editing systems obtained by inserting the pioneer factor SOX2 into the amino terminus of the GBE base editing system deaminase (SoxN-GBE: SOX2-APOBEC1-nCas9-UNG) and the carboxyl terminus of the CBE base editing system deaminase (SoxM-BE4max: APOBEC1-SOX2-nCas9-UGI) can respectively promote the editing efficiency and expand the editing range of the GBE and CBE base editing systems.

[0109] Example 4: Exploring the effect of the functional domain of the pioneer factor SOX2 protein on base editing

[0110] 1. Disassemble the SOX2 functional domain and construct a recombinant base editing system based on the SOX2 protein functional domain.

[0111] The SOX2 protein mainly includes three functional domains ( Figure 6 The three functional domains of the SOX2 protein were amplified by PCR using the cDNA from step 2.1 of Example 1. The fragments were then ligated into the BE4max and GBE base editing system plasmids using a seamless cloning kit. Six recombinant base editing systems based on these three functional domains were obtained: HMG-Middle-CBE, RBD-Middle-CBE, SAD-Middle-CBE, HMG-NH3-GBE, RBD-NH3-GBE, and SAD-NH3-GBE.

[0112] 2. Validating the effectiveness of a base editing system incorporating different structural domains at the cellular level.

[0113] Six hundred ng of the six recombinant base editing system plasmids obtained in step 1 and three hundred ng of the one gRNA recombinant plasmid obtained in step 1 of Example 2 (target gene is FANCF, target site sequence and amplification primers are shown in Table 2) were transfected into 293T cells according to the transfection method in step 1 of Example 3, and the base editing effect was detected. The results showed that, compared with the CBE base editing system, HMG-Middle-CBE ( Figure 6 HmgM-CBE of A and SAD-Middle-CBE ( Figure 6 The SadM-CBE recombinant base editing system (CBE) showed a significant improvement in efficiency (expanded editing range) for cytosine in the later positions of the pre-spacer motif frame; compared to the GBE base editing system SAD-NH3-GBE ( Figure 6 The SadN-GBE recombinant base editing system (B-type) significantly improved the editing efficiency of cytosine at position 6 within the VISTA sequence editing frame. Figure 6 (B)

[0114] The HmgM-CBE recombinant base editing system plasmid obtained based on the CBE base editing system contains the recombinant gene APOBEC1-HMG-nCas9-2xUGI, whose nucleotide sequence is sequence 6 in the sequence listing. It can express the fusion protein APOBEC1-HMG-nCas9-2xUGI. The amino acid sequence of the fusion protein APOBEC1-HMG-nCas9-2xUGI consists of 1957 amino acid residues and is encoded by the nucleotide sequence from position 1 to 5871 of sequence 6 in the sequence listing.

[0115] The fusion protein APOBEC1-HMG-nCas9-2xUGI consists of, from N-terminus to C-terminus, cytidine deaminase 1 (APOBEC1), the HMG domain of the pioneer factor SOX2, Cas9 protein (nCas9), and uracil glycosylation inhibitor protein (UGI). The HMG domain consists of 72 amino acid residues and is encoded by the nucleotide sequence from positions 838 to 1053 of sequence 6 in the sequence listing.

[0116] The SadM-CBE recombinant base editing system plasmid obtained based on the CBE base editing system contains the recombinant gene APOBEC1-SAD-nCas9-2xUGI, whose nucleotide sequence is sequence 7 in the sequence listing. It can express the fusion protein APOBEC1-SAD-nCas9-2xUGI. The amino acid sequence of the fusion protein APOBEC1-SAD-nCas9-2xUGI consists of 2002 amino acid residues and is encoded by the nucleotide sequence from position 1 to position 6006 of sequence 7 in the sequence listing.

[0117] The fusion protein APOBEC1-SAD-nCas9-2xUGI consists of, from N-terminus to C-terminus, cytidine deaminase 1 (APOBEC1), the SAD domain of the pioneer factor SOX2, Cas9 protein (nCas9), and uracil glycosylation inhibitor protein (UGI). The SAD domain consists of 117 amino acid residues and is encoded by the nucleotide sequence from position 838 to 1188 of sequence 7 in the sequence listing.

[0118] The SadN-GBE recombinant base editing system plasmid obtained based on the GBE base editing system contains the recombinant gene SAD-APOBEC1-nCas9-UNG, whose nucleotide sequence is sequence 8 in the sequence listing. It can express the fusion protein SAD-APOBEC1-nCas9-UNG. The amino acid sequence of the fusion protein SAD-APOBEC1-nCas9-UNG consists of 2024 amino acid residues and is encoded by the nucleotide sequence from position 1 to position 6072 of sequence 8 in the sequence listing.

[0119] The fusion protein SAD-APOBEC1-nCas9-UNG consists of, from N-terminus to C-terminus, the SAD domain of the pioneer factor SOX2, cytidine deaminase (APOBEC1), Cas9 protein (nCas9), and uracil glycosylation enzyme (UNG).

[0120] Example 5: Effects of epigenetic factors SETD2 and METTL3 on the GBE editing system

[0121] 1. Constructing a GBE recombinant base editing system based on SETD2 and METTL3 proteins

[0122] Literature was searched to screen epigenetic factor histone methyltransferase SETD2 and RNA methyltransferase METTL3 proteins for base editing system optimization. The GBE recombinant base editing system was constructed. Using 293T cDNA as a template, the core enzyme catalytic domain fragment of the SETD2 gene (nucleotides 25-915 of sequence 9 in the sequence listing) and the METTL3 gene fragment (nucleotides 25-1761 of sequence 10 in the sequence listing) were amplified by PCR. The amplification primers are shown in Table 1. Subsequently, they were ligated into the GBE base editing system plasmid using a seamless cloning kit. Novel recombinant base editing systems, including SETD2-NH3-GBE and METTL3-NH3-GBE, were obtained through screening.

[0123] The SETD2-NH3-GBE recombinant base editing system plasmid obtained based on the GBE base editing system contains the recombinant gene SETD2-APOBEC1-nCas9-UNG, whose nucleotide sequence is sequence 9 in the sequence listing. It can express the fusion protein SETD2-APOBEC1-nCas9-UNG. The amino acid sequence of the fusion protein SETD2-APOBEC1-nCas9-UNG consists of 2224 amino acid residues and is encoded by the nucleotide sequence from position 1 to position 6612 of sequence 9 in the sequence listing.

[0124] The fusion protein SETD2-APOBEC1-nCas9-UNG consists of, from N-terminus to C-terminus, histone methyltransferase SETD2, cytidine deaminase (APOBEC1), Cas9 protein (nCas9), and uracil glycosylation enzyme (UNG). SETD2's amino acid sequence comprises 297 amino acid residues and is encoded by the nucleotide sequence from positions 25 to 915 of sequence 9 in the sequence listing.

[0125] The METTL3-NH3-GBE recombinant base editing system plasmid obtained based on the GBE base editing system contains the recombinant gene METTL3-APOBEC1-nCas9-UNG, whose nucleotide sequence is sequence 10 in the sequence listing. It can express the fusion protein METTL3-APOBEC1-nCas9-UNG. The amino acid sequence of the fusion protein METTL3-APOBEC1-nCas9-UNG consists of 2486 amino acid residues and is encoded by the nucleotide sequence from position 1 to position 7458 of sequence 10 in the sequence listing.

[0126] The fusion protein METTL3-APOBEC1-nCas9-UNG consists of, from N-terminus to C-terminus, the RNA methyltransferase METTL3, cytidine deaminase 1 (APOBEC1), Cas9 protein (nCas9), and uracil glycosylation enzyme (UNG). The amino acid sequence of METTL3 consists of 579 amino acid residues and is encoded by the nucleotide sequence from positions 25 to 1761 of sequence 10 in the sequence listing.

[0127] 2. Validation of the efficacy of the SETD2-NH3-GBE and METTL3-NH3-GBE recombinant base editing systems at the cellular level.

[0128] The SETD2-NH3-GBE and METTL3-NH3-GBE recombinant base editing systems and the gRNA expression plasmid obtained in step 1 of Example 2 (target gene VISTA, target site sequence and amplification primers are shown in Table 2) were co-transfected into 293T cells according to the method in step 1 of Example 3. The base editing effect of cytosine at position 6 in the editing frame of the target gene was detected. The results showed that the SETD2-NH3-GBE and METTL3-NH3-GBE recombinant base editing systems had significantly improved editing effects compared to the GBE editing system. Figure 7 ).

[0129] The present invention has been described in detail above. For those skilled in the art, the invention can be practiced in a wide range of ways with equivalent parameters, concentrations, and conditions without departing from its spirit and scope, and without requiring unnecessary experiments. Although specific embodiments have been given, it should be understood that further modifications can be made to the invention. In summary, according to the principles of the invention, this application is intended to include any changes, uses, or improvements to the invention, including changes made using conventional techniques known in the art that depart from the scope disclosed herein. Some of the essential features can be applied within the scope of the following appended claims. sequence list <110> Tianjin Institute of Industrial Biotechnology, Chinese Academy of Sciences <120> Optimizing the application of epigenetic factors in eukaryotic cells and gene editing tools <130> GNCSQ212224 <160> 10 <170> SIPOSequenceListing 1.0 <210> 1 <211> 2202 <212> PRT <213> Artificial Sequence <400> 1 Met Lys Arg Thr Ala Asp Gly Ser Glu Phe Glu Ser Pro Lys Lys Lys 1 5 10 15 Arg Lys Val Ser Ser Glu Thr Gly Pro Val Ala Val Asp Pro Thr Leu 20 25 30 Arg Arg Arg Ile Glu Pro His Glu Phe Glu Val Phe Phe Asp Pro Arg 35 40 45 Glu Leu Arg Lys Glu Thr Cys Leu Leu Tyr Glu Ile Asn Trp Gly Gly 50 55 60 Arg His Ser Ile Trp Arg His Thr Ser Gln Asn Thr Asn Lys His Val 65 70 75 80 Glu Val Asn Phe Ile Glu Lys Phe Thr Thr Glu Arg Tyr Phe Cys Pro 85 90 95 Asn Thr Arg Cys Ser Ile Thr Trp Phe Leu Ser Trp Ser Pro Cys Gly 100 105 110 Glu Cys Ser Arg Ala Ile Thr Glu Phe Leu Ser Arg Tyr Pro His Val 115 120 125 Thr Leu Phe Ile Tyr Ile Ala Arg Leu Tyr His His Ala Asp Pro Arg 130 135 140 Asn Arg Gln Gly Leu Arg Asp Leu Ile Ser Ser Gly Val Thr Ile Gln 145 150 155 160 Ile Met Thr Glu Gln Glu Ser Gly Tyr Cys Trp Arg Asn Phe Val Asn 165 170 175 Tyr Ser Pro Ser Asn Glu Ala His Trp Pro Arg Tyr Pro His Leu Trp 180 185 190 Val Arg Leu Tyr Val Leu Glu Leu Tyr Cys Ile Ile Leu Gly Leu Pro 195 200 205 Pro Cys Leu Asn Ile Leu Arg Arg Lys Gln Pro Gln Leu Thr Phe Phe 210 215 220 Thr Ile Ala Leu Gln Ser Cys His Tyr Gln Arg Leu Pro Pro His Ile 225 230 235 240 Leu Trp Ala Thr Gly Leu Lys Ser Gly Gly Ser Ser Gly Gly Ser Ser 245 250 255 Gly Ser Glu Thr Pro Gly Thr Ser Glu Ser Ala Thr Pro Glu Ser Ser 260 265 270 Gly Gly Ser Ser Gly Gly Ser Met Tyr Asn Met Met Glu Thr Glu Leu 275 280 285 Lys Pro Pro Gly Pro Gln Gln Thr Ser Gly Gly Gly Gly Gly Asn Ser 290 295 300 Thr Ala Ala Ala Ala Gly Gly Asn Gln Lys Asn Ser Pro Asp Arg Val 305 310 315 320 Lys Arg Pro Met Asn Ala Phe Met Val Trp Ser Arg Gly Gln Arg Arg 325 330 335 Lys Met Ala Gln Glu Asn Pro Lys Met His Asn Ser Glu Ile Ser Lys 340 345 350 Arg Leu Gly Ala Glu Trp Lys Leu Leu Ser Glu Thr Glu Lys Arg Pro 355 360 365 Phe Ile Asp Glu Ala Lys Arg Leu Arg Ala Leu His Met Lys Glu His 370 375 380 Pro Asp Tyr Lys Tyr Arg Pro Arg Arg Lys Thr Lys Thr Leu Met Lys 385 390 395 400 Lys Asp Lys Tyr Thr Leu Pro Gly Gly Leu Leu Ala Pro Gly Gly Asn 405 410 415 Ser Met Ala Ser Gly Val Gly Val Gly Ala Gly Leu Gly Ala Gly Val 420 425 430 Asn Gln Arg Met Asp Ser Tyr Ala His Met Asn Gly Trp Ser Asn Gly 435 440 445 Ser Tyr Ser Met Met Gln Asp Gln Leu Gly Tyr Pro Gln His Pro Gly 450 455 460 Leu Asn Ala His Gly Ala Ala Gln Met Gln Pro Met His Arg Tyr Asp 465 470 475 480 Val Ser Ala Leu Gln Tyr Asn Ser Met Thr Ser Ser Gln Thr Tyr Met 485 490 495 Asn Gly Ser Pro Thr Tyr Ser Met Ser Tyr Ser Gln Gln Gly Thr Pro 500 505 510 Gly Met Ala Leu Gly Ser Met Gly Ser Val Val Lys Ser Glu Ala Ser 515 520 525 Ser Ser Pro Pro Val Val Thr Ser Ser Ser His Ser Arg Ala Pro Cys 530 535 540 Gln Ala Gly Asp Leu Arg Asp Met Ile Ser Met Tyr Leu Pro Gly Ala 545 550 555 560 Glu Val Pro Glu Pro Ala Ala Pro Ser Arg Leu His Met Ser Gln His 565 570 575 Tyr Gln Ser Gly Pro Val Pro Gly Thr Ala Ile Asn Gly Thr Leu Pro 580 585 590 Leu Ser His Met Ser Gly Gly Ser Ser Gly Gly Ser Ser Gly Ser Glu 595 600 605 Thr Pro Gly Thr Ser Glu Ser Ala Thr Pro Glu Ser Ser Gly Gly Ser 610 615 620 Ser Gly Gly Ser Asp Lys Lys Tyr Ser Ile Gly Leu Ala Ile Gly Thr 625 630 635 640 Asn Ser Val Gly Trp Ala Val Ile Thr Asp Glu Tyr Lys Val Pro Ser 645 650 655 Lys Lys Phe Lys Val Leu Gly Asn Thr Asp Arg His Ser Ile Lys Lys 660 665 670 Asn Leu Ile Gly Ala Leu Leu Phe Asp Ser Gly Glu Thr Ala Glu Ala 675 680 685 Thr Arg Leu Lys Arg Thr Ala Arg Arg Arg Tyr Thr Arg Arg Lys Asn 690 695 700 Arg Ile Cys Tyr Leu Gln Glu Ile Phe Ser Asn Glu Met Ala Lys Val 705 710 715 720 Asp Asp Ser Phe Phe His Arg Leu Glu Glu Ser Phe Leu Val Glu Glu 725 730 735 Asp Lys Lys His Glu Arg His Pro Ile Phe Gly Asn Ile Val Asp Glu 740 745 750 Val Ala Tyr His Glu Lys Tyr Pro Thr Ile Tyr His Leu Arg Lys Lys 755 760 765 Leu Val Asp Ser Thr Asp Lys Ala Asp Leu Arg Leu Ile Tyr Leu Ala 770 775 780 Leu Ala His Met Ile Lys Phe Arg Gly His Phe Leu Ile Glu Gly Asp 785 790 795 800 Leu Asn Pro Asp Asn Ser Asp Val Asp Lys Leu Phe Ile Gln Leu Val 805 810 815 Gln Thr Tyr Asn Gln Leu Phe Glu Glu Asn Pro Ile Asn Ala Ser Gly 820 825 830 Val Asp Ala Lys Ala Ile Leu Ser Ala Arg Leu Ser Lys Ser Arg Arg 835 840 845 Leu Glu Asn Leu Ile Ala Gln Leu Pro Gly Glu Lys Lys Asn Gly Leu 850 855 860 Phe Gly Asn Leu Ile Ala Leu Ser Leu Gly Leu Thr Pro Asn Phe Lys 865 870 875 880 Ser Asn Phe Asp Leu Ala Glu Asp Ala Lys Leu Gln Leu Ser Lys Asp 885 890 895 Thr Tyr Asp Asp Asp Leu Asp Asn Leu Leu Ala Gln Ile Gly Asp Gln 900 905 910 Tyr Ala Asp Leu Phe Leu Ala Ala Lys Asn Leu Ser Asp Ala Ile Leu 915 920 925 Leu Ser Asp Ile Leu Arg Val Asn Thr Glu Ile Thr Lys Ala Pro Leu 930 935 940 Ser Ala Ser Met Ile Lys Arg Tyr Asp Glu His His Gln Asp Leu Thr 945 950 955 960 Leu Leu Lys Ala Leu Val Arg Gln Gln Leu Pro Glu Lys Tyr Lys Glu 965 970 975 Ile Phe Phe Asp Gln Ser Lys Asn Gly Tyr Ala Gly Tyr Ile Asp Gly 980 985 990 Gly Ala Ser Gln Glu Glu Phe Tyr Lys Phe Ile Lys Pro Ile Leu Glu 995 1000 1005 Lys Met Asp Gly Thr Glu Glu Leu Leu Val Lys Leu Asn Arg Glu Asp 1010 1015 1020 Leu Leu Arg Lys Gln Arg Thr Phe Asp Asn Gly Ser Ile Pro His Gln 1025 1030 1035 1040 Ile His Leu Gly Glu Leu His Ala Ile Leu Arg Arg Gln Glu Asp Phe 1045 1050 1055 Tyr Pro Phe Leu Lys Asp Asn Arg Glu Lys Ile Glu Lys Ile Leu Thr 1060 1065 1070 Phe Arg Ile Pro Tyr Tyr Val Gly Pro Leu Ala Arg Gly Asn Ser Arg 1075 1080 1085 Phe Ala Trp Met Thr Arg Lys Ser Glu Glu Thr Ile Thr Pro Trp Asn 1090 1095 1100 Phe Glu Glu Val Val Asp Lys Gly Ala Ser Ala Gln Ser Phe Ile Glu 1105 1110 1115 1120 Arg Met Thr Asn Phe Asp Lys Asn Leu Pro Asn Glu Lys Val Leu Pro 1125 1130 1135 Lys His Ser Leu Leu Tyr Glu Tyr Phe Thr Val Tyr Asn Glu Leu Thr 1140 1145 1150 Lys Val Lys Tyr Val Thr Glu Gly Met Arg Lys Pro Ala Phe Leu Ser 1155 1160 1165 Gly Glu Gln Lys Lys Ala Ile Val Asp Leu Leu Phe Lys Thr Asn Arg 1170 1175 1180 Lys Val Thr Val Lys Gln Leu Lys Glu Asp Tyr Phe Lys Lys Ile Glu 1185 1190 1195 1200 Cys Phe Asp Ser Val Glu Ile Ser Gly Val Glu Asp Arg Phe Asn Ala 1205 1210 1215 Ser Leu Gly Thr Tyr His Asp Leu Leu Lys Ile Ile Lys Asp Lys Asp 1220 1225 1230 Phe Leu Asp Asn Glu Glu Asn Glu Asp Ile Leu Glu Asp Ile Val Leu 1235 1240 1245 Thr Leu Thr Leu Phe Glu Asp Arg Glu Met Ile Glu Glu Arg Leu Lys 1250 1255 1260 Thr Tyr Ala His Leu Phe Asp Asp Lys Val Met Lys Gln Leu Lys Arg 1265 1270 1275 1280 Arg Arg Tyr Thr Gly Trp Gly Arg Leu Ser Arg Lys Leu Ile Asn Gly 1285 1290 1295 Ile Arg Asp Lys Gln Ser Gly Lys Thr Ile Leu Asp Phe Leu Lys Ser 1300 1305 1310 Asp Gly Phe Ala Asn Arg Asn Phe Met Gln Leu Ile His Asp Asp Ser 1315 1320 1325 Leu Thr Phe Lys Glu Asp Ile Gln Lys Ala Gln Val Ser Gly Gln Gly 1330 1335 1340 Asp Ser Leu His Glu His Ile Ala Asn Leu Ala Gly Ser Pro Ala Ile 1345 1350 1355 1360 Lys Lys Gly Ile Leu Gln Thr Val Lys Val Val Asp Glu Leu Val Lys 1365 1370 1375 Val Met Gly Arg His Lys Pro Glu Asn Ile Val Ile Glu Met Ala Arg 1380 1385 1390 Glu Asn Gln Thr Thr Gln Lys Gly Gln Lys Asn Ser Arg Glu Arg Met 1395 1400 1405 Lys Arg Ile Glu Glu Gly Ile Lys Glu Leu Gly Ser Gln Ile Leu Lys 1410 1415 1420 Glu His Pro Val Glu Asn Thr Gln Leu Gln Asn Glu Lys Leu Tyr Leu 1425 1430 1435 1440 Tyr Tyr Leu Gln Asn Gly Arg Asp Met Tyr Val Asp Gln Glu Leu Asp 1445 1450 1455 Ile Asn Arg Leu Ser Asp Tyr Asp Val Asp His Ile Val Pro Gln Ser 1460 1465 1470 Phe Leu Lys Asp Asp Ser Ile Asp Asn Lys Val Leu Thr Arg Ser Asp 1475 1480 1485 Lys Asn Arg Gly Lys Ser Asp Asn Val Pro Ser Glu Glu Val Val Lys 1490 1495 1500 Lys Met Lys Asn Tyr Trp Arg Gln Leu Leu Asn Ala Lys Leu Ile Thr 1505 1510 1515 1520 Gln Arg Lys Phe Asp Asn Leu Thr Lys Ala Glu Arg Gly Gly Leu Ser 1525 1530 1535 Glu Leu Asp Lys Ala Gly Phe Ile Lys Arg Gln Leu Val Glu Thr Arg 1540 1545 1550 Gln Ile Thr Lys His Val Ala Gln Ile Leu Asp Ser Arg Met Asn Thr 1555 1560 1565 Lys Tyr Asp Glu Asn Asp Lys Leu Ile Arg Glu Val Lys Val Ile Thr 1570 1575 1580 Leu Lys Ser Lys Leu Val Ser Asp Phe Arg Lys Asp Phe Gln Phe Tyr 1585 1590 1595 1600 Lys Val Arg Glu Ile Asn Asn Tyr His His Ala His Asp Ala Tyr Leu 1605 1610 1615 Asn Ala Val Val Gly Thr Ala Leu Ile Lys Lys Tyr Pro Lys Leu Glu 1620 1625 1630 Ser Glu Phe Val Tyr Gly Asp Tyr Lys Val Tyr Asp Val Arg Lys Met 1635 1640 1645 Ile Ala Lys Ser Glu Gln Glu Ile Gly Lys Ala Thr Ala Lys Tyr Phe 1650 1655 1660 Phe Tyr Ser Asn Ile Met Asn Phe Phe Lys Thr Glu Ile Thr Leu Ala 1665 1670 1675 1680 Asn Gly Glu Ile Arg Lys Arg Pro Leu Ile Glu Thr Asn Gly Glu Thr 1685 1690 1695 Gly Glu Ile Val Trp Asp Lys Gly Arg Asp Phe Ala Thr Val Arg Lys 1700 1705 1710 Val Leu Ser Met Pro Gln Val Asn Ile Val Lys Lys Thr Glu Val Gln 1715 1720 1725 Thr Gly Gly Phe Ser Lys Glu Ser Ile Leu Pro Lys Arg Asn Ser Asp 1730 1735 1740 Lys Leu Ile Ala Arg Lys Lys Asp Trp Asp Pro Lys Lys Tyr Gly Gly 1745 1750 1755 1760 Phe Asp Ser Pro Thr Val Ala Tyr Ser Val Leu Val Val Ala Lys Val 1765 1770 1775 Glu Lys Gly Lys Ser Lys Lys Leu Lys Ser Val Lys Glu Leu Leu Gly 1780 1785 1790 Ile Thr Ile Met Glu Arg Ser Ser Phe Glu Lys Asn Pro Ile Asp Phe 1795 1800 1805 Leu Glu Ala Lys Gly Tyr Lys Glu Val Lys Lys Asp Leu Ile Ile Lys 1810 1815 1820 Leu Pro Lys Tyr Ser Leu Phe Glu Leu Glu Asn Gly Arg Lys Arg Met 1825 1830 1835 1840 Leu Ala Ser Ala Gly Glu Leu Gln Lys Gly Asn Glu Leu Ala Leu Pro 1845 1850 1855 Ser Lys Tyr Val Asn Phe Leu Tyr Leu Ala Ser His Tyr Glu Lys Leu 1860 1865 1870 Lys Gly Ser Pro Glu Asp Asn Glu Gln Lys Gln Leu Phe Val Glu Gln 1875 1880 1885 His Lys His Tyr Leu Asp Glu Ile Ile Glu Gln Ile Ser Glu Phe Ser 1890 1895 1900 Lys Arg Val Ile Leu Ala Asp Ala Asn Leu Asp Lys Val Leu Ser Ala 1905 1910 1915 1920 Tyr Asn Lys His Arg Asp Lys Pro Ile Arg Glu Gln Ala Glu Asn Ile 1925 1930 1935 Ile His Leu Phe Thr Leu Thr Asn Leu Gly Ala Pro Ala Ala Phe Lys 1940 1945 1950 Tyr Phe Asp Thr Thr Ile Asp Arg Lys Arg Tyr Thr Ser Thr Lys Glu 1955 1960 1965 Val Leu Asp Ala Thr Leu Ile His Gln Ser Ile Thr Gly Leu Tyr Glu 1970 1975 1980 Thr Arg Ile Asp Leu Ser Gln Leu Gly Gly Asp Ser Gly Gly Ser Gly 1985 1990 1995 2000 Gly Ser Gly Gly Ser Thr Asn Leu Ser Asp Ile Ile Glu Lys Glu Thr 2005 2010 2015 Gly Lys Gln Leu Val Ile Gln Glu Ser Ile Leu Met Leu Pro Glu Glu 2020 2025 2030 Val Glu Glu Val Ile Gly Asn Lys Pro Glu Ser Asp Ile Leu Val His 2035 2040 2045 Thr Ala Tyr Asp Glu Ser Thr Asp Glu Asn Val Met Leu Leu Thr Ser 2050 2055 2060 Asp Ala Pro Glu Tyr Lys Pro Trp Ala Leu Val Ile Gln Asp Ser Asn 2065 2070 2075 2080 Gly Glu Asn Lys Ile Lys Met Leu Ser Gly Gly Ser Gly Gly Ser Gly 2085 2090 2095 Gly Ser Thr Asn Leu Ser Asp Ile Ile Glu Lys Glu Thr Gly Lys Gln 2100 2105 2110 Leu Val Ile Gln Glu Ser Ile Leu Met Leu Pro Glu Glu Val Glu Glu 2115 2120 2125 Val Ile Gly Asn Lys Pro Glu Ser Asp Ile Leu Val His Thr Ala Tyr 2130 2135 2140 Asp Glu Ser Thr Asp Glu Asn Val Met Leu Leu Thr Ser Asp Ala Pro 2145 2150 2155 2160 Glu Tyr Lys Pro Trp Ala Leu Val Ile Gln Asp Ser Asn Gly Glu Asn 2165 2170 2175 Lys Ile Lys Met Leu Ser Gly Gly Ser Lys Arg Thr Ala Asp Gly Ser 2180 2185 2190 Glu Phe Glu Pro Lys Lys Lys Arg Lys Val 2195 2200 <210> 2 <211> 6609 <212> DNA <213> Artificial Sequence <400> 2 atgaaacgga cagccgacgg aagcgagttc gagtcaccaa agaagaagcg gaaagtctcc 60 tcagagactg ggcctgtcgc cgtcgatcca accctgcgcc gccggattga acctcacgag 120 tttgaagtgt tctttgaccc ccgggagctg agaaaggaga catgcctgct gtacgagatc 180 aactggggag gcaggcactc catctggagg cacacctctc agaacacaaa taagcacgtg 240 gaggtgaact tcatcgagaa gtttaccaca gagcggtact tctgccccaa taccagatgt 300 agcatcacat ggtttctgag ctggtcccct tgcggagagt gtagcagggc catcaccgag 360 ttcctgtcca gatatccaca cgtgacactg tttatctaca tcgccaggct gtatcaccac 420 gcagacccaa ggaataggca gggcctgcgc gatctgatca gctccggcgt gaccatccag 480 atcatgacag agcaggagtc cggctactgc tggcggaact tcgtgaatta ttctcctagc 540 aacgaggccc actggcctag gtacccacac ctgtgggtgc gcctgtacgt gctggagctg 600 tattgcatca tcctgggcct gcccccttgt ctgaatatcc tgcggagaaa gcagccccag 660 ctgaccttct ttacaatcgc cctgcagtct tgtcactatc agaggctgcc accccacatc 720 ctgtgggcca caggcctgaa gtctggagga tctagcggag gatcctctgg cagcgagaca 780 ccaggaacaa gcgagtcagc aacaccagag agcagtggcg gcagcagcgg cggcagcatg 840 tacaacatga tggagacgga gctgaagccg ccgggcccgc agcaaacttc ggggggcggc 900 ggcggcaact ccaccgcggc ggcggccggc ggcaaccaga aaaacagccc ggaccgcgtc 960 aagcggccca tgaatgcctt catggtgtgg tcccgcgggc agcggcgcaa gatggcccag 1020 gagaacccca agatgcacaa ctcggagatc agcaagcgcc tgggcgccga gtggaaactt 1080 ttgtcggaga cggagaagcg gccgttcatc gacgaggcta agcggctgcg agcgctgcac 1140 atgaaggagc acccggatta taaataccgg ccccggcgga aaaccaagac gctcatgaag 1200 aaggataagt acacgctgcc cggcgggctg ctggcccccg gcggcaatag catggcgagc 1260 ggggtcgggg tgggcgccgg cctgggcgcg ggcgtgaacc agcgcatgga cagttacgcg 1320 cacatgaacg gctggagcaa cggcagctac agcatgatgc aggaccagct gggctacccg 1380 cagcacccgg gcctcaatgc gcacggcgca gcgcagatgc agcccatgca ccgctacgac 1440 gtgagcgccc tgcagtacaa ctccatgacc agctcgcaga cctacatgaa cggctcgccc 1500 acctacagca tgtcctactc gcagcagggc acccctggca tggctcttg ctccatgggt 1560 tcggtggtca agtccgaggc cagctccagc ccccctgtgg ttacctcttc ctcccactcc 1620 agggcgccct gccaggccgg ggacctccgg gacatgatca gcatgtatct ccccggcgcc 1680 gaggtgccgg aacccgccgc ccccagcaga cttcacatgt cccagcacta ccagagcggc 1740 ccggtgcccg gcacggccat taacggcaca ctgcccctct cacacatgag cggaggatct 1800 agcggaggat caagcggaag cgagactcct ggaaccagcg aaagcgcaac cccagaaagc 1860 agcggaggaa gtagcggagg aagcgacaag aagtacagca tcggcctggc catcggcacc 1920 aactctgtgg gctgggccgt gatcaccgac gagtacaagg tgcccagcaa gaaattcaag 1980 gtgctgggca acaccgaccg gcacagcatc aagaagaacc tgatcggagc cctgctgttc 2040 gacagcggcg aaacagccga ggccacccgg ctgaagagaa ccgccagaag aagatacacc 2100 agacggaaga accggatctg ctatctgcaa gagatcttca gcaacgagat ggccaaggtg 2160 gacgacagct tcttccacag actggaagag tccttcctgg tggaagagga taagaagcac 2220 gagcggcacc ccatcttcgg caacatcgtg gacgaggtgg cctaccacga gaagtacccc 2280 accatctacc acctgagaaa gaaactggtg gacagcaccg acaaggccga cctgcggctg 2340 atctatctgg ccctggccca catgatcaag ttccggggcc acttcctgat cgagggcgac 2400 ctgaaccccg acaacagcga cgtggacaag ctgttcatcc agctggtgca gacctacaac 2460 cagctgttcg aggaaaaccc catcaacgcc agcggcgtgg acgccaaggc catcctgtct 2520 gccagactga gcaagagcag acggctggaa aatctgatcg cccagctgcc cggcgagaag 2580 aagaatggcc tgttcggaaa cctgattgcc ctgagcctgg gcctgacccc caacttcaag 2640 agcaacttcg acctggccga ggatgccaaa ctgcagctga gcaaggacac ctacgacgac 2700 gacctggaca acctgctggc ccagatcggc gaccagtacg ccgacctgtt tctggccgcc 2760 aagaacctgt ccgacgccat cctgctgagc gacatcctga gagtgaacac cgagatcacc 2820 aaggcccccc tgagcgcctc tatgatcaag agatacgacg agcaccacca ggacctgacc 2880 ctgctgaaag ctctcgtgcg gcagcagctg cctgagaagt acaaagagat tttcttcgac 2940 cagagcaaga acggctacgc cggctacatt gacggcggag ccagccagga agagttctac 3000 aagttcatca agcccatcct ggaaaagatg gacggcaccg aggaactgct cgtgaagctg 3060 aacagagagg acctgctgcg gaagcagcgg accttcgaca acggcagcat cccccaccag 3120 atccacctgg gagagctgca cgccattctg cggcggcagg aagattttta cccattcctg 3180 aaggacaacc gggaaaagat cgagaagatc ctgaccttcc gcatccccta ctacgtgggc 3240 cctctggcca ggggaaacag cagattcgcc tggatgacca gaaagagcga ggaaaccatc 3300 accccctgga acttcgagga agtggtggac aagggcgctt ccgcccagag cttcatcgag 3360 cggatgacca acttcgataa gaacctgccc aacgagaagg tgctgcccaa gcacagcctg 3420 ctgtacgagt acttcaccgt gtataacgag ctgaccaaag tgaaatacgt gaccgaggga 3480 atgagaaagc ccgccttcct gagcggcgag cagaaaaagg ccatcgtgga cctgctgttc 3540 aagaccaacc ggaaagtgac cgtgaagcag ctgaaagagg actacttcaa gaaaatcgag 3600 tgcttcgact ccgtggaaat ctccggcgtg gaagatcggt tcaacgcctc cctgggcaca 3660 taccacgatc tgctgaaat tatchcaggac aaggacttcc tggacaatga ggaaaacgag 3720 gatattctgg aagatatcgt gctgaccctg acactgttg aggacagaga gatgatcgag 3780 gaacggctga aaacctatgc ccacctgttc gacgacaag tgatgaagca gctgaagcgg 3840 cggagataca ccggctgggg caggctgagc cggaagctga tcaacggcat ccgggacaag 3900 cagtccggca agacaatcct ggatttcctg aagtccgacg gctcgccaa cagaaacttc 3960 atgcagctga tccacgacga cagcctgacc ttaagagg acatccagaa agcccaggtg 4020 tccggccagg gcgatagcct gcacgagcac attgccaatc tggccggcag ccccgccatt 4080 aagaagggca tcctgcagac agtgaaggtg gtggacgagc tcgtgaagt gatggggccgg 4140 cacaagcccg agaacatcgt gatcgaatg gccagagaga accagaccac ccagaaggga 4200 cagagaaca gccgcgagag atgaagcgg atcgaaggg gcatcaagag gctgggcagc 4260 cagatcctga aagacaccc cgtggaaaac acccagctgc agaacgagaa gctgtaccctg 4320 tactacctgc agaatgggcg ggatatgtac gtggaccagg aactggacat caaccggctg 4380 tccgactacg atgtggacca tatcgtgcct cagagctttc tgaaggacga ctccatcgac aacaaggtgc tgaccagaag cgacaagaac cggggcaaga gcgacaacgt gccctccgaa gaggtcgtga agagatga gaactactgg cggcagctgc tgaacgccaa gctgattacc cagagaagt tcgacaatct gaccaaggcc gagagaggcg gcctgagcga actggataag gccggcttca tcaagagaca gctggtggaa acccggcaga tcacaaagca cgtggcacag atcctggact cccggatgaa cactaagtac gacgagaatg acaagctgat ccgggaagtg aaagtgatca ccctgaagtc caagctggtg tccgatttcc ggaggattt ccagttttac 4800. aaagtgcgcg agatcaacaa ctaccaccac gcccacgacg cctacctgaa cgccgtcgtg ggaccgccc tgatcaaaaa gtaccctaag ctggaaagcg agttcgtgta cggcgactac aaggtgtacg acgtgcgga gatgatcgcc aagagcgagc aggaatcgg caaggctacc 4980. gccaagtact tcttctacag caacatcatg aactttttca agaccgagat taccctggcc aacggcgaga tccggaagcg gcctctgatc gagacaaacg gcgaaaccgg ggagatcgtg tgggataagg gccgggattt tgccaccgtg cggaaagtgc tgagcatgcc ccaagtgaat 5160 atcgtgaaaa agaccgaggt gcagacaggc ggcttcagca aagagtctat cctgcccaag 5220 aggaacagcg ataagctgat cgccagaaag aaggactggg accctaagaa gtacggcggc 5280 ttcgacagcc ccaccgtggc ctattctgtg ctggtggtgg ccaaagtgga aaagggcaag 5340 tccaagaaac tgaagagtgt gaaagagctg ctggggatca ccatcatgga aagaagcagc 5400 ttcgagaaga atcccatcga ctttctggaa gccaagggct acaaagaagt gaaaaaggac 5460 ctgatcatca agctgcctaa gtactccctg ttcgagctgg aaaacggccg gaagagaatg 5520 ctggcctctg ccggcgaact gcagaaggga aacgaactgg ccctgccctc caaatatgtg 5580 aacttcctgt acctggccag ccactatgag aagctgaagg gctcccccga ggataatgag 5640 cagaaacagc tgtttgtgga acagcacaag cactacctgg acgagatcat cgagcagatc 5700 agcgagttct ccaagagagt gatcctggcc gacgctaatc tggacaaagt gctgtccgcc 5760 tacaacaagc accgggataa gcccatcaga gagcaggccg agaatatcat ccacctgttt 5820 accctgacca atctgggagc ccctgccgcc ttcagtact tgacaccac catcgaccgg 5880 aagaggtaca ccagcaccaa agaggtgctg gacgccaccc tgatccacca gagcatcacc 5940 ggcctgtacg agacacggat cgacctgtct cagctgggag gtgacagcgg cgggagcggc 6000 gggagcgggg ggagcactaa tctgagcgac atcattgaga aggactgg gaacagctg 6060 gtcattcagg agtccatcct gatgctgcct gaggaggtgg aggaagtgat cggcacaag 6120 ccagagtctg acatcctggt gcacaccgcc tacgacgt ccacagatga gatgtgatg 6180 ctgctgacct ctgacgcccc cgagtataag ccttgggccc tggtcatcca ggattctaac 6240 ggcgagaata agatcagat gctgagcgga ggatccggag gatctggagg cagcaccac 6300 ctgtctgaca tcatcgagaa ggagacaggc aagcagctgg tcatccagga gagcatcctg 6360 atgctgcccg aagaagtcga agagtgatc ggaacaagc ctgagagcga tatcctggtc 6420 cataccgcct acgacgagag taccgacgaa atgtgatgc tgctgacatc cgacgcccca 6480 gagtataagc cctgggctct ggtcatccag gattccaacg gagagaaca atcaaatg 6540 ctgtctggcg gctcaaaaag aaccgccgac ggcagcgaat tcgagcccaa gaagaagagg 6600 aaagtctaa 6609 <210> 3 <211> 2224 <212> PRT <213> Artificial Sequence <400> 3 Met Pro Lys Lys Lys Arg Lys Val Met Tyr Asn Met Met Glu Thr Glu 1 5 10 15 Leu Lys Pro Pro Gly Pro Gln Gln Thr Ser Gly Gly Gly Gly Gly Asn 20 25 30 Ser Thr Ala Ala Ala Ala Gly Gly Asn Gln Lys Asn Ser Pro Asp Arg 35 40 45 Val Lys Arg Pro Met Asn Ala Phe Met Val Trp Ser Arg Gly Gln Arg 50 55 60 Arg Lys Met Ala Gln Glu Asn Pro Lys Met His Asn Ser Glu Ile Ser 65 70 75 80 Lys Arg Leu Gly Ala Glu Trp Lys Leu Leu Ser Glu Thr Glu Lys Arg 85 90 95 Pro Phe Ile Asp Glu Ala Lys Arg Leu Arg Ala Leu His Met Lys Glu 100 105 110 His Pro Asp Tyr Lys Tyr Arg Pro Arg Arg Lys Thr Lys Thr Leu Met 115 120 125 Lys Lys Asp Lys Tyr Thr Leu Pro Gly Gly Leu Leu Ala Pro Gly Gly 130 135 140 Asn Ser Met Ala Ser Gly Val Gly Val Gly Ala Gly Leu Gly Ala Gly 145 150 155 160 Val Asn Gln Arg Met Asp Ser Tyr Ala His Met Asn Gly Trp Ser Asn 165 170 175 Gly Ser Tyr Ser Met Met Gln Asp Gln Leu Gly Tyr Pro Gln His Pro 180 185 190 Gly Leu Asn Ala His Gly Ala Ala Gln Met Gln Pro Met His Arg Tyr 195 200 205 Asp Val Ser Ala Leu Gln Tyr Asn Ser Met Thr Ser Ser Gln Thr Tyr 210 215 220 Met Asn Gly Ser Pro Thr Tyr Ser Met Ser Tyr Ser Gln Gln Gly Thr 225 230 235 240 Pro Gly Met Ala Leu Gly Ser Met Gly Ser Val Val Lys Ser Glu Ala 245 250 255 Ser Ser Ser Pro Pro Val Val Thr Ser Ser Ser His Ser Arg Ala Pro 260 265 270 Cys Gln Ala Gly Asp Leu Arg Asp Met Ile Ser Met Tyr Leu Pro Gly 275 280 285 Ala Glu Val Pro Glu Pro Ala Ala Pro Ser Arg Leu His Met Ser Gln 290 295 300 His Tyr Gln Ser Gly Pro Val Pro Gly Thr Ala Ile Asn Gly Thr Leu 305 310 315 320 Pro Leu Ser His Met Ser Gly Gly Ser Ser Gly Gly Ser Ser Gly Ser 325 330 335 Glu Thr Pro Gly Thr Ser Glu Ser Ala Thr Pro Glu Ser Ser Gly Gly 340 345 350 Ser Ser Gly Gly Ser Ser Ser Glu Thr Gly Pro Val Ala Val Asp Pro 355 360 365 Thr Leu Arg Arg Arg Ile Glu Pro His Glu Phe Glu Val Phe Phe Asp 370 375 380 Pro Arg Glu Leu Arg Lys Glu Thr Cys Leu Leu Tyr Glu Ile Asn Trp 385 390 395 400 Gly Gly Arg His Ser Ile Trp Arg His Thr Ser Gln Asn Thr Asn Lys 405 410 415 His Val Glu Val Asn Phe Ile Glu Lys Phe Thr Thr Glu Arg Tyr Phe 420 425 430 Cys Pro Asn Thr Arg Cys Ser Ile Thr Trp Phe Leu Ser Trp Ser Pro 435 440 445 Cys Gly Glu Cys Ser Arg Ala Ile Thr Glu Phe Leu Ser Arg Tyr Pro 450 455 460 His Val Thr Leu Phe Ile Tyr Ile Ala Arg Leu Tyr His His Ala Asp 465 470 475 480 Pro Arg Asn Arg Gln Gly Leu Arg Asp Leu Ile Ser Ser Gly Val Thr 485 490 495 Ile Gln Ile Met Thr Glu Gln Glu Ser Gly Tyr Cys Trp Arg Asn Phe 500 505 510 Val Asn Tyr Ser Pro Ser Asn Glu Ala His Trp Pro Arg Tyr Pro His 515 520 525 Leu Trp Val Arg Leu Tyr Val Leu Glu Leu Tyr Cys Ile Ile Leu Gly 530 535 540 Leu Pro Pro Cys Leu Asn Ile Leu Arg Arg Lys Gln Pro Gln Leu Thr 545 550 555 560 Phe Phe Thr Ile Ala Leu Gln Ser Cys His Tyr Gln Arg Leu Pro Pro 565 570 575 His Ile Leu Trp Ala Thr Gly Leu Lys Ser Gly Ser Glu Thr Pro Gly 580 585 590 Thr Ser Glu Ser Ala Thr Pro Glu Leu Lys Asp Lys Lys Tyr Ser Ile 595 600 605 Gly Leu Ala Ile Gly Thr Asn Ser Val Gly Trp Ala Val Ile Thr Asp 610 615 620 Glu Tyr Lys Val Pro Ser Lys Lys Phe Lys Val Leu Gly Asn Thr Asp 625 630 635 640 Arg His Ser Ile Lys Lys Asn Leu Ile Gly Ala Leu Leu Phe Asp Ser 645 650 655 Gly Glu Thr Ala Glu Ala Thr Arg Leu Lys Arg Thr Ala Arg Arg Arg 660 665 670 Tyr Thr Arg Arg Lys Asn Arg Ile Cys Tyr Leu Gln Glu Ile Phe Ser 675 680 685 Asn Glu Met Ala Lys Val Asp Asp Ser Phe Phe His Arg Leu Glu Glu 690 695 700 Ser Phe Leu Val Glu Glu Asp Lys Lys His Glu Arg His Pro Ile Phe 705 710 715 720 Gly Asn Ile Val Asp Glu Val Ala Tyr His Glu Lys Tyr Pro Thr Ile 725 730 735 Tyr His Leu Arg Lys Lys Leu Val Asp Ser Thr Asp Lys Ala Asp Leu 740 745 750 Arg Leu Ile Tyr Leu Ala Leu Ala His Met Ile Lys Phe Arg Gly His 755 760 765 Phe Leu Ile Glu Gly Asp Leu Asn Pro Asp Asn Ser Asp Val Asp Lys 770 775 780 Leu Phe Ile Gln Leu Val Gln Thr Tyr Asn Gln Leu Phe Glu Glu Asn 785 790 795 800 Pro Ile Asn Ala Ser Gly Val Asp Ala Lys Ala Ile Leu Ser Ala Arg 805 810 815 Leu Ser Lys Ser Arg Arg Leu Glu Asn Leu Ile Ala Gln Leu Pro Gly 820 825 830 Glu Lys Lys Asn Gly Leu Phe Gly Asn Leu Ile Ala Leu Ser Leu Gly 835 840 845 Leu Thr Pro Asn Phe Lys Ser Asn Phe Asp Leu Ala Glu Asp Ala Lys 850 855 860 Leu Gln Leu Ser Lys Asp Thr Tyr Asp Asp Asp Leu Asp Asn Leu Leu 865 870 875 880 Ala Gln Ile Gly Asp Gln Tyr Ala Asp Leu Phe Leu Ala Ala Lys Asn 885 890 895 Leu Ser Asp Ala Ile Leu Leu Ser Asp Ile Leu Arg Val Asn Thr Glu 900 905 910 Ile Thr Lys Ala Pro Leu Ser Ala Ser Met Ile Lys Arg Tyr Asp Glu 915 920 925 His His Gln Asp Leu Thr Leu Leu Lys Ala Leu Val Arg Gln Gln Leu 930 935 940 Pro Glu Lys Tyr Lys Glu Ile Phe Phe Asp Gln Ser Lys Asn Gly Tyr 945 950 955 960 Ala Gly Tyr Ile Asp Gly Gly Ala Ser Gln Glu Glu Phe Tyr Lys Phe 965 970 975 Ile Lys Pro Ile Leu Glu Lys Met Asp Gly Thr Glu Glu Leu Leu Val 980 985 990 Lys Leu Asn Arg Glu Asp Leu Leu Arg Lys Gln Arg Thr Phe Asp Asn 995 1000 1005 Gly Ser Ile Pro His Gln Ile His Leu Gly Glu Leu His Ala Ile Leu 1010 1015 1020 Arg Arg Gln Glu Asp Phe Tyr Pro Phe Leu Lys Asp Asn Arg Glu Lys 1025 1030 1035 1040 Ile Glu Lys Ile Leu Thr Phe Arg Ile Pro Tyr Tyr Val Gly Pro Leu 1045 1050 1055 Ala Arg Gly Asn Ser Arg Phe Ala Trp Met Thr Arg Lys Ser Glu Glu 1060 1065 1070 Thr Ile Thr Pro Trp Asn Phe Glu Glu Val Val Asp Lys Gly Ala Ser 1075 1080 1085 Ala Gln Ser Phe Ile Glu Arg Met Thr Asn Phe Asp Lys Asn Leu Pro 1090 1095 1100 Asn Glu Lys Val Leu Pro Lys His Ser Leu Leu Tyr Glu Tyr Phe Thr 1105 1110 1115 1120 Val Tyr Asn Glu Leu Thr Lys Val Lys Tyr Val Thr Glu Gly Met Arg 1125 1130 1135 Lys Pro Ala Phe Leu Ser Gly Glu Gln Lys Lys Ala Ile Val Asp Leu 1140 1145 1150 Leu Phe Lys Thr Asn Arg Lys Val Thr Val Lys Gln Leu Lys Glu Asp 1155 1160 1165 Tyr Phe Lys Lys Ile Glu Cys Phe Asp Ser Val Glu Ile Ser Gly Val 1170 1175 1180 Glu Asp Arg Phe Asn Ala Ser Leu Gly Thr Tyr His Asp Leu Leu Lys 1185 1190 1195 1200 Ile Ile Lys Asp Lys Asp Phe Leu Asp Asn Glu Glu Asn Glu Asp Ile 1205 1210 1215 Leu Glu Asp Ile Val Leu Thr Leu Thr Leu Phe Glu Asp Arg Glu Met 1220 1225 1230 Ile Glu Glu Arg Leu Lys Thr Tyr Ala His Leu Phe Asp Asp Lys Val 1235 1240 1245 Met Lys Gln Leu Lys Arg Arg Arg Tyr Thr Gly Trp Gly Arg Leu Ser 1250 1255 1260 Arg Lys Leu Ile Asn Gly Ile Arg Asp Lys Gln Ser Gly Lys Thr Ile 1265 1270 1275 1280 Leu Asp Phe Leu Lys Ser Asp Gly Phe Ala Asn Arg Asn Phe Met Gln 1285 1290 1295 Leu Ile His Asp Asp Ser Leu Thr Phe Lys Glu Asp Ile Gln Lys Ala 1300 1305 1310 Gln Val Ser Gly Gln Gly Asp Ser Leu His Glu His Ile Ala Asn Leu 1315 1320 1325 Ala Gly Ser Pro Ala Ile Lys Lys Gly Ile Leu Gln Thr Val Lys Val 1330 1335 1340 Val Asp Glu Leu Val Lys Val Met Gly Arg His Lys Pro Glu Asn Ile 1345 1350 1355 1360 Val Ile Glu Met Ala Arg Glu Asn Gln Thr Thr Gln Lys Gly Gln Lys 1365 1370 1375 Asn Ser Arg Glu Arg Met Lys Arg Ile Glu Glu Gly Ile Lys Glu Leu 1380 1385 1390 Gly Ser Gln Ile Leu Lys Glu His Pro Val Glu Asn Thr Gln Leu Gln 1395 1400 1405 Asn Glu Lys Leu Tyr Leu Tyr Tyr Leu Gln Asn Gly Arg Asp Met Tyr 1410 1415 1420 Val Asp Gln Glu Leu Asp Ile Asn Arg Leu Ser Asp Tyr Asp Val Asp 1425 1430 1435 1440 His Ile Val Pro Gln Ser Phe Leu Lys Asp Asp Ser Ile Asp Asn Lys 1445 1450 1455 Val Leu Thr Arg Ser Asp Lys Asn Arg Gly Lys Ser Asp Asn Val Pro 1460 1465 1470 Ser Glu Glu Val Val Lys Lys Met Lys Asn Tyr Trp Arg Gln Leu Leu 1475 1480 1485 Asn Ala Lys Leu Ile Thr Gln Arg Lys Phe Asp Asn Leu Thr Lys Ala 1490 1495 1500 Glu Arg Gly Gly Leu Ser Glu Leu Asp Lys Ala Gly Phe Ile Lys Arg 1505 1510 1515 1520 Gln Leu Will Glu Thr Arg Gln Ile Thr Lys His Will Ala Gln Ile Leu 1525 1530 1535 Asp Ser Arg With Thr Lys Tyr Asp Glu Asp Lys With Arg 1540 1545 1550 Glu Val Lys Val Ile Thr Leu Lys Ser Lys Leu Val Ser Asp Phe Arg 1555 1560 1565 Lys Asp Phe Gln Phe Tyr Lys Val Arg Glu Ile Asn Asn Tyr His His 1570 1575 1580 Only His Asp Only Tyr Leu Asn Only Val Val Gly Thr Only Leu Ile Lys 1585 1590 1595 1600 Lys Tyr Pro Lys Leu Glu Ser Glu Phe Val Tyr Gly Asp Tyr Lys Val 1605 1610 1615 Tyr Asp Val Arg Lys Met Ile Ala Lys Served as Glu Gln Glu Ile Gly Lys 1620 1625 1630 Ala Thr Ala Lys Tyr Phe Phe Tyr Ser Asn Ile Met Asn Phe Phe Lys 1635 1640 1645 Thr Glu With Thr Leu Ala Asn Gly Glu With Arg Lys Arg Pro Leu 1650 1655 1660 Glu Thr Asn Gly Glu Thr Gly Glu Ile Val Trp Asp Lys Gly Arg Asp 1665 1670 1675 1680 Phe Ala Thr Val Arg Lys Val Leu Ser Met Pro Gln Val Asn Ile Val 1685 1690 1695 Lys Lys Thr Glu Val Gln Thr Gly Gly Phe Ser Lys Glu Ser Ile Leu 1700 1705 1710 Pro Lys Arg Asn Ser Asp Lys Leu Ile Ala Arg Lys Lys Asp Trp Asp 1715 1720 1725 Pro Lys Lys Tyr Gly Gly Phe Asp Ser Pro Thr Val Ala Tyr Ser Val 1730 1735 1740 Leu Val Val Ala Lys Val Glu Lys Gly Lys Ser Lys Lys Leu Lys Ser 1745 1750 1755 1760 Val Lys Glu Leu Leu Gly Ile Thr Ile Met Glu Arg Ser Ser Phe Glu 1765 1770 1775 Lys Asn Pro Ile Asp Phe Leu Glu Ala Lys Gly Tyr Lys Glu Val Lys 1780 1785 1790 Lys Asp Leu Ile Ile Lys Leu Pro Lys Tyr Ser Leu Phe Glu Leu Glu 1795 1800 1805 Asn Gly Arg Lys Arg Met Leu Ala Ser Ala Gly Glu Leu Gln Lys Gly 1810 1815 1820 Asn Glu Leu Ala Leu Pro Ser Lys Tyr Val Asn Phe Leu Tyr Leu Ala 1825 1830 1835 1840 Ser His Tyr Glu Lys Leu Lys Gly Ser Pro Glu Asp Asn Glu Gln Lys 1845 1850 1855 Gln Leu Phe Val Glu Gln His Lys His Tyr Leu Asp Glu Ile Ile Glu 1860 1865 1870 Gln Ile Ser Glu Phe Ser Lys Arg Val Ile Leu Ala Asp Ala Asn Leu 1875 1880 1885 Asp Lys Val Leu Ser Ala Tyr Asn Lys His Arg Asp Lys Pro Ile Arg 1890 1895 1900 Glu Gln Ala Glu Asn Ile Ile His Leu Phe Thr Leu Thr Asn Leu Gly 1905 1910 1915 1920 Ala Pro Ala Ala Phe Lys Tyr Phe Asp Thr Thr Ile Asp Arg Lys Arg 1925 1930 1935 Tyr Thr Ser Thr Lys Glu Val Leu Asp Ala Thr Leu Ile His Gln Ser 1940 1945 1950 Ile Thr Gly Leu Tyr Glu Thr Arg Ile Asp Leu Ser Gln Leu Gly Gly 1955 1960 1965 Asp Lys Arg Pro Ala Ala Thr Lys Lys Ala Gly Gln Ala Lys Lys Lys 1970 1975 1980 Lys Thr Arg Asp Ser Gly Gly Ser Met Phe Gly Glu Ser Trp Lys Lys 1985 1990 1995 2000 His Leu Ser Gly Glu Phe Gly Lys Pro Tyr Phe Ile Lys Leu Met Gly 2005 2010 2015 Phe Val Ala Glu Glu Arg Lys His Tyr Thr Val Tyr Pro Pro Pro His 2020 2025 2030 Gln Val Phe Thr Trp Thr Gln Met Cys Asp Ile Lys Asp Val Lys Val 2035 2040 2045 Val Ile Leu Gly Gln Asp Pro Tyr His Gly Pro Asn Gln Ala His Gly 2050 2055 2060 Leu Cys Phe Ser Val Gln Arg Pro Val Pro Pro Pro Pro Ser Leu Glu 2065 2070 2075 2080 Asn Ile Tyr Lys Glu Leu Ser Thr Asp Ile Glu Asp Phe Val His Pro 2085 2090 2095 Gly His Gly Asp Leu Ser Gly Trp Ala Lys Gln Gly Val Leu Leu Leu 2100 2105 2110 Asn Ala Val Leu Thr Val Arg Ala His Gln Ala Asn Ser His Lys Glu 2115 2120 2125 Arg Gly Trp Glu Gln Phe Thr Asp Ala Val Val Ser Trp Leu Asn Gln 2130 2135 2140 Asn Ser Asn Gly Leu Val Phe Leu Leu Trp Gly Ser Tyr Ala Gln Lys 2145 2150 2155 2160 Lys Gly Ser Ala Ile Asp Arg Lys Arg His His Val Leu Gln Thr Ala 2165 2170 2175 His Pro Ser Pro Leu Ser Val Tyr Arg Gly Phe Phe Gly Cys Arg His 2180 2185 2190 Phe Ser Lys Thr Asn Glu Leu Leu Gln Lys Ser Gly Lys Lys Pro Ile 2195 2200 2205 Asp Trp Lys Glu Leu Ser Gly Gly Ser Pro Lys Lys Lys Arg Lys Val 2210 2215 2220 <210> 4 <211> 6675 <212> DNA <213> Artificial Sequence <400> 4 atgccaaaga agaagaggaa ggttatgtac aacatgatgg agacggagct gaagccgccg 60 ggcccgcagc aaacttcggg gggcggcggc ggcaactcca ccgcggcggc ggccggcggc 120 aaccagaaaa acagccccgga ccgcgtcaag cggcccatga atgccttcat ggtgtggtcc 180 cgcgggcagc ggcgcaagat ggcccaggag aaccccaaga tgcacaactc ggagatcagc 240 aagcgcctgg gcgccgagtg gaaacttttg tcggagacgg agaagcggcc gttcatcgac 300 gaggctaagc ggctgcgagc gctgcacatg aaggagcacc cggattataa ataccggccc 360 cggcggaaaa ccaagacgct catgaagaag gataagtaca cgctgcccgg cgggctgctg 420 gccccggcg gcaatagcat ggcgagcggg gtcggggtgg gcgccggcct gggcgcgggc 480 gtgaaccagc gcatggacag ttacgcgcac atgaacggct ggagcaacgg cagctacagc 540 atgatgcagg accagctggg ctacccgcag cacccgggcc tcaatgcgca cggcgcagcg 600 cagatgcagc ccatgcaccg ctacgacgtg agcgccctgc agtacaactc catgaccagc 660 tcgcagacct acatgaacgg ctcgcccacc tacagcatgt ctactcgca gcagggcacc 720 cctggcatgg ctcttggctc catgggttcg gtggtcaagt ccgaggccag ctccagcccc 780 cctgtggtta cctctctc ccactccagg gcgccctgcc aggccgggga cctccgggac 840 atgatcagca tgtatctccc cggcgccgag gtgccggaac ccgccgcccc cagcagactt 900 cacatgtccc agcactacca gagcggcccg gtgcccggca cggccattaa cggcacactg 960 cccctctcac acatgagcgg aggatctagc ggaggatcaa gcggaagcga gactcctgga 1020 accagcgaaa gcgcaacccc agaaagcagc ggaggaagta gcggaggaag ctcatcggag 1080 accggccctg ttgctgttga ccccaccctg cggcggagaa tcgagccaca cgagttcgag 1140 gtgttcttcg acccaaggga gctccgcaag gagacgtgcc tcctgtacga gatcaactgg 1200 ggcggcaggc actccatctg gaggcacacc agccaaaaca ccaacaagca cgtggaggtc 1260 aacttcatcg agaagttcac caccgagagg tacttctgcc caaacacccg ctgctccatc 1320 acctggttcc tgtcctggag cccatgcggc gagtgctcca gggccatcac cgagttcctc 1380 agccgctacc cacacgtcac cctgttcatc tacatcgcca ggctctacca ccacgccgac 1440 ccaaggaaca ggcagggcct ccgcgacctg atctccagcg gcgtgaccat ccaaatcatg 1500 accgagcagg agtccggcta ctgctggagg aacttcgtca actactcccc aagcaacgag 1560 gcccactggc caaggtaccc acacctctgg gtgcgcctct acgtgctcga gctgtactgc 1620 atcatcctcg gcctgccacc atgcctcaac atcctgaggc gcaagcaacc acagctgacc 1680 ttcttcacca tcgccctcca aagctgccac taccagaggc tcccaccaca catcctgtgg 1740 gctaccggcc tcaagtccgg cagcgagacg ccaggcacct ccgagagcgc tacgcctgaa 1800 cttaaggaca agaagtactc gatcggcctc gccatcggga cgaactcagt tggctgggcc 1860 gtgatcaccg acgagtacaa ggtgccctct aagaagttca aggtcctggg gaacaccgac 1920 cgccattcca tcaagaagaa cctcatcggc gctctcctgt tcgacagcgg ggagaccgct 1980 gaggctacga ggctcaagag aaccgctagg cgccggtaca cgagaaggaa gaacaggatc 2040 tgctacctcc aagagatttt ctccaacgag atggccaagg ttgacgattc attcttccac 2100 cgcctggagg agtctttcct cgtggaggag gataagaagc acgagcggca tcccatcttc 2160 ggcaacatcg tggacgaggt tgcctaccac gagaagtacc ctacgatcta ccatctgcgg 2220 aagaagctcg tggactccac cgataaggcg gacctcagac tgatctacct cgctctggcc 2280 cacatgatca agttccgcgg ccattcctg atcgaggggg atctcaaccc agacacagc 2340 gatgttgaca agctgttcat cacactcgtg cagacctaca accaacctt cgaggagaac 2400 ccgatcaacg cctctggcgt ggacgcgaag gctatcctgt ccgcgaggct ctcgaagtcc 2460 aggaggctgg agaacctgat cgctcagctc ccaggcgaga agagaacgg cctgttcggg 2520 aactcatcg ctctcagcct gggctcacc ccgaacttca agtcgaactt cgatctcgct 2580 gaggacgcca agctgcaact ctccaaggac acctacgacg atgacctcga taacctccctg 2640 gccagatcg gcgatcaata cgcggacctg ttcctcgctg ccagaacct gtcggacgcc 2700 atcctcctgt cagatatcct ccgcgtgaac accgagatca cgaaggctcc actctctgcc 2760 tccatgatca agcgctacga cgagcaccat caggatctga ccctcctgaa ggcgctggtc 2820 cgccaacagc tcccggagaa gtacaaggag atttctctcg atcagtcgaa gaacggctac 2880 gctgggtaca tcgacggcgg ggcctcaca gaggagttct acagttcat caagccaatc 2940 ctggagaga tggacggcac ggaggagctc ctggtgaagc tcacaggga ggaccctcctg 3000 cggaagcaga gaaccttcga taacggcagc atccccacc aaatccatct cggggagctg 3060 cacgccatcc tgagaggca agaggacttc taccctttcc tcaggataa ccgggagaag 3120 atcgagaaga tcctgacctt cagaatccca tactacgtcg gccctctcgc gcgggggaac 3180 tcaagattcg cttggatgac ccgcaagtct gaggagacca tcacgccgtg gaacttcgag 3240 gaggtggtgg acaagggcgc tagcgctcag tcgttcatcg agaggatgac caacttcgac 3300 aagaacctgc ccaacgagaa gtgctccct aagcactcgc tcctgtacga gtacttcacc 3360 gtctacaacg agctcacgaa gtgaagtac gtcaccgagg gcatgcgcaa gccagcgttc 3420 ctgtccgggg agcagagaa ggctatcgtg gaccctctgt tcagaccaa ccggaggtc 3480 acggttaagc aactcagga ggactacttc aagagatcg agtgcttcga ttcggtcgag 3540 atcagcggcg tgaggaccg cttcaacgcc agcctcggga cctaccacga tctcctgaag 3600 atcatcagg attaggactt cctggacaac gaggagaacg aggatatcct ggaggacatc 3660 gtgctgaccc tcacgctgtt cgaggacagg gagatgatcg aggagcgcct gaagacgtac 3720 gcccatctct tcgatgacaa ggtcatgaag caactcaagc gccggagata caccggctgg 3780 gggaggctgt cccgcaagct catcaacggc atccgggaca agcagtccgg gaagaccatc 3840 ctcgacttcc tcaagagcga tggcttcgcc aacaggaact tcatgcaact gatccacgat 3900 gacagcctca ccttcaagga ggatatccaa aaggctcaag tgagcggcca gggggactcg 3960 ctgcaccgagc atatcgcgaa cctcgctggc tcccccgga tcaagaaggg catcctccag 4020 accgtgaagg ttgtggacga gctcgtgaag gtcatgggcc ggcacaagcc tgagaacaatc 4080 gtcatcgaga tggccagaga gaaccaaacc acgcagaagg ggcaaaagaa ctctagggag 4140 cgcatgaagc gcatcgagga gggcatcaag gagctggggt cccaaatcct caaggagcac 4200 ccagtggaga acacccaact gcagaacgag aagctctacc tgtactacct ccagaacggc 4260 agggatatgt acgtggacca agagctggat atcaaccgcc tcagcgatta cgacgtcgat 4320 catatcgttc cccagtcttt cctgaaggat gactccatcg acaacaaggt cctcaccagg 4380 4440 aagaactact ggaggcagct cctgaacgcc aagctgatca cgcaaaggaa gttcgacaac 4500 ctcaccaagg ctgagagagg cgggctctca gagctggaca aggccggctt catcaagcgg 4560 cagctggtcg agaccagaca aatcacgaag cacgttgcgc aaatcctcga ctctcggatg 4620 aacacgaagt acgatgagaa cgacaagctg atcagggagg ttaaggtgat caccctgaag 4680 tctaagctcg tctccgactt caggaaggat ttccagttct acaaggttcg cgagatcaac 4740 aactaccacc atgcccatga cgcttacctc aacgctgtgg tcggcaccgc tctgatcaag 4800 aagtacccaa agctggagtc cgagttcgtg tacggggact acaaggttta cgatgtgcgc 4860 aagatgatcg ccaagtcgga gcaagagatc ggcaaggcta ccgccaagta cttcttctac 4920 tcaaacatca tgaacttctt caagaccgag atcacgctgg ccaacggcga gatccggaag 4980 agaccgctca tcgagaccaa cggcgagacg ggggagatcg tgtgggacaa gggcagggat 5040 ttcgcgaccg tccgcaaggt tctctccatg ccccaggtga acatcgtcaa gaagaccgag 5100 gtccaaacgg gcgggttctc aaaggagtct atcctgccta agcggaacag cgacaagctc 5160 atcgccagaa agaggactg ggacccaaag aagtacggcg ggttcgacag ccctaccgtg 5220 gcctactcgg tcctggttgt ggcgaaggtt gagaagggca agtccaagaa gctcaagagc 5280 gtgaaggagc tcctggggat caccatcatg gagagggtcca gcttcgagaa gaacccaatc 5340 gacttcctgg aggccaaggg ctacaaggag gtgaagaagg acctgatcat caagctccccg 5400 5460 ctccagaagg ggaacgagct cgcgctgcca agcaagtacg tgaacttcct ctacctggct 5520 tcccactacg agaagctcaa gggcagcccg gaggaacg agcaaaagca gctgttcgtc 5580 gagcagcaca agcattacct cgacgagatc atcgagcaaa tctccgagtt cagcaagcgc 5640 gtgatcctcg ccgacgcgaa cctggataag gtcctctccg cctacaacaa gcaccgggac 5700 aagcccatca gagagcaagc ggagaacatc atccatctct tcaccctgac gaacctcggc 5760 gctcctgctg ctttcaagta cttcgacacc acgatcgatc ggaagagata cacctccacg 5820 aaggaggtcc tggacgcgac cctcatccac cagtcgatca ccggcctgta cgagacgagg 5880 atcgacctct cacaactcgg cggggataag agacccgcag caaccaagaa ggcagggcaa 5940 gcaaagaaga agaagacgcg tgactccggc ggcagcatgt ttggagagag ctggaagaag 6000 cacctcagcg gggagttcgg gaaaccgtat tttatcaagc taatgggatt tgttgcagaa 6060 gaaagaaagc attacactgt ttatccaccc ccacaccaag tcttcacctg gacccagatg 6120 tgtgacataa aagatgtgaa ggttgtcatc ctgggacagg atccatatca tggacctaat 6180 caagctcacg ggctctgctt tagtgttcaa aggcctgttc cgcctccgcc cagtttggag 6240 aacatttata aagagttgtc tacagacata gaggattttg ttcatcctgg ccatggagat 6300 ttatctgggt gggccaagca aggtgttctc cttctcaacg ctgtcctcac ggttcgtgcc 6360 catcaagcca actctcataa ggagcgaggc tgggagcagt tcactgatgc agttgtgtcc 6420 tggctaaatc agaactcgaa tggccttgtt ttcttgctct ggggctctta tgctcagaag 6480 aagggcagtg ccattgatag gaagcggcac catgtactac agacggctca tccctcccct 6540 ttgtcagtgt atagagggtt ctttggatgt agacactttt caaagaccaa tgagctgctg 6600 cagaagtctg gcaagaagcc cattgactgg aaggagctgt cgggggggag cccaaagaag 6660 aagcggaagg tgtag 6675 <210> 5 <211> 204 <212> DNA <213> Artificial Sequence <400> 5 ccctcctacg ttgcggtcac acccttctcc cttcggggag acaacgacgg cggtggcggg 60 agcttctcca cggccgacca gctggagatg gtgaccgagc tgctgggagg agacatggtg 120 aaccagagtt tcatctgcga cccggacgac gagaccttca tcaaaaacat catcatccag 180 gactgtatgt ggagcggctt ctcg 204 <210> 6 <211> 5871 <212> DNA <213> Artificial Sequence <400> 6 atgaaacgga cagccgacgg aagcgagttc gagtcaccaa agaagaagcg gaaagtctcc 60 tcagagactg ggcctgtcgc cgtcgatcca accctgcgcc gccggattga acctcacgag 120 tttgaagtgt tctttgaccc ccgggagctg agaaaggaga catgcctgct gtacgagatc 180 aactggggag gcaggcactc catctggagg cacacctctc agaacacaaa taagcacgtg 240 gaggtgaact tcatcgagaa gtttaccaca gagcggtact tctgccccaa taccagatgt 300 agcatcacat ggtttctgag ctggtcccct tgcggagagt gtagcagggc catcaccgag 360 ttcctgtcca gatatccaca cgtgacactg tttatctaca tcgccaggct gtatcaccac 420 gcagacccaa ggaataggca gggcctgcgc gatctgatca gctccggcgt gaccatccag 480 atcatgacag agcaggagtc cggctactgc tggcggaact tcgtgaatta ttctcctagc 540 aacgaggccc actggcctag gtacccacac ctgtgggtgc gcctgtacgt gctggagctg 600 tattgcatca tcctgggcct gcccccttgt ctgaatatcc tgcggagaaa gcagccccag 660 ctgaccttct ttacaatcgc cctgcagtct tgtcactatc agaggctgcc accccacatc 720 ctgtgggcca caggcctgaa gtctggagga tctagcggag gatcctctgg cagcgagaca 780 ccaggaacaa gcgagtcagc aacaccagag agcagtggcg gcagcagcgg cggcagccgc 840 gtcaagcggc ccatgaatgc cttcatggtg tggtcccgcg ggcagcggcg caagatggcc 900 caggagaacc ccaagatgca caactcggag atcagcaagc gcctgggcgc cgagtggaaa 960 cttttgtcgg agacggagaa gcggccgttc atcgacgagg ctaagcggct gcgagcgctg 1020 cacatgaagg agcacccgga tattaac cggaggcggag cacatgacgg aggatcaggc 1080 ggaagcgaga ctcctggaac cagcgaaagc gcaccccag aaagcagcgg aggagtagc 1140 ggaggaagcg acagaagta cagcatcggc ctggccatcg gcaccactc tgtgggctgg 1200 gccgtgatca ccgacgagta caggtgccc agcaagaat tcaggtgct gggcacacc 1260 gaccggcaca gcatcaagaa gaacctgatc ggagccctgc tgttcgacag cggcgaaaca 1320 gccgaggcca cccggctgaa gagaaccgcc agaagagat acaccagacg gagaaccgg 1380 atctgctatc tgcaagagat cttcagcac gagatggcca aggtggacga cagctcttc 1440 cacagactgg agagtcctt cctggtggaa gaggataaga agcacgagcg gcacccatc 1500 ttcggcaaca tcgtggacga ggtggcctac cacgagaagt acccaccat ctaccacctg 1560 agaaagaaac tggtggacag caccgacaag gccgacctgc ggctgatcta tctggccctg 1620 gcccacatga tcaagttccg gggccactc ctgatcgagg gcgacctgaa cccgacac 1680 agcgacgtgg acaagctgtt catccagctg gtgcagacct acaaccagct gttcgaggaa 1740 aaccccatca acgccagcgg cgtggacgcc aaggccatcc tgtctgccag actgagcaag 1800 agcagacggc tggaaaatct gatcgcccag ctgcccggcg agaagaagaa tggcctgttc 1860 ggaaacctga ttgccctgag cctgggcctg acccccaact tcaagagcaa cttcgacctg 1920 gccgaggatg ccaaactgca gctgagcaag gacacctacg aggacgacct ggacaacctg 1980 ctggcccaga tcggcgacca gtacgccgac ctgtttctgg ccgccaagaa cctgtccgac 2040 gccatcctgc tgagcgacat cctgagagtg aacaccgaga tcaccaaggc ccccctgagc 2100 gcctctatga tcaagagata cgaccgagcac caccaggacc tgaccctgct gaaagctctc 2160 gtgcggcagc agctgcctga gaagtacaaa gagattttct tcgaccagag caagaacggc 2220 tacgccggct acattgacgg cggagccagc caggaagagt tctacaagtt catcaagccc 2280 atcctggaaa agatggacgg caccgaggaa ctgctcgtga agctgaacag agaggacctg 2340 ctgcggaagc agcggacctt cgacaacggc agcatcccccc accagatcca cctgggagag 2400 ctgcacgcca ttctgcggcg gcaggaagat ttttaccat tcctgaagga siaccgggaa 2460 aagatcgaga agatcctgac cttccgcatc ccctactacg tggccctct ggccagggga 2520 aacagcagat tcgcctggat gaccagaaag agcgagaaa ccatcacccc ctggaacttc 2580 gaggaagtgg tggacaaggg cgctccgcc cagagcttca tcgagcggat gaccaacttc 2640 gataagaacc tgccaacga gaggtgctg cccaagcaca gcctgctgta cgagtacttc 2700 accgtgtata acgagctgac caagtgaaa tacgtgaccg agggaatgag aaagcccgcc 2760 ttcctgagcg gcgagcagaa aaggccatc gtggacctgc tgttcaagac caaccggaaa 2820 gtgaccgtga agcagctgaa agaggactac ttcaagaaaa tcgagtgctt cgactccgtg 2880 gaaatctccg gcgtggaaga tcggttcac gcctccctgg gcacatacca cgatctgctg 2940 aaaatttaca aggaagga cttcctggac agaggaaa aggaggacat tctggagat 3000 atcgtgctga ccctgacact gttgaggac agagagatga tcgaggaacg gctgaaaacc 3060 tatgcccacc tgttcgacga caagtgatg aagcagctga agcggcggag atacaccggc 3120 tggggcaggc tgagccgaa gctgatcaac ggcatccggg acagcagtc cggcagaca 3180 atcctggatt tcctgaagtc cgacggctc gccacagaa acttcatgca gctgatccac 3240 gacgacagcc tgacctta agaggacatc cagaagccc aggtccgg ccaggcgat 3300 agcctgcacg agcacattgc caatctggcc ggcagccccg ccattaagaa gggcatcctg 3360 cagacagtga aggtggtgga cgagctcgtg aaagtgatgg gccggcacaa gcccgagaac 3420 atcgtgatcg aaatggccag aggaaccag accaccaga agggacaga gacacccgc 3480 gagagaatga agcggatcga agagggcatc aaagagctgg gcagccagat cctgaaagaa 3540 caccccgtgg aaaacacca gctgcagaac gagaagctgt acctgtacta cctgcagaat 3600 gggcgggata tgtacgtgga ccaggactg gatacacc ggctgtccga ctacgatgtg 3660 gaccatatcg tgcctcagag ctttctgaag gacgactcca tcgacaaca ggtgctgacc 3720 agaagcgaca agaaccgggg caagcgac aacgtgccct ccgaagaggt cgtgaagaag 3780 atgaagaact actggcggca gctgctgaac gccaagctga tacccagag aaagttcgac 3840 aatctgacca aggccgagag aggcggcctg agcgaactgg ataaggccgg cttcatcaag 3900 agacagctgg tggaaacccg gcagatcaca aagcacgtgg cacagatcct ggactcccgg 3960 atgaacacta agtacgacga gaatgacaag ctgatccggg aagtgaaagt gatcaccctg 4020 aagtccaagc tggtgtccga tttccggaag gatttccagt tttacaaagt gcgcgagatc 4080 aacaactacc accacgccca cgacgcctac ctgaacgccg tcgtgggaac cgccctgatc 4140 aaaaagtacc ctaagctgga aagcgagttc gtgtacggcg actacaaggt gtacgacgtg 4200 cggaagatga tcgccaagag cgagcaggaa atcggcaagg ctaccgccaa gtacttcttc 4260 tacagcaaca tcatgaactt tttcaagacc gagattaccc tggccaacgg cgagatccgg 4320 aagcggcctc tgatcgagac aaacggcgaa accggggaga tcgtgtggga taagggccgg 4380 gattttgcca ccgtgcggaa agtgctgagc atgccccaag tgaatatcgt gaaaaagacc 4440 gaggtgcaga caggcggctt cagcaaagag tctatcctgc ccaagaggaa cagcgataag 4500 ctgatcgcca gaaagaagga ctgggaccct aagaagtacg gcggcttcga cagccccacc 4560 gtggcctatt ctgtgctggt ggtggccaaa gtggaaaagg gcaagtccaa gaaactgaag 4620 agtgtgaaag agctgctggg gatcaccatc atggaaagaa gcagcttcga gaagaatccc 4680 atcgactttc tggaagccaa gggctacaaa gaagtgaaaa aggacctgat catcaagctg 4740 cctaagtact ccctgttcga gctggaaaac ggccggaaga gaatgctggc ctctgccggc 4800 gaactgcaga agggaaacga actggccctg ccctccaaat atgtgaactt cctgtacctg 4860 gccagccact atgagaagct gaagggctcc cccgaggata atgagcagaa acagctgttt 4920 gtggaacagc acaagcacta cctggacgag atcatcgagc agatcagcga gttctccaag 4980 agagtgatcc tggccgacgc taatctggac aaagtgctgt ccgcctacaa caagcaccgg 5040 gataagccca tcagagagca ggccgagaat atcatccacc tgtttaccct gaccaatctg 5100 ggagcccctg ccgccttcaa gtactttgac accaccatcg accggaagag gtacaccagc 5160 accaaagagg tgctggacgc caccctgatc caccagagca tcaccggcct gtacgagaca 5220 cggatcgacc tgtctcagct gggaggtgac agcggcggga gcggcgggag cggggggc 5280 actaatctga gcgacatcat tgagaaggag actgggaaac agctggtcat tcaggagtcc 5340 atcctgatgc tgcctgagga ggtggaggaa gtgatcggca acaagccaga gtctgacatc 5400 ctggtgcaca ccgcctacga cgagtccaca gatgagaatg tgatgctgct gacctctgac 5460 gcccccgagt ataagccttg ggccctggtc atccaggatt ctaacggcga gaataagatc 5520 aagatgctga gcggaggatc cggaggatct ggaggcagca ccaacctgtc tgacatcatc 5580 gagaaggaga caggcaagca gctggtcatc caggagagca tcctgatgct gcccgaagaa 5640 gtcgaagaag tgatcggaaa caagcctgag agcgatatcc tggtccatac cgcctacgac 5700 gagagtaccg acgaaaatgt gatgctgctg acatccgacg ccccagagta taagccctgg 5760 gctctggtca tccaggattc caacggagag aacaaaatca aaatgctgtc tggcggctca 5820 aaaagaaccg ccgacggcag cgaattcgag cccaagaaga agaggaaagt c 5871 <210> 7 <211> 6006 <212> DNA <213> Artificial Sequence <400> 7 atgaaacgga cagccgacgg aagcgagttc gagtcaccaa agaagaagcg gaaagtctcc 60 tcagagactg ggcctgtcgc cgtcgatcca accctgcgcc gccggattga acctcacgag 120 tttgaagtgt tctttgaccc ccgggagctg agaaaggaga catgcctgct gtacgagatc 180 aactggggag gcaggcactc catctggagg cacacctctc agaacacaaa taagcacgtg 240 gaggtgaact tcatcgagaa gtttaccaca gagcggtact tctgccccaa taccagatgt 300 agcatcacat ggtttctgag ctggtcccct tgcggagagt gtagcagggc catcaccgag 360 ttcctgtcca gatatccaca cgtgacactg tttatctaca tcgccaggct gtatcaccac 420 gcagacccaa ggaataggca gggcctgcgc gatctgatca gctccggcgt gaccatccag 480 atcatgacag agcaggagtc cggctactgc tggcggaact tcgtgaatta ttctcctagc 540 aacgaggccc actggcctag gtacccacac ctgtgggtgc gcctgtacgt gctggagctg 600 tattgcatca tcctgggcct gcccccttgt ctgaatatcc tgcggagaaa gcagccccag 660 ctgaccttct ttacaatcgc cctgcagtct tgtcactatc agaggctgcc accccacatc 720 ctgtgggcca caggcctgaa gtctggagga tctagcggag gatcctctgg cagcgagaca 780 ccaggaacaa gcgagtcagc aacaccagag agcagtggcg gcagcagcgg cggcagcgac 840 gtgagcgccc tgcagtacaa ctccatgacc agctcgcaga cctacatgaa cggctcgccc 900 acctacagca tgtcctactc gcagcagggc acccctggca tggctcttgg ctccatgggt 960 tcggtggtca agtccgaggc cagctccagc ccccctgtgg ttacctcttc ctcccactcc 1020 agggcgccct gccaggccgg ggacctccgg gacatgatca gcatgtatct ccccggcgcc 1080 gaggtgccgg aacccgccgc ccccagcaga cttcacatgt cccagcacta ccagagcggc 1140 ccggtgcccg gcacggccat taacggcaca ctgcccctct cacacatgag cggaggatct 1200 agcggaggat caagcggaag cgagactcct ggaaccagcg aaagcgcaac cccagaaagc 1260 agcggaggaa gtagcggagg aagcgacaag aagtacagca tcggcctggc catcggcacc 1320 aactctgtgg gctgggccgt gatcaccgac gagtacaagg tgcccagcaa gaaattcaag 1380 gtgctgggca acaccgaccg gcacagcatc aagaagaacc tgatcggagc cctgctgttc 1440 gacagcggcg aaacagccga ggccacccgg ctgaagagaa ccgccagaag aagatacacc 1500 agacggaaga accggatctg ctatctgcaa gagatcttca gcaacgagat ggccaaggtg 1560 gacgacagct tcttccacag actggaagag tccttcctgg tggaagagga taagaagcac 1620 gagcggcacc ccatcttcgg caacatcgtg gacgaggtgg cctaccacga gaagtacccc 1680 accatctacc acctgagaaa gaaactggtg gacagcaccg acaaggccga cctgcggctg 1740 atctatctgg ccctggccca catgatcaag ttccggggcc acttcctgat cgagggcgac 1800 ctgaaccccg acaacagcga cgtggacaag ctgttcatcc agctggtgca gacctacaac 1860 cagctgttcg aggaaaaccc catcaacgcc agcggcgtgg acgccaaggc catcctgtct 1920 gccagactga gcaagagcag acggctggaa aatctgatcg cccagctgcc cggcgagaag 1980 aagaatggcc tgttcggaaa cctgattgcc ctgagcctgg gcctgacccc caacttcaag 2040 agcaacttcg acctggccga ggatgccaaa ctgcagctga gcaaggacac ctacgacgac 2100 gacctggaca acctgctggc ccagatcggc gaccagtacg ccgacctgtt tctggccgcc 2160 aagaacctgt ccgacgccat cctgctgagc gacatcctga gagtgaacac cgagatcacc 2220 aaggcccccc tgagcgcctc tatgatcaag agatacgacg agcaccacca ggacctgacc 2280 ctgctgaaag ctctcgtgcg gcagcagctg cctgagaagt acaaagagat tttcttcgac 2340 cagagcaaga acggctacgc cggctacatt gacggcggag ccagccagga agagttctac 2400 aagttcatca agcccatcct ggaaaagatg gacggcaccg aggaactgct cgtgaagctg 2460 aacagagagg acctgctgcg gaagcagcgg accttcgaca acggcagcat cccccaccag 2520 atccacctgg gagagctgca cgccattctg cggcggcagg aagattttta cccattcctg 2580 aaggacaacc gggaaaagat cgagaagatc ctgaccttcc gcatccccta ctacgtgggc 2640 cctctggcca ggggaaacag cagattcgcc tggatgacca gaaagagcga ggaaaccatc 2700 accccctgga acttcgagga agtggtggac aagggcgctt ccgcccagag cttcatcgag 2760 cggatgacca acttcgataa gaacctgccc aacgagaagg tgctgcccaa gcacagcctg 2820 ctgtacgagt acttcaccgt gtataacgag ctgaccaaag tgaaatacgt gaccgaggga 2880 atgagaaagc ccgccttcct gagcggcgag cagaaaagg ccatcgtgga cctgctgttc 2940 aagaccaacc ggaaagtgac cgtgaagcag ctgaaagagg actactca gaaaatcgag 3000 tgcttcgact ccgtggaat ctccggcgtg gaagatcggt tcaacgcctc cctgggcaca 3060 taccacgatc tgctgaaat tatchcaggac aaggacttcc tggacaatga ggaaaacgag 3120 gatattctgg aagatatcgt gctgaccctg acactgttg aggacagaga gatgatcgag 3180 gaacggctga aaacctagc ccacctgttc gacgacaag tgatgaagca gctgaagcgg 3240 cggagataca ccggctgggg caggctgagc cggaagctga tcaacggcat ccgggacaag 3300 cagtccggca agacaatcct ggatttcctg aagtccgacg gctcgccaa cagaaacttc 3360 atgcagctga tccacgacga cagcctgacc ttaagagg acatccagaa agcccaggtg 3420 tccggccagg gcgatagcct gcacgagcac attgccaatc tggccggcag ccccgccatt 3480 aagaagggca tcctgcagac agtgaaggtg gtggacgagc tcgtgaagt gatggggccgg 3540 cacaagcccg agaacatcgt gatcgaaatg gccagagaga accagaccac ccagaaggga 3600 3660. gccgcgagag aatgaagcgg atcgaagagg gcatcaaaga gctgggcagc cagatcctga aagaacaccc cgtggaaaac acccagctgc agaacgaga gctgtacctg tactacctgc agaatgggcg ggatatgtac gtggaccagg aactggacat caaccggctg tccgactacg atgtggacca tatcgtgcct cagagctttc tgaaggacga ctccatcgac aacaaggtgc tgaccagaag cgacaagaac cggggcaaga gcgacaacgt gccctccgaa gaggtcgtga agagatga gaactactgg cggcagctgc tgaacgccaa gctgattacc cagagaagt tcgacaatct gaccaaggcc gagagaggcg gcctgagcga actggataag gccggcttca tcaagagaca gctggtggaa acccggcaga tcacaaagca cgtggcacag atcctggact cccggatgaa cactaagtac gacgagaatg acaagctgat ccgggaagtg aaagtgatca ccctgaagtc caagctggtg tccgatttcc ggaggattt ccagttttac 4200. 4260. aaagtgcgcg agatcaaca ctaccaccac gcccacgacg cctacctgaa cgccgtcgtg 4320. ggaccgccc tgatcaaaaa gtaccctaag ctggaaagcg agttcgtgta cggcgactac aaggtgtacg acgtgcggaa gatgatcgcc aagagcgagc aggaatcgg caagctacc 4380 gccaagtact tctctacag gccacatcatg aacttttca agaccgagat taccctggcc 4440 aacggcgaga tccggaagcg gcctctgatc gagacaacg gcgaaaccgg ggagatcgtg 4500 tgggatagg gccgggatt tgccaccgtg cggaagtgc tgagcatgcc ccaagtgaat 4560 atcgtgaaaa agaccgaggt gcagacaggc ggctcagca agagtctat cctgcccaag 4620 aggacagcg ataagctgat cgccagaaag aaggactggg accctaagaa gtacggcggc 4680 ttcgacagcc ccaccgtggc ctattctgtg ctgtggtgg ccaagtgga aaagggcaag 4740 tccaagaac tgaagagtgt gaagagctg ctggggatca ccatcatgga aagaagcagc 4800 ttcgagaga atcccatcga ctttctggaa gccaagggct aagaagt gaaaaggac 4860 ctgatcatca agctgcctaa gtactccctg ttcgagctgg aaacggccg gagagaatg 4920 ctggcctctg ccggcgaact gcagaaggga aacgaactgg ccctgccctc caatatgtg 4980 aacttcctgt acctggccag ccactgag aagctgaagg gctcccccga ggataatgag 5040 cagaaacagc tgtttgtgga cactacctgg cactacctgg cgagcatc agcgagttct ccaagagagt gatcctggcc gacgctaatc tggacaaagt gctgtccgcc 5220. accgggataa gcccatcaga gagcaggccg agaatcat ccacctgttt accctgacca atctggggagc ccctgccgcc ttcaagtact ttgacaccac catcgaccgg aagaggtaca ccagcaccaa agaggtgctg gacgccaccc tgatccacca gagcatcacc ggcctgtacg agacacggat cgacctgtct cagctgggag gtgacagcgg cgggagcggc 5400 gggagcgggg ggagcactaa tctgagcgac atcattgaga aggagactgg gaaacagctg gtcattcagg agtccatcct gatgctgcct gaggaggtgg aggaagtgat cggcaacaag 5520 ccagagtctg acatcctggt gcacaccgcc tacgacgagt ccacagatga gaatgtgatg ctgctgacct ctgacgcccc cgagtaag ccttgggccc tggtcatcca ggattctaac 5640. ggcgagaata agatcaagat gctgagcgga ggatccggag gatctggagg cagcaccaac ctgtctgaca tcatcgaga ggagacaggc aagcagctgg tcatccagga gagcatcctg atgctgcccg aagaagtcga agaagtgatc ggaaacaagc ctgagagcga tatcctggtc 5820 cataccgcct acgacgagag taccgacgaa aatgtgatgc tgctgacatc cgacgcccca 5880 gagtataagc cctgggctct ggtcatccag gattccaacg gagagaacaa aatcaaaatg 5940 ctgtctggcg gctcaaaaag aaccgccgac ggcagcgaat tcgagcccaa gaagaagagg 6000 aaagtc 6006 <210> 8 <211> 6072 <212> DNA <213> Artificial Sequence <400> 8 atgccaaaga agaagaggaa ggttgacgtg agcgccctgc agtacaactc catgaccagc 60 tcgcagacct acatgaacgg ctcgcccacc tacagcatgt cctactcgca gcagggcacc 120 cctggcatgg ctcttggctc catgggttcg gtggtcaagt ccgaggccag ctccagcccc 180 cctgtggtta cctcttcctc ccactccagg gcgccctgcc aggccgggga cctccgggac 240 atgatcagca tgtatctccc cggcgccgag gtgccggaac ccgccgcccc cagcagactt 300 cacatgtccc agcactacca gagcggcccg gtgcccggca cggccattaa cggcacactg 360 cccctctcac acatgagcgg aggatctagc ggaggatcaa gcggaagcga gactcctgga 420 accagcgaaa gcgcaacccc agaaagcagc ggaggaagta gcggaggaag ctcatcggag 480 accggccctg ttgctgttga ccccaccctg cggcggagaa tcgagccaca cgagttcgag 540 gtgttcttcg acccaaggga gctccgcaag gagacgtgcc tcctgtacga gatcaactgg 600 ggcggcaggc actccatctg gaggcacacc agccaaaaca ccaacaagca cgtggaggtc 660 aacttcatcg agaagttcac caccgagagg tacttctgcc caaacacccg ctgctccatc 720 acctggttcc tgtcctggag cccatgcggc gagtgctcca gggccatcac cgagttcctc 780 agccgctacc cacacgtcac cctgttcatc tacatcgcca ggctctacca ccacgccgac 840 ccaaggaaca ggcagggcct ccgcgacctg atctccagcg gcgtgaccat ccaaatcatg 900 accgagcagg agtccggcta ctgctggagg aacttcgtca actactcccc aagcaacgag 960 gcccactggc caaggtaccc acacctctgg gtgcgcctct acgtgctcga gctgtactgc 1020 atcatcctcg gcctgccacc atgcctcaac atcctgaggc gcaagcaacc acagctgacc 1080 ttcttcacca tcgccctcca aagctgccac taccagaggc tcccaccaca catcctgtgg 1140 gctaccggcc tcaagtccgg cagcgagacg ccaggcacct ccgagagcgc tacgcctgaa 1200 cttaaggaca agaagtactc gatcggcctc gccatcggga cgaactcagt tggctgggcc 1260 gtgatcaccg acgagtacaa ggtgccctct aagaagttca aggtcctggg gaacaccgac 1320 cgccattcca tcaagaagaa cctcatcggc gctctcctgt tcgacagcgg ggagaccgct 1380 gaggctacga ggctcaagag aaccgctagg cgccggtaca cgagaaggaa gaacaggatc 1440 tgctacctcc aagagatttt ctccaacgag atggccaagg ttgacgattc attcttccac 1500 cgcctggagg agtctttcct cgtggaggag gataagaagc acgagcggca tcccatcttc 1560 ggcaacatcg tggacgaggt tgcctaccac gagaagtacc ctacgatcta ccatctgcgg 1620 aagaagctcg tggactccac cgataaggcg gacctcagac tgatctacct cgctctggcc 1680 cacatgatca agttccgcgg ccatttcctg atcgaggggg atctcaaccc agacaacagc 1740 gatgttgaca agctgttcat ccaactcgtg cagacctaca accaactctt cgaggagaac 1800 ccgatcaacg cctctggcgt ggcgcgaag gctacctgt ccgcgaggct ctcgaagtcc 1860 aggaggctgg agaacctgat cgctcagctc ccaggcgaga agagaacgg cctgttcggg 1920 aactcatcg ctctcagcct ggggctcacc ccgaacttca agtcgaactt cgatctcgct 1980 gaggacgcca agctgcact ctccaaggac acctacgacg atgacctcga taacctccctg 2040 gcccagatcg gcgatcaata cgcggacctg ttcctcgctg ccagaacct gtcggacgcc 2100 atcctcctgt cagatatcct ccgcgtgaac accgagatca cgaaggctcc actctctgcc 2160 tccatgatca agcgctacga cgagcaccat caggatctga ccctcctgaa ggcgctggtc 2220 cgccaacagc tcccggagaa gtacaaggag atttctctcg atcagtcgaa gaacggctac 2280 gctgggtaca tcgacggcgg ggcctcaca gaggagttct acagttcat caagccaatc 2340 ctggagaga tggacggcac ggaggagctc ctggtgaagc tcacaggga ggaccctcctg 2400 cggaagcaga gaaccttcga taacggcagc atccccacc aaatccatct cggggagctg 2460 cacgccatcc tgagaggca agaggacttc taccctttcc tcaggataa ccgggagaag 2520 atcgagaaga tcctgacctt cagaatccca tactacgtcg gccctctcgc gcgggggaac 2580 tcaagattcg cttggatgac ccgcaagtct gaggagacca tcacgccgtg gaacttcgag 2640 gaggtggtgg acaagggcgc tagcgctcag tcgttcatcg agaggatgac caacttcgac 2700 aagaacctgc ccaacgagaa gtgctccct aagcactcgc tcctgtacga gtacttcacc 2760 gtctacaacg agctcacgaa gtgaagtac gtcaccgagg gcatgcgcaa gccagcgttc 2820 ctgtccgggg agcagagaa ggctatcgtg gaccctctgt tcagaccaa ccggaggtc 2880 acggttaagc aactcagga ggactacttc aagagatcg agtgcttcga ttcggtcgag 2940 atcagcggcg tgaggaccg cttcaacgcc agcctcggga cctaccacga tctcctgaag 3000 atcatcagg attaggactt cctggacaac gaggagaacg aggatatcct ggaggacatc 3060 gtgctgaccc tcacgctgtt cgaggacagg gagatgatcg aggagcgcct gaagacgtac 3120 gcccatctct tcgatgacaa ggtcatgaag caaccaagc gccggagata caccggctgg 3180 gggaggctgt cccgcaagct catcaacggc atccgggaca agcagtccgg gagaccacc 3240 ctcgacttcc tcaagagcga tggcttcgcc aacaggaact tcatgcaact gatccacgat 3300 gacagcctca ccttcaagga ggatatccaa aaggctcaag tgagcggcca gggggactcg 3360 ctgcaccgagc atatcgcgaa cctcgctggc tcccccgga tcaagaaggg catcctccag 3420 accgtgaagg ttgtggacga gctcgtgaag gtcatgggcc ggcacaagcc tgagaacaatc 3480 gtcatcgaga tggccagaga gaaccaaacc acgcagaagg ggcaaaagaa ctctagggag 3540 cgcatgaagc gcatcgagga gggcatcaag gagctggggt cccaaatcct caaggagcac 3600 ccagtggaga acacccaact gcagaacgag aagctctacc tgtactacct ccagaacggc 3660 agggatatgt acgtggacca agagctggat atcaaccgcc tcagcgatta cgacgtcgat 3720 catatcgttc cccagtcttt cctgaaggat gactccatcg acaacaaggt cctcaccagg 3780 3840 aagaactact ggaggcagct cctgaacgcc aagctgatca cgcaaaggaa gttcgacaac 3900 ctcaccaagg ctgagagagg cgggctctca gagctggca aggccggctt catcaagcgg 3960 cagctggtcg agaccagaca aatcacgaag cacgttgcgc aaatcctcga ctctcggatg 4020 aacacgaagt acgatgagaa cgacaagctg atcagggagg ttaaggtgat caccctgaag 4080 tctaagctcg tctccgactt caggaaggat ttccagttct acaaggttcg cgagatcaac 4140 aactaccacc atgcccatga cgcttacctc aacgctgtgg tcggcaccgc tctgatcaag 4200 aagtacccaa agctggagtc cgagttcgtg tacggggact acaaggttta cgatgtgcgc 4260 aagatgatcg ccaagtcgga gcaagagatc ggcaaggcta ccgccaagta cttcttctac 4320 tcaaacatca tgaacttctt caagaccgag atcacgctgg ccaacggcga gatccggaag 4380 agaccgctca tcgagaccaa cggcgagacg ggggagatcg tgtgggacaa gggcagggat 4440 ttcgcgaccg tccgcaaggt tctctccatg ccccaggtga acatcgtcaa gaagaccgag 4500 gtccaaacgg gcgggttctc aaaggagtct atcctgccta agcggaacag cgacaagctc 4560 atcgccagaa agaaggactg ggacccaaag aagtacggcg ggttcgacag ccctaccgtg 4620 gcctactcgg tcctggttgt ggcgaaggtt gagaagggca agtccaagaa gctcaagagc 4680 gtgaaggagc tcctggggat caccatcatg gagagggtcca gcttcgagaa gaacccaatc 4740 gacttcctgg aggccaaggg ctacaaggag gtgaagaagg acctgatcat caagctccccg 4800 4860 ctccagaagg ggaacgagct cgcgctgcca agcaagtacg tgaacttcct ctacctggct 4920 tcccactacg agaagctcaa gggcagcccg gaggaacg agcaaaagca gctgttcgtc 4980 gagcagcaca agcattacct cgacgagatc atcgagcaaa tctccgagtt cagcaagcgc 5040 gtgatcctcg ccgacgcgaa cctggataag gtcctctccg cctacaacaa gcaccgggac 5100 aagcccatca gagagcaagc ggagaacatc atccatctct tcaccctgac gaacctcggc 5160 gctcctgctg ctttcaagta cttcgacacc acgatcgatc ggaagagata cacctccacg 5220 aaggaggtcc tggacgcgac cctcatccac cagtcgatca ccggcctgta cgagacgagg 5280 atcgacctct cacaactcgg cggggataag agacccgcag caaccaagaa ggcagggcaa 5340 gcaaaagaagaagacgcg tgactccggc ggcagcatgt ttggagagag ctggagaagaag 5400 cacctcagcg gggagttcgg gaaaccgtat tttatcaagc taatgggatt tgttgcagaa 5460 gaaagaaagc attacactgt ttatccaccc ccacaccaag tcttcacctg gacccagatg 5520 tgtgacataa aagatgtgaa ggttgtcatc ctgggacagg atccatatca tggacctaat 5580 caagctcacg ggctctgctt tagtgttcaa aggcctgttc cgcctccgcc cagtttggag 5640 aacatttata aagagttgtc tacagacata gaggattttg ttcatcctgg ccatggagat 5700 ttatctgggt gggccaagca aggtgttctc cttctcaacg ctgtcctcac ggttcgtgcc 5760 catcaagcca actctcataa ggagcgaggc tgggagcagt tcactgatgc agttgtgtcc 5820 tggctaaatc agaactcgaa tggccttgtt ttcttgctct ggggctctta tgctcagaag 5880 aagggcagtg ccattgatag gaagcggcac catgtactac agacggctca tccctcccct 5940 ttgtcagtgt atagagggtt ctttggatgt agacactttt caaagaccaa tgagctgctg 6000 cagaagtctg gcaagaagcc cattgactgg aaggagctgt cgggggggag cccaaagaag 6060 aagcggaagg tg 6072 <210> 9 <211> 6612 <212> DNA <213> Artificial Sequence <400> 9 atgccaaaga agaagaggaa ggttctggtt gggccctcct gtgtcatgga tgacttcagg 60 gacccacagc gatggaagga atgtgccaag caagggaaaa tgccatgtta ctttgatctt 120 attgaagaaa atgtttattt aacagaaaga aagaagaata aatctcatcg agatattaag 180 cgaatgcagt gtgagtgtac acctctttct aaagatgaaa gagctcaagg tgaaatagca 240 tgtggggaag attgtcttaa tcgtcttctc atgattgaat gttcttctcg gtgtccaaat 300 ggggattatt gttccaatag acggtttcag agaaaacagc atgcagatgt ggaagtcata 360 ctcacagaaa agaaaggctg gggcttgaga gctgccaaag accttccttc gaacaccttt 420 gtcctagaat attgtggaga ggtactcgat cataaagagt ttaaagctcg agtgaaggag 480 tatgcacgaa acaaaaacat ccattactat ttcatggccc tgaagaatga tgagataata 540 gatgccactc aaaaaggaaa ttgctctcgt ttcatgaatc acagctgtga accaaattgt 600 gaaacccaaa aatggactgt gaacggacaa ctgagggttg ggttttttac caccaaactg 660 gttccttcag gctcagagtt aacgtttgac tatcagttcc agagatatgg aaagaagcc 720 cagaaatgtt tctgcggatc agccaattgc cggggttacc tgggaggaga aacagagtc 780 agcatcagag cagcaggagg gaaatgaag aaggaacgat ctcgtaagaa ggattcagtg 840 gatgagagc tagagctct gatggaaat ggtgagggtc tctctgataa aaaccaggtg 900 ctcagcttat cccggagcgg aggattagc ggaggatca gcggaagcga gactcctgga 960 accagcgaaa gcgcaacccc agaagcagc ggaggagta gcggaggaag ctcatcggag 1020 accggccctg tgctgttga cccaccctg cggcggagaa tcgagccaca cgagttcgag 1080 gtgttcttcg acccaaggga gctccgcaag gagacgtgcc tcctgtacga gatcaactgg 1140 ggcggcaggc actcatctg gaggcacacc agccaaaca ccacaagca cgtggaggtc 1200 aacttcatcg agaagttcac caccgagagg tacttctgcc caacacccg ctgctccatc 1260 acctggttcc tgtcctggag cccatgcggc gagtgctcca gggccatcac cgagttcctc 1320 agccgctacc cacacgtcac cctgttcatc tacatcgcca ggctctacca ccacgccgac 1380 ccaaggaaca ggcagggcct ccgcgacctg atctccagcg gcgtgaccat ccaaatcatg 1440 accgagcagg agtccggcta ctgctggagg aacttcgtca actactcccc aagcaacgag 1500 gcccactggc caaggtaccc acacctctgg gtgcgcctct acgtgctcga gctgtactgc 1560 atcatcctcg gcctgccacc atgcctcaac atcctgaggc gcaagcaacc acagctgacc 1620 ttcttcacca tcgccctcca aagctgccac taccagaggc tcccaccaca catcctgtgg 1680 gctaccggcc tcaagtccgg cagcgagacg ccaggcacct ccgagagcgc tacgcctgaa 1740 cttaaggaca agaagtactc gatcggcctc gccatcggga cgaactcagt tggctgggcc 1800 gtgatcaccg acgagtacaa ggtgccctct aagaagttca aggtcctggg gaacaccgac 1860 cgccattcca tcaagaagaa cctcatcggc gctctcctgt tcgacagcgg ggagaccgct 1920 gaggctacga ggctcaagag aaccgctagg cgccggtaca cgagaaggaa gaacaggatc 1980 tgctacctcc aagagatttt ctccaacgag atggccaagg ttgacgattc attcttccac 2040 cgcctggagg agtctttcct cgtggaggag gataagaagc acgagcggca tcccatcttc 2100 ggcaacatcg tggacgaggt tgcctaccac gagaagtacc ctacgatcta ccatctgcgg 2160 aagaagctcg tggactccac cgataaggcg gacctcagac tgatctacct cgctctggcc 2220 cacatgatca agttccgcgg ccatttcctg atcgaggggg atctcaaccc agacaacagc 2280 gatgttgaca agctgttcat ccaactcgtg cagacctaca accaactctt cgaggagaac 2340 ccgatcaacg cctctggcgt ggacgcgaag gctatcctgt ccgcgaggct ctcgaagtcc 2400 aggaggctgg agaacctgat cgctcagctc ccaggcgaga agaagaacgg cctgttcggg 2460 aacctcatcg ctctcagcct ggggctcacc ccgaacttca agtcgaactt cgatctcgct 2520 gaggacgcca agctgcaact ctccaaggac acctacgacg atgacctcga taacctcctg 2580 gcccagatcg gcgatcaata cgcggacctg ttctcgctg ccaagaacct gtcggacgcc 2640 atcctcctgt cagatatcct ccgcgtgaac accgagatca cgaaggctcc acctctgcc 2700 tccatgatca agcgctacga cgagcaccat caggatctga ccctcctgaa ggcgctggtc 2760 cgccaacagc tcccggagaa gtacaaggag atttctttcg atcagtcgaa gaacggctac 2820 gctgggtaca tcgacggcgg ggcctcaca gaggagttct acagttcat caagccaatc 2880 ctggagaga tggacggcac ggaggagctc ctggtgaagc tcacaggga ggaccctcctg 2940 cggaagcaga gaaccttcga taacggcagc atccccacc aaatccatct cggggagctg 3000 cacgccatcc tgagaggca agaggacttc taccctttcc tcaggataa ccgggagaag 3060 atcgagaaga tcctgacctt cagaatccca tactacgtcg gccctctcgc gcgggggac 3120 tcaagattcg cttggatgac ccgcaagtct gaggagacca tcacgccgtg gaacttcgag 3180 gaggtggtgg acaagggcgc tagcgctcag tcgttcatcg agaggatgac caacttcgac 3240 aagaacctgc ccaacgagaa gtgctccct aagcactcgc tcctgtacga gtacttcacc 3300 gtctacaacg agctcacgaa ggtgaagtac gtcaccgagg gcatgcgcaa gccagcgttc 3360 ctgtccgggg agcagagaa ggtacgtg gacctctgt tcagaccaa ccggaaggtc 3420 acggttaagc aactcagga ggactacttc aagagatcg agtgcttcga ttcggtcgag 3480 atcagcggcg tgaggaccg cttcaacgcc agcctcggga cctaccacga tctcctgaag 3540 atcatcagg attaggactt cctggacac gaggagaacg aggatatcct ggaggacatc 3600 gtgctgaccc tcacgctgtt cgaggacagg gagatgatcg aggagcgcct gaagacgtac 3660 gcccatctct tcgatgacaa ggtcatgaag caaccaagc gccggagata caccggctgg 3720 gggaggctgt cccgcaagct catcaacggc atccgggaca agcagtccgg gaagaccac 3780 ctcgacttcc tcagagcga tggctcgcc aacaggaact tcatgcaact gatccacgat 3840 gabagcctca ccttcagga ggatatccaa aaggctcaag tgagcggcca gggggactcg 3900 ctgcacgagc atatcgcgaa cctcgctggc tccccgcga tcaagaaggg catcctccag 3960 accgtgaagg tgtgacga gctcgtgaag gtcatgggcc ggcacaagcc tgagaacatc 4020 gtcatcgaga tggccagaga gaaccaaacc acgcagaagg ggcaaagaa cttagggag 4080 cgcatgaagc gcatcgagga gggcatcaag gagctggggt cccaatcct caggagcac 4140 ccagtggaga acacccact gcagaacgag aagctctacc tgtactacct ccagaacggc 4200 agggatatgt acgtggacca agagctgt atcaccgcc tcagcgatta cgacgtcgat 4260 catatcgttc cccagtcttt cctgaaggat gactccatcg acaaggt cctcaccagg 4320 tcggacaaga accgcggcaa gtcagataac gttccatctg aggaggtcgt tagagatg 4380 aagaactact ggaggcagct cctgaacgcc aagctgatca cgcaaggaa gttcgacaac 4440 ctcaccaagg ctgagagagg cgggctctca gagctggaca aggccggct catcaagcgg 4500 cagctggtcg agaccagaca aatcacgaag cacgttgcgc aaatcctcga ctctcggatg 4560 aacacgaagt acgatgagaa cgacaagctg atcaggctg ttaggtgat caccctgaag 4620 tctaagctcg tctccgactt caggaaggat ttccagttct acaggttcg cgagatcac 4680 aactaccacc atgcccatga cgcttaccctc aacgctgtgg tcggcaccgc tctgatcaag 4740 aagtacccaa agctggagtc cgagttcgtg tacgggact acaagtttta cgatgtgcgc 4800 aagatgatcg ccaagtcgga gcaagagatc ggcaagcta ccgccaagta ctctctctac 4860 tcaacatca tgaacttt cagaccgag atcacgctgg ccaacggcga gatccggaag 4920 agaccgctca tcgagaccaa cggcgagacg ggggagatcg tgtgggacaa gggcagggat 4980 ttcgcgaccg tccgcaaggt tctctccatg ccccaggtga acatcgtcaa gaagaccgag 5040 gtccaaacgg gcgggttctc aaaggagtct atcctgccta agcggaacag cgacaagctc 5100 atcgccagaa agaaggactg ggacccaaag aagtacggcg ggttcgacag ccctaccgtg 5160 gcctactcgg tcctggttgt ggcgaaggtt gagaagggca agtccaagaa gctcaagagc 5220 gtgaaggagc tcctggggat caccatcatg gagaggtcca gcttcgagaa gaacccaatc 5280 gacttcctgg aggccaaggg ctacaaggag gtgaagaagg acctgatcat caagctcccg 5340 aagtactctc tcttcgagct ggagaacggc aggaagagaa tgctggcttc cgctggcgag 5400 ctccagaagg ggaacgagct cgcgctgcca agcaagtacg tgaacttcct ctacctggct 5460 tcccactacg agaagctcaa gggcagcccg gaggacaacg agcaaaagca gctgttcgtc 5520 gagcagcaca agcattacct cgacgagatc atcgagcaaa tctccgagtt cagcaagcgc 5580 gtgatcctcg ccgacgcgaa cctggataag gtcctctccg cctacaacaa gcaccgggac 5640 aagcccatca gagagcaagc ggagaacatc atccatctct tcaccctgac gaacctcggc 5700 gctcctgctg ctttcaagta cttcgacacc acgatcgatc ggaagagata cacctccacg 5760 aaggaggtcc tggacgcgac cctcatccac cagtcgatca ccggcctgta cgagacgagg 5820 atcgacctct cacaactcgg cggggataag agacccgcag caaccaagaa ggcagggcaa 5880 gcaaaagaagaagacgcg tgactccggc ggcagcatgt ttggagagag ctggagaagaag 5940 cacctcagcg gggagttcgg gaaacgtat tttatcaagc taatgggatt tgttgcagaa 6000 gaagaaagc attacactgt ttatccacccc ccacaccaag tcttcacctg gacccagatg 6060 tgtgacataa aagatgtgaa ggttgtcatc ctgggacagg atccatatca tggacctaat 6120 caagctcacg ggctctgctt tagtgttcaa aggcctgttc cgcctccgcc cagtttggag 6180 aacatttata aagagttgtc tacagacata gaggatttg ttcatcctgg ccatggagat 6240 ttatctgggt gggccaagca aggtgttctc cttctcaacg ctgtcctcac ggttcgtgcc 6300 catcaagcca actctcataa ggagcgaggc tgggagcagt tcactgatgc agttgtgtcc 6360 tggctaaatc agaactcgaa tggccttgtt ttcttgctct ggggctctta tgctcagaag 6420 aagggcagtg ccattgatag gaagcggcac catgtactac agacggctca tccctcccct 6480 ttgtcagtgt atagagggtt ctttggatgt agacactttt caaagaccaa tgagctgctg 6540 cagaagtctg gcaagaagcc cattgactgg aaggagctgt cgggggggag cccaaagaag 6600 aagcggaagg tg 6612 <210> 10 <211> 7458 <212> DNA <213> Artificial Sequence <400> 10 atgccaaaga agaagaggaa ggtttcggac acgtggagct ctatccaggc ccacaagaag 60 cagctggact ctctgcggga gaggctgcag cggaggcgga agcaggactc ggggcacttg 120 gatctacgga atccagaggc agcattgtct ccaaccttcc gtagtgacag cccagtgcct 180 actgcaccca cctctggtgg ccctaagccc agcacagctt cagcagttcc tgaattagct 240 acagatcctg agttagagaa gaagttgcta caccacctct ctgatctggc cttaacattg 300 cccactgatg ctgtgtccat ctgtcttgcc atctccacgc cagatgctcc tgccactcaa 360 gatggggtag aaagcctcct gcagaagttt gcagctcagg agttgattga ggtaaagcga 420 ggtctcctac aagatgatgc acatcctact ctgtaacct atgctgacca ttccaagctc 480 tctgccatga tgggtgctgt ggcagaaag aagggccctg gggaggtagc agggactgtc 540 acagggcaga agcggcgtgc agacaggac tcgactacag tagctgcctt tgccagttcg 600 ttagtctctg gtctgaactc ttcagcatcg gaaccagcaa aggagccagc gaagaatca 660 aggaaacatg ctgcctcaga tgttgatctg gagatagaga gccttctgaa ccaacagtcc 720 actaaggac aagagcaa gaggtcagt caggagatcc tagagtatt aatactaca 780 acagccaagg aacaatccat tgttgaaaa ttcgctctc gaggtcgggc ccaagtgcaa 840 gattctgtg actatggaac caggagg tgcatgaaag ccagtgatgc tgatcgaccc 900 tgtcgcaagc tgcactcag acgaattatc ataaaacaca ctgatgagtc tttaggtgac 960 tgctctttcc ttaatacatg tttccacatg gatacctgca agtatgttca ctatgaaatt 1020 gatgcttgca tggattctga ggcccctggc agcaagacc acacgccaag ccaggactt 1080 gctcttacac agtgtcgg aggtgatcc agtgcagacc gactctccc actcagtgg 1140 atctgttgtg atatccgcta cctggacgtc agtatctttgg gcaagttttgc agttgtgatg 1200 gctgacccac cctgggat tcacatggaa ctgcctatg ggaccctgac agatgatgag 1260 atgcgcaggc tcacatacc cgtactacag gatgatggct ttctctcct ctgggtcaca 1320 ggcagggcca tggagttggg gagagaatgt ctaaacctct gggggtatga acgggtagat 1380 gaaattattt gggtgagac aaatcaactg caacgcatca ttcggacagg ccgtacaggt 1440 cactggttga accatgggaa ggacactgc tggttggtg tcaaggaa tcccaaggc 1500 ttcaccagg gtctggattg tgatgtgatc gtagctgagg ttcgttccac cagtcataaa 1560 ccagatgaaa tctatggcat gattgaaaga ctatctcctg gcactcgcaa gattgagtta 1620 tttggacgac cacacaatgt gcacccac tggatcaccc ttggaaacca actggatggg 1680 atccacctac tagacccaga tgtggttgca cggttcaagc aaggtacc agatggtatc 1740 atctctaaac ctaagaattt aagcgagga tctagcggag gatcaagcgg aagcgagact 1800 cctggaacca gcgaagcgc aaccccagaa agcagcggag gaagtagcgg aggaagctca 1860 tcggagaccg gccctgttgc tgttgacccc accctgcggc ggagaatcga gccacacgag 1920 ttcgaggtgt tcttcgaccc aagggagctc cgcaaggaga cgtgcctcct gtacgagatc 1980 aactggggcg gcaggcactc catctggagg cacaccagcc aaaacaccaa caagcacgtg 2040 gaggtcaact tcatcgagaa gttcaccacc gagaggtact tctgcccaaa cacccgctgc 2100 tccatcacct ggttcctgtc ctggagccca tgcggcgagt gctccagggc catcaccgag 2160 ttcctcagcc gctacccaca cgtcaccctg ttcatctaca tcgccaggct ctaccaccac 2220 gccgacccaa ggaacaggca gggcctccgc gacctgatct ccagcggcgt gaccatccaa 2280 atcatgaccg agcaggagtc cggctactgc tggaggaact tcgtcaacta ctccccaagc 2340 aacgaggccc actggccaag gtacccacac ctctgggtgc gcctctacgt gctcgagctg 2400 tactgcatca tcctcggcct gccaccatgc ctcaacatcc tgaggcgcaa gcaaccacag 2460 ctgaccttct tcaccatcgc cctccaaagc tgccactacc agaggctccc accacacatc 2520 ctgtgggcta ccggcctcaa gtccggcagc gagacgccag gcacctccga gagcgctacg 2580 cctgaactta aggacaagaa gtactcgatc ggcctcgcca tcgggacgaa ctcagttggc 2640 tgggccgtga tcaccgacga gtacaaggtg ccctctaaga agttcaaggt cctgggggaac 2700 accgaccgcc attccatcaa gaagaacctc atcggcgctc tcctgttcga cagcggggag 2760 accgctgagg ctacgaggct caagagaacc gctaggcgcc ggtacacgag aaagaac 2820 aggatctgct acctccaaga gattttctcc aacgagatgg ccaaggttga cgattcattc 2880 ttccaccgcc tggaggagtc tttcctcgtg gaggagata agaagcacga gcggcatccc 2940 atcttcggca acatcgtgga cgaggttgcc taccacgaga agtaccctac gatctaccat 3000 3060 ctggcccaca tgatcaagtt ccgcggccat ttcctgatcg aggggatct caacccagac 3120 aacagcgatg ttgacaagct gttcatccaa ctcgtgcaga cctacaacca actcttcgag 3180 gagaacccga tcaacgcctc tggcgtggac gcgaaggcta tcctgtccgc gaggctctcg 3240 aagtccagga ggctggagaa cctgatcgct cagctcccag gcgaagagaa gaacggcctg 3300 ttcgggaacc tcatcgctct cagcctgggg ctcaccccga acttcaagtc gaacttcgat 3360 ctcgctgagg acgccaagct gcaactctcc areacacct acgacgatga cctcgataac 3420 ctcctggccc agatcggcga tcaatacgcg gacctgttcc tcgctgccaa gaacctgtcg 3480 gacgccatcc tcctgtcaga tatcctccgc gtgaacaccg agatcacgaa ggctccactc 3540 tctgcctcca tgatcaagcg ctacgacgag caccatcagg atctgaccct cctgaaggcg 3600 ctggtccgcc aacagctccc gggagaagtac aaggagattt tcttcgatca gtcgaagaac 3660 ggctacgctg ggtacatcga cggcggggcc tcacaagagg agttctacaa gttcatcaag 3720 3780 3840 gagctgcacg ccatcctgag aaggcaagag gacttctacc ctttcctcaa ggataaccgg 3900 gagaatcg agaagatcct gaccttcaga atcccatact acgtcggccc tctcgcgcgg 3960 gggaactcaa gattcgcttg gatgacccgc aagtctgagg agaccatcac gccgtggaac 4020 ttcgaggagg tggtggacaa gggcgctagc gctcagtcgt tcatcgagag gatgaccaac 4080 ttcgacaaga acctgcccaa cgagaaggtg ctccctaagc actcgctcct gtacgagtac 4140 ttcaccgtct aaacgagct cacgaaggtg aagtacgtca ccgagggcat gcgcaagcca 4200 gcgttcctgt ccggggagca gaagaggct atcgtggacc tcctgttcaa gaccaaccgg 4260 aaggtcacgg ttaagcaact caaggagcac tacttcaaga agatcgagtg cttcgattcg 4320 gtcgagatca gcggcgttga ggaccgcttc aacgccagcc tcgggaccta ccacgatctc 4380 ctgaagatca tcaaggataa ggacttcctg gacaacgagg agaacgaga tatcctggag 4440 gacatcgtgc tgaccctcac gctgttcgag gacgggaga tgatcgagga gcgcctgaag 4500 acgtacgccc atctcttcga tgacaaggtc atgaagcaac tcaagcgccg gagatacacc 4560 ggctggggga ggctgtcccg caagctcatc aacggcatcc gggacaagca gtccgggaag 4620 accatcctcg acttctccaa gagcgatggc ttcgccaaca ggaacttcat gcaactgatc 4680 cacgatgaca gcctcacctt caaggagat atccaaaagg ctcaagtgag cggccagggg 4740 gactcgctgc acgagcatat cgcgaacctc gctggctccc ccgcgatcaa gaagggcatc 4800 ctccagaccg tgaaggttgt ggacgagctc gtgaaggtca tgggccggca caagcctgag 4860 aacatcgtca tcgagatggc cagagagaac caaaccacgc agaaggggca aaagaactct 4920 agggagcgca tgaagcgcat cgaggagggc atcaaggagc tggggtccca aatcctcaag 4980 5040 aacggcaggg atatgtacgt ggaccaagag ctggatatca accgcctcag cgattacgac 5100 gtcgatcata tcgttcccca gtctttcctg areatgact ccatcgacaa caaggtcctc 5160 accaggtcgg acaagaaccg cggcaagtca gataacgttc catctgagga ggtcgttaag 5220 aagatgaaga actactggag gcagctcctg aacgccaagc tgatcacgca aaagaagttc 5280 gacaacctca ccaaggctga gagaggcggg ctctcagagc tggacaaggc cggcttcatc 5340 aagcggcagc tggtcgagac cagaaatc agaagcacg ttgcgcaaat cctcgactct 5400 cggatgaaca cgaagtacga tgagaacgac aagctgatca gggaggttaa ggtgatcacc 5460 ctgaagtcta agctcgtctc cgacttcagg areatttcc agttctacaa ggttcgcgag 5520 atcaacaact accaccatgc ccatgacgct tacctcaacg ctgtggtcgg caccgctctg 5580 atcaagaagt acccaaagct ggagtccgag ttcgtgtacg gggactacaa ggtttacgat 5640 5700 ttctactcaa acatcatgaa cttcttcaag accgagatca cgctggccaa cggcgagatc 5760 5820 agggatttcg cgaccgtccg caaggttctc tccatgcccc aggtgaacat cgtcaagaag 5880 accgaggtcc aaacgggcgg gttctcaaag gagtctatcc tgcctaagcg gaacagcgac 5940 aagctcatcg ccagaaagaa ggactgggac ccaaagaagt acggcgggtt cgacagccct 6000 accgtggcct actcggtcct ggttgtggcg aaggttgaga agggcaagtc caagaagctc 6060 aagagcgtga aggagctcct ggggatcacc atcatggaga ggtccagctt cgagaagaac 6120 ccaatcgact tcctggaggc caagggctac aaggaggtga agaaggacct gatcatcaag 6180 ctcccgaagt actctctt cgagctggag aacggcagga agagaatgct ggcttccgct 6240 ggcgagctcc agaaggggaa cgagctcgcg ctgccaagca agtacgtgaa cttcctctac 6300 ctggcttccc actacgagaa gctcaagggc agcccggagg acaacgagca aaagcagctg 6360 ttcgtcgagc agcacaagca ttacctcgac gagatcatcg agcaaatctc cgagttcagc 6420 aagcgcgtga tcctcgccga cgcgaacctg gataaggtcc tctcgccta caacaagcac 6480 cgggacaagc ccatcagaga gcaagcggag aacatcatcc atctcttcac cctgacgaac 6540 ctcggcgctc ctgctgcttt caagtacttc gacaccacga tcgatcggaa gagatacacc 6600 tccacgaagg aggtcctgga cgcgaccctc atccaccagt cgatcaccgg cctgtacgag 6660 acgaggatcg acctctcaca actcggcggg gataagagac ccgcagcaac caagaaggca 6720 gggcaagcaa agaagaagaa gacgcgtgac tccggcggca gcatgtttgg agagagctgg 6780 aagaagcacc tcagcgggga gttcgggaaa ccgtatttta tcaagctaat gggatttgtt 6840 gcagaagaaa gaaagcatta cactgttat ccacccccac accaagtctt cacctggacc 6900 cagatgtgtg actaaaaga tgtgaaggtt gtcatcctgg caggaggatcc atatcatgga 6960 cctaatcaag ctcacggggct ctgctttagt gttcaaggc ctgttccgcc tcccccagt 7020 ttggagaaca tttataaga gttgtctaca gatagagg atttgttca tcctggccat 7080 ggagatttat ctgggtgggc caagcaggt gttctccttc tcacgctgt cctcacggtt 7140 cgtgcccatc aagccaacc tcataggag cgaggctggg agcagttcac tgatgcagtt 7200 gtgtcctggc taaatcagaa ctcgaatggc cttgttttct tgctgggg ctcttatgct 7260 cagaagaagg gcagtgccat tgataggaag cggcaccatg tactacagac ggctcatccc 7320 tcccctttgt cagtgtatag agggttcttt ggatgtagac acttttcaa gaccaatgag 7380 ctgctgcaga agtctggcaa gaagcccatt gactggaagg agctgtcggg ggggagccca 7440 aagaagc ggaggtg 7458

Claims

1. A recombinant gene editing system, characterized in that: The recombinant gene editing system is a modified version of a gene editing system. The recombinant gene editing system expresses a fusion protein, which contains sequence-specific binding proteins, induced genome modification factors, and epigenetic factors. The gene editing efficiency of the recombinant gene editing system is higher than that of the original gene editing system. The fusion protein is any one of D1), D2), D3), D4), D5), D6), and D7. D1) The amino acid sequence is that of the protein in sequence 1 of the sequence listing; D2) The amino acid sequence of this protein is sequence 3 in the sequence listing; D3) A protein encoded by the nucleotide sequence of sequence 6 in the sequence listing, from position 1 to 5871. D4) Proteins encoded by the nucleotide sequence of sequence 7 in the sequence listing, specifically positions 1-6006. D5) A protein encoded by the nucleotide sequence of sequence 8 in the sequence listing, from position 1 to position 6072. D6) A protein encoded by the nucleotide sequence of sequence 9 in the sequence listing, from position 1 to position 6612. D7) is a protein encoded by the nucleotide sequence of sequence 10 in the sequence listing, from position 1 to position 7458.

2. The recombinant gene editing system according to claim 1, characterized in that: The gene editing system is a base editing system.

3. The fusion protein or related biomaterial as described in claim 1 or 2, wherein the biomaterial is any one of the following: E1) A nucleic acid molecule encoding the fusion protein as described in claim 1 or 2; E2) An expression cassette containing the nucleic acid molecules described in E1); E3) A recombinant vector containing the nucleic acid molecule described in E1), or a recombinant vector containing the expression cassette described in E2); E4) Recombinant microorganisms containing the nucleic acid molecules described in E1), or recombinant microorganisms containing the expression cassette described in E2), or recombinant microorganisms containing the recombinant vector described in E3).

4. The application of the fusion protein and / or related biomaterials of claim 3 for non-disease diagnostic and therapeutic purposes in gene editing.

Citation Information

Patent Citations

  • Fusion protein, base editing tool and application thereof

    CN113403294A