Collagen-derived polypeptides
Recombinant collagen-derived polypeptides produced in non-animal host cells provide a sustainable and scalable solution for vegan-friendly collagen and gelatin production, addressing the limitations of animal-derived sources.
Patent Information
- Application Number
- PCT/CA2023/051604
- Authority / Receiving Office
- WO · WO
- Patent Type
- Applications
- Current Assignee / Owner
- Filing Date
- 2023-12-01
- Publication Date
- 2025-06-05
AI Technical Summary
Current methods for producing collagen and gelatin rely on animal-derived sources, making them unsuitable for vegan formulations and facing challenges in scaling sustainably to meet market demand.
Development of recombinant collagen-derived polypeptides produced using non-animal host cells, which have sequences identical or substantially similar to native collagen proteins, and can be used as substitutes for animal-derived collagen in various applications.
The recombinant collagen-derived polypeptides offer a sustainable and scalable solution for producing collagen and gelatin, compatible with vegan diets and capable of replicating the functional properties of natural collagen.
Smart Images

Figure CA2023051604_05062025_PF_FP_ABST
Abstract
Description
[0001] COLLAGEN-DERIVED POLYPEPTIDES CROSS-REFERENCE [1] This application claims priority benefit of U.S. Provisional Patent Application No. 63 / 429,246 filed December 1, 2022, the entire contents of which are incorporated herein by reference in its entirety. TECHNICAL FIELD [2] This disclosure generally relates to the field of recombinant collagen and gelatin production, and more particularly to non-animal collagen-derived polypeptides, and methods of their production and use. BACKGROUND OF THE ART [3] Collagen is the most abundant protein in the animal kingdom. It is the primary constituent of connective tissue, which is a major component of bone, skin, muscles, tendons, and cartilage. [4] There is some evidence that collagen supplementation could improve hair, skin, muscle, gut and / or joint health. Collagen supplements are commercially available, and generally exist in the form of hydrolyzed or denatured collagen. [5] Collagen is used to produce gelatin, which is a translucent, colorless, flavorless food ingredient. Gelatin is commonly used as a gelling agent for food and beverage, pharmaceutical, medical and nutraceutical, and cosmetic applications, among others. Gelatin is currently produced from animal by-products rich in collagen such as cartilage, pig skin and fish waste. These processes of gelatin production are unsuitable for use in plant-based or vegan formulations, and generally not available for halal and kosher foods as most collagen is derived from porcine or bovine origin. [6] Collagen and gelatin in the food and beverage market is strictly dependent on the animal industry, which is a challenge to scale sustainably to provide sufficient raw materials to meet the market demand for collagen and gelatin. SUMMARY [7] In one aspect, disclosed are recombinant collagen-derived polypeptides, preferably produced using non-animal host cells. In some embodiments, the polypeptides consist of a sequence which is identical to a portion of a sequence of a native full-length collagen protein, or substantially similar sequence. [8] In some embodiments, the polypeptide may comprise a native sequence portion and a modification or a tag such as a secretion tag, a histidine tag, a green fluorescent protein tag, a protease cleavage site, or a beta-lactamase. [9] In some embodiments, the collagen-derived polypeptide may include an N-terminal or a C-terminal modification, or both N- and C-terminal modifications. The modification may comprise a Gxy repeating sequence of amino acids, where x and y may be any amino acid, preferably proline or hydroxyproline. In some embodiments, the repeating sequence may be a GlyProPro repeating sequence. In some embodiments, some proline residues in the modification may be hydroxylated, such that the repeating sequence may be a GlyProHyp, GlyHypPro or GlyHypHyp repeating sequence.
[0010] In some embodiments, the collagen-derived polypeptide may comprise a signal sequence which may support secretion of the polypeptide. Extracellular secretion of a recombinant or heterologously expressed protein from a host cell may facilitate protein purification.
[0011] In some embodiments, the collagen-derived polypeptide further comprises a protease cleavage site, or may be the polypeptide which remains after protease cleavage.
[0012] In some embodiments, the polypeptides are selected from the group consisting of SEQ ID NO: 1, SEQ ID NO: 2, SEQ ID NO: 3, SEQ ID NO: 7, SEQ ID NO: 8, SEQ ID NO: 10, SEQ ID NO: 12, SEQ ID NO: 14, SEQ ID NO: 16, SEQ ID NO: 18, SEQ ID NO: 20, SEQ ID NO: 22, SEQ ID NO: 24, SEQ ID NO: 26, SEQ ID NO: 28, SEQ ID NO: 30, SEQ ID NO: 32, SEQ ID NO: 34, SEQ ID NO: 36, SEQ ID NO: 38, SEQ ID NO: 40, SEQ ID NO: 42, SEQ ID NO: 44, SEQ ID NO: 46, SEQ ID NO: 48, SEQ ID NO: 50, SEQ ID NO: 52, SEQ ID NO: 54, SEQ ID NO: 56, SEQ ID NO: 58, SEQ ID NO: 60, SEQ ID NO: 62, SEQ ID NO: 64, and SEQ ID NO: 66, and substantially similar variants thereof.
[0013] In another aspect, disclosed are polynucleotides which encode a collagen-derived polypeptide. In some embodiments, the encoded polypeptide is SEQ ID NO: 1, SEQ ID NO: 2, SEQ ID NO: 3, SEQ ID NO: 7, SEQ ID NO: 8, SEQ ID NO: 10, SEQ ID NO: 12, SEQ ID NO: 14, SEQ ID NO: 16, SEQ ID NO: 18, SEQ ID NO: 20, SEQ ID NO: 22, SEQ ID NO: 24, SEQ ID NO: 26, SEQ ID NO: 28, SEQ ID NO: 30, SEQ ID NO: 32, SEQ ID NO: 34, SEQ ID NO: 36, SEQ ID NO: 38, SEQ ID NO: 40, SEQ ID NO: 42, SEQ ID NO: 44, SEQ ID NO: 46, SEQ ID NO: 48, SEQ ID NO: 50, SEQ ID NO: 52, SEQ ID NO: 54, SEQ ID NO: 56, SEQ ID NO: 58, SEQ ID NO: 60, SEQ ID NO: 62, SEQ ID NO: 64, or SEQ ID NO: 66, or substantially similar variants thereof.
[0014] In some embodiments, the polynucleotide is SEQ ID NO: 4, SEQ ID NO:5 and SEQ ID NO: 6, , SEQ ID NO: 9, SEQ ID NO: 11, SEQ ID NO: 13, SEQ ID NO: 15, SEQ ID NO: 17, SEQ ID NO: 19, SEQ ID NO: 21, SEQ ID NO: 23, SEQ ID NO: 25, SEQ ID NO: 27, SEQ ID NO: 29, SEQ ID NO: 31, SEQ ID NO: 33, SEQ ID NO: 35, SEQ ID NO: 37, SEQ ID NO: 39, SEQ ID NO: 41, SEQ ID NO: 43, SEQ ID NO: 45, SEQ ID NO: 47, SEQ ID NO: 49, SEQ ID NO: 51, SEQ ID NO: 53, SEQ ID NO: 55, SEQ ID NO: 57, SEQ ID NO: 59, SEQ ID NO: 61, SEQ ID NO: 63, SEQ ID NO: 65, or SEQ ID NO: 67.
[0015] In another aspect, provided is an expression vector comprising a polynucleotide as provided herein and non-animal host cell which express the polynucleotides disclosed herein. The host cell can be any non-animal host cell used to express exogenous polynucleotides. The host cell may be a fermenting microorganism such as a yeast or fungal cell, such as Komagataella phaffi.
[0016] In another aspect, provided is a method for producing a collagen-derived polypeptide comprising: transforming a microorganism with an expression vector comprising a promoter operably linked to a polynucleotide encoding a polypeptide as provided herein; and culturing the transformed microorganism under conditions for producing the polypeptide.
[0017] In another aspect, the non-animal recombinant collagen-derived polypeptides may be used as an amino acid or protein supplement, or as an ingredient in a consumable product such as a food, beverage or nutraceutical product. Thus, the polypeptides may be used as a food or beverage additive, gelling agent, stabilizing agent, foaming agent, film-forming agent, emulsifier or thickening agent. Preferably, the polypeptides may be used in a vegan formulation or composition to replace an animal collagen source.
[0018] Many further features and combinations thereof concerning the present improvements will appear to those skilled in the art following a reading of the instant disclosure. DESCRIPTION OF THE DRAWINGS
[0019] Fig.1 is a schematic of a process according to an embodiment of the present invention.
[0020] Fig.2 is a photograph of a gelatin formed from a collagen-derived polypeptide produced according to an embodiment of the present invention.
[0021] Fig.3 is a photograph of a gelatin formed from a collagen-derived polypeptide produced according to an embodiment of the present invention.
[0022] Fig.4 is a photograph of protein gel showing production of correct sizes of target proteins.
[0023] Fig.5 is a schematic depiction of a collagen alpha-1 protein, showing regions, motifs, and sites. Some embodiments of a collagen-derived polypeptide comprise a sequence from the region shown in the box. DETAILED DESCRIPTION
[0024] In the following description, certain specific details are set forth in order to provide a thorough understanding of various embodiments of the disclosure. However, one skilled in the art will understand that the disclosure may be practiced without these details. Before the present invention is described further, it is to be understood that this invention is not limited to particular embodiments described, and as such may, of course, vary. It is also to be understood that the terminology used herein is for the purpose of describing particular embodiments only, and is not intended to be limiting, since the scope of the present invention will be limited only by the appended claims.
[0025] Where a range of values is provided, it is understood that each intervening value, to the tenth of the unit of the lower limit unless the context clearly dictates otherwise, between the upper and lower limit of that range and any other stated or intervening value in that stated range is encompassed within the invention, as well as any subrange encompassed within the stated range which can be envisioned by one skilled in the art.
[0026] Unless defined otherwise, all technical and scientific terms used herein have the same meaning as commonly understood by one of ordinary skill in the art to which this invention belongs. Although any methods and materials similar or equivalent to those described herein can be used in the practice or testing of the present invention, the preferred methods and materials are now described. All publications mentioned herein are incorporated herein by reference to disclose and describe the methods and / or materials in connection with which the publications are cited.
[0027] It must be noted that as used herein and in the appended claims, the singular forms "a", "and", and "the" include plural referents unless the context clearly dictates otherwise. Thus, for example, reference to "a cell" includes a plurality of cells and reference to "a polypeptide" includes reference to one or more polypeptides and equivalents thereof known to those skilled in the art, and so forth. It is further noted that the claims may be drafted to exclude any optional element. As such, this statement is intended to serve as an antecedent basis for use of such exclusive terminology as "solely", "only" and the like in connection with the recitation of claim elements, or use of a "negative" limitation.
[0028] All publications and patents cited in this specification are herein incorporated by reference as if each individual publication or patent were specifically and individually indicated to be incorporated by reference and are incorporated herein by reference to disclose and describe the methods and / or materials in connection with which the publications are cited. The citation of any publication is for its disclosure prior to the filing date and should not be construed as an admission that the publication is relevant prior art. Further, the dates of publication provided may be different from the actual publication dates which may need to be independently confirmed.
[0029] As will be apparent to those of skill in the art upon reading this disclosure, each of the individual embodiments described and illustrated herein has discrete components and features which may be readily separated from or combined with the features of any of the other several embodiments without departing from the scope or spirit of the present invention. Any recited method can be carried out in the order of events recited or in any other order which is logically possible. DEFINITIONS
[0030] The term “collagen-derived polypeptide” as used herein refers to a monomeric polypeptide which is a truncation or variant of a natural collagen polypeptide. A collagen-derived polypeptide may consist of between about 100 to about 1200 amino acids, with a sequence that is identical to or substantially similar to a portion of the amino acid sequence of a natural collagen. Some, but not all collagen-derived polypeptides can associate with one or more collagen or collagen-like polypeptides to form a quaternary structure, similar to that of natural collagen. The quaternary structure of natural collagen is a triple helix typically composed of three polypeptides. The term “procollagen” as used herein refers to polypeptides produced by cells that can be processed to naturally occurring collagen.
[0031] As used herein, the term “gelatin” refers to a collagen-derived polypeptide, or a modified or treated polypeptide, that can form a gel. A collagen-derived polypeptide may be modified by exposure to acid, base or heat to provide gel-forming ability. Without restriction to a theory, treatment of a collagen or a collagen-derived polypeptide with acid, base or heat is thought to denature the polypeptides. Aqueous denatured collagen solutions form reversible gels used in foods, cosmetics, pharmaceuticals, industrial products, medical products, laboratory culture growth media, and many other applications. A collagen-derived polypeptide can be processed to produce gelatin, or a collagen-derived polypeptide can be used as a gelatin without further processing.
[0032] The terms “protein” and “polypeptide” are used interchangeably herein.
[0033] A "substantially similar" sequence or variant of a polynucleotide or polypeptide can be described as having at least 80, 85, 90, 91, 92, 93, 94, 95, 96, 97, 98 or 99 percent “sequence identity” to another polynucleotide or polypeptide, meaning that, when aligned, that percentage of bases or amino acids are the same, and in the same relative position, when comparing the two sequences. In general, “sequence identity” refers to an exact nucleotide-to-nucleotide or amino acid-to-amino acid correspondence of two polynucleotides or polypeptide sequences, respectively. Typically, techniques for determining sequence identity include determining the nucleotide sequence of a polynucleotide and / or determining the amino acid sequence encoded thereby, and comparing these sequences to a second nucleotide or amino acid sequence. Two or more sequences (polynucleotide or amino acid) can be compared by determining their “percent identity.” The percent identity to a reference sequence (e.g., nucleic acid or amino acid sequences), which may be a sequence within a longer molecule (e.g., polynucleotide or polypeptide), may be calculated as the number of exact matches between two optimally aligned sequences divided by the length of the reference sequence and multiplied by 100. Percent identity may also be determined, for example, by comparing sequence information using the advanced BLAST computer program, available from the National Institutes of Health. The BLAST program is based on the alignment method of Karlin and Altschul, Proc. Natl. Acad. Sci. USA 87:2264- 2268 (1990) and as discussed in Altschul, et al., J. Mol. Biol. 215:403-410 (1990); Karlin And Altschul, Proc. Natl. Acad. Sci. USA 90:5873-5877 (1993); and Altschul et al., Nucleic Acids Res. 25:3389-3402 (1997). Briefly, the BLAST program defines identity as the number of identical aligned symbols (e.g., nucleotides or amino acids), divided by the total number of symbols in the shorter of the two sequences. The program may be used to determine percent identity over the entire length of the sequences being compared. Default parameters are provided to optimize searches with short query sequences, for example, with the blastp program. The program also allows use of an SEG filter to mask-off segments of the query sequences as determined by the SEG program of Wootton and Federhen, Computers and Chemistry 17:149-163 (1993).
[0034] The term “promoter” refers to a regulatory DNA region which controls transcription of an operably linked nucleic acid encoding a gene product, and which can be located adjacent to or overlapping a nucleotide or region of nucleotides at which RNA transcription is initiated. A promoter generally contains specific DNA sequences which bind protein factors, often referred to as transcription factors, which facilitate binding of RNA polymerase to the DNA leading to gene transcription.
[0035] The terms “nucleic acid” and “polynucleotide” are used interchangeably herein.
[0036] The term “coding sequence” refers to a nucleic acid sequence that once transcribed and translated produces a protein, for example, in vivo, when placed under the control of appropriate regulatory elements. A coding sequence as used herein may have a continuous ORF or might have an ORF interrupted by the presence of introns or non-coding sequences. In this embodiment, the non-coding sequences are spliced out from the pre-mRNA to produce a mature mRNA.
[0037] The term “operably-linked” refers to the association of nucleic acid sequences on a single nucleic acid fragment so that the function of one is affected by the other. For example, a promoter is operably-linked with a coding sequence when it is capable of affecting the expression of that coding sequence (i.e., the coding sequence is under the transcriptional control of the promoter). Similarly, when an intron is operably-linked to a coding sequence, the intron is spliced out of the mRNA to provide for expression of the coding sequence. In the context of gene conversion, two nucleic acids sequences are operably linked if one sequence can “donate” sequence to the other by gene conversion. If two sequences are unlinked in that one can donate sequence to the other via gene conversion, the donating sequences may be upstream or downstream of the other, and the two sequences may be proximal to each other, i.e., in that there are no other intervening genes. “Unlinked” means that the associated genetic elements are not closely associated with one another and the function of one does not affect the other.
[0038] The terms “upstream” and “downstream” are used with reference to the direction of transcription.
[0039] The term “intron” refers to a sequence of DNA found in eukaryotic genes that may be transcribed but is removed from the pre-mRNA transcript before the mRNA is translated into a protein. This process of intron removal occurs by splicing together of nucleic acid (exons) that flank the intron.
[0040] As used herein, the term "variant", as in “variant polypeptide” or “variant polynucleotide”, encompasses naturally-occurring variants (e.g., homologs and allelic variants) and non-naturally- occurring variants (e.g., muteins). Naturally-occurring variants include homologs, i.e., nucleic acids and polypeptides that differ in nucleotide or amino acid sequence, respectively, from one species to another. Naturally-occurring variants include allelic variants, i.e., nucleic acids and polypeptides that occur in nature and differ in nucleotide or amino acid sequence, respectively, from one individual to another within a species. Non-naturally-occurring variants include nucleic acids and polypeptides that comprise a change in nucleotide or amino acid sequence, respectively, where the change in sequence is artificially introduced and does not occur in nature, e.g., the change is generated in the laboratory or other facility by human intervention ("hand of man").
[0041] The term “endogenous”, with reference to a gene, indicates that the gene is native to a cell, i.e., the gene is present at a particular locus in the genome of a non-modified cell. An endogenous gene may be a wild type gene present at that locus in a wild type cell (as found in nature). An endogenous gene may be a modified endogenous gene if it is present at the same locus in the genome as a wild type gene. An example of such a modified endogenous gene is a gene into which a foreign nucleic acid is inserted. An endogenous gene may be present in the nuclear genome, mitochondrial genome etc.
[0042] The term “expression construct” or “expression vector” refers to a recombinant nucleic acid, generally recombinant DNA, that has been generated for the purpose of the expression of a selected nucleotide sequence(s), or is to be used in the construction of other recombinant nucleotide sequences. An expression construct can be present in a vector or in a genome. A "vector" is a nucleic acid replicon, such as plasmid, phage nucleic acid, viral nucleic acid, or cosmid, to which another nucleic acid segment may be attached so as to bring about the replication of the attached segment in a cell.
[0043] The term “recombinant” refers to a polynucleotide, polypeptide, or host cell that has been manipulated by the hand of man, e.g., to provide a polynucleotide, polypeptide or host cell that does not occur in nature. A recombinant molecule may contain two or more naturally-occurring sequences that are linked together in a way that does not occur naturally, or may consist of a portion or portions of a naturally-occurring sequence, which portion does not occur naturally. A recombinant cell contains a recombinant polynucleotide or polypeptide. If a cell is genetically modified to contain a recombinant nucleic acid, the nucleic acid is “exogenous” to the cell.
[0044] The term “selectable marker” refers to a protein capable of expression in a host that allows for ease of selection of those hosts containing an introduced nucleic acid or vector. Examples of selectable markers include, but are not limited to, proteins that confer resistance to antimicrobial agents (e.g., hygromycin, bleomycin, or chloramphenicol), proteins that confer a metabolic advantage, such as a nutritional advantage on the host cell, as well as proteins that confer a functional or phenotypic advantage (e.g., cell division) on a cell. Additionally, a fluorescent protein may be used as a selectable marker, such as GFP or mCherry.
[0045] The term “expression”, as used herein, refers to the process by which a polypeptide or other gene product is produced based on the nucleic acid sequence of a gene. The process includes both transcription and, if the gene product is a protein, translation.
[0046] The term “introduced” in the context of inserting a nucleic acid sequence into a cell, means “transfection”, or ‘transformation” or “transduction” and includes reference to the incorporation of a nucleic acid sequence into a eukaryotic or prokaryotic cell wherein the nucleic acid sequence may be incorporated into the genome of the cell (e.g., chromosome, plasmid, plastid, or mitochondrial DNA), converted into an autonomous replicon, or transiently expressed (e.g., transfected mRNA).
[0047] A "host cell" or “target cell” as used herein, denotes an in vivo or in vitro cell, e.g., an avian cell, that can be, or has been, genetically modified, e.g., to contain an expression construct as described herein, and includes the progeny of such cells (e.g., when the cell has been genetically modified). It is understood that the progeny of a single cell may not necessarily be completely identical in morphology or in genomic or total DNA complement as the original parent, due to natural, accidental, or deliberate mutation. A "recombinant host cell" (also referred to as a "genetically modified host cell") is a host cell which has been manipulated by the hand of man so as to introduce a nucleic acid exogenous to the cell, e.g., an exogenous expression vector.
[0048] As used herein the term “exogenous” refers to molecules or activity that is introduced into a host microorganism. The molecule can be introduced, for example, by introduction of an encoding nucleic acid into the host genetic material such as by integration into a host chromosome or as non-chromosomal genetic material such as a plasmid. In reference to expression of an encoding nucleic acid the term refers to introduction of the encoding nucleic acid in an expressible form into the microorganism. When used in reference to a biosynthetic activity, the term refers to an activity that is introduced into a reference host organism. The source can be, for example, an encoding nucleic acid that expresses the activity following introduction into the host microorganism.
[0049] The term “plurality” refers to at least 2, at least 5, at least 10, at least 20, at least 50, at least 100, at least 200, at least 500, at least 1000, at least 2000, at least 5000, or at least 10,000 or at least 50,000 or more. In certain cases, a plurality includes at least 10 to 50. In other embodiments, a plurality may be at least 50 to 1,000.
[0050] As used herein “enzyme” includes proteins produced by a cell capable of catalyzing biochemical reactions. Further, unless context dictates otherwise, as used herein “enzyme” includes protein fragments that retain the relevant catalytic activity and may include artificial enzymes synthesized to retain the relevant catalytic activity.
[0051] As used herein, the term “microorganism” is intended to mean any organism that exists as a microscopic cell and encompasses prokaryotic or eukaryotic cells or organisms having a microscopic size and includes bacteria, archaea and eubacteria of all species as well as eukaryotic microorganisms such as yeast, fungi and algae. The term also includes cell cultures of any species (including e.g. plant or animal cells) that can be cultured for the production of a biochemical. Preferably, the cells do not have an animal origin, and are suitable for producing polypeptides for a vegetarian or vegan diet.
[0052] As used herein, the term “non-naturally occurring” when used in reference to a microorganism refers to a microorganism that has at least one genetic alteration not normally found in a naturally occurring strain of the referenced species, including wild-type strains of the referenced species. Genetic alterations include, for example, modifications introducing expressible nucleic acids encoding metabolic polypeptides, other nucleic acid additions, nucleic acid deletions and / or other functional disruption of the microbial genetic material. Such modifications include, for example, coding regions and functional fragments thereof, for heterologous, homologous or both heterologous and homologous polypeptides for the referenced species. Additional modifications include, for example, non-coding regulatory regions in which the modifications alter expression of a gene or operon.
[0053] The term “heterologous” refers to a molecule or activity derived from a source other than the referenced species whereas “homologous” refers to a molecule or activity derived from the host microbial organism. Accordingly, exogenous expression of an encoding nucleic acid of the invention can use either or both a heterologous or homologous encoding nucleic acid. Overview
[0054] Generally, aspects of the invention provided herein relate to a recombinant collagen- derived polypeptide, and processing streams for its production and use. As shown in Fig.1, a preferred embodiment uses an agricultural by-product in a fermentation process using recombinant microorganisms to produce an animal-free protein ingredients derived from animal collagen. Collagen-Derived Polypeptides
[0055] In one aspect, the collagen-derived polypeptide is derived from a natural collagen from animals such as mammals, avian species, or fish or marine species. Exemplary animal collagens include human, pig, cow, chicken or salmon collagen. In some embodiments, the collagen- derived polypeptides have similar biophysical properties to a native collagen sequence, such as similar amino acid composition, isoelectric point (measured or predicted), solubility, gelation, or viscosity. As used herein, the term "similar" means within 10%, 5%, 4%, 3%, 2% or 1% of the value of the native collagen sequence property. Preferably, such polypeptides have gelling functionality and may be used as a gelling agent. These polypeptides may be further post- translationally modified to enhance gelation.
[0056] In some embodiments, the collagen-derived polypeptide consists of an amino acid composition identical to or substantially similar to that of at least a portion or portions of the full- length native collagen upon which it is based, and an optional tag and / or modification. In some embodiments, the polypeptides consist of an amino acid sequence identical to a sequence between amino acid positions 162 and 1218 of collagen alpha-1 protein, as shown in Fig.5, with an optional tag and / or modification.
[0057] One primary characteristic of native collagen is the high content of glycine and proline. The structure of collagen is a triple helix in which three polypeptide strands together form a helical coil. The individual polypeptide strands include repeating triplet amino acid sequences GLY-X-Y, where X and Y can be any amino acid. The amino acids proline and hydroxyproline are found in high concentrations in collagen. The most common triplet is glycine-hydroxyproline-proline (GlyHypPro) accounting for approximately 10.5% of the triplets in collagen. In natural collagen, hydroxyproline residues are the result of post-translational hydroxylation of proline residues.
[0058] Therefore, in some embodiments, the collagen-derived polypeptide may have a glycine content of greater than about 25% and a proline content of greater than about 15%. In some embodiments, the amino acid profile may be as follows: Gly % Pro % Ala % Arg % Glu % Lys % Ser % Asp % Gln % Leu % 29-35 16-30 5-15 2-8 2-8 1-6 1-6 1-6 0-5 0-5 Val % Thr % Phe % Asn % Ile % Met % His % Tyr % Cys % Trp % 0-5 0-5 0-3 0-3 0-3 0-3 0-3 0-3 0-1 0-1
[0059] An exemplary collagen-derived polypeptide is selected from the group consisting of SEQ ID No: 1, SEQ ID NO: 2, SEQ ID NO: 3, SEQ ID NO: 7, SEQ ID NO: 8, SEQ ID NO: 10, SEQ ID NO: 12, SEQ ID NO: 14, SEQ ID NO: 16, SEQ ID NO: 18, SEQ ID NO: 20, SEQ ID NO: 22, SEQ ID NO: 24, SEQ ID NO: 26, SEQ ID NO: 28, SEQ ID NO: 30, SEQ ID NO: 32, SEQ ID NO: 34, SEQ ID NO: 36, SEQ ID NO: 38, SEQ ID NO: 40, SEQ ID NO: 42, SEQ ID NO: 44, SEQ ID NO: 46, SEQ ID NO: 48, SEQ ID NO: 50, SEQ ID NO: 52, SEQ ID NO: 54, SEQ ID NO: 56, SEQ ID NO: 58, SEQ ID NO: 60, SEQ ID NO: 62, SEQ ID NO: 64, and SEQ ID NO: 66, and substantially similar variants thereof. A substantially similar variant of a polypeptide may have one or more substitutions, additions or deletions of an amino acid, which does not substantially affect the function of the polypeptide.
[0060] In some embodiments, the collagen-derived polypeptide may, in addition to a portion which consists of a sequence identical to a portion or portions of a full-length native collagen protein, include an N-terminal or a C-terminal modification, or both N- and C-terminal modifications. The modification may comprise a Gxy repeating sequence of amino acids, such as a GPP repeating sequence. Such modifications may promote dimerization or trimerization. For example, SEQ ID NO: 1 is a collagen-derived polypeptide which consists of a portion that is identical to a portion of a human collagen protein, and modified with 10x GPP repeats at both ends.
[0061] In some embodiments, the collagen-derived polypeptide may, in addition to a portion which consists of a sequence identical to a portion or portions of a full-length collagen protein, comprise a signal sequence which may support secretion of the polypeptide. Extracellular secretion of a recombinant or heterologously expressed protein from a host cell may facilitate protein purification. For example, recovery of a recombinant protein from a cell culture supernatant may be preferable to lysing host cells to release a complex mixture of proteins including intracellular proteins of the host cell. Secretion may reduce deleterious effects that intracellular overexpression of a heterologous protein may have on a host cell such as toxicity or decreased growth rate. Secretion may allow increased protein production compared to intracellular expression in a host cell of limited volume to store the synthesized proteins. Secretory production of a protein may facilitate post-translational modification or processing (e.g., protein folding, formation of disulfide bonds, glycosylation).
[0062] A secreted protein may initially be expressed as a precursor with an N-terminal signal peptide. A signal peptide may contain a positively charged N-terminus of 1-5 residues (n-region), a central hydrophobic core of 6-16 amino acids (h-region), and a polar region of 3-7 amino acids that is a recognition site for a signal peptidase (c-region). A signal peptide may be located at the N-terminus of a preprotein that is destined for secretion out of the cell. In some cases, e.g., chicken ovalbumin and human plasminogen activator, a signal peptide is internal. A signal peptide may be 15 to 85 amino acids in length.
[0063] A signal peptide may direct the expressed precursor preprotein across the membrane of the endoplasmic reticulum. A signal peptide may be cleaved off from the rest of the protein by a signal peptidase, for example, during translocation or shortly after completion of translocation. A protein may be transported to the Golgi apparatus and secreted unless it carries a signal for retention in intracellular compartments.
[0064] In some embodiments, the collagen-derived polypeptide may, in addition to a portion which consists of a sequence identical to a portion or portions of a full-length collagen protein, further comprise a protease cleavage site, or may be the polypeptide which remains after protease cleavage. The protease cleavage site is useful to cleave the recombinantly produced collagen to remove portions of the polypeptide. The portions of the polypeptide that may be removed include the secretion tag, the histidine tag, or any other tag. The proteases comprise endoproteases, exoproteases, serine proteases, cysteine proteases, threonine proteases, aspartic proteases, glutamic proteases, and metalloproteases. Exemplary protease cleavage sites include amino acids that are cleaved by Thrombin, TEV protease, Factor Xa, Enteropeptidase, Rhinovirus 3C Protease, Kex2, and Ste13. In one aspect the cleavage tag is attached to the collagen-derived polypeptide. In another aspect the cleavage tag is removed by an appropriate protease from the collagen-derived polypeptide.
[0065] In some embodiments, the polypeptides may, in addition to a portion which consists of a sequence identical to a portion or portions of a full-length collagen protein, comprise a portion or portions of the C-terminal region of a pre-collagen protein that has a regulatory role and is not present in the final processed collagen fibrils in the extracellular matrix in vivo constructs. For example, SEQ ID NOs: 54 and 60 (C22x and C23x) comprise such regulatory sequences.
[0066] In some embodiments, the collagen-derived polypeptides disclosed herein may be hydroxylated. For example, the polypeptide may be hydroxylated to hydroxylate proline residues with, for example, prolyl hydroxylase. Therefore, in some embodiments, at least one proline residue, and preferably a plurality of proline residues in any polypeptide disclosed herein may be substituted with hydroxyproline. Partially hydroxylated collagen-derived polypeptides can be produced by co-expression with prolyl hydroxylase or by enzymatic hydroxylation in a cell-free system (in vitro).
[0067] The collagen-derived polypeptides provided herein may be digested or hydrolyzed to form a mixture of peptides, the composition of which will depend on the digestion or hydrolyzation method chosen, and other process parameters. The digest or hydrolysate may be used in place of digests or hydrolysates of full-length natural collagen.
[0068] The collagen-derived polypeptides may be used in formulations or compositions which require or may benefit from the functional properties and / or nutritional content of the polypeptides. They may be used as a substitute for animal-based collagen in different products, as they have one or more properties of natural animal-based collagen. For example, in some embodiments, the polypeptides are soluble in that they form a clear solution at a concentration of at least 1% wt, preferably at least 5%, or more preferably at least 10%, in water or buffer between about pH 3.0 to about 10.0, at a temperature between about 4° C to about 100° C, preferably between about 15° to about 80° C. In some embodiments, they form a viscous solution, where viscosity is measured with a 1% wt solution at 20° C. Preferably, the solution has a viscosity between about 10 mP and 5000 cP, between about 1 cP to about 2000 cP, or between about 10 cP to about 2000 cP.
[0069] In preferred embodiments, the polypeptides form a gel, which is preferably a reversible gel. Gel-forming ability may be determined if the polypeptides, at a concentration of at least 5% wt, form a gel in a pH of between about 3.0 to 10.0.
[0070] As used herein, a "gel" may be a polymeric or colloidal gel, comprising a substantially dilute semi-solid system, where solid particles are cross-linked or otherwise non-chemically bonded, which exhibits no flow when in the steady state, although the liquid phase may still diffuse through this system. Polynucleotides, Expression Vectors and Host Cells
[0071] In one aspect, the present disclosure provides a polynucleotide encoding a collagen- derived polypeptide described herein. A polynucleotide may be codon optimized and may be DNA or RNA. An exemplary polynucleotide is selected from the group consisting of SEQ ID NO: 4, SEQ ID NO:5 and SEQ ID NO: 6, SEQ ID NO: 9, SEQ ID NO: 11, SEQ ID NO: 13, SEQ ID NO: 15, SEQ ID NO: 17, SEQ ID NO: 19, SEQ ID NO: 21, SEQ ID NO: 23, SEQ ID NO: 25, SEQ ID NO: 27, SEQ ID NO: 29, SEQ ID NO: 31, SEQ ID NO: 33, SEQ ID NO: 35, SEQ ID NO: 37, SEQ ID NO: 39, SEQ ID NO: 41, SEQ ID NO: 43, SEQ ID NO: 45, SEQ ID NO: 47, SEQ ID NO: 49, SEQ ID NO: 51, SEQ ID NO: 53, SEQ ID NO: 55, SEQ ID NO: 57, SEQ ID NO: 59, SEQ ID NO: 61, SEQ ID NO: 63, SEQ ID NO: 65, and SEQ ID NO: 67.
[0072] A polynucleotide described herein can be obtained using chemical synthesis, molecular cloning or recombinant methods, DNA or gene assembly methods, artificial gene synthesis, PCR, or any combination thereof. Methods of chemical polynucleotide synthesis are well known in the art and need not be described in detail herein. One of skill in the art can use the sequences provided herein and a commercial DNA synthesizer to produce a desired DNA sequence. For preparing polynucleotides using recombinant methods, a polynucleotide comprising a desired sequence can be inserted into a suitable cloning or expression vector, and the cloning or expression vector in turn can be introduced into a suitable host cell for replication and amplification, as further discussed herein. Polynucleotides may be inserted into host cells by any means known in the art. Cells may be transformed by introducing an exogenous polynucleotide, for example, by direct uptake, endocytosis, transfection, F-mating, PEG-mediated protoplast fusion, Agrobacterium tumefaciens-mediated transformation, biolistic transformation, chemical transformation, or electroporation. Once introduced, the exogenous polynucleotide can be maintained within the cell as a non-integrated expression vector (such as a plasmid) or integrated into the host cell genome. The polynucleotide so amplified can be isolated from the host cell by methods well known within the art. Alternatively, nucleic acid amplification methods (e.g., PCR) allow reproduction of DNA sequences.
[0073] RNA can be obtained by using the isolated DNA in an appropriate expression vector and inserting it into a suitable host cell. When the cell replicates and the DNA is transcribed into RNA, the RNA can then be isolated using methods well known to those of skill in the art. Alternatively, RNA can be obtained by transcribing the isolated DNA, for example, by an in vitro transcription reaction using an RNA polymerase. Alternatively, RNA can be obtained using chemical synthesis.
[0074] Suitable cloning vectors may be constructed according to standard techniques, or may be selected from a large number of cloning vectors available in the art. While the cloning vector selected may vary according to the host cell intended to be used, useful cloning vectors may be integrated to the genome of the host cell or have the ability to self-replicate, may possess a single target for a particular restriction endonuclease, and / or may carry genes for a marker that can be used in selecting clones containing the expression vector. Suitable examples include plasmids and bacterial viruses, e.g., pUC18, pUC19, Bluescript (e.g., pBS SK+) and its derivatives, mp18, mp19, pBR322, pMB9, ColE1, pCR1, RP4, phage DNAs, and shuttle vectors such as pSA3 and pAT28. These and many other cloning vectors are available from commercial vendors such as BioRad, Strategene, and Invitrogen.
[0075] A polynucleotide described herein may further encode a signal sequence, a protease cleavage site, and / or terminal modifications. as described above.
[0076] In one aspect, the disclosure provides an expression vector comprising any of the polynucleotides described herein. A polynucleotide may be located in an expression vector. An expression vector may be a construct, which is capable of delivering, and preferably expressing, one or more gene(s) or sequence(s) of interest in a host cell. Examples of expression vectors include, but are not limited to, viral vectors (e.g., adenoviruses, adeno-associated viruses, and retroviruses), naked DNA or RNA expression vectors, plasmids, cosmids, phage vectors, DNA or RNA expression vectors associated with cationic condensing agents, DNA or RNA expression vectors encapsulated in liposomes, and certain eukaryotic cells, such as producer cells. An expression vector may allow easy and efficient replication, cloning, and / or selection.
[0077] A nucleic acid molecule encoding polypeptides as described herein can be used alone or as part of a vector. The nucleic acid molecules can include expression control sequences operably linked to the polynucleotide comprised in the nucleic acid molecule. These expression control sequences may be suited to ensure transcription and synthesis of a translatable RNA in bacteria or fungi. Expression refers to the transcription of the heterologous DNA sequence, preferably into a translatable mRNA. Regulatory elements ensuring expression in fungi and bacteria are known to those skilled in the art and encompass promoters, enhancers, termination signals, targeting signals and the like.
[0078] Accordingly, an expression vector may additionally include nucleic acid sequences that permit it to replicate in the host cell, such as an origin of replication, one or more therapeutic genes and / or selectable marker genes and other genetic elements known in the art such as regulatory elements directing transcription, translation and / or secretion of the encoded protein. Expression vector components may generally include, but are not limited to, one or more of the following: a signal sequence; an origin of replication; one or more marker genes; and suitable transcriptional controlling elements (such as promoters, enhancers and terminator). For expression (e.g., translation), one or more translational controlling elements are also usually required, such as ribosome binding sites, translation initiation sites, internal ribosome entry site, and stop codons. The expression vector may be used to transduce, transform or infect a cell, thereby causing the cell to express nucleic acids and / or proteins other than those native to the cell. The expression vector optionally includes materials to aid in achieving entry of the nucleic acid into the cell, such as a viral particle, liposome, protein coating or the like. Numerous types of appropriate expression vectors are known in the art for protein expression, by standard molecular biology techniques. Such expression vectors are selected from among conventional vector types including insects, e.g., baculovirus expression, or yeast, fungal, bacterial or viral expression systems. Other appropriate expression vectors, of which numerous types are known in the art, can also be used for this purpose. Methods for obtaining cloning and expression vectors are well- known (see, e.g., Green and Sambrook, Molecular Cloning: A Laboratory Manual, 4th edition, Cold Spring Harbor Laboratory Press, New York (2012)).
[0079] An expression vector may further comprise a promoter. Promoters for use in connection with the nucleic acid molecule may be homologous or heterologous with regard to its origin and / or with regard to the gene to be expressed. Suitable promoters are for instance promoters which lend themselves to constitutive expression. However, promoters which are only activated at a point in time determined by external influences can also be used. Artificial and / or chemically inducible promoters may be used. Promoters include, but are not limited to, a constitutive promoter, inducible promoter, and hybrid promoter. Promoters include, but are not limited to, acu- 5, adhl+, alcohol dehydrogenase (ADH1, ADH2, ADH4), AHSB4m, AINV, alcA, α-amylase, alternative oxidase (AOD), alcohol oxidase I (AOX1), alcohol oxidase 2 (AOX2), AXDH, B2, CaMV, cellobiohydrolase I (cbhl), ccg-1, cDNA1, cellular filament polypeptide (cfp), cpc-2, ctr4+, CUP1, dihydroxyacetone synthase (DAS), enolase (ENO, ENO1), formaldehyde dehydrogenase (FLD1), FMD, formate dehydrogenase (FMDH), G1, G6, GAA, GALL, GAL2, GAL3, GAL4, GAL5, GAL6, GAL7, GAL8, GAL9, GAL10, GCW14, gdhA, gla-1, α-glucoamylase (glaA), glyceraldehyde-3-phosphate dehydrogenase (gpdA, GAP, GAPDH), phosphoglycerate mutase (GPM1), glycerol kinase (GUT1), HSP82, invl+, isocitrate lyase (ICL1), acetohydroxy acid isomeroreductase (ILV5), KAR2, KEX2, β-galactosidase (lac4), LEU2, me1O, MET3, methanol oxidase (MOX), nmtl, NSP, pcbC, PET9, peroxin 8 (PEX8), phosphoglycerate kinase (PGK, PGK1), phol, PHO5, PHO89, phosphatidylinositol synthase (PIS1), PYK1, pyruvate kinase (pkil), RPS7, sorbitol dehydrogenase (SDH), 3-phosphoserine aminotransferase (SERI), SSA4, SV40, TEF, translation elongation factor 1 alpha (TEF1), THI11, homoserine kinase (THR1), tpi, TPS1, triose phosphate isomerase (TPI1), XRP2, and YPT1.
[0080] An expression vector may further comprise an auxotrophic marker (e.g., ADE1, ARG4, HIS4, URA3, MET2). An expression vector may further comprise a selectable marker (e.g., a resistance gene). In some cases, a resistance gene may confer resistance to zeocin, ampicillin, blasticidin, kanamycin, nurseothricin, chloroamphenicol, tetracycline, triclosan, or ganciclovir. An expression vector may comprise a plasmid.
[0081] In one aspect, the present disclosure provides a host cell, such as a non-animal host cell, transformed to express a collagen-derived polypeptide. Any host cell capable of expressing heterologous DNA can be used for the purpose of isolating a protein or the polynucleotides encoding a protein. In various embodiments, host cells can be selected from, for example, bacteria, yeast, fungus or any of a variety of other microorganisms.
[0082] The host cells can be transfected, e.g., by conventional means such as electroporation with at least one expression vector of the disclosure. The expression vectors containing the polynucleotides of interest can be introduced into a host cell by any of a number of appropriate means. The choice of introducing expression vectors or polynucleotides will often depend on features of the host cell. The transfected or transformed host cell may then be cultured under conditions that allow expression of the protein. In some embodiments, a protein is purified from a host cell.
[0083] An expression vector may be genomically integrated. A host cell may comprise multiple copies of an expression vector. In some cases, a host cell may be selected from the group consisting of bacteria, fungi, plant, insect, and any combination thereof. In some cases, fungi may be yeast or filamentous fungi. Yeast includes, but is not limited to, Arxula spp., Arxula adeninivorans, Kluyveromyces spp., Kluyveromyces lactis, Komagataella (formerly known as Pichia) spp. such as Komagataella phaffii, Saccharomyces spp., Saccharomyces cerevisiae, Schizosaccharomyces spp., Schizosaccharomyces pombe, Yarrowia spp., and Yarrowia lipolytica. Fungi include, but are not limited to, Agaricus spp., Agaricus bisporus, Aspergillus spp., Aspergillus awamori, Aspergillus fumigatus, Aspergillus nidulans, Aspergillus niger, Aspergillus oryzae, Colletotrichum spp., Colletotrichum gloeosporiodes, Endothia spp., Endothia parasitica, Fusarium spp., Fusarium graminearum, Fusarium solani, Mucor spp., Mucor miehei, Mucor pusillus, Myceliophthora spp., Myceliophthora thermophila, Neurospora spp., Neurospora crassa, Penicillium spp., Penicillium camemberti, Penicillium canescens, Penicillium chrysogenum, Penicillium (Talaromyces) emersonii, Penicillium funiculosum, Penicillium purpurogenum, Penicillium roqueforti, Pleurotus spp., Pleurotus ostreatus, Rhizomucor spp., Rhizomucor miehei, Rhizomucor pusillus, Rhizopus spp., Rhizopus arrhizus, Rhizopus oligosporus, Rhizopus oryzae, Trichoderma spp., Trichoderma altroviride, Trichoderma reesei, and Trichoderma vireus. A host cell may be approved as generally regarded as safe by the U.S. Food and Drug Administration. A host cell may be auxotrophic. A host cell may be glycoengineered, for instance, by having its glycosylation pathways humanized or engineered to more closely resemble another organism (e.g., a bird or chicken).
[0084] In some embodiments, bacterial species may include: Escherichia coli, Bacillus subtilis, Bacillus licheniformis, Bacillus cereus, Bacillus megaterium, Bacillus brevis, Bacillus pumilus, Corynebacterium glutamicum, Zymomonas mobilis, Clostridium acetobutylicum, Clostridium butylicum, Clostridium kluyveri, Clostridium autoethanogenum, Moorella thermoacetica, Clostridium aceticum, Clostridium beijerinckii, Clostridium saccharoperbutylacetonicum, Clostridium perfringens, Clostridium difficile, Clostridium botulinum, Clostridium tyrobutyricum, Clostridium tetanomorphum, Clostridium tetani, Clostridium propionicum, Clostridium aminobutyricum, Clostridium subterminale, Clostridium sticklandii, Ralstonia eutropha, Mycobacterium bovis, Mycobacterium tuberculosis, Porphyromonas gingivalis, Pseudomonas fluorescens, Pseudomonas putida, Pseudomonas aeruginosa, Pseudomonas carboxidovorans (Oligotropha carboxidovorans), Pseudomonas stutzeri, Klebsiella pneumonia, Klebsiella oxytoca, Anaerobiospirillum succiniciproducens, Actinobacillus succinogenes, Mannheimia succiniciproducens, Rhizobium etli, Gluconobacter oxydans, Lactococcus lactis, Lactobacillus plantarum, Streptomyces coelicolor, Citrobacter freundii, Citrobacter amalonaticus, Acinetobacter calcoaceticus, Acinetobacter baylyi, Thermotoga maritima, Halobacterium salinarum, Serratia marcescens, Rhodospirillum rubrum, Ideonella sp., Rhodobacter capsulatus, Methylococcus capsulatus, Methylosinus trichosporium, Methylobacterium extorquens, Methylocystis GB25, Methylotrophus capsulatus, Methylomonas sp.16a, Pyrococcus furiosus.
[0085] In some embodiments, yeasts or fungi may include: Saccharomyces cerevisiae, Schizosaccharomyces pombe, Saccharomycopsis crataegensis, Kluyveromyces lactis, Kluyveromyces marxianus, Aspergillus oryzae, Aspergillus terreus, Aspergillus niger, Aspergillus sojae, Pichia stipitis, Pichia pastoris, Rhizopus arrhizus, Rhizobus oryzae, Yarrowia lipoiytica, Issatchenkia orientalis, Issatchenkia occidentalis, Candida lambica, Candida sorboxylosa, Candida zemplinina, Candida geochares, Pichia membranifaciens, Zygosaccharomyces kombuchaensis, Candida sorbosivorans, Candida vanderwaltii, Candida sorbophila, Zygosaccharomyces bisporus, Zygosaccharomyces lentus, Saccharomyces bayanus, Saccharomyces bulderi, Debaryomyces castellii, Candida boidinii, Candida etchellsii, Pichia jadinii, Pichia anomala, Penicillium chrysogenum, Trichoderma reesei.
[0086] While in some embodiments, the host microorganism is not specifically restricted, in a preferred embodiment, the host microorganism is Komagataella phaffii, formerly known as Pichia pastoris.
[0087] An overview of different expression systems is for instance contained in Bitter et al. (Methods in Enzymology 153 (1987), 516-544) and in Sawers et al. (Applied Microbiology and Biotechnology 46 (1996), 1-9), Billman-Jacobe (Current Opinion in Biotechnology 7 (1996), 500- 4), Hockney (Trends in Biotechnology 12 (1994), 456-463), Griffiths et al., (Methods in Molecular Biology 75 (1997), 427-440). An overview of yeast expression systems is for instance given by Hensing et al. (Antonie van Leuwenhoek 67 (1995), 261-279), Bussineau et al. (Developments in Biological Standardization 83 (1994), 13-19), Gellissen et al. (Antonie van Leuwenhoek 62 (1992), 79-93, Fleer (Current Opinion in Biotechnology 3 (1992), 486-496), Vedvick (Current Opinion in Biotechnology 2 (1991), 742-745) and Buckholz (Bio / Technology 9 (1991), 1067-1072).
[0088] Expression vectors have been widely described in the literature. As a rule, they contain not only a selection marker gene and a replication-origin ensuring replication in the host selected, but also a bacterial or viral promoter, and in most cases a termination signal for transcription. Between the promoter and the termination signal there is in general at least one restriction site or a polylinker which enables the insertion of a coding DNA sequence. The DNA sequence naturally controlling the transcription of the corresponding gene can be used as the promoter sequence, if it is active in the selected host organism. However, this sequence can also be exchanged for other promoter sequences. It is possible to use promoters ensuring constitutive expression of the gene and inducible promoters which permit a deliberate control of the expression of the gene. Bacterial and viral promoter sequences possessing these properties are described in detail in the literature. Regulatory sequences for the expression in microorganisms, including E. coli and S. cerevisiae, are described in the literature known to those of skill in the art. Termination signals for transcription are also described in the literature.
[0089] Inducible promoters which may provide higher polypeptide yields than constitutive promoters can be used. Suitably, in certain embodiments, a two-stage process may be used: the host cells are first cultured under optimum conditions up to a relatively high cell density; and transcription is then induced.
[0090] When reference is made to more than one exogenous nucleic acid being included in a microorganism, it is to be understood that this refers to the referenced encoding nucleic acids or biochemical activities and not the number of separate nucleic acids introduced into the host organism. As will be understood by those of skill in the art, such exogenous nucleic acids may be introduced into the host organism on separate nucleic acid molecules, on polycistronic nucleic acid molecules, or a combination thereof.
[0091] As will be understood by those of skill in the art, when two or more exogenous encoding nucleic acids are to be co-expressed, both nucleic acids may be inserted, for example, into one expression vector or into separate expression vectors. For single vector expression, the encoding nucleic acids can be operationally linked to a common expression control sequence or linked to different expression control sequences, such as one inducible promoter and one constitutive promoter. Fermentation
[0092] Collagen-derived polypeptides provided herein may be produced by growing transformed host cells described above in any suitable growth medium comprising a carbon source. A suitable growth medium must contain at least one carbon source, at least one nitrogen source, salts, cofactors, buffers, and other components required to grow and maintain the recombinant microorganism. In some embodiments, the organisms can be grown under aerobic conditions within a pH range between 3-7 and a temperature in the range of 15-30ºC.
[0093] Fermentation processes for producing recombinant polypeptides are well-known in the art, and need not be described in detail here. For Komagataella fermentation, fermentation processes may be implemented generally in accordance with Pichia Fermentation Process Guidelines (Invitrogen Life Technologies, version B, 053002).
[0094] In some embodiments, the culture growth medium comprises biorenewable organic matter that includes a source of carbohydrates. These include, for example, grasses, trees (hardwood and softwood), vegetation and crop residues. Other sources can include, for example, waste materials (e.g., spent paper, green waste.). Suitable carbohydrates, including glucose, may be isolated from biorenewable materials using methods that are known in the art. See, for example, Centi and van Santen, Catalysis for Renewables, Wiley-VCH, Weinheim 2007; Kamm, Gruber and Kamm, Biorefineries-Industrial Processes and Products, Wiley-VCH, Weinheim 2006; Shang-Tian Yang, Bioprocessing for Value-Added Products from Renewable Resources New Technologies and Applications, Elsevier B. V.2007; Furia, Starch in the Food Industry, Chapter 8, CRC Handbook of Food Additives 2ndEdition CRC Press, 1973. See also chapters devoted to Starch, Sugar and Syrups within Kirk-Othmer Encyclopedia of Chemical Technology 5thEdition, John Wiley and Sons 2001. Processes to convert starch to glucose are also well known in the art, see, for example, Schenck, “Glucose and Glucose containing Syrups” in Ullmann's Encyclopedia of Industrial Chemistry, Wiley-VCH 2009. Furthermore, methods to convert cellulose to glucose are known in the art, see, for example, Centi and van Santen, Catalysis for Renewables, Wiley-VCH, Weinheim 2007; Kamm, Gruber and Kamm, Biorefineries-Industrial Processes and Products, Wiley-VCH, Weinheim 2006; Shang-Tian Yang, Bioprocessing for Value-Added Products from Renewable Resources New Technologies and Applications, Elsevier B. V.2007.
[0095] Alternative carbon sources may be crude glycerol obtained from biodiesel production plants, lactic acid obtained from degradation of waste poly-lactic acid, lactose or cheese whey permeate obtained from dairy industry, glucosamine obtained from chitin rich waste. The carbon sources may also be fatty acids and their esters (monoglycerides, diglycerides and triglycerides) obtained from plants or plant products such as canola oil, coconut oil, corn oil, olive oil, palm oil, safflower oil, peanut oil, soybean oil, sesame oil, sunflower oil and combinations thereof.
[0096] Another carbon source may be synthesis gas or “syngas”, which is primarily a mixture of H2and CO, may contain CO2, and which is a product of the gasification of organic or fossil fuel based carbonaceous materials.
[0097] C1 compounds, such as carbon monoxide (CO), carbon dioxide (CO2), and methane (CH4) can be derived as feedstocks from wastes gases from industry such as steel manufacture, oil refining, coal, and natural gas, shale gas, biogas, and methane hydrates, as well as in the form of synthesis gas (or syngas) produced from gasification of sustainable resources such as biomass and domestic waste and agricultural wastes.
[0098] In some embodiments, the feedstock source is a starch such as corn starch or a pulse starch. Starch represents the major component of pulse seeds, ranging from 40-50% of the dry seed weight. Starches naturally occur as granules that are composed of chains of glucose units linked together to form the two building blocks of starch: amylose and amylopectin. Compared to many other naturally occurring starches, pulse starches contain high levels of amylose and associated enzymatic resistance.
[0099] The use of starch, and particularly corn starch, is well-known in fermentation processes in the agriculture and food industry, such as for producing bioethanols.
[0100] In some embodiments, starches and in particular, pulse starches, may be subject to enzymatic pre-treatment to transform the starch to fermentable sugars. In some embodiments, amylase and gluco-amylase are suitably used in the enzymatic pretreatment process. The non- refined pretreated stream of starch is used as a feedstock to grow the polypeptide-producing microorganisms.
[0101] In one embodiment, the processes as provided may be carried out in a fermenter.
[0102] The engineered organism can be cultivated in a variety of reactor systems, and the process can be carried out in different modes of operations. The most commonly used bioreactor is a stirred tank bioreactor or aerated fermenter. The fermenter is equipped with sterile air supply, the mixing of bubble dispersion is achieved by mechanical agitation, and the temperature may be maintained using a jacket or coil that circulates steam or cooling water. For aerated vessels, high height / diameter ratio (>3) may be chosen to increase the contact time between the bubbles and liquid phase. Other variations of bioreactors are airlift bioreactor where mixing is achieved without mechanical agitation, and packed bed or fluidized bed bioreactors which are used when the biocatalyst is immobilized.
[0103] The fermentation can be carried out in three different modes: batch, fed-batch and continuous mode. A standard batch bioreactor is considered a “closed” system. In batch mode, all the media components are added to the bioreactor while ensuring sterility. Once the medium has been prepared, the bioreactor is inoculated with an appropriate inoculum and the fermentation is allowed to proceed until the end without any changes to the medium, i.e., without feeding of any additional components. Components such as acid and / or base can, however, be added to maintain the pH, and air / oxygen can be added to maintain the dissolved oxygen levels. In batch fermentation biomass and product concentration change over time until the fermentation is complete. The cells undergo classical lag-phase, exponential growth-phase, stationary phase growth, followed by death phase.
[0104] A variation of the batch mode is fed-batch mode where the nutrients including the carbon source are added to the fermenter as the process progresses.
[0105] In addition to batch or fed-batch mode, continuous mode of fermentation can also be used. A continuous system is considered to be “open” system in contrast to the batch mode. In continuous mode, a defined production medium is added continuously to the bioreactor and equal amount of bioreactor contents are removed at the same rate. Continuous operation can be carried out in a chemostat where the vessel contents, including the cells are removed, or in a bioreactor that uses perfusion culture, which allows recycling of the viable cells back to the bioreactor, allowing high cell densities to be achieved.
[0106] The commonly used fermenter designs and different operation modes are very well- established in the literature [Biochemical Engineering Fundamentals, 2ndEd. J. E. Bailey and D. F. Ollis, McGraw Hill, New York, 1986; Development of Sustainable Bioprocesses: Modeling and Assessment, E. Heinzle, A. P. Biwer and C. L. Cooney, John Wiley & Sons, Ltd., 2006; Bioprocess Engineering: Basic Concepts, 2ndEd., M. L. Shuler and F. Kargi, Prentice Hall, 2001].
[0107] As will be understood by a person of skill in the art, various components may be added to the culture medium to support growth of the microorganism and / or the metabolic processes described herein, including, for example, nutrients, pH modifiers, osmoprotectants. Processing of secreted polypeptides
[0108] In some embodiments, processes as disclosed herein further include purifying the collagen-derived polypeptide product. Methods of purification are known to those of skill in the art and include e.g. by liquid extraction, filtration, distillation or evaporation. Isolation of compound from the fermentation broth depends on the final purity of the compound required. The separation techniques may include: centrifugation, microfiltration, ultrafiltration, nano-filtration, evaporation, crystallization, distillation, and ion-exchange.
[0109] In a preferred embodiment, centrifugation is used to separate the biomass from the fermentation broth. Suitably, the polypeptides can be separated from the supernatant using tangential flow filtration (TFF), followed by precipitation, suitably ammonium sulfate precipitation, followed by dialysis, or chromatographic separation. Suitably, the dialyzed product can be freeze dried or spray dried. Optionally, the method may further include buffer exchange, decolouring and / or deodorizing steps.
[0110] The collagen-derived polypeptides may have gelation properties and be used as isolated, or may be further processed to produce gelatin or improve its gelation properties. For example, the polypeptides may be cross-linked using chemical, enzymatic or thermal cross-linking methods, which are well known in the art. Compositions
[0111] Also provided herein are compositions or formulations containing the collagen-derived polypeptides provided herein, and methods of making such compositions or formulations. In some embodiments, the composition is a consumable product, such as a food, beverage or nutraceutical product. In some embodiments, the polypeptides are included in a composition in an amount sufficient to act as a gelling agent, stabilizing agent, foaming agent, film-forming agent, emulsifier or thickening agent, in like manner to animal-derived collagen products. The polypeptides may be treated to produce a mixture of smaller peptides, such as by digesting or hydrolyzing the polypeptide.
[0112] The collagen-derived polypeptides provided herein may be used in formulations or compositions which require or may benefit from the functional properties and / or nutritional content of the polypeptides. They may be used as a substitute for animal-based collagen in different products, as they have one or more properties of natural animal-based collagen. For example, in some embodiments, the polypeptides are soluble in that they form a clear solution at a concentration of at least 1% wt, preferably at least 5%, or more preferably at least 10%, in water or buffer between about pH 3.0 to about 10.0, at a temperature between about 4° C to about 100° C, preferably between about 15° to about 80° C. In some embodiments, they form a viscous solution, where viscosity is measured with a 1% wt solution at 20° C. Preferably, the solution has a viscosity between about 10 mP and 5000 cP, between about 1 cP to about 2000 cP, or between about 10 cP to about 2000 cP.
[0113] In preferred embodiments, the polypeptides form a gel, which is preferably a reversible gel. Gel-forming ability may be determined if the polypeptides, at a concentration of 5% wt or more, form a gel in a pH of between about 3.0 to 10.0. As used herein, a "gel" may be a polymeric or colloidal gel, comprising a substantially dilute semi-solid system, where solid particles are cross-linked or otherwise non-chemically bonded, which exhibits no flow when in the steady state, although the liquid phase may still diffuse through this system.
[0114] In some embodiments, the composition or formula may provide an edible vegan alternative to an animal product, such as bone broth, a functional beverage, protein supplement, cheesecake, and the like. Preferably, the edible vegan alternative product may taste identical to animal-derived edible product, with identical mouth feel, and the same or better nutritional profile.
[0115] In some embodiments, the composition may comprise the collagen-derived polypeptides as an amino acid supplement, in like manner to animal-derived collagen hydrolysates or products used as a nutritional supplement.
[0116] In some embodiments, the composition may comprise at least one suitable additive such as sweeteners, flavorings, and colorings, which are well-known in the art. The composition may be identical or substantially similar to an existing or conventional formulation, except for the addition of or substitution with the collagen-derived polypeptides provided herein.
[0117] In some embodiments, the collagen-derived polypeptides may be used as a cell- scaffolding additive or agent. EXAMPLES
[0118] Microbial strains were designed to produce animal-free collagen-derived polypeptides from digested pulse starches. The original strain prior to modification is Komagataella phaffii (formerly known as Pichia pastoris) strain Y11430. Example 1. Expression of Collagen-Derived Polypeptides
[0119] The original strain Komagataella phaffii was modified by inserting DNA sequence of a portion of a native collagen in the genome. The DNA sequences encode amino acid sequences of partial Type 1 collagen from three species (human, pig and salmon). The human collagen- derived polypeptide was further modified with additional glycine-proline-proline. The sequences of these polypeptides are provided herein as SEQ ID NO: 1, SEQ ID NO: 2 and SEQ ID NO: 3. The sequences were selected based on criteria such as amino acid composition, predicted isoelectric points, expected yield and improved post-translational processing. These polypeptides have similar biophysical properties to full-length native collagen sequences, or truncated versions of those native sequences. As evidenced in Examples, these polypeptides have gelling functionality.
[0120] Additional gene fragments were inserted as well in the genome to assist gene regulation, including a GAP prompter and alpha secretion signal sequence to promote gelatin secretion from the cell. These DNA sequences, which encode the polypeptides SEQ ID NOs: 1, 2 and 3, are provided herein as SEQ ID NOs: 4, 5 and 6.
[0121] Komagataella host cells were prepared and transformed generally in accordance with Lin- Cereghino et al.2005 – Condensed protocol for competent cell preparation and transformation of the methylotrophic yeast Pichia pastoris. Generally, Komagataella was grown overnight in YPD at 30°C, 200rpm. The culture was diluted and grown at 30° C, 200rpm for about 4-5hr. A portion of mid-log phase (OD600 = 0.8-1.0) culture of cells was harvested and spun to obtain a pellet. The pellet was resuspended in ice-cold BEDS solution: Reagent Stock Working concentration Amt added for 50 ml Bicine-NaOH, pH 8.3 200 mM 10 mM 2.5 ml
[0122] Plasmid DNA was linearized at 37°C for 1 hr, with care taken to digest enough plasmid for intended number of transformations, accounting for loss during plasmid clean-up. Time, temperature, buffer and enzyme amounts were adjusted based on the DNA amount and specific enzyme used.
[0123] In one sample protocol, plasmid 15ug in 200uL, buffer (10x) 25uL, enzyme SalI 2.5uL (25U total) and milliQ 22.5uL was combined and incubated at enzyme reaction temperature for 3hr.
[0124] While the reaction was incubating, 1% agarose gel was prepared. After 3hr, the reaction was placed into a fridge and a gel was run to confirm that the plasmid has been fully linearized.
[0125] The linearized plasmid DNA was cleaned up by adding 1 / 10 volume of 3M Sodium Acetate and 2.5 volumes of 96% or anhydrous ethanol to each refrigerated sample.
[0126] The samples were incubated at -20° C for 30 mins, centrifuged to pellet DNA at 14,000 RPM (or max speed of tabletop centrifuge) for 10 min at 4°C, washed with 70% ethanol, and repelleted. The DNA pellet was then air dried and resuspended in 20μL of deionized sterile milliQ water. The Sall digestion provided from 15ug starting plasmid about 500ng / uL after cleanup (10ug total) and 5uL was used for each transformation reaction (HIS+ selection).
[0127] The cells were then transformed by electroporation. Approximately 3 μL (50–100 ng) of linearized plasmid DNA was mixed with 40-50 μL of competent cells or a thawed cell stock in an ice-chilled EP tube and incubated for 2 min on ice. The solution was then transferred into an ice- chilled electroporation cuvette – BioRad™ 0.2cm gap, and electroporated using the following parameters:
[0128] For BioRad Micropulser™ set to ‘Pic’ setting (2kV), for ECM® 630 electroporator (BTX, San Diego, CA, USA): cuvette gap, 2.0 mm; charging voltage, 1500 V; resistance, 200 Ω; capacitance, 50 μF, or for Gene Pulser® II electroporator (Bio-Rad Laboratories, Hercules, CA, USA): cuvette gap, 2.0 mm; charging voltage, 1500 V; resistance, 200 Ω; capacitance, 25 μF.
[0129] The cuvette was immediately removed and 0.5 mL of ice cold 1.0 M sorbitol was added to the cuvette when selecting for complementation of an auxotrophic mutant and plated on selective media (YNB, 2% glucose + 1M sorbitol). For antibiotic resistance selection, 1.0 mL of ice cold YPD / sorbitol was added to the cuvette (0.5 mL 1.0 M sorbitol and 0.5 mL YPD) and the cells incubated at 30° C for 1 hour w / o shaking. Cells were pelleted and resuspended in the remaining solution and plated on YPDS (YPD + 1M sorbitol) with increasing concentration of the antibiotic.
[0130] Pulse parameters were checked to ensure the time constant should be close to 5 milliseconds. The field strength can be calculated as actual volts (kV) / cuvette gap (cm).
[0131] The plates were then incubated for 72–96 hrs at 30 °C for colonies to appear.
[0132] Successful expression of SEQ ID NO: 1, SEQ ID NO: 2 and SEQ ID NO: 3 was verified by SDS-PAGE and mass spectrometry analysis. Example 2. Fermentation
[0133] The host strain, transformed in Example 1, was grown in a fermenter to reach optical density (OD) of over 40, observed for additional 2 days, collected final OD sample when it reached 50, and the collagen-derived polypeptides, secreted in the fermentation broth extracellularly, were harvested using steps listed below. Example 3. Downstream processing of fermented cells to produce non-animal based collagen- derived polypeptides
[0134] Non-animal collagen-derived polypeptide was prepared from cells prepared and fermented per Examples 1 and 2 by the following method: 1. Following the fermentation, cells were removed by centrifugation at 6000 rpm (9,000g). for 15 min and 4°C. 2. Crystalline ammonium sulfate was slowly added to the medium to 45% ammonium sulfate saturation while stirring to create a solution. 3. The solution was incubated at 4°C over-night. 4. The solution was centrifuged in 1L bucket at 6000rpm (~9000g), 60min, 4°C to pellet gelatin. 5. Most of the solution was decanted and pellet was mixed with remaining 40mL of solution and centrifuged again at 21000g, 30min, 4°C. 6. Clarified solution was decanted and pellet was dissolved in about 4mL of milliQ water. 7. The polypeptide solution was then dialyzed for 3hr at room temperature (RT) into 1800mL of purified water using SnakeSkin™ dialysis tubing (Thermo Scientific, 10,000 MWCO – molecular weight cut off) with stirring. 8. After dialysis, a precipitate was removed by centrifugation – 3min, tabletop centrifuge for Eppendorf tubes at 13,000rpm, RT. 9. Clear solution was then concentrated using VacuFuge Plus™ (Eppendorf) or freeze-dried and final solution / gel or dried gelatin was stored at 4°C.
[0135] SEQ ID No: 1 and 2 polypeptides formed free-standing gels. Fig.2 shows a photograph of a gelatin prepared according to this process. Fig. 3 shows an animal-free porcine collagen- derived polypeptides with gelling functionality. SEQ ID No: 3 formed a viscous solution. Example 4 – Edible Food Product
[0136] Collagen-derived polypeptides, produced and harvested in accordance with Examples 1- 3, were used to prepare a vegan bone broth. The polypeptides were combined with modified corn starch, natural flavors, tapioca maltodextrin, natural seasonings, yeast extract, modified tapioca starch, medium chain triglycerides (MCT) oil, and salt to produce a bone broth which tastes very similar to an animal-derived bone broth, with identical or equivalent mouth feel, and the same or better nutritional profile. Heading, incorporation by reference and modifications
[0137] The section headings used herein are for organizational purposes only and are not to be construed as limiting the subject matter described.
[0138] All documents referenced herein are incorporated by reference for all purposes, however, it should be appreciated that any patent, publication, or other disclosure material, in whole or in part, that is incorporated by reference herein is incorporated only to the extent that the incorporated material does not conflict with definitions, statements, or other disclosure material set forth in this disclosure. As such, and to the extent necessary, the disclosure as explicitly set forth herein supersedes any conflicting material incorporated herein by reference.
[0139] It will be understood that numerous modifications thereto will appear to those skilled in the art. Accordingly, the above description, accompanying drawings and examples that follow should be taken as illustrative of the invention and not in a limiting sense. It will further be understood that it is intended to cover any variations, uses, or adaptations of the invention following, in general, the principles of the invention and including such departures from the present disclosure as come within known or customary practice within the art to which the invention pertains and as may be applied to the essential features herein before set forth, and as follows in the scope of the appended claims.
[0140] The embodiments of the invention described above are intended to be exemplary only. The scope of the invention is therefore intended to be limited solely by the scope of the appended claims. Sequences
[0141] This application contains a Sequence Listing which has been submitted electronically in XML format and is hereby incorporated by reference in its entirety. Said XML copy, created on Dec.1, 2023, is named 94704_5_Liven_PCT.xml and is 122 KB in size. SEQ ID NO: 1 HUMAN – with N- and C-terminal modifications (underlined) GPPGPPGPPGPPGPPGPPGPPGPPGPPGPPSGARGERGFPGERGVQGPPGPAGPRGANGAPGNDGAKGDA GAPGAPGSQGAPGLQGMPGERGAAGLPGPKGDRGDAGPKGADGSPGKDGVRGLTGPIGPPGPAGAPGDKGE SGPSGPAGPTGARGAPGDRGEPGPPGPAGFAGPPGADGQPGAKGEPGDAGAKGDAGPPGPAGPAGPPGPIG NVGAPGAKGARGSAGPPGATGFPGAAGRVGPPGPSGNAGPPGPPGPAGKEGGKGPRGETGPAGRPGEVGPP GPPGPAGEKGSPGADGPAGAPGTPGPQGIAGQRGVVGLPGQRGERGFGPPGPPGPPGPPGPPGPPGPPGPP GPPGPP SEQ ID NO: 2 PIG SGARGERGFPGERGVQGPPGPAGPRGANGAPGNDGAKGDAGAPGAPGSQGAPGLQGMPGERGAAGLPGPK GDRGDAGPKGADGAPGKDGVRGLTGPIGPPGPAGAPGDKGETGPSGPAGPTGARGAPGDRGEPGPPGPAGF AGPPGADGQPGAKGEPGDAGAKGDAGPPGPAGPTGPPGPIGSVGAPGPKGARGSAGPPGATGFPGAAGRVG PPGPSGNAGPPGPPGPAGKEGSKGPRGETGPAGRPGEAGPPGPPGPAGEKGSPGADGPAGAPGTPGPQGIA GQRGVVGLPGQRGERGF SEQ ID NO: 3 SALMON SGSRGDRGFPGERGGLGSAGPTGPRGANGSPGNDGARGESGAAGAPGGMGAPGLQGMPGERGSSGNSGAK GERGDGGPKGADGGPGKDGMRGMTGPIGPPGPTGAHGEKGEGGLGGPPGPTGGRGSPGERGEHGAPGPAG FAGPPGADGQPGNKGEAGNNGPKGEAGAPGPGGPVGAPGPQGPAGNSGAKGTRGAPGPPGASGMPGPGGR VGPPGGSGAPGSAGPPGPAGKEGQRGGRGETGNAGRPGEAGAAGPPGPSGPSGSKGNDGPMGAPGTPGPG GIAGQRGIVGGPGGRGPSGT SEQ ID NO: 4 HUMAN - DNA GGTCCACCTGGTCCACCTGGTCCACCTGGTCCACCTGGTCCACCTGGTCCACCTGGTCCACCTGGTCCACC TGGTCCACCTGGTCCACCTTCTGGTGCTAGAGGTGAAAGAGGTTTTCCAGGAGAGAGAGGTGTTCAGGGTC CACCTGGTCCAGCTGGTCCTAGAGGTGCTAACGGTGCTCCAGGAAATGATGGTGCTAAGGGAGATGCTGGT GCTCCAGGTGCTCCTGGTTCTCAAGGTGCTCCTGGTTTGCAGGGTATGCCAGGTGAAAGAGGTGCTGCTGG TTTGCCAGGTCCTAAAGGAGATAGAGGAGATGCTGGTCCTAAGGGTGCTGATGGTTCTCCTGGTAAAGATG GTGTTAGAGGTTTGACTGGTCCAATTGGTCCACCTGGTCCTGCTGGTGCTCCAGGAGATAAGGGTGAATCT GGTCCATCTGGTCCTGCTGGTCCTACTGGTGCTAGAGGTGCTCCAGGAGATAGAGGTGAACCAGGTCCACC TGGACCAGCTGGTTTTGCTGGTCCACCTGGTGCTGATGGTCAACCTGGTGCTAAGGGAGAGCCAGGAGATG CTGGTGCTAAAGGAGATGCCGGTCCACCTGGACCTGCTGGTCCAGCTGGTCCACCTGGTCCTATTGGTAAC GTTGGTGCTCCAGGTGCTAAGGGTGCTAGAGGTTCTGCTGGTCCACCTGGAGCCACTGGTTTCCCAGGTGC TGCTGGTAGAGTTGGTCCACCTGGTCCATCTGGTAATGCCGGTCCACCTGGTCCACCTGGGCCAGCTGGTA AAGAAGGTGGTAAAGGTCCAAGAGGTGAGACTGGTCCTGCTGGTAGACCAGGTGAGGTCGGTCCACCTGG TCCACCTGGACCTGCTGGTGAAAAAGGTTCTCCAGGTGCTGACGGACCTGCTGGTGCTCCAGGTACTCCAG GTCCTCAAGGTATTGCTGGTCAAAGAGGTGTTGTTGGTTTGCCAGGTCAAAGAGGTGAAAGAGGTTTCGGTC CACCTGGTCCACCTGGTCCACCTGGTCCACCTGGTCCACCTGGTCCACCTGGTCCACCTGGTCCACCTGGT CCACCTGGTCCACCT SEQ ID NO: 5 PIG - DNA TCTGGTGCTAGAGGTGAAAGAGGTTTTCCTGGAGAGAGAGGTGTTCAGGGTCCACCTGGTCCAGCTGGTCC TAGAGGTGCTAACGGTGCTCCAGGAAATGATGGTGCTAAGGGAGATGCTGGTGCTCCAGGTGCTCCTGGTT CTCAAGGTGCTCCTGGTTTGCAGGGTATGCCAGGTGAAAGAGGTGCTGCTGGTTTGCCAGGTCCTAAAGGA GATAGAGGAGATGCTGGTCCTAAGGGTGCTGATGGTGCTCCAGGTAAAGATGGTGTTAGAGGTTTGACTGG TCCAATCGGTCCACCTGGTCCTGCTGGTGCTCCAGGAGATAAGGGTGAAACTGGTCCATCTGGTCCTGCTG GTCCAACTGGTGCTAGAGGTGCTCCAGGAGATAGAGGTGAACCAGGTCCACCTGGACCAGCTGGTTTTGCT GGTCCACCTGGTGCTGACGGTCAACCTGGTGCTAAGGGAGAGCCAGGAGATGCTGGTGCTAAAGGAGATG CCGGTCCACCTGGACCTGCTGGTCCTACCGGTCCACCTGGACCAATTGGTTCTGTTGGTGCTCCAGGTCCT AAGGGTGCTAGAGGTTCTGCTGGTCCACCTGGAGCCACTGGTTTCCCTGGTGCTGCTGGTAGAGTTGGTCC ACCTGGTCCATCTGGTAACGCTGGTCCACCTGGTCCACCTGGCCCAGCTGGTAAAGAAGGTTCTAAAGGTC CAAGAGGTGAGACTGGTCCTGCTGGTAGACCAGGTGAAGCCGGTCCACCTGGTCCACCTGGGCCTGCTGG TGAAAAAGGTTCTCCAGGTGCTGACGGACCTGCTGGTGCTCCAGGTACTCCAGGTCCTCAAGGTATTGCTG GTCAAAGAGGTGTTGTTGGTTTGCCAGGTCAAAGAGGTGAAAGAGGTTTC SEQ ID NO: 6 SALMON - DNA TCTGGTTCTAGAGGAGATAGAGGTTTTCCTGGTGAAAGAGGTGGTTTGGGTTCTGCTGGTCCTACTGGTCCT AGAGGTGCTAACGGTTCTCCTGGTAATGATGGTGCTAGAGGTGAGTCTGGTGCTGCTGGTGCTCCAGGTGG TATGGGTGCTCCTGGTTTGCAGGGTATGCCAGGTGAAAGAGGTTCTTCTGGTAACTCTGGTGCTAAGGGAG AGAGAGGAGATGGTGGTCCAAAGGGTGCTGACGGTGGTCCTGGTAAAGATGGTATGCGTGGTATGACTGGT CCTATTGGTCCACCTGGACCAACTGGTGCTCATGGTGAAAAAGGAGAGGGTGGTTTGGGTGGTCCACCTGG ACCTACTGGTGGTAGAGGTTCTCCAGGTGAAAGAGGTGAGCACGGTGCTCCAGGTCCTGCTGGTTTCGCCG GTCCACCTGGAGCTGATGGTCAGCCTGGTAACAAGGGTGAAGCTGGTAACAATGGTCCAAAAGGAGAGGCT GGTGCTCCAGGTCCTGGTGGTCCTGTTGGTGCTCCAGGTCCTCAAGGTCCAGCTGGTAATTCTGGTGCTAA GGGTACTAGAGGTGCTCCAGGTCCACCTGGAGCTTCTGGTATGCCAGGACCTGGTGGTAGAGTTGGTCCAC CTGGTGGTTCTGGTGCTCCTGGTTCTGCTGGTCCACCTGGTCCAGCTGGTAAAGAAGGTCAAAGAGGTGGT AGAGGTGAGACTGGTAACGCTGGTAGACCAGGTGAAGCTGGTGCTGCTGGTCCACCTGGACCTTCTGGTCC TTCTGGTTCTAAGGGTAATGATGGTCCAATGGGTGCTCCTGGTACTCCAGGTCCTGGTGGTATTGCTGGTCA AAGAGGTATTGTTGGTGGTCCAGGTGGTAGAGGTCCTTCTGGTACT SEQ ID NO: 7 Human without GPP repeats SGARGERGFPGERGVQGPPGPAGPRGANGAPGNDGAKGDAGAPGAPGSQGAPGLQGMPGERGAAGLPGPK GDRGDAGPKGADGSPGKDGVRGLTGPIGPPGPAGAPGDKGESGPSGPAGPTGARGAPGDRGEPGPPGPAGF AGPPGADGQPGAKGEPGDAGAKGDAGPPGPAGPAGPPGPIGNVGAPGAKGARGSAGPPGATGFPGAAGRVG PPGPSGNAGPPGPPGPAGKEGGKGPRGETGPAGRPGEVGPPGPPGPAGEKGSPGADGPAGAPGTPGPQGIA GQRGVVGLPGQRGERGF SEQ ID NO: 8 P2 pig SYGYDEKSAGISVPGPMGPSGPRGLPGPPGAPGPQGFQGPPGEPGEPGASGPMGPRGPPGPPGKNGDDGEA GKPGRPGERGPPGPQGARGLPGTAGLPGMKGHRGFSGLDGAKGDAGPAGPKGEPGSPGENGAPGQMGPRG LPGERGRPGPPGPAGARGNDGATGAAGPPGPTGPAGPPGFPGAVGAKGEAGPQGARGSEGPQGVRGEPGPP GPAGAAGPAGNPGADGQPGGKGANGAPGIAGAPGFPGARGPSGPQGPSGPPGPKGNSGEPGAPGSKGDTGA KGEPGPTGVQGPPGPAGEEGKRGARGEPGPAGLPGPPGERGGPGSRGFPGADGVAGPKGPAGERGSPGPA GPKGSPGEAGRPGEAGLPGAKGLTGSPGSPGPDGKTGPPGPAGQDGRPGPPGPPGARGQAGVMGFPGPKG AAGEPGKAGERGVPGPPGAVGPAGKDGEAGAQGPPGPAGPAGERGEQGPAGSPGFQGLPGPAGPPGEAGKP GEQGVPGDLGAPGPSGARGERGFPGERGVQGPPGPAGPRGANGAPGNDGAKGDAGAPGAPGSQGAPGLQG MPGERGAAGLPGPKGDRGDAGPKGADGAPGKDGVRGLTGPIGPPGPAGAPGDKGETGPSGPAGPTGARGAP GDRGEPGPPGPAGFAGPPGADGQPGAKGEPGDAGAKGDAGPPGPAGPTGPPGPIGSVGAPGPKGARGSAGP PGATGFPGAAGRVGPPGPSGNAGPPGPPGPAGKEGSKGPRGETGPAGRPGEAGPPGPPGPAGEKGSPGADG PAGAPGTPGPQGIAGQRGVVGLPGQRGERGFPGLPGPSGEPGKQGPSGPSGERGPPGPMGPPGLAGPPGES GREGAPGAEGSPGRDGAPGPKGDRGESGPAGPPGAPGAPGAPGPVGPAGKSGDRGETGPAGPAGPVGPVG ARGPAGPQGPRGDKGETGEQGDRGIKGHRGFSGLQGPPGPPGSPGEQGPSGASGPAGPRGPPGSAGAPGKD GLNGLPGPIGPPGPRGRTGDAGPVGPPGPPGPPGPPGPPSGGFDFSFLPQPPQEKAHDGGRYYRA SEQ ID NO: 9 P2 pig DNA TCCTACGGATATGACGAAAAATCTGCAGGAATTAGTGTTCCTGGACCGATGGGGCCGAGTGGACCACGAGG GCTTCCGGGGCCCCCTGGTGCCCCAGGGCCGCAGGGGTTCCAGGGTCCCCCTGGCGAACCGGGAGAGCC CGGCGCATCGGGACCAATGGGACCGCGAGGACCTCCGGGACCTCCTGGCAAAAACGGGGATGACGGCGA AGCAGGTAAGCCGGGACGGCCAGGTGAGAGGGGACCGCCTGGTCCCCAAGGGGCTCGGGGGCTGCCAG GCACAGCGGGGCTTCCCGGTATGAAGGGTCACAGAGGGTTTTCAGGTTTAGATGGGGCTAAGGGAGATGC CGGGCCGGCGGGACCAAAAGGAGAACCAGGAAGCCCCGGAGAGAATGGCGCCCCGGGTCAGATGGGGCC ACGGGGTTTACCTGGCGAGCGTGGGAGGCCCGGTCCCCCGGGGCCTGCTGGGGCTCGTGGTAACGACGG CGCGACCGGGGCCGCCGGTCCACCCGGACCAACTGGCCCTGCCGGGCCGCCGGGCTTCCCCGGAGCTGT TGGAGCGAAGGGAGAAGCAGGCCCTCAAGGCGCGCGAGGCTCCGAAGGACCCCAAGGCGTTCGTGGTGA GCCTGGACCGCCGGGCCCAGCAGGGGCGGCCGGACCGGCTGGAAACCCAGGTGCTGATGGGCAGCCCG GCGGTAAAGGTGCAAATGGAGCGCCCGGCATAGCTGGCGCTCCTGGTTTCCCAGGTGCACGTGGCCCGTC TGGGCCTCAGGGCCCGTCAGGTCCGCCGGGACCTAAGGGTAATTCTGGCGAGCCCGGTGCTCCAGGGAGT AAAGGCGATACTGGTGCCAAAGGTGAACCTGGACCAACGGGGGTTCAAGGGCCACCTGGACCCGCAGGTG AAGAGGGAAAGAGAGGCGCCAGGGGGGAACCGGGCCCCGCAGGCCTACCTGGGCCTCCGGGCGAACGTG GAGGACCTGGTAGTCGTGGGTTTCCGGGTGCGGACGGCGTGGCAGGTCCGAAGGGTCCCGCAGGTGAAA GGGGCAGCCCCGGGCCAGCGGGCCCAAAAGGATCTCCAGGCGAAGCAGGGCGCCCGGGCGAGGCAGGA CTTCCGGGCGCTAAGGGTTTGACCGGTTCACCTGGGTCACCCGGCCCCGACGGTAAAACGGGTCCGCCCG GGCCTGCGGGCCAGGACGGCCGCCCCGGGCCGCCGGGACCGCCAGGTGCTCGTGGGCAGGCCGGTGTT ATGGGTTTCCCTGGACCGAAGGGAGCTGCTGGCGAACCGGGGAAGGCAGGAGAGAGAGGTGTCCCCGGC CCCCCGGGGGCTGTAGGTCCCGCTGGGAAAGACGGGGAGGCAGGGGCCCAAGGTCCCCCCGGACCTGCG GGCCCGGCAGGAGAGCGCGGTGAGCAGGGGCCAGCAGGGAGCCCCGGCTTCCAGGGCTTACCCGGCCC CGCAGGCCCACCAGGTGAGGCCGGAAAACCAGGCGAGCAAGGTGTGCCTGGCGATTTAGGTGCGCCTGGA CCGTCTGGTGCTCGTGGTGAGCGCGGATTTCCAGGGGAGCGCGGTGTCCAAGGTCCACCGGGACCTGCCG GGCCCCGGGGCGCAAACGGCGCCCCCGGGAATGATGGAGCCAAGGGTGACGCAGGGGCGCCCGGTGCG CCAGGATCGCAGGGTGCCCCAGGACTCCAAGGCATGCCGGGTGAAAGAGGGGCAGCAGGATTGCCCGGT CCCAAGGGCGATAGGGGTGATGCCGGCCCTAAGGGGGCGGACGGCGCACCTGGCAAGGATGGCGTAAGA GGGCTGACTGGGCCAATTGGCCCGCCTGGGCCCGCCGGGGCGCCGGGAGATAAAGGAGAGACAGGTCCA TCAGGACCAGCTGGTCCTACCGGGGCTAGGGGCGCACCAGGGGACCGAGGTGAACCTGGGCCCCCCGGG CCTGCGGGGTTCGCCGGTCCTCCTGGCGCCGATGGACAACCCGGGGCGAAAGGCGAACCTGGTGACGCC GGCGCAAAAGGTGATGCGGGGCCACCCGGGCCAGCTGGACCCACCGGCCCCCCTGGGCCTATCGGATCT GTCGGAGCACCCGGTCCCAAGGGCGCGAGGGGCAGCGCCGGTCCTCCCGGAGCGACGGGATTCCCGGGT GCAGCCGGCCGGGTTGGCCCTCCCGGGCCATCCGGCAATGCAGGTCCTCCTGGACCCCCAGGGCCAGCT GGAAAAGAGGGCAGTAAAGGCCCTCGCGGAGAAACTGGTCCAGCGGGACGGCCAGGGGAGGCCGGCCCT CCTGGTCCACCGGGACCAGCTGGTGAAAAGGGATCTCCAGGTGCTGATGGGCCCGCCGGTGCTCCTGGAA CACCCGGTCCACAAGGGATCGCCGGACAACGAGGTGTAGTAGGTCTGCCAGGGCAACGCGGGGAAAGAG GTTTTCCCGGCCTCCCGGGGCCGTCCGGAGAGCCCGGAAAGCAGGGTCCGTCAGGACCGTCGGGGGAAA GGGGACCTCCTGGGCCGATGGGACCCCCGGGTCTGGCTGGGCCACCGGGTGAATCGGGCCGGGAGGGA GCGCCCGGGGCTGAAGGTAGCCCTGGCCGTGACGGTGCGCCTGGACCTAAAGGTGATCGGGGAGAAAGT GGCCCAGCCGGTCCCCCCGGCGCTCCTGGGGCCCCAGGCGCTCCGGGTCCCGTAGGACCAGCTGGGAAG AGCGGCGATCGTGGTGAGACGGGTCCAGCGGGCCCAGCGGGACCGGTCGGTCCCGTGGGTGCCCGAGGT CCTGCAGGTCCACAGGGGCCTCGTGGTGATAAAGGCGAGACAGGGGAGCAGGGCGACCGAGGCATTAAAG GTCATCGGGGTTTTTCGGGGCTCCAAGGCCCACCGGGCCCGCCGGGGTCCCCGGGAGAACAGGGCCCGT CCGGTGCGTCTGGTCCAGCAGGTCCTCGTGGTCCTCCTGGCTCCGCTGGAGCCCCAGGCAAGGACGGATT GAACGGGCTCCCAGGCCCGATAGGGCCACCTGGACCACGAGGGAGAACCGGCGATGCGGGGCCGGTGGG GCCACCGGGGCCTCCGGGCCCGCCAGGACCCCCCGGTCCTCCTTCGGGTGGATTTGATTTCAGCTTTCTAC CTCAGCCTCCACAAGAAAAAGCCCATGATGGAGGACGTTACTATAGAGCGtaa SEQ ID NO: 10 - P3 pig SGPPGPKGNSGEPGAPGSKGDTGAKGEPGPTGVQGPPGPAGEEGKRGARGEPGPAGLPGPPGERGGPGSR GFPGADGVAGPKGPAGERGSPGPAGPKGSPGEAGRPGEAGLPGAKGLTGSPGSPGPDGKTGPPGPAGQDGR PGPPGPPGARGQAGVMGFPGPKGAAGEPGKAGERGVPGPPGAVGPAGKDGEAGAQGPPGPAGPAGERGEQ GPAGSPGFQGLPGPAGPPGEAGKPGEQGVPGDLGAPGPSGARGERGFPGERGVQGPPGPAGPRGANGAPG NDGAKGDAGAPGAPGSQGAPGLQGMPGERGAAGLPGPKGDRGDAGPKGADGAPGKDGVRGLTGPIGPPGPA GAPGDKGETGPSGPAGPTGARGAPGDRGEPGPPGPAGFAGPPGADGQPGAKGEPGDAGAKGDAGPPGPAG PTGPPGPIGSVGAPGPKGARGSAGPPGATGFPGAAGRVGPPGPSGNAGPPGPPGPAGKEGSKGPRGETGPA GRPGEAGPPGPPGPAGEKGSPGADGPAGAPGTPGPQGIAGQRGVVGLPGQRGERGFPGLPGPSGEPGKQGP SGPSGERGPPGPMGPPGLAGPPGESGREGAPGAEGSPGRDGAPGPKGDRGESGPAGPPGAPGAPGAPGPV GPAGKSGDRGETGPAGPAGPVGPVGARGPAGPQGPRGDKGETGEQGDRGIKGHRGFSGLQGPPGPPGSPGE QGPSGASGPAGPRGPPGSAGAPGKDGLNGLPGPIGPPGPRGRTGDAGPVGPPGPPGPPGPPGPPSGGFDFSF LPQPPQEKAHDGGRYYRA SEQ ID NO: 11 P3 pig DNA TCAGGTCCGCCGGGACCTAAGGGTAATTCTGGCGAGCCCGGTGCTCCAGGGAGTAAAGGCGATACTGGTG CCAAAGGTGAACCTGGACCAACGGGGGTTCAAGGGCCACCTGGACCCGCAGGTGAAGAGGGAAAGAGAGG CGCCAGGGGGGAACCGGGCCCCGCAGGCCTACCTGGGCCTCCGGGCGAACGTGGAGGACCTGGTAGTCG TGGGTTTCCGGGTGCGGACGGCGTGGCAGGTCCGAAGGGTCCCGCAGGTGAAAGGGGCAGCCCCGGGCC AGCGGGCCCAAAAGGATCTCCAGGCGAAGCAGGGCGCCCGGGCGAGGCAGGACTTCCGGGCGCTAAGGG TTTGACCGGTTCACCTGGGTCACCCGGCCCCGACGGTAAAACGGGTCCGCCCGGGCCTGCGGGCCAGGAC GGCCGCCCCGGGCCGCCGGGACCGCCAGGTGCTCGTGGGCAGGCCGGTGTTATGGGTTTCCCTGGACCG AAGGGAGCTGCTGGCGAACCGGGGAAGGCAGGAGAGAGAGGTGTCCCCGGCCCCCCGGGGGCTGTAGGT CCCGCTGGGAAAGACGGGGAGGCAGGGGCCCAAGGTCCCCCCGGACCTGCGGGCCCGGCAGGAGAGCG CGGTGAGCAGGGGCCAGCAGGGAGCCCCGGCTTCCAGGGCTTACCCGGCCCCGCAGGCCCACCAGGTGA GGCCGGAAAACCAGGCGAGCAAGGTGTGCCTGGCGATTTAGGTGCGCCTGGACCGTCTGGTGCTCGTGGT GAGCGCGGATTTCCAGGGGAGCGCGGTGTCCAAGGTCCACCGGGACCTGCCGGGCCCCGGGGCGCAAAC GGCGCCCCCGGGAATGATGGAGCCAAGGGTGACGCAGGGGCGCCCGGTGCGCCAGGATCGCAGGGTGC CCCAGGACTCCAAGGCATGCCGGGTGAAAGAGGGGCAGCAGGATTGCCCGGTCCCAAGGGCGATAGGGG TGATGCCGGCCCTAAGGGGGCGGACGGCGCACCTGGCAAGGATGGCGTAAGAGGGCTGACTGGGCCAAT TGGCCCGCCTGGGCCCGCCGGGGCGCCGGGAGATAAAGGAGAGACAGGTCCATCAGGACCAGCTGGTCC TACCGGGGCTAGGGGCGCACCAGGGGACCGAGGTGAACCTGGGCCCCCCGGGCCTGCGGGGTTCGCCG GTCCTCCTGGCGCCGATGGACAACCCGGGGCGAAAGGCGAACCTGGTGACGCCGGCGCAAAAGGTGATG CGGGGCCACCCGGGCCAGCTGGACCCACCGGCCCCCCTGGGCCTATCGGATCTGTCGGAGCACCCGGTC CCAAGGGCGCGAGGGGCAGCGCCGGTCCTCCCGGAGCGACGGGATTCCCGGGTGCAGCCGGCCGGGTT GGCCCTCCCGGGCCATCCGGCAATGCAGGTCCTCCTGGACCCCCAGGGCCAGCTGGAAAAGAGGGCAGTA AAGGCCCTCGCGGAGAAACTGGTCCAGCGGGACGGCCAGGGGAGGCCGGCCCTCCTGGTCCACCGGGAC CAGCTGGTGAAAAGGGATCTCCAGGTGCTGATGGGCCCGCCGGTGCTCCTGGAACACCCGGTCCACAAGG GATCGCCGGACAACGAGGTGTAGTAGGTCTGCCAGGGCAACGCGGGGAAAGAGGTTTTCCCGGCCTCCCG GGGCCGTCCGGAGAGCCCGGAAAGCAGGGTCCGTCAGGACCGTCGGGGGAAAGGGGACCTCCTGGGCCG ATGGGACCCCCGGGTCTGGCTGGGCCACCGGGTGAATCGGGCCGGGAGGGAGCGCCCGGGGCTGAAGG TAGCCCTGGCCGTGACGGTGCGCCTGGACCTAAAGGTGATCGGGGAGAAAGTGGCCCAGCCGGTCCCCCC GGCGCTCCTGGGGCCCCAGGCGCTCCGGGTCCCGTAGGACCAGCTGGGAAGAGCGGCGATCGTGGTGAG ACGGGTCCAGCGGGCCCAGCGGGACCGGTCGGTCCCGTGGGTGCCCGAGGTCCTGCAGGTCCACAGGGG CCTCGTGGTGATAAAGGCGAGACAGGGGAGCAGGGCGACCGAGGCATTAAAGGTCATCGGGGTTTTTCGG GGCTCCAAGGCCCACCGGGCCCGCCGGGGTCCCCGGGAGAACAGGGCCCGTCCGGTGCGTCTGGTCCAG CAGGTCCTCGTGGTCCTCCTGGCTCCGCTGGAGCCCCAGGCAAGGACGGATTGAACGGGCTCCCAGGCCC GATAGGGCCACCTGGACCACGAGGGAGAACCGGCGATGCGGGGCCGGTGGGGCCACCGGGGCCTCCGG GCCCGCCAGGACCCCCCGGTCCTCCTTCGGGTGGATTTGATTTCAGCTTTCTACCTCAGCCTCCACAAGAAA AAGCCCATGATGGAGGACGTTACTATAGAGCGtaa SEQ ID NO: 12 P4 pig SGARGERGFPGERGVQGPPGPAGPRGANGAPGNDGAKGDAGAPGAPGSQGAPGLQGMPGERGAAGLPGPK GDRGDAGPKGADGAPGKDGVRGLTGPIGPPGPAGAPGDKGETGPSGPAGPTGARGAPGDRGEPGPPGPAGF AGPPGADGQPGAKGEPGDAGAKGDAGPPGPAGPTGPPGPIGSVGAPGPKGARGSAGPPGATGFPGAAGRVG PPGPSGNAGPPGPPGPAGKEGSKGPRGETGPAGRPGEAGPPGPPGPAGEKGSPGADGPAGAPGTPGPQGIA GQRGVVGLPGQRGERGFPGLPGPSGEPGKQGPSGPSGERGPPGPMGPPGLAGPPGESGREGAPGAEGSPG RDGAPGPKGDRGESGPAGPPGAPGAPGAPGPVGPAGKSGDRGETGPAGPAGPVGPVGARGPAGPQGPRGD KGETGEQGDRGIKGHRGFSGLQGPPGPPGSPGEQGPSGASGPAGPRGPPGSAGAPGKDGLNGLPGPIGPPGP RGRTGDAGPVGPPGPPGPPGPPGPPSGGFDFSFLPQPPQEKAHDGGRYYRA SEQ ID NO: 13 P4 pig DNA TCaGGTGCTCGTGGTGAGCGCGGATTTCCAGGGGAGCGCGGTGTCCAAGGTCCACCGGGACCTGCCGGGC CCCGGGGCGCAAACGGCGCCCCCGGGAATGATGGAGCCAAGGGTGACGCAGGGGCGCCCGGTGCGCCA GGATCGCAGGGTGCCCCAGGACTCCAAGGCATGCCGGGTGAAAGAGGGGCAGCAGGATTGCCCGGTCCC AAGGGCGATAGGGGTGATGCCGGCCCTAAGGGGGCGGACGGCGCACCTGGCAAGGATGGCGTAAGAGGG CTGACTGGGCCAATTGGCCCGCCTGGGCCCGCCGGGGCGCCGGGAGATAAAGGAGAGACAGGTCCATCA GGACCAGCTGGTCCTACCGGGGCTAGGGGCGCACCAGGGGACCGAGGTGAACCTGGGCCCCCCGGGCCT GCGGGGTTCGCCGGTCCTCCTGGCGCCGATGGACAACCCGGGGCGAAAGGCGAACCTGGTGACGCCGGC GCAAAAGGTGATGCGGGGCCACCCGGGCCAGCTGGACCCACCGGCCCCCCTGGGCCTATCGGATCTGTC GGAGCACCCGGTCCCAAGGGCGCGAGGGGCAGCGCCGGTCCTCCCGGAGCGACGGGATTCCCGGGTGCA GCCGGCCGGGTTGGCCCTCCCGGGCCATCCGGCAATGCAGGTCCTCCTGGACCCCCAGGGCCAGCTGGA AAAGAGGGCAGTAAAGGCCCTCGCGGAGAAACTGGTCCAGCGGGACGGCCAGGGGAGGCCGGCCCTCCT GGTCCACCGGGACCAGCTGGTGAAAAGGGATCTCCAGGTGCTGATGGGCCCGCCGGTGCTCCTGGAACAC CCGGTCCACAAGGGATCGCCGGACAACGAGGTGTAGTAGGTCTGCCAGGGCAACGCGGGGAAAGAGGTTT TCCCGGCCTCCCGGGGCCGTCCGGAGAGCCCGGAAAGCAGGGTCCGTCAGGACCGTCGGGGGAAAGGGG ACCTCCTGGGCCGATGGGACCCCCGGGTCTGGCTGGGCCACCGGGTGAATCGGGCCGGGAGGGAGCGCC CGGGGCTGAAGGTAGCCCTGGCCGTGACGGTGCGCCTGGACCTAAAGGTGATCGGGGAGAAAGTGGCCC AGCCGGTCCCCCCGGCGCTCCTGGGGCCCCAGGCGCTCCGGGTCCCGTAGGACCAGCTGGGAAGAGCGG CGATCGTGGTGAGACGGGTCCAGCGGGCCCAGCGGGACCGGTCGGTCCCGTGGGTGCCCGAGGTCCTGC AGGTCCACAGGGGCCTCGTGGTGATAAAGGCGAGACAGGGGAGCAGGGCGACCGAGGCATTAAAGGTCAT CGGGGTTTTTCGGGGCTCCAAGGCCCACCGGGCCCGCCGGGGTCCCCGGGAGAACAGGGCCCGTCCGGT GCGTCTGGTCCAGCAGGTCCTCGTGGTCCTCCTGGCTCCGCTGGAGCCCCAGGCAAGGACGGATTGAACG GGCTCCCAGGCCCGATAGGGCCACCTGGACCACGAGGGAGAACCGGCGATGCGGGGCCGGTGGGGCCAC CGGGGCCTCCGGGCCCGCCAGGACCCCCCGGTCCTCCTTCGGGTGGATTTGATTTCAGCTTTCTACCTCAG CCTCCACAAGAAAAAGCCCATGATGGAGGACGTTACTATAGAGCGtaa SEQ ID NO: 14 S2 – salmon SGGFDEKSGGGMSMPGPMGPMGPRGPPGPPGSSGPQGFTGPPGEPGEAGSSGPMGPRGPAGPPGKNGDD GESGKPGRPGERGASGPQGARGFPGTPGLPGIKGHRGFSGLDGAKGETGPAGPKGEAGASGENGAAGAMGP RGLPGERGRAGPNGAAGARGNDGAAGAAGPPGPTGPAGAPGFPGGPGAKGEVGAQGARGGEGPQGSRGEA GNPGPAGAAGPAGNNGADGNPGTKGAPGSAGIAGAPGFPGPRGPPGPQGAGGAPGPKGNTGEVGATGAKGE AGAKGESGPAGVQGPAGPAGEEGKRGSRGEPGAAGARGAPGERGGPGSRGFPGADGAAGPKGGPGERGGA GVAGAKGNTGEPGRNGEPGMPGSKGMTGSPGSPGPDGKTGPSGAGGQDGRPGPPGPVGARGQPGVMGFP GPKGAAGEGGKPGERGVMGPGGAVGAPGKDGDVGAPGAPGVAGPAGERGEQGAGGPPGFQGLPGPQGAIG ETGKPGEQGLPGEGGAPGSAGSRGDRGFPGERGAPGPSGPAGARGSPGSAGNDGAKGEAGAAGAPGGQGP PGLQGMPGERGAGGLPGLKGDRGDQGVKGADGAGGKDGARGMTGPIGPNGPAGSPGDKGETGAPGAVGPS GARGAPGERGESGAPGPAGFAGPPGGDGQPGAKGEAGDNGAKGDGGAQGPAGPTGAPGPQGPAGNTGAKG ARGAAGPPGATGFPGAAGRVGPPGPSGNNGPPGPPGPGGKEGQKGNRGETGPAGRPGELGAAGPPGAQGE KGQPGGDGPNGPSGTPGPQGIGGQRGIVGLPGQRGERGFPGLAGQLGEPGKQGPGGPSGERGPPGPMGPP GLAGAPGEPGREGTPGNEGSSGRDGAAGPKGERGESGVAGASGAPGPPGAPGPVGPAGKSGDRGESGPAGP AGIAGPAGPRGPSGPAGARGDKGEAGEAGERGMKGHRGFTGMQGPPGPSGQSGESGPAGASGPAGPRGPS GSAGAAGKDGMSGLPGPIGPPGPRGRSGEMGPSGPPGPPGPPGPPGPPGGGFDMGFIAQPAQEKAPDPFRHF RA SEQ ID NO: 15 S2 salmon DNA AGCGGTGGCTTTGATGAAAAATCGGGAGGTGGGATGTCCATGCCAGGGCCGATGGGCCCCATGGGGCCGA GAGGCCCGCCGGGGCCTCCCGGATCAAGCGGTCCTCAAGGTTTCACAGGGCCTCCTGGTGAACCAGGCGA GGCTGGGTCAAGTGGGCCGATGGGTCCTCGTGGTCCAGCTGGACCACCAGGTAAAAACGGTGACGATGGA GAATCAGGGAAACCCGGAAGACCCGGTGAGAGAGGGGCCTCGGGGCCGCAAGGCGCTAGGGGATTTCCG GGAACACCGGGACTCCCCGGTATTAAAGGTCATCGGGGCTTCTCGGGGCTAGACGGGGCGAAGGGAGAAA CTGGACCAGCGGGACCAAAGGGTGAGGCAGGAGCATCCGGCGAAAATGGGGCTGCTGGGGCGATGGGCC CGAGAGGGTTGCCAGGTGAGCGGGGTCGTGCCGGTCCAAACGGTGCCGCCGGAGCGAGGGGTAATGACG GTGCCGCAGGCGCCGCAGGCCCTCCTGGTCCTACTGGCCCCGCCGGGGCACCGGGCTTCCCAGGTGGAC CGGGAGCGAAAGGTGAGGTTGGTGCACAGGGCGCCCGAGGAGGCGAAGGTCCACAGGGCTCCCGAGGAG AAGCTGGTAACCCGGGCCCTGCTGGTGCTGCAGGGCCTGCAGGCAATAACGGCGCAGATGGAAATCCCGG TACCAAGGGCGCGCCGGGCTCTGCTGGTATAGCAGGAGCGCCGGGGTTTCCCGGTCCCAGGGGGCCCCC CGGTCCTCAGGGCGCCGGGGGCGCCCCGGGACCTAAAGGCAACACTGGCGAAGTCGGAGCAACCGGCGC GAAAGGCGAGGCGGGAGCCAAAGGAGAGAGTGGTCCGGCAGGCGTGCAGGGGCCCGCAGGGCCAGCGG GTGAAGAGGGAAAGCGTGGAAGCCGAGGCGAGCCCGGGGCGGCCGGTGCCCGGGGGGCTCCGGGTGAG AGGGGGGGTCCAGGAAGTCGTGGGTTTCCCGGCGCGGACGGCGCCGCTGGACCCAAAGGCGGGCCGGG CGAACGCGGCGGTGCAGGTGTAGCGGGAGCCAAAGGTAATACGGGTGAACCGGGTAGGAACGGGGAACC GGGTATGCCAGGGTCCAAGGGTATGACCGGATCTCCTGGTTCTCCTGGTCCTGATGGCAAGACGGGTCCGT CGGGGGCAGGTGGGCAGGACGGTCGTCCTGGCCCTCCCGGCCCCGTTGGGGCCCGTGGACAGCCGGGA GTGATGGGATTTCCTGGCCCCAAGGGGGCGGCAGGAGAGGGCGGAAAGCCTGGCGAACGAGGTGTGATG GGACCAGGAGGAGCTGTGGGTGCACCTGGGAAAGATGGAGACGTAGGGGCACCAGGGGCTCCCGGTGTT GCGGGGCCCGCCGGGGAACGCGGCGAACAAGGCGCTGGTGGACCTCCGGGATTTCAAGGGCTACCGGGT CCCCAGGGAGCTATCGGAGAAACGGGTAAGCCTGGCGAGCAAGGCCTTCCTGGCGAGGGGGGAGCGCCT GGTTCTGCAGGGAGCCGTGGTGATCGGGGTTTCCCTGGCGAGCGTGGAGCACCGGGGCCGAGCGGCCCA GCGGGGGCAAGAGGAAGTCCTGGGTCTGCGGGTAATGACGGTGCTAAAGGCGAGGCGGGAGCTGCTGGC GCTCCTGGAGGTCAGGGGCCCCCAGGGCTGCAGGGAATGCCCGGCGAGCGCGGCGCGGGGGGCTTACC AGGACTGAAGGGCGATCGTGGTGACCAAGGGGTCAAGGGAGCTGATGGTGCTGGGGGAAAGGACGGAGC GCGAGGGATGACTGGACCCATAGGGCCAAACGGACCAGCGGGGTCACCAGGCGATAAAGGGGAAACTGG CGCTCCCGGGGCAGTCGGGCCCAGCGGAGCGAGAGGCGCCCCGGGGGAACGTGGGGAGAGTGGAGCCC CAGGACCAGCGGGGTTCGCAGGACCACCAGGGGGCGACGGGCAACCTGGCGCTAAGGGTGAAGCTGGTG ACAACGGCGCTAAAGGGGATGGCGGAGCGCAAGGGCCGGCAGGTCCAACCGGTGCTCCGGGCCCCCAAG GGCCGGCTGGAAATACAGGGGCCAAAGGTGCCCGGGGGGCCGCCGGGCCCCCGGGAGCAACAGGCTTTC CAGGCGCCGCCGGTCGTGTCGGACCGCCAGGCCCTAGCGGAAACAATGGCCCACCCGGTCCGCCAGGAC CTGGGGGGAAGGAGGGCCAAAAGGGTAATCGAGGCGAAACGGGGCCCGCAGGGCGCCCGGGTGAATTAG GTGCCGCCGGACCCCCAGGTGCGCAGGGTGAAAAAGGGCAGCCAGGAGGGGATGGCCCTAATGGACCAT CGGGGACACCGGGCCCACAGGGAATCGGCGGACAAAGAGGCATCGTAGGACTACCAGGGCAGCGCGGGG AACGGGGCTTCCCAGGCCTCGCGGGTCAACTTGGAGAACCGGGAAAGCAAGGCCCTGGAGGACCCTCCGG CGAAAGGGGCCCACCTGGTCCTATGGGTCCCCCTGGGTTGGCTGGTGCACCAGGAGAGCCTGGTCGGGAG GGTACCCCAGGAAACGAAGGGTCTTCGGGTCGCGACGGAGCAGCCGGACCAAAAGGCGAGCGGGGCGAA TCGGGGGTTGCTGGGGCGAGTGGGGCGCCGGGTCCCCCGGGTGCACCAGGCCCTGTAGGACCCGCTGG GAAGTCGGGTGATAGGGGTGAGTCTGGACCTGCGGGGCCTGCGGGTATAGCTGGCCCTGCCGGTCCCCG AGGTCCCTCAGGGCCAGCCGGCGCGCGCGGGGACAAGGGTGAGGCTGGTGAGGCAGGCGAGCGGGGTA TGAAAGGTCACAGGGGATTCACGGGTATGCAGGGGCCTCCCGGCCCTAGTGGACAGTCGGGCGAGTCTGG CCCTGCTGGGGCCAGCGGACCGGCCGGTCCAAGAGGCCCAAGTGGCTCCGCAGGGGCAGCTGGAAAGGA TGGAATGTCTGGCCTCCCCGGACCCATTGGGCCGCCGGGTCCACGCGGACGTTCTGGTGAGATGGGACCG TCAGGGCCCCCCGGTCCTCCGGGCCCCCCCGGACCCCCCGGCCCTCCCGGTGGAGGTTTCGATATGGGG TTCATTGCACAACCGGCCCAAGAAAAAGCACCTGATCCTTTTAGGCACTTTCGAGCGtaa SEQ ID NO: 16 S3 - salmon SAGIAGAPGFPGPRGPPGPQGAGGAPGPKGNTGEVGATGAKGEAGAKGESGPAGVQGPAGPAGEEGKRGSR GEPGAAGARGAPGERGGPGSRGFPGADGAAGPKGGPGERGGAGVAGAKGNTGEPGRNGEPGMPGSKGMT GSPGSPGPDGKTGPSGAGGQDGRPGPPGPVGARGQPGVMGFPGPKGAAGEGGKPGERGVMGPGGAVGAP GKDGDVGAPGAPGVAGPAGERGEQGAGGPPGFQGLPGPQGAIGETGKPGEQGLPGEGGAPGSAGSRGDRGF PGERGAPGPSGPAGARGSPGSAGNDGAKGEAGAAGAPGGQGPPGLQGMPGERGAGGLPGLKGDRGDQGVK GADGAGGKDGARGMTGPIGPNGPAGSPGDKGETGAPGAVGPSGARGAPGERGESGAPGPAGFAGPPGGDG QPGAKGEAGDNGAKGDGGAQGPAGPTGAPGPQGPAGNTGAKGARGAAGPPGATGFPGAAGRVGPPGPSGN NGPPGPPGPGGKEGQKGNRGETGPAGRPGELGAAGPPGAQGEKGQPGGDGPNGPSGTPGPQGIGGQRGIV GLPGQRGERGFPGLAGQLGEPGKQGPGGPSGERGPPGPMGPPGLAGAPGEPGREGTPGNEGSSGRDGAAG PKGERGESGVAGASGAPGPPGAPGPVGPAGKSGDRGESGPAGPAGIAGPAGPRGPSGPAGARGDKGEAGEA GERGMKGHRGFTGMQGPPGPSGQSGESGPAGASGPAGPRGPSGSAGAAGKDGMSGLPGPIGPPGPRGRSG EMGPSGPPGPPGPPGPPGPPGGGFDMGFIAQPAQEKAPDPFRHFRA SEQ ID NO: 17 S3 salmon DNA TCcGCTGGTATAGCAGGAGCGCCGGGGTTTCCCGGTCCCAGGGGGCCCCCCGGTCCTCAGGGCGCCGGG GGCGCCCCGGGACCTAAAGGCAACACTGGCGAAGTCGGAGCAACCGGCGCGAAAGGCGAGGCGGGAGCC AAAGGAGAGAGTGGTCCGGCAGGCGTGCAGGGGCCCGCAGGGCCAGCGGGTGAAGAGGGAAAGCGTGGA AGCCGAGGCGAGCCCGGGGCGGCCGGTGCCCGGGGGGCTCCGGGTGAGAGGGGGGGTCCAGGAAGTCG TGGGTTTCCCGGCGCGGACGGCGCCGCTGGACCCAAAGGCGGGCCGGGCGAACGCGGCGGTGCAGGTG TAGCGGGAGCCAAAGGTAATACGGGTGAACCGGGTAGGAACGGGGAACCGGGTATGCCAGGGTCCAAGG GTATGACCGGATCTCCTGGTTCTCCTGGTCCTGATGGCAAGACGGGTCCGTCGGGGGCAGGTGGGCAGGA CGGTCGTCCTGGCCCTCCCGGCCCCGTTGGGGCCCGTGGACAGCCGGGAGTGATGGGATTTCCTGGCCC CAAGGGGGCGGCAGGAGAGGGCGGAAAGCCTGGCGAACGAGGTGTGATGGGACCAGGAGGAGCTGTGG GTGCACCTGGGAAAGATGGAGACGTAGGGGCACCAGGGGCTCCCGGTGTTGCGGGGCCCGCCGGGGAAC GCGGCGAACAAGGCGCTGGTGGACCTCCGGGATTTCAAGGGCTACCGGGTCCCCAGGGAGCTATCGGAGA AACGGGTAAGCCTGGCGAGCAAGGCCTTCCTGGCGAGGGGGGAGCGCCTGGTTCTGCAGGGAGCCGTGG TGATCGGGGTTTCCCTGGCGAGCGTGGAGCACCGGGGCCGAGCGGCCCAGCGGGGGCAAGAGGAAGTCC TGGGTCTGCGGGTAATGACGGTGCTAAAGGCGAGGCGGGAGCTGCTGGCGCTCCTGGAGGTCAGGGGCC CCCAGGGCTGCAGGGAATGCCCGGCGAGCGCGGCGCGGGGGGCTTACCAGGACTGAAGGGCGATCGTGG TGACCAAGGGGTCAAGGGAGCTGATGGTGCTGGGGGAAAGGACGGAGCGCGAGGGATGACTGGACCCAT AGGGCCAAACGGACCAGCGGGGTCACCAGGCGATAAAGGGGAAACTGGCGCTCCCGGGGCAGTCGGGCC CAGCGGAGCGAGAGGCGCCCCGGGGGAACGTGGGGAGAGTGGAGCCCCAGGACCAGCGGGGTTCGCAG GACCACCAGGGGGCGACGGGCAACCTGGCGCTAAGGGTGAAGCTGGTGACAACGGCGCTAAAGGGGATG GCGGAGCGCAAGGGCCGGCAGGTCCAACCGGTGCTCCGGGCCCCCAAGGGCCGGCTGGAAATACAGGGG CCAAAGGTGCCCGGGGGGCCGCCGGGCCCCCGGGAGCAACAGGCTTTCCAGGCGCCGCCGGTCGTGTCG GACCGCCAGGCCCTAGCGGAAACAATGGCCCACCCGGTCCGCCAGGACCTGGGGGGAAGGAGGGCCAAA AGGGTAATCGAGGCGAAACGGGGCCCGCAGGGCGCCCGGGTGAATTAGGTGCCGCCGGACCCCCAGGTG CGCAGGGTGAAAAAGGGCAGCCAGGAGGGGATGGCCCTAATGGACCATCGGGGACACCGGGCCCACAGG GAATCGGCGGACAAAGAGGCATCGTAGGACTACCAGGGCAGCGCGGGGAACGGGGCTTCCCAGGCCTCG CGGGTCAACTTGGAGAACCGGGAAAGCAAGGCCCTGGAGGACCCTCCGGCGAAAGGGGCCCACCTGGTC CTATGGGTCCCCCTGGGTTGGCTGGTGCACCAGGAGAGCCTGGTCGGGAGGGTACCCCAGGAAACGAAGG GTCTTCGGGTCGCGACGGAGCAGCCGGACCAAAAGGCGAGCGGGGCGAATCGGGGGTTGCTGGGGCGAG TGGGGCGCCGGGTCCCCCGGGTGCACCAGGCCCTGTAGGACCCGCTGGGAAGTCGGGTGATAGGGGTGA GTCTGGACCTGCGGGGCCTGCGGGTATAGCTGGCCCTGCCGGTCCCCGAGGTCCCTCAGGGCCAGCCGG CGCGCGCGGGGACAAGGGTGAGGCTGGTGAGGCAGGCGAGCGGGGTATGAAAGGTCACAGGGGATTCAC GGGTATGCAGGGGCCTCCCGGCCCTAGTGGACAGTCGGGCGAGTCTGGCCCTGCTGGGGCCAGCGGACC GGCCGGTCCAAGAGGCCCAAGTGGCTCCGCAGGGGCAGCTGGAAAGGATGGAATGTCTGGCCTCCCCGG ACCCATTGGGCCGCCGGGTCCACGCGGACGTTCTGGTGAGATGGGACCGTCAGGGCCCCCCGGTCCTCC GGGCCCCCCCGGACCCCCCGGCCCTCCCGGTGGAGGTTTCGATATGGGGTTCATTGCACAACCGGCCCAA GAAAAAGCACCTGATCCTTTTAGGCACTTTCGAGCGtaa SEQ ID NO: 18 S4 - salmon SAGSRGDRGFPGERGAPGPSGPAGARGSPGSAGNDGAKGEAGAAGAPGGQGPPGLQGMPGERGAGGLPGL KGDRGDQGVKGADGAGGKDGARGMTGPIGPNGPAGSPGDKGETGAPGAVGPSGARGAPGERGESGAPGPA GFAGPPGGDGQPGAKGEAGDNGAKGDGGAQGPAGPTGAPGPQGPAGNTGAKGARGAAGPPGATGFPGAAG RVGPPGPSGNNGPPGPPGPGGKEGQKGNRGETGPAGRPGELGAAGPPGAQGEKGQPGGDGPNGPSGTPGP QGIGGQRGIVGLPGQRGERGFPGLAGQLGEPGKQGPGGPSGERGPPGPMGPPGLAGAPGEPGREGTPGNEG SSGRDGAAGPKGERGESGVAGASGAPGPPGAPGPVGPAGKSGDRGESGPAGPAGIAGPAGPRGPSGPAGAR GDKGEAGEAGERGMKGHRGFTGMQGPPGPSGQSGESGPAGASGPAGPRGPSGSAGAAGKDGMSGLPGPIG PPGPRGRSGEMGPSGPPGPPGPPGPPGPPGGGFDMGFIAQPAQEKAPDPFRHFRA SEQ ID NO: 19 S4 – salmon DNA TCcGCAGGGAGCCGTGGTGATCGGGGTTTCCCTGGCGAGCGTGGAGCACCGGGGCCGAGCGGCCCAGCG GGGGCAAGAGGAAGTCCTGGGTCTGCGGGTAATGACGGTGCTAAAGGCGAGGCGGGAGCTGCTGGCGCT CCTGGAGGTCAGGGGCCCCCAGGGCTGCAGGGAATGCCCGGCGAGCGCGGCGCGGGGGGCTTACCAGG ACTGAAGGGCGATCGTGGTGACCAAGGGGTCAAGGGAGCTGATGGTGCTGGGGGAAAGGACGGAGCGCG AGGGATGACTGGACCCATAGGGCCAAACGGACCAGCGGGGTCACCAGGCGATAAAGGGGAAACTGGCGCT CCCGGGGCAGTCGGGCCCAGCGGAGCGAGAGGCGCCCCGGGGGAACGTGGGGAGAGTGGAGCCCCAGG ACCAGCGGGGTTCGCAGGACCACCAGGGGGCGACGGGCAACCTGGCGCTAAGGGTGAAGCTGGTGACAA CGGCGCTAAAGGGGATGGCGGAGCGCAAGGGCCGGCAGGTCCAACCGGTGCTCCGGGCCCCCAAGGGCC GGCTGGAAATACAGGGGCCAAAGGTGCCCGGGGGGCCGCCGGGCCCCCGGGAGCAACAGGCTTTCCAGG CGCCGCCGGTCGTGTCGGACCGCCAGGCCCTAGCGGAAACAATGGCCCACCCGGTCCGCCAGGACCTGG GGGGAAGGAGGGCCAAAAGGGTAATCGAGGCGAAACGGGGCCCGCAGGGCGCCCGGGTGAATTAGGTGC CGCCGGACCCCCAGGTGCGCAGGGTGAAAAAGGGCAGCCAGGAGGGGATGGCCCTAATGGACCATCGGG GACACCGGGCCCACAGGGAATCGGCGGACAAAGAGGCATCGTAGGACTACCAGGGCAGCGCGGGGAACG GGGCTTCCCAGGCCTCGCGGGTCAACTTGGAGAACCGGGAAAGCAAGGCCCTGGAGGACCCTCCGGCGAA AGGGGCCCACCTGGTCCTATGGGTCCCCCTGGGTTGGCTGGTGCACCAGGAGAGCCTGGTCGGGAGGGTA CCCCAGGAAACGAAGGGTCTTCGGGTCGCGACGGAGCAGCCGGACCAAAAGGCGAGCGGGGCGAATCGG GGGTTGCTGGGGCGAGTGGGGCGCCGGGTCCCCCGGGTGCACCAGGCCCTGTAGGACCCGCTGGGAAGT CGGGTGATAGGGGTGAGTCTGGACCTGCGGGGCCTGCGGGTATAGCTGGCCCTGCCGGTCCCCGAGGTC CCTCAGGGCCAGCCGGCGCGCGCGGGGACAAGGGTGAGGCTGGTGAGGCAGGCGAGCGGGGTATGAAA GGTCACAGGGGATTCACGGGTATGCAGGGGCCTCCCGGCCCTAGTGGACAGTCGGGCGAGTCTGGCCCTG CTGGGGCCAGCGGACCGGCCGGTCCAAGAGGCCCAAGTGGCTCCGCAGGGGCAGCTGGAAAGGATGGAA TGTCTGGCCTCCCCGGACCCATTGGGCCGCCGGGTCCACGCGGACGTTCTGGTGAGATGGGACCGTCAGG GCCCCCCGGTCCTCCGGGCCCCCCCGGACCCCCCGGCCCTCCCGGTGGAGGTTTCGATATGGGGTTCATT GCACAACCGGCCCAAGAAAAAGCACCTGATCCTTTTAGGCACTTTCGAGCGtaa 547 48918.79 SEQ ID NO: 20 S5 salmon AGSPGDKGETGAPGAVGPSGARGAPGERGESGAPGPAGFAGPPGGDGQPGAKGEAGDNGAKGDGGAQGPA GPTGAPGPQGPAGNTGAKGARGAAGPPGATGFPGAAGRVGPPGPSGNNGPPGPPGPGGKEGQKGNRGETG PAGRPGELGAAGPPGAQGEKGQPGGDGPNGPSGTPGPQGIGGQRGIVGLPGQRGERGFPGLAGQLGEPGKQ GPGGPSGERGPPGPMGPPGLAGAPGEPGREGTPGNEGSSGRDGAAGPKGERGESGVAGASGAPGPPGAPG PVGPAGKSGDRGESGPAGPAGIAGPAGPRGPSGPAGARGDKGEAGEAGERGMKGHRGFTGMQGPPGPSGQ SGESGPAGASGPAGPRGPSGSAGAAGKDGMSGLPGPIGPPGPRGRSGEMGPSGPPGPPGPPGPPGPPGGGF DMGFIAQPAQEKAPDPFRHFRA SEQ ID NO: 21 S5 salmon DNA GCGGGGTCACCAGGCGATAAAGGGGAAACTGGCGCTCCCGGGGCAGTCGGGCCCAGCGGAGCGAGAGGC GCCCCGGGGGAACGTGGGGAGAGTGGAGCCCCAGGACCAGCGGGGTTCGCAGGACCACCAGGGGGCGA CGGGCAACCTGGCGCTAAGGGTGAAGCTGGTGACAACGGCGCTAAAGGGGATGGCGGAGCGCAAGGGCC GGCAGGTCCAACCGGTGCTCCGGGCCCCCAAGGGCCGGCTGGAAATACAGGGGCCAAAGGTGCCCGGGG GGCCGCCGGGCCCCCGGGAGCAACAGGCTTTCCAGGCGCCGCCGGTCGTGTCGGACCGCCAGGCCCTAG CGGAAACAATGGCCCACCCGGTCCGCCAGGACCTGGGGGGAAGGAGGGCCAAAAGGGTAATCGAGGCGA AACGGGGCCCGCAGGGCGCCCGGGTGAATTAGGTGCCGCCGGACCCCCAGGTGCGCAGGGTGAAAAAGG GCAGCCAGGAGGGGATGGCCCTAATGGACCATCGGGGACACCGGGCCCACAGGGAATCGGCGGACAAAG AGGCATCGTAGGACTACCAGGGCAGCGCGGGGAACGGGGCTTCCCAGGCCTCGCGGGTCAACTTGGAGAA CCGGGAAAGCAAGGCCCTGGAGGACCCTCCGGCGAAAGGGGCCCACCTGGTCCTATGGGTCCCCCTGGG TTGGCTGGTGCACCAGGAGAGCCTGGTCGGGAGGGTACCCCAGGAAACGAAGGGTCTTCGGGTCGCGACG GAGCAGCCGGACCAAAAGGCGAGCGGGGCGAATCGGGGGTTGCTGGGGCGAGTGGGGCGCCGGGTCCC CCGGGTGCACCAGGCCCTGTAGGACCCGCTGGGAAGTCGGGTGATAGGGGTGAGTCTGGACCTGCGGGG CCTGCGGGTATAGCTGGCCCTGCCGGTCCCCGAGGTCCCTCAGGGCCAGCCGGCGCGCGCGGGGACAAG GGTGAGGCTGGTGAGGCAGGCGAGCGGGGTATGAAAGGTCACAGGGGATTCACGGGTATGCAGGGGCCT CCCGGCCCTAGTGGACAGTCGGGCGAGTCTGGCCCTGCTGGGGCCAGCGGACCGGCCGGTCCAAGAGGC CCAAGTGGCTCCGCAGGGGCAGCTGGAAAGGATGGAATGTCTGGCCTCCCCGGACCCATTGGGCCGCCGG GTCCACGCGGACGTTCTGGTGAGATGGGACCGTCAGGGCCCCCCGGTCCTCCGGGCCCCCCCGGACCCC CCGGCCCTCCCGGTGGAGGTTTCGATATGGGGTTCATTGCACAACCGGCCCAAGAAAAAGCACCTGATCCT TTTAGGCACTTTCGAGCGtaa SEQ ID NO: 22 S6 salmon SGNNGPPGPPGPGGKEGQKGNRGETGPAGRPGELGAAGPPGAQGEKGQPGGDGPNGPSGTPGPQGIGGQR GIVGLPGQRGERGFPGLAGQLGEPGKQGPGGPSGERGPPGPMGPPGLAGAPGEPGREGTPGNEGSSGRDGA AGPKGERGESGVAGASGAPGPPGAPGPVGPAGKSGDRGESGPAGPAGIAGPAGPRGPSGPAGARGDKGEAG EAGERGMKGHRGFTGMQGPPGPSGQSGESGPAGASGPAGPRGPSGSAGAAGKDGMSGLPGPIGPPGPRGR SGEMGPSGPPGPPGPPGPPGPPGGGFDMGFIAQPAQEKAPDPFRHFRA SEQ ID NO: 23 S6 salmon DNA AGCGGAAACAATGGCCCACCCGGTCCGCCAGGACCTGGGGGGAAGGAGGGCCAAAAGGGTAATCGAGGC GAAACGGGGCCCGCAGGGCGCCCGGGTGAATTAGGTGCCGCCGGACCCCCAGGTGCGCAGGGTGAAAAA GGGCAGCCAGGAGGGGATGGCCCTAATGGACCATCGGGGACACCGGGCCCACAGGGAATCGGCGGACAA AGAGGCATCGTAGGACTACCAGGGCAGCGCGGGGAACGGGGCTTCCCAGGCCTCGCGGGTCAACTTGGA GAACCGGGAAAGCAAGGCCCTGGAGGACCCTCCGGCGAAAGGGGCCCACCTGGTCCTATGGGTCCCCCTG GGTTGGCTGGTGCACCAGGAGAGCCTGGTCGGGAGGGTACCCCAGGAAACGAAGGGTCTTCGGGTCGCG ACGGAGCAGCCGGACCAAAAGGCGAGCGGGGCGAATCGGGGGTTGCTGGGGCGAGTGGGGCGCCGGGT CCCCCGGGTGCACCAGGCCCTGTAGGACCCGCTGGGAAGTCGGGTGATAGGGGTGAGTCTGGACCTGCG GGGCCTGCGGGTATAGCTGGCCCTGCCGGTCCCCGAGGTCCCTCAGGGCCAGCCGGCGCGCGCGGGGAC AAGGGTGAGGCTGGTGAGGCAGGCGAGCGGGGTATGAAAGGTCACAGGGGATTCACGGGTATGCAGGGG CCTCCCGGCCCTAGTGGACAGTCGGGCGAGTCTGGCCCTGCTGGGGCCAGCGGACCGGCCGGTCCAAGA GGCCCAAGTGGCTCCGCAGGGGCAGCTGGAAAGGATGGAATGTCTGGCCTCCCCGGACCCATTGGGCCGC CGGGTCCACGCGGACGTTCTGGTGAGATGGGACCGTCAGGGCCCCCCGGTCCTCCGGGCCCCCCCGGAC CCCCCGGCCCTCCCGGTGGAGGTTTCGATATGGGGTTCATTGCACAACCGGCCCAAGAAAAAGCACCTGAT CCTTTTAGGCACTTTCGAGCGtaa SEQ ID NO: 24 H12 human NPGRDGARGAPGAVGAPGPAGATGDRGEAGAAGPAGPAGPRGSPGERGEVGPAGPNGFAGPAGAAGQPGA KGERGAKGPKGENGVVGPTGPVGAAGPAGPNGPPGPAGSRGDGGPPGMTGFPGAAGRTGPPGPSGISGPPG PPGPAGKEGLRGPRGDQGPVGRTGEVGAVGPPGFAGEKGPSGEAGTAGPPGTPGPQGLLGAPGILGLPGSRG ERGLPGVAGAVGEPGPLGIAGPPGARGPPGAVGSPGVNGAPGEAGRDGNPGNDGPPGRDGQPGHKGERGYP GNIGPVGAAGAPGPHGPVGPAGKHGNRGETGPSGPVGPAGAVGPRGPSGPQGIRGDKGEPGEKGPRGLPGLK GHNGLQGLPGIAGHHGDQGAPGSVGPAGPRGPAGPSGPAGKDGRTGHPGTVGPAGIRGPQGHQGPAGPPGP PGPPGPPGVSGGGYDFGYDGDFYRA SEQ ID NO: 25 H12 human DNA AACCCAGGTCGAGACGGTGCGAGGGGAGCCCCTGGCGCGGTGGGGGCCCCGGGACCCGCAGGGGCGAC GGGCGACCGAGGTGAAGCTGGGGCCGCCGGTCCTGCTGGACCTGCAGGGCCTAGAGGAAGCCCAGGGGA GAGAGGTGAAGTTGGCCCGGCTGGTCCAAATGGCTTCGCAGGGCCTGCAGGCGCGGCCGGTCAACCCGG GGCAAAAGGTGAGCGGGGCGCTAAGGGGCCAAAGGGTGAGAACGGTGTTGTTGGCCCTACTGGTCCTGTC GGAGCGGCCGGACCGGCGGGTCCTAACGGACCTCCCGGGCCTGCGGGTTCAAGGGGAGACGGGGGGCC TCCCGGAATGACTGGTTTCCCCGGCGCCGCTGGTCGCACGGGGCCACCGGGGCCTTCGGGTATCAGTGGA CCCCCGGGCCCACCTGGTCCAGCTGGCAAAGAGGGGTTACGTGGGCCCCGAGGAGACCAGGGTCCAGTA GGTCGAACAGGTGAAGTTGGAGCCGTAGGACCACCCGGATTTGCTGGTGAGAAAGGTCCATCGGGAGAAG CAGGAACCGCTGGGCCACCAGGTACACCAGGACCTCAAGGACTACTCGGTGCACCCGGAATACTTGGCCTT CCGGGTTCTCGGGGGGAGCGTGGTCTACCTGGGGTGGCTGGAGCGGTGGGGGAACCGGGCCCATTGGGC ATAGCGGGACCTCCAGGAGCAAGAGGGCCGCCGGGAGCGGTAGGGAGTCCCGGTGTCAATGGGGCACCC GGCGAGGCAGGCCGCGATGGGAATCCCGGCAATGATGGCCCGCCGGGGCGGGATGGGCAGCCAGGACAT AAGGGTGAAAGGGGATATCCGGGGAACATCGGGCCCGTTGGAGCTGCTGGTGCTCCTGGTCCCCACGGAC CAGTAGGGCCCGCAGGTAAGCACGGTAACCGGGGGGAAACCGGACCATCCGGACCAGTGGGCCCAGCAG GGGCAGTAGGGCCCCGTGGCCCCAGCGGTCCGCAAGGGATTAGAGGCGATAAGGGAGAACCCGGCGAGA AAGGGCCGCGTGGGCTCCCGGGCCTGAAAGGTCATAATGGGTTGCAAGGGCTGCCGGGTATTGCTGGTCA CCATGGCGACCAGGGCGCCCCGGGCTCCGTCGGTCCTGCCGGCCCTCGCGGACCTGCTGGTCCTTCAGG ACCGGCGGGCAAGGATGGGCGAACAGGCCATCCCGGTACCGTCGGACCAGCCGGCATAAGGGGCCCTCA GGGACACCAGGGTCCCGCCGGGCCTCCTGGACCGCCCGGCCCACCGGGCCCGCCCGGCGTCTCTGGAG GCGGCTACGACTTCGGATACGATGGCGATTTTTATCGCGCGtaa SEQ ID NO: 26 H13 human SRGDGGPPGMTGFPGAAGRTGPPGPSGISGPPGPPGPAGKEGLRGPRGDQGPVGRTGEVGAVGPPGFAGEK GPSGEAGTAGPPGTPGPQGLLGAPGILGLPGSRGERGLPGVAGAVGEPGPLGIAGPPGARGPPGAVGSPGVNG APGEAGRDGNPGNDGPPGRDGQPGHKGERGYPGNIGPVGAAGAPGPHGPVGPAGKHGNRGETGPSGPVGP AGAVGPRGPSGPQGIRGDKGEPGEKGPRGLPGLKGHNGLQGLPGIAGHHGDQGAPGSVGPAGPRGPAGPSG PAGKDGRTGHPGTVGPAGIRGPQGHQGPAGPPGPPGPPGPPGVSGGGYDFGYDGDFYRA SEQ ID NO: 27 H13 human DNA TCAAGGGGAGACGGGGGGCCTCCCGGAATGACTGGTTTCCCCGGCGCCGCTGGTCGCACGGGGCCACCG GGGCCTTCGGGTATCAGTGGACCCCCGGGCCCACCTGGTCCAGCTGGCAAAGAGGGGTTACGTGGGCCCC GAGGAGACCAGGGTCCAGTAGGTCGAACAGGTGAAGTTGGAGCCGTAGGACCACCCGGATTTGCTGGTGA GAAAGGTCCATCGGGAGAAGCAGGAACCGCTGGGCCACCAGGTACACCAGGACCTCAAGGACTACTCGGT GCACCCGGAATACTTGGCCTTCCGGGTTCTCGGGGGGAGCGTGGTCTACCTGGGGTGGCTGGAGCGGTGG GGGAACCGGGCCCATTGGGCATAGCGGGACCTCCAGGAGCAAGAGGGCCGCCGGGAGCGGTAGGGAGTC CCGGTGTCAATGGGGCACCCGGCGAGGCAGGCCGCGATGGGAATCCCGGCAATGATGGCCCGCCGGGGC GGGATGGGCAGCCAGGACATAAGGGTGAAAGGGGATATCCGGGGAACATCGGGCCCGTTGGAGCTGCTG GTGCTCCTGGTCCCCACGGACCAGTAGGGCCCGCAGGTAAGCACGGTAACCGGGGGGAAACCGGACCATC CGGACCAGTGGGCCCAGCAGGGGCAGTAGGGCCCCGTGGCCCCAGCGGTCCGCAAGGGATTAGAGGCGA TAAGGGAGAACCCGGCGAGAAAGGGCCGCGTGGGCTCCCGGGCCTGAAAGGTCATAATGGGTTGCAAGGG CTGCCGGGTATTGCTGGTCACCATGGCGACCAGGGCGCCCCGGGCTCCGTCGGTCCTGCCGGCCCTCGC GGACCTGCTGGTCCTTCAGGACCGGCGGGCAAGGATGGGCGAACAGGCCATCCCGGTACCGTCGGACCA GCCGGCATAAGGGGCCCTCAGGGACACCAGGGTCCCGCCGGGCCTCCTGGACCGCCCGGCCCACCGGGC CCGCCCGGCGTCTCTGGAGGCGGCTACGACTTCGGATACGATGGCGATTTTTATCGCGCGtaa SEQ ID NO: 28 H22 human APGKDGGRGLTGPIGPPGPAGANGEKGEVGPPGPAGSAGARGAPGERGETGPPGPAGFAGPPGADGQPGAK GEQGEAGQKGDAGAPGPQGPSGAPGPQGPTGVTGPKGARGAQGPPGATGFPGAAGRVGPPGSNGNPGPPG PPGPSGKDGPKGARGDSGPPGRAGEPGLQGPAGPPGEKGEPGDDGPSGAEGPPGPQGLAGQRGIVGLPGQR GERGFPGLPGPSGEPGKQGAPGASGDRGPPGPVGPPGLTGPAGEPGREGSPGADGPPGRDGAAGVKGDRG ETGAVGAPGAPGPPGSPGPAGPTGKQGDRGEAGAQGPMGPSGPAGARGIQGPQGPRGDKGEAGEPGERGLK GHRGFTGLQGLPGPPGPSGDQGASGPAGPSGPRGPPGPVGPSGKDGANGIPGPIGPPGPRGRSGETGPAGPP GNPGPPGPPGPPGPGIDMSAFAGLGPREKGPDPLQYMRA SEQ ID NO: 29 H22 human DNA GCGCCGGGAAAGGACGGCGGTCGTGGGCTGACGGGCCCCATAGGACCCCCGGGACCAGCTGGTGCCAAT GGCGAGAAGGGCGAAGTGGGACCGCCGGGGCCGGCTGGTAGTGCGGGCGCTAGAGGCGCGCCCGGGGA AAGGGGCGAAACTGGACCACCAGGGCCAGCCGGATTTGCTGGTCCACCTGGTGCCGACGGTCAGCCTGGT GCCAAGGGTGAGCAAGGAGAAGCCGGCCAAAAAGGAGATGCGGGCGCACCTGGACCTCAAGGTCCCTCAG GGGCGCCAGGCCCACAGGGTCCCACTGGAGTTACAGGCCCTAAAGGCGCGAGAGGCGCGCAGGGACCGC CAGGCGCTACAGGATTTCCTGGAGCTGCTGGGCGCGTTGGGCCCCCAGGCTCCAATGGAAACCCTGGACC TCCGGGTCCGCCCGGGCCGTCCGGGAAGGATGGTCCGAAAGGGGCAAGAGGAGACAGCGGTCCACCCGG ACGGGCAGGAGAACCAGGACTCCAAGGCCCTGCAGGGCCTCCGGGTGAGAAGGGAGAGCCAGGCGATGA CGGCCCAAGCGGCGCGGAGGGACCTCCAGGACCTCAAGGGCTTGCCGGTCAGCGCGGCATCGTAGGTTT GCCAGGACAACGTGGGGAGCGAGGTTTCCCTGGTTTGCCCGGACCGTCTGGGGAGCCGGGCAAGCAAGG CGCACCAGGTGCCTCCGGCGACAGAGGGCCTCCAGGTCCCGTAGGCCCGCCTGGCCTTACTGGGCCGGC CGGTGAACCAGGCAGGGAGGGCTCGCCAGGGGCGGATGGCCCACCGGGGCGGGACGGTGCAGCTGGGG TGAAGGGTGACCGTGGCGAAACGGGTGCCGTCGGGGCTCCTGGGGCTCCCGGGCCTCCCGGGTCACCGG GTCCGGCTGGGCCAACCGGTAAGCAAGGTGACCGAGGCGAAGCAGGGGCACAGGGGCCAATGGGTCCAT CTGGGCCTGCGGGTGCACGTGGTATCCAGGGACCGCAGGGTCCCAGGGGCGACAAAGGTGAGGCAGGAG AACCTGGAGAGCGCGGCCTAAAAGGCCACAGGGGGTTCACGGGGTTACAGGGTTTACCCGGACCACCTGG CCCTTCGGGGGATCAAGGGGCCAGTGGTCCTGCTGGTCCCAGCGGGCCTCGCGGGCCTCCAGGTCCGGT CGGTCCTTCAGGTAAAGATGGGGCCAATGGGATACCGGGACCCATTGGCCCGCCCGGACCCCGAGGGCGA TCGGGGGAAACCGGCCCTGCTGGTCCGCCGGGCAACCCCGGACCTCCGGGACCACCCGGGCCCCCCGGA CCCGGAATTGATATGAGTGCATTCGCGGGACTCGGCCCCCGGGAAAAAGGACCCGATCCGCTACAGTACAT GCGGGCCTAA SEQ ID NO: 30 H23 human AGRVGPPGSNGNPGPPGPPGPSGKDGPKGARGDSGPPGRAGEPGLQGPAGPPGEKGEPGDDGPSGAEGPP GPQGLAGQRGIVGLPGQRGERGFPGLPGPSGEPGKQGAPGASGDRGPPGPVGPPGLTGPAGEPGREGSPGA DGPPGRDGAAGVKGDRGETGAVGAPGAPGPPGSPGPAGPTGKQGDRGEAGAQGPMGPSGPAGARGIQGPQ GPRGDKGEAGEPGERGLKGHRGFTGLQGLPGPPGPSGDQGASGPAGPSGPRGPPGPVGPSGKDGANGIPGPI GPPGPRGRSGETGPAGPPGNPGPPGPPGPPGPGIDMSAFAGLGPREKGPDPLQYMRA SEQ ID NO: 31 H23 human DNA GCTGGGCGCGTTGGGCCCCCAGGCTCCAATGGAAACCCTGGACCTCCGGGTCCGCCCGGGCCGTCCGGG AAGGATGGTCCGAAAGGGGCAAGAGGAGACAGCGGTCCACCCGGACGGGCAGGAGAACCAGGACTCCAA GGCCCTGCAGGGCCTCCGGGTGAGAAGGGAGAGCCAGGCGATGACGGCCCAAGCGGCGCGGAGGGACC TCCAGGACCTCAAGGGCTTGCCGGTCAGCGCGGCATCGTAGGTTTGCCAGGACAACGTGGGGAGCGAGGT TTCCCTGGTTTGCCCGGACCGTCTGGGGAGCCGGGCAAGCAAGGCGCACCAGGTGCCTCCGGCGACAGA GGGCCTCCAGGTCCCGTAGGCCCGCCTGGCCTTACTGGGCCGGCCGGTGAACCAGGCAGGGAGGGCTCG CCAGGGGCGGATGGCCCACCGGGGCGGGACGGTGCAGCTGGGGTGAAGGGTGACCGTGGCGAAACGGG TGCCGTCGGGGCTCCTGGGGCTCCCGGGCCTCCCGGGTCACCGGGTCCGGCTGGGCCAACCGGTAAGCA AGGTGACCGAGGCGAAGCAGGGGCACAGGGGCCAATGGGTCCATCTGGGCCTGCGGGTGCACGTGGTAT CCAGGGACCGCAGGGTCCCAGGGGCGACAAAGGTGAGGCAGGAGAACCTGGAGAGCGCGGCCTAAAAGG CCACAGGGGGTTCACGGGGTTACAGGGTTTACCCGGACCACCTGGCCCTTCGGGGGATCAAGGGGCCAGT GGTCCTGCTGGTCCCAGCGGGCCTCGCGGGCCTCCAGGTCCGGTCGGTCCTTCAGGTAAAGATGGGGCCA ATGGGATACCGGGACCCATTGGCCCGCCCGGACCCCGAGGGCGATCGGGGGAAACCGGCCCTGCTGGTC CGCCGGGCAACCCCGGACCTCCGGGACCACCCGGGCCCCCCGGACCCGGAATTGATATGAGTGCATTCGC GGGACTCGGCCCCCGGGAAAAAGGACCCGATCCGCTACAGTACATGCGGGCCTAA SEQ ID NO: 32 H32 human NYSPQYDSYDVKSGVAVGGLAGYPGPAGPPGPPGPPGTSGHPGSPGSPGYQGPPGEPGQAGPSGPPGPPGAI GPSGPAGKDGESGRPGRPGERGLPGPPGIKGPAGIPGFPGMKGHRGFDGRNGEKGETGAPGLKGENGLPGEN GAPGPMGPRGAPGERGRPGLPGAAGARGNDGARGSDGQPGPPGPPGTAGFPGSPGAKGEVGPAGSPGSNG APGQRGEPGPQGHAGAQGPPGPPGINGSPGGKGEMGPAGIPGAPGLMGARGPPGPAGANGAPGLRGGAGEP GKNGAKGEPGPRGERGEAGIPGVPGAKGEDGKDGSPGEPGANGLPGAAGERGAPGFRGPAGPNGIPGEKGPA GERGAPGPAGPRGAAGEPGRDGVPGGPGMRGMPGSPGGPGSDGKPGPPGSQGESGRPGPPGPSGPRGQP GVMGFPGPKGNDGAPGKNGERGGP SEQ ID NO: 33 H32 human DNA AACTATTCACCCCAGTACGATTCCTACGACGTCAAAAGTGGTGTAGCTGTGGGAGGCCTTGCTGGGTATCCT GGCCCCGCAGGGCCACCGGGTCCCCCAGGGCCCCCAGGGACCAGTGGGCACCCGGGCAGCCCCGGATC TCCAGGGTATCAGGGACCCCCCGGTGAGCCAGGGCAGGCGGGTCCGTCTGGCCCACCTGGACCACCAGG CGCTATTGGCCCGAGTGGACCTGCAGGCAAGGATGGAGAATCCGGCCGCCCCGGTCGCCCTGGGGAACGT GGGCTGCCAGGCCCACCAGGTATCAAAGGTCCGGCCGGGATTCCGGGTTTTCCAGGGATGAAAGGACATC GAGGATTTGATGGTCGAAATGGCGAGAAAGGCGAAACAGGCGCACCTGGACTCAAGGGGGAAAATGGCCT TCCAGGCGAAAATGGTGCTCCTGGACCAATGGGCCCACGAGGTGCGCCCGGGGAGAGAGGCAGACCTGGT TTGCCTGGTGCCGCCGGGGCACGTGGCAACGACGGCGCAAGAGGATCAGACGGACAGCCGGGACCGCCA GGTCCTCCAGGCACGGCCGGTTTTCCGGGGTCCCCGGGTGCGAAGGGTGAGGTGGGACCTGCTGGTAGC CCAGGTTCTAACGGTGCCCCGGGACAAAGGGGGGAGCCGGGACCTCAAGGCCATGCAGGAGCCCAAGGT CCCCCTGGGCCCCCCGGAATAAATGGGTCTCCGGGGGGTAAAGGAGAGATGGGTCCTGCTGGTATTCCAG GCGCTCCCGGCTTAATGGGAGCGAGGGGACCTCCAGGGCCCGCCGGAGCAAACGGTGCGCCGGGACTGC GGGGAGGCGCCGGAGAGCCCGGAAAGAATGGGGCTAAAGGGGAGCCCGGACCTCGCGGGGAACGGGGA GAAGCGGGTATCCCCGGTGTTCCGGGCGCAAAAGGGGAAGATGGAAAGGATGGTTCACCGGGAGAGCCTG GTGCTAATGGCCTACCCGGCGCAGCTGGAGAGCGTGGGGCGCCGGGTTTCCGAGGCCCTGCTGGTCCCAA CGGTATACCTGGGGAAAAAGGCCCTGCGGGCGAAAGGGGTGCCCCTGGGCCGGCAGGACCAAGAGGGGC TGCGGGAGAGCCCGGTCGGGACGGTGTACCCGGGGGGCCTGGCATGAGGGGGATGCCGGGTTCTCCTGG TGGCCCTGGGAGCGACGGGAAGCCTGGGCCACCTGGTTCGCAAGGTGAGTCGGGCCGGCCAGGCCCTCC CGGCCCTTCGGGTCCGCGTGGCCAGCCGGGTGTTATGGGCTTCCCAGGGCCTAAGGGAAATGACGGGGC CCCGGGAAAGAACGGGGAACGCGGGGGTCCTtaa SEQ ID NO: 34 H33 human NYSPQYDSYDVKSGVAVGGLAGYPGPAGPPGPPGPPGTSGHPGSPGSPGYQGPPGEPGQAGPSGPPGPPGAI GPSGPAGKDGESGRPGRPGERGLPGPPGIKGPAGIPGFPGMKGHRGFDGRNGEKGETGAPGLKGENGLPGEN GAPGPMGPRGAPGERGRPGLPGAAGARGNDGARGSDGQPGPPGPPGTAGFPGSPGAKGEVGPAGSPGSNG APGQRGEPGPQGHAGAQGPPGPPGINGSPGGKGEMGPAGIPGAPGLMGARGPPGPAGANGAPGLRGGAGEP GKNGAKGEPGPRGERGEAGIPGVPGAKGEDGKDGSPGEPGANGLPGAAGERGAP SEQ ID NO: 35 H33 human DNA AACTATTCACCCCAGTACGATTCCTACGACGTCAAAAGTGGTGTAGCTGTGGGAGGCCTTGCTGGGTATCCT GGCCCCGCAGGGCCACCGGGTCCCCCAGGGCCCCCAGGGACCAGTGGGCACCCGGGCAGCCCCGGATC TCCAGGGTATCAGGGACCCCCCGGTGAGCCAGGGCAGGCGGGTCCGTCTGGCCCACCTGGACCACCAGG CGCTATTGGCCCGAGTGGACCTGCAGGCAAGGATGGAGAATCCGGCCGCCCCGGTCGCCCTGGGGAACGT GGGCTGCCAGGCCCACCAGGTATCAAAGGTCCGGCCGGGATTCCGGGTTTTCCAGGGATGAAAGGACATC GAGGATTTGATGGTCGAAATGGCGAGAAAGGCGAAACAGGCGCACCTGGACTCAAGGGGGAAAATGGCCT TCCAGGCGAAAATGGTGCTCCTGGACCAATGGGCCCACGAGGTGCGCCCGGGGAGAGAGGCAGACCTGGT TTGCCTGGTGCCGCCGGGGCACGTGGCAACGACGGCGCAAGAGGATCAGACGGACAGCCGGGACCGCCA GGTCCTCCAGGCACGGCCGGTTTTCCGGGGTCCCCGGGTGCGAAGGGTGAGGTGGGACCTGCTGGTAGC CCAGGTTCTAACGGTGCCCCGGGACAAAGGGGGGAGCCGGGACCTCAAGGCCATGCAGGAGCCCAAGGT CCCCCTGGGCCCCCCGGAATAAATGGGTCTCCGGGGGGTAAAGGAGAGATGGGTCCTGCTGGTATTCCAG GCGCTCCCGGCTTAATGGGAGCGAGGGGACCTCCAGGGCCCGCCGGAGCAAACGGTGCGCCGGGACTGC GGGGAGGCGCCGGAGAGCCCGGAAAGAATGGGGCTAAAGGGGAGCCCGGACCTCGCGGGGAACGGGGA GAAGCGGGTATCCCCGGTGTTCCGGGCGCAAAAGGGGAAGATGGAAAGGATGGTTCACCGGGAGAGCCTG GTGCTAATGGCCTACCCGGCGCAGCTGGAGAGCGTGGGGCGCCGtaa SEQ ID NO: 36 B12 bovine SYGYDEKSTGISVPGPMGPSGPRGLPGPPGAPGPQGFQGPPGEPGEPGASGPMGPRGPPGPPGKNGDDGEA GKPGRPGERGPPGPQGARGLPGTAGLPGMKGHRGFSGLDGAKGDAGPAGPKGEPGSPGENGAPGQMGPRG LPGERGRPGAPGPAGARGNDGATGAAGPPGPTGPAGPPGFPGAVGAKGEGGPQGPRGSEGPQGVRGEPGP PGPAGAAGPAGNPGADGQPGAKGANGAPGIAGAPGFPGARGPSGPQGPSGPPGPKGNSGEPGAPGSKGDTG AKGEPGPTGIQGPPGPAGEEGKRGARGEPGPAGLPGPPGERGGPGSRGFPGADGVAGPKGPAGERGAPGPA GPKGSPGEAGRPGEAGLPGAKGLTGSPGSPGPDGKTGPPGPAGQDGRPGPPGPPGARGQAGVMGFPGPKG AAGEPGKAGERGVPGPPGAVGPAGKDG SEQ ID NO: 37 B12 bovine DNA AGTTACGGATATGATGAGAAATCGACGGGTATCAGCGTACCAGGACCGATGGGCCCATCTGGTCCGAGGGG TCTGCCAGGCCCACCGGGAGCGCCGGGTCCGCAGGGATTCCAAGGCCCTCCTGGCGAACCCGGCGAACC AGGGGCGTCGGGACCCATGGGACCTCGTGGTCCCCCGGGGCCACCTGGCAAAAATGGCGATGACGGGGA GGCGGGCAAGCCTGGCCGGCCAGGGGAGCGAGGGCCTCCAGGGCCCCAGGGTGCACGGGGTCTCCCTG GAACTGCTGGACTTCCCGGCATGAAGGGCCATCGTGGTTTCTCAGGACTAGATGGAGCCAAAGGGGACGCA GGTCCAGCTGGTCCAAAAGGTGAGCCGGGGTCACCAGGCGAAAATGGTGCACCCGGACAGATGGGTCCTC GTGGTTTGCCTGGAGAGCGTGGCCGTCCGGGCGCCCCTGGACCTGCTGGTGCGAGAGGCAACGATGGGG CCACCGGCGCGGCTGGCCCTCCGGGCCCGACAGGTCCAGCCGGGCCTCCCGGTTTTCCCGGAGCAGTGG GGGCGAAGGGGGAGGGCGGACCCCAAGGTCCTCGTGGTTCCGAAGGCCCTCAAGGAGTTCGAGGCGAGC CTGGCCCGCCGGGCCCGGCAGGAGCAGCGGGACCCGCTGGCAATCCTGGAGCCGACGGCCAACCTGGG GCTAAAGGGGCGAACGGTGCTCCCGGGATAGCAGGAGCCCCCGGCTTCCCGGGTGCTCGTGGACCTTCG GGCCCTCAGGGCCCTTCAGGACCGCCCGGCCCCAAAGGGAACAGCGGTGAGCCCGGTGCTCCTGGTTCTA AAGGTGATACGGGGGCCAAGGGAGAGCCCGGGCCGACAGGTATTCAAGGGCCCCCAGGCCCAGCAGGTG AGGAAGGTAAAAGAGGGGCTCGTGGGGAACCTGGCCCAGCCGGCCTTCCGGGACCCCCTGGTGAACGAG GAGGTCCGGGGAGCAGGGGCTTTCCGGGAGCTGATGGTGTCGCGGGTCCAAAGGGTCCGGCTGGTGAGC GTGGGGCACCGGGTCCTGCTGGGCCCAAGGGGAGTCCCGGAGAAGCAGGACGCCCTGGTGAAGCAGGGT TGCCTGGGGCAAAGGGTTTAACCGGTTCCCCTGGTTCTCCTGGCCCAGACGGAAAGACTGGGCCACCAGG GCCAGCCGGGCAAGACGGCAGACCCGGGCCACCGGGGCCGCCCGGTGCCAGAGGACAGGCAGGTGTGA TGGGGTTTCCAGGTCCAAAAGGCGCGGCCGGCGAACCGGGTAAGGCGGGCGAACGCGGAGTACCAGGGC CACCCGGGGCTGTTGGTCCAGCCGGAAAGGACGGAtaa 450 SEQ ID NO: 38 B13 bovine SYGYDEKSTGISVPGPMGPSGPRGLPGPPGAPGPQGFQGPPGEPGEPGASGPMGPRGPPGPPGKNGDDGEA GKPGRPGERGPPGPQGARGLPGTAGLPGMKGHRGFSGLDGAKGDAGPAGPKGEPGSPGENGAPGQMGPRG LPGERGRPGAPGPAGARGNDGATGAAGPPGPTGPAGPPGFPGAVGAKGEGGPQGPRGSEGPQGVRGEPGP PGPAGAAGPAGNPGADGQPGAKGANGAPGIAGAPGFPGARGPSGPQGPSGPPGPKGNSGEPGAPGSKGDTG AKGEPGPTGIQGPPGPAGEEGKRGARGEPGPAGLPGPPGERGGP SEQ ID NO: 39 B13 bovine DNA AGTTACGGATATGATGAGAAATCGACGGGTATCAGCGTACCAGGACCGATGGGCCCATCTGGTCCGAGGGG TCTGCCAGGCCCACCGGGAGCGCCGGGTCCGCAGGGATTCCAAGGCCCTCCTGGCGAACCCGGCGAACC AGGGGCGTCGGGACCCATGGGACCTCGTGGTCCCCCGGGGCCACCTGGCAAAAATGGCGATGACGGGGA GGCGGGCAAGCCTGGCCGGCCAGGGGAGCGAGGGCCTCCAGGGCCCCAGGGTGCACGGGGTCTCCCTG GAACTGCTGGACTTCCCGGCATGAAGGGCCATCGTGGTTTCTCAGGACTAGATGGAGCCAAAGGGGACGCA GGTCCAGCTGGTCCAAAAGGTGAGCCGGGGTCACCAGGCGAAAATGGTGCACCCGGACAGATGGGTCCTC GTGGTTTGCCTGGAGAGCGTGGCCGTCCGGGCGCCCCTGGACCTGCTGGTGCGAGAGGCAACGATGGGG CCACCGGCGCGGCTGGCCCTCCGGGCCCGACAGGTCCAGCCGGGCCTCCCGGTTTTCCCGGAGCAGTGG GGGCGAAGGGGGAGGGCGGACCCCAAGGTCCTCGTGGTTCCGAAGGCCCTCAAGGAGTTCGAGGCGAGC CTGGCCCGCCGGGCCCGGCAGGAGCAGCGGGACCCGCTGGCAATCCTGGAGCCGACGGCCAACCTGGG GCTAAAGGGGCGAACGGTGCTCCCGGGATAGCAGGAGCCCCCGGCTTCCCGGGTGCTCGTGGACCTTCG GGCCCTCAGGGCCCTTCAGGACCGCCCGGCCCCAAAGGGAACAGCGGTGAGCCCGGTGCTCCTGGTTCTA AAGGTGATACGGGGGCCAAGGGAGAGCCCGGGCCGACAGGTATTCAAGGGCCCCCAGGCCCAGCAGGTG AGGAAGGTAAAAGAGGGGCTCGTGGGGAACCTGGCCCAGCCGGCCTTCCGGGACCCCCTGGTGAACGAG GAGGTCCGtaa SEQ ID NO: 40 B22 bovine AGGFDEKAGGAQMGVMQGPMGPMGPRGPPGPAGAPGPQGFQGNPGEPGEPGVSGPMGPRGPPGPPGKPG DDGEAGKPGKSGERGPPGPQGARGFPGTPGLPGVKGHRGYPGLDGAKGEAGAPGVKGESGSPGENGSPGP MGPRGLPGERGRTGPAGAAGARGNDGQPGPAGPPGPVGPAGGPGFPGAPGAKGEAGPTGARGPEGAQGPR GEPGTPGSPGPAGAAGNPGTDGIPGAKGSAGAPGIAGAPGFPGPRGPPGPQGATGPLGPKGQTGEPGIAGFKG EQGPKGEPGPAGPQGAPGPAGEEGKRGARGEPGGAGPAGPPGERGAPGNRGFPGQDGLAGPKGAPGERGP SGLAGPKGANGDPGRPGEPGLPGARGLTGRPGDAGPQGKVGPSGAPGEDGRPGPPGPQGARGQPGVMGFP GPKGANGEPGKAGEKGLPGAPGLRGLPG SEQ ID NO: 41 B22 bovine DNA GCTGGTGGCTTCGACGAGAAAGCGGGAGGTGCTCAAATGGGTGTAATGCAAGGTCCCATGGGACCGATGG GCCCACGTGGTCCCCCCGGGCCTGCGGGGGCGCCGGGCCCACAAGGCTTTCAGGGGAACCCTGGGGAAC CAGGTGAGCCAGGCGTGAGTGGCCCAATGGGTCCCCGAGGTCCGCCCGGCCCTCCAGGAAAGCCTGGCG ATGATGGGGAGGCCGGTAAGCCCGGCAAAAGCGGAGAACGAGGCCCTCCTGGACCACAAGGAGCTAGGG GGTTCCCAGGAACCCCCGGTCTCCCCGGGGTGAAAGGACACCGTGGTTATCCGGGTTTAGACGGAGCGAA GGGAGAAGCGGGCGCACCTGGTGTTAAGGGGGAGTCGGGTAGTCCGGGCGAGAACGGCTCCCCGGGGCC GATGGGACCTCGTGGTCTGCCGGGTGAGCGTGGTAGAACTGGCCCTGCAGGGGCCGCCGGTGCTCGTGG AAATGATGGTCAGCCCGGCCCGGCCGGCCCGCCGGGTCCAGTCGGTCCTGCAGGTGGCCCAGGATTCCC GGGCGCGCCAGGGGCTAAAGGGGAAGCAGGGCCTACAGGCGCGCGCGGGCCTGAAGGCGCACAGGGGC CTAGAGGCGAACCAGGAACTCCAGGATCTCCTGGCCCTGCAGGCGCCGCCGGGAACCCCGGGACAGATG GCATCCCGGGCGCAAAGGGGTCTGCCGGCGCTCCGGGTATAGCAGGTGCCCCGGGGTTTCCGGGGCCGA GGGGCCCACCTGGGCCCCAAGGGGCAACCGGGCCGCTGGGGCCAAAAGGCCAAACGGGGGAGCCAGGG ATTGCAGGTTTCAAGGGCGAGCAAGGGCCAAAAGGCGAACCCGGTCCAGCGGGACCTCAGGGGGCTCCAG GGCCGGCTGGCGAGGAAGGCAAAAGAGGTGCGCGCGGTGAACCAGGAGGTGCGGGTCCTGCCGGTCCGC CCGGAGAGAGGGGTGCACCCGGAAATCGAGGGTTTCCTGGACAAGACGGTTTGGCCGGGCCCAAGGGCG CTCCTGGAGAGCGTGGTCCAAGCGGATTGGCAGGACCCAAAGGGGCCAATGGAGACCCAGGCCGACCTGG GGAACCGGGGCTCCCGGGAGCACGGGGTCTAACGGGGCGGCCTGGTGACGCTGGTCCCCAAGGTAAGGT AGGTCCATCAGGTGCGCCCGGAGAGGATGGACGGCCTGGACCCCCTGGGCCCCAGGGGGCGCGGGGCC AGCCCGGGGTCATGGGCTTTCCTGGCCCAAAAGGAGCTAACGGGGAACCCGGAAAGGCTGGAGAAAAGGG ACTTCCGGGAGCCCCCGGATTAAGAGGACTTCCGGGATAA SEQ ID NO: 42 B23 bovine AGGFDEKAGGAQMGVMQGPMGPMGPRGPPGPAGAPGPQGFQGNPGEPGEPGVSGPMGPRGPPGPPGKPG DDGEAGKPGKSGERGPPGPQGARGFPGTPGLPGVKGHRGYPGLDGAKGEAGAPGVKGESGSPGENGSPGP MGPRGLPGERGRTGPAGAAGARGNDGQPGPAGPPGPVGPAGGPGFPGAPGAKGEAGPTGARGPEGAQGPR GEPGTPGSPGPAGAAGNPGTDGIPGAKGSAGAPGIAGAPGFPGPRGPPGPQGATGPLGPKGQTGEPGIAGFKG EQGPKGEPGPAGPQGAPG SEQ ID NO: 43 B23 bovine DNA GCTGGTGGCTTCGACGAGAAAGCGGGAGGTGCTCAAATGGGTGTAATGCAAGGTCCCATGGGACCGATGG GCCCACGTGGTCCCCCCGGGCCTGCGGGGGCGCCGGGCCCACAAGGCTTTCAGGGGAACCCTGGGGAAC CAGGTGAGCCAGGCGTGAGTGGCCCAATGGGTCCCCGAGGTCCGCCCGGCCCTCCAGGAAAGCCTGGCG ATGATGGGGAGGCCGGTAAGCCCGGCAAAAGCGGAGAACGAGGCCCTCCTGGACCACAAGGAGCTAGGG GGTTCCCAGGAACCCCCGGTCTCCCCGGGGTGAAAGGACACCGTGGTTATCCGGGTTTAGACGGAGCGAA GGGAGAAGCGGGCGCACCTGGTGTTAAGGGGGAGTCGGGTAGTCCGGGCGAGAACGGCTCCCCGGGGCC GATGGGACCTCGTGGTCTGCCGGGTGAGCGTGGTAGAACTGGCCCTGCAGGGGCCGCCGGTGCTCGTGG AAATGATGGTCAGCCCGGCCCGGCCGGCCCGCCGGGTCCAGTCGGTCCTGCAGGTGGCCCAGGATTCCC GGGCGCGCCAGGGGCTAAAGGGGAAGCAGGGCCTACAGGCGCGCGCGGGCCTGAAGGCGCACAGGGGC CTAGAGGCGAACCAGGAACTCCAGGATCTCCTGGCCCTGCAGGCGCCGCCGGGAACCCCGGGACAGATG GCATCCCGGGCGCAAAGGGGTCTGCCGGCGCTCCGGGTATAGCAGGTGCCCCGGGGTTTCCGGGGCCGA GGGGCCCACCTGGGCCCCAAGGGGCAACCGGGCCGCTGGGGCCAAAAGGCCAAACGGGGGAGCCAGGG ATTGCAGGTTTCAAGGGCGAGCAAGGGCCAAAAGGCGAACCCGGTCCAGCGGGACCTCAGGGGGCTCCAG GGTAA SEQ ID NO: 44 B31 bovine NYSPQYEAYDVKSGVAGGGIAGYPGPAGPPGPPGPPGTSGHPGAPGAPGYQGPPGEPGQAGPAGPPGPPGAI GPSGPAGKDGESGRPGRPGERGFPGPPGMKGPAGMPGFPGMKGHRGFDGRNGEKGETGAPGLKGENGVPG ENGAPGPMGPRGAPGERGRPGLPGAAGARGNDGARGSDGQPGPPGPPGTAGFPGSPGAKGEVGPAGSPGS SGAPGQRGEPGPQGHAGAPGPPGPPGSNGSPGGKGEMGPAGIPGAPGLIGARGPPGPPGTNGVPGQRGAAG EPGKNGAKGDPGPRGERGEAGSPGIAGPKGEDGKDGSPGEPGANGLPGAAGERGVPGFRGPAGANGLPGEK GPPGDRGGPGPAGPRGVAGEPGRDGLPGGPGLRGIPGSPGGPGSDGKPGPPGSQGETGRPGPPGSPGPRG QPGVMGFPGPKGNDGAPGKNGERGGPGGPGPQGPAGKNGETGPQGPPGPTGPSGDKGDTGPPGPQGLQGL PGTSGPPGENGKPGEPGPKGEAGAPGIPGGKGDSGAPGERGPPGAGGPPGPRGGAGPPGPEGGKGAAGPPG PPGSAGTPGLQGMPGERGGPGGPGPKGDKGEPGSSGVDGAPGKDGPRGPTGPIGPPGPAGQPGDKGESGAP GVPGIAGPRGGPGERGEQGPPGPAGFPGAPGQNGEPGAKGERGAPGEKGEGGPPGAAGPAGGSGPAGPPG PQGVKGERGSPGGPGAAGFPGGRGPPGPPGSNGNPGPPGSSGAPGKDGPPGPPGSNGAPGSPGISGPKGDS GPPGERGAPGPQGPPGAPGPLGIAGLTGARGLAGPPGMPGARGSPGPQGIKGENGKPGPSGQNGERGPPGP QGLPGLAGTAGEPGRDGNPGSDGLPGRDGAPGAKGDRGENGSPGAPGAPGHPGPPGPVGPAGKSGDRGET GPAGPSGAPGPAGSRGPPGPQGPRGDKGETGERGAMGIKGHRGFPGNPGAPGSPGPAGHQGAVGSPGPAG PRGPVGPSGPPGKDGASGHPGPIGPPGPRGNRGERGSEGSPGHPGQPGPPGPPGAPGPCCGAGGVAAIAGV GAEKAGGFAPYYG SEQ ID NO: 45 B31 bovine DNA AACTACAGCCCACAGTATGAGGCGTATGACGTTAAATCTGGCGTGGCCGGAGGGGGGATTGCGGGTTACCC GGGACCTGCCGGACCGCCCGGGCCGCCGGGGCCTCCAGGTACTTCTGGGCATCCGGGGGCGCCAGGCG CGCCCGGATACCAAGGGCCCCCAGGGGAACCAGGTCAAGCGGGTCCAGCTGGTCCCCCAGGTCCTCCTG GAGCAATCGGCCCGTCGGGTCCGGCCGGCAAGGATGGCGAATCGGGGCGGCCGGGTCGGCCCGGTGAG CGGGGCTTTCCAGGACCTCCTGGTATGAAAGGTCCGGCAGGTATGCCCGGTTTTCCCGGTATGAAGGGCCA TCGTGGCTTTGACGGACGAAATGGAGAGAAGGGGGAAACGGGAGCACCCGGGCTAAAGGGCGAGAACGGT GTACCTGGTGAAAACGGAGCACCGGGGCCTATGGGGCCTCGTGGTGCCCCTGGAGAACGAGGGCGACCG GGGCTGCCCGGAGCCGCTGGCGCAAGGGGAAACGACGGCGCGCGAGGCTCTGATGGTCAGCCAGGTCCG CCGGGTCCTCCCGGTACTGCTGGTTTCCCAGGTTCCCCCGGTGCTAAGGGCGAAGTGGGGCCTGCCGGGT CACCAGGAAGCTCTGGCGCGCCCGGTCAGCGAGGCGAGCCCGGACCCCAGGGACACGCGGGAGCACCTG GCCCACCAGGACCCCCCGGGTCGAACGGGTCACCAGGGGGTAAAGGGGAAATGGGGCCCGCTGGTATTC CCGGCGCGCCCGGGCTAATCGGGGCAAGAGGACCACCAGGTCCGCCCGGCACGAATGGTGTACCCGGCC AGAGAGGTGCGGCTGGTGAACCGGGGAAGAATGGAGCTAAGGGCGATCCGGGCCCGCGCGGAGAGCGTG GAGAGGCAGGGAGCCCTGGCATAGCCGGTCCGAAAGGGGAGGATGGAAAGGACGGGTCGCCGGGCGAGC CCGGAGCTAATGGGCTGCCGGGTGCAGCCGGCGAGAGGGGAGTCCCCGGATTTCGCGGTCCTGCCGGGG CTAATGGCCTTCCTGGGGAGAAAGGCCCACCGGGCGATAGAGGCGGACCCGGGCCTGCCGGGCCTCGTG GTGTCGCCGGAGAACCGGGCAGAGACGGCCTGCCGGGAGGTCCGGGGTTGAGGGGAATACCCGGCTCCC CTGGCGGGCCCGGATCAGATGGTAAGCCAGGTCCTCCTGGCTCCCAAGGCGAAACAGGAAGACCAGGGCC GCCAGGAAGTCCAGGACCCCGAGGACAGCCGGGCGTCATGGGGTTTCCCGGACCGAAGGGTAACGACGG AGCGCCAGGAAAAAACGGCGAGCGCGGCGGGCCAGGGGGGCCAGGGCCCCAGGGTCCGGCCGGTAAAA ATGGGGAGACCGGACCCCAAGGTCCTCCGGGCCCAACAGGGCCATCCGGAGATAAAGGAGACACGGGCC CACCAGGACCTCAAGGGCTCCAAGGTCTCCCCGGCACGAGTGGCCCGCCGGGCGAAAACGGCAAGCCAG GCGAGCCCGGTCCAAAAGGGGAAGCGGGAGCCCCCGGTATACCGGGTGGAAAGGGGGATTCTGGAGCGC CAGGTGAACGTGGTCCCCCTGGAGCAGGAGGCCCACCAGGACCACGAGGAGGGGCTGGGCCACCCGGAC CCGAAGGAGGTAAAGGTGCCGCTGGACCACCTGGGCCTCCGGGTTCTGCAGGAACCCCCGGATTGCAGGG CATGCCGGGCGAGAGGGGCGGACCGGGGGGGCCTGGTCCGAAAGGGGACAAAGGGGAGCCGGGGAGTT CAGGAGTAGATGGCGCCCCAGGTAAGGATGGACCTCGTGGTCCGACCGGCCCCATTGGGCCGCCCGGTCC AGCGGGACAGCCTGGGGACAAAGGAGAAAGTGGGGCACCCGGCGTTCCCGGTATAGCCGGTCCTCGGGG GGGCCCCGGTGAACGTGGCGAACAGGGCCCGCCCGGCCCTGCCGGCTTCCCTGGTGCGCCCGGGCAAAA TGGTGAACCCGGGGCCAAGGGTGAGAGGGGCGCTCCTGGTGAGAAAGGGGAGGGGGGTCCACCGGGTGC GGCCGGCCCAGCTGGGGGCTCCGGACCCGCCGGGCCTCCTGGCCCGCAAGGAGTAAAAGGCGAGCGCG GCTCGCCCGGGGGACCTGGAGCTGCTGGTTTCCCTGGGGGGCGTGGTCCTCCTGGTCCGCCGGGGTCAA ATGGCAACCCGGGCCCACCTGGCAGCAGTGGTGCACCCGGGAAAGATGGACCGCCTGGGCCACCCGGTT CCAATGGTGCTCCGGGCAGCCCAGGAATAAGTGGACCTAAAGGCGACTCTGGTCCACCAGGCGAGCGGGG AGCACCTGGACCTCAGGGACCCCCGGGTGCACCAGGCCCATTAGGAATTGCAGGCTTAACTGGAGCACGC GGTTTAGCGGGTCCTCCGGGTATGCCGGGTGCACGCGGCTCTCCGGGGCCCCAGGGTATCAAGGGCGAAA ATGGTAAGCCAGGGCCATCAGGCCAAAACGGCGAGAGAGGGCCTCCCGGTCCTCAAGGACTTCCCGGGCT AGCAGGTACTGCTGGGGAGCCCGGTCGTGATGGGAACCCAGGGAGTGATGGATTGCCGGGCCGGGATGG AGCACCAGGGGCTAAAGGCGACCGAGGAGAAAATGGAAGTCCCGGGGCGCCCGGGGCACCTGGCCACCC GGGGCCTCCGGGGCCGGTTGGACCCGCTGGCAAGTCGGGGGACAGAGGTGAGACTGGACCTGCTGGGCC GTCAGGGGCCCCTGGCCCCGCAGGAAGCAGGGGTCCTCCTGGTCCGCAAGGTCCTCGGGGGGACAAAGG CGAAACAGGGGAAAGAGGAGCTATGGGAATTAAGGGACATAGGGGATTCCCTGGCAATCCCGGCGCGCCC GGTTCCCCCGGTCCAGCTGGTCATCAAGGTGCTGTGGGATCGCCTGGCCCGGCTGGGCCACGCGGTCCG GTTGGCCCGTCCGGTCCACCAGGCAAGGACGGAGCATCGGGGCACCCCGGCCCAATCGGCCCCCCTGGT CCAAGAGGGAACCGTGGCGAACGCGGCAGCGAGGGGTCACCGGGACACCCTGGACAGCCTGGTCCCCCA GGTCCTCCGGGGGCACCCGGTCCGTGCTGTGGTGCGGGGGGCGTCGCTGCCATCGCCGGGGTGGGAGCT GAAAAGGCGGGCGGATTCGCGCCATATTATGGCtaa SEQ ID NO: 46 B32 bovine DGPRGPTGPIGPPGPAGQPGDKGESGAPGVPGIAGPRGGPGERGEQGPPGPAGFPGAPGQNGEPGAKGERG APGEKGEGGPPGAAGPAGGSGPAGPPGPQGVKGERGSPGGPGAAGFPGGRGPPGPPGSNGNPGPPGSSGA PGKDGPPGPPGSNGAPGSPGISGPKGDSGPPGERGAPGPQGPPGAPGPLGIAGLTGARGLAGPPGMPGARGS PGPQGIKGENGKPGPSGQNGERGPPGPQGLPGLAGTAGEPGRDGNPGSDGLPGRDGAPGAKGDRGENGSPG APGAPGHPGPPGPVGPAGKSGDRGETGPAGPSGAPGPAGSRGPPGPQGPRGDKGETGERGAMGIKGHRGFP GNPGAPGSPGPAGHQGAVGSPGPAGPRGPVGPSGPPGKDGASGHPGPIGPPGPRGNRGERGSEGSPGHPG QPGPPGPPGAPGPCCGAGGVAAIAGVGAEKAGGFAPYYG SEQ ID NO: 47 B32 bovine DNA GATGGACCTCGTGGTCCGACCGGCCCCATTGGGCCGCCCGGTCCAGCGGGACAGCCTGGGGACAAAGGA GAAAGTGGGGCACCCGGCGTTCCCGGTATAGCCGGTCCTCGGGGGGGCCCCGGTGAACGTGGCGAACAG GGCCCGCCCGGCCCTGCCGGCTTCCCTGGTGCGCCCGGGCAAAATGGTGAACCCGGGGCCAAGGGTGAG AGGGGCGCTCCTGGTGAGAAAGGGGAGGGGGGTCCACCGGGTGCGGCCGGCCCAGCTGGGGGCTCCGG ACCCGCCGGGCCTCCTGGCCCGCAAGGAGTAAAAGGCGAGCGCGGCTCGCCCGGGGGACCTGGAGCTGC TGGTTTCCCTGGGGGGCGTGGTCCTCCTGGTCCGCCGGGGTCAAATGGCAACCCGGGCCCACCTGGCAGC AGTGGTGCACCCGGGAAAGATGGACCGCCTGGGCCACCCGGTTCCAATGGTGCTCCGGGCAGCCCAGGAA TAAGTGGACCTAAAGGCGACTCTGGTCCACCAGGCGAGCGGGGAGCACCTGGACCTCAGGGACCCCCGGG TGCACCAGGCCCATTAGGAATTGCAGGCTTAACTGGAGCACGCGGTTTAGCGGGTCCTCCGGGTATGCCGG GTGCACGCGGCTCTCCGGGGCCCCAGGGTATCAAGGGCGAAAATGGTAAGCCAGGGCCATCAGGCCAAAA CGGCGAGAGAGGGCCTCCCGGTCCTCAAGGACTTCCCGGGCTAGCAGGTACTGCTGGGGAGCCCGGTCG TGATGGGAACCCAGGGAGTGATGGATTGCCGGGCCGGGATGGAGCACCAGGGGCTAAAGGCGACCGAGG AGAAAATGGAAGTCCCGGGGCGCCCGGGGCACCTGGCCACCCGGGGCCTCCGGGGCCGGTTGGACCCGC TGGCAAGTCGGGGGACAGAGGTGAGACTGGACCTGCTGGGCCGTCAGGGGCCCCTGGCCCCGCAGGAAG CAGGGGTCCTCCTGGTCCGCAAGGTCCTCGGGGGGACAAAGGCGAAACAGGGGAAAGAGGAGCTATGGG AATTAAGGGACATAGGGGATTCCCTGGCAATCCCGGCGCGCCCGGTTCCCCCGGTCCAGCTGGTCATCAAG GTGCTGTGGGATCGCCTGGCCCGGCTGGGCCACGCGGTCCGGTTGGCCCGTCCGGTCCACCAGGCAAGG ACGGAGCATCGGGGCACCCCGGCCCAATCGGCCCCCCTGGTCCAAGAGGGAACCGTGGCGAACGCGGCA GCGAGGGGTCACCGGGACACCCTGGACAGCCTGGTCCCCCAGGTCCTCCGGGGGCACCCGGTCCGTGCT GTGGTGCGGGGGGCGTCGCTGCCATCGCCGGGGTGGGAGCTGAAAAGGCGGGCGGATTCGCGCCATATT ATGGCtaa SEQ ID NO: 48 B33 bovine NGAPGSPGISGPKGDSGPPGERGAPGPQGPPGAPGPLGIAGLTGARGLAGPPGMPGARGSPGPQGIKGENGK PGPSGQNGERGPPGPQGLPGLAGTAGEPGRDGNPGSDGLPGRDGAPGAKGDRGENGSPGAPGAPGHPGPP GPVGPAGKSGDRGETGPAGPSGAPGPAGSRGPPGPQGPRGDKGETGERGAMGIKGHRGFPGNPGAPGSPGP AGHQGAVGSPGPAGPRGPVGPSGPPGKDGASGHPGPIGPPGPRGNRGERGSEGSPGHPGQPGPPGPPGAP GPCCGAGGVAAIAGVGAEKAGGFAPYYG SEQ ID NO: 49 B33 bovine DNA AATGGTGCTCCGGGCAGCCCAGGAATAAGTGGACCTAAAGGCGACTCTGGTCCACCAGGCGAGCGGGGAG CACCTGGACCTCAGGGACCCCCGGGTGCACCAGGCCCATTAGGAATTGCAGGCTTAACTGGAGCACGCGG TTTAGCGGGTCCTCCGGGTATGCCGGGTGCACGCGGCTCTCCGGGGCCCCAGGGTATCAAGGGCGAAAAT GGTAAGCCAGGGCCATCAGGCCAAAACGGCGAGAGAGGGCCTCCCGGTCCTCAAGGACTTCCCGGGCTAG CAGGTACTGCTGGGGAGCCCGGTCGTGATGGGAACCCAGGGAGTGATGGATTGCCGGGCCGGGATGGAG CACCAGGGGCTAAAGGCGACCGAGGAGAAAATGGAAGTCCCGGGGCGCCCGGGGCACCTGGCCACCCGG GGCCTCCGGGGCCGGTTGGACCCGCTGGCAAGTCGGGGGACAGAGGTGAGACTGGACCTGCTGGGCCGT CAGGGGCCCCTGGCCCCGCAGGAAGCAGGGGTCCTCCTGGTCCGCAAGGTCCTCGGGGGGACAAAGGCG AAACAGGGGAAAGAGGAGCTATGGGAATTAAGGGACATAGGGGATTCCCTGGCAATCCCGGCGCGCCCGG TTCCCCCGGTCCAGCTGGTCATCAAGGTGCTGTGGGATCGCCTGGCCCGGCTGGGCCACGCGGTCCGGTT GGCCCGTCCGGTCCACCAGGCAAGGACGGAGCATCGGGGCACCCCGGCCCAATCGGCCCCCCTGGTCCA AGAGGGAACCGTGGCGAACGCGGCAGCGAGGGGTCACCGGGACACCCTGGACAGCCTGGTCCCCCAGGT CCTCCGGGGGCACCCGGTCCGTGCTGTGGTGCGGGGGGCGTCGCTGCCATCGCCGGGGTGGGAGCTGAA AAGGCGGGCGGATTCGCGCCATATTATGGCtaa 311 SEQ ID NO: 50 C12 chicken KGEKGAPGLRGDTGATGRDGARGLPGAIGAPGPAGGAGDRGEGGPAGPAGPAGARGIPGERGEPGPVGPSGF AGPPGAAGQPGAKGERGPKGPKGETGPTGAIGPIGASGPPGPVGAAGPAGPRGDAGPPGMTGFPGAAGRVGP PGPAGITGPPGPPGPAGKDGPRGLRGDVGPVGRTGEQGIAGPPGFAGEKGPSGEAGAAGPPGTPGPQGILGAP GILGLPGSRGERGLPGIAGATGEPGPLGVSGPPGARGPSGPVGSPGPNGAPGEAGRDGNPGNDGPPGRDGAP GFKGERGAPGNPGPSGALGAPGPHGQVGPSGKPGNRGDPGPVGPVGPAGAFGPRGLAGPQGPRGEKGEPG DKGHRGLPGLKGHNGLQGLPGLAGQHGDQGPPGNNGPAGPRGPPGPSGPPGKDGRNGLPGPIGPAGVRGSH GSQGPAGPPGPPGPPGPPGPNGGGYEVGFDAEYYR SEQ ID NO: 51 C12 chicken DNA AAAGGCGAGAAAGGTGCTCCTGGGCTTCGAGGAGATACAGGAGCCACCGGGCGTGACGGTGCCCGTGGTC TACCCGGAGCGATAGGAGCACCAGGACCAGCGGGAGGGGCCGGCGACAGAGGAGAGGGGGGACCTGCT GGGCCTGCCGGTCCCGCTGGGGCAAGGGGCATTCCTGGCGAACGGGGTGAGCCCGGTCCTGTGGGCCCT TCGGGCTTCGCCGGCCCGCCAGGGGCTGCGGGACAACCGGGAGCCAAAGGCGAGAGAGGACCGAAGGG GCCGAAGGGTGAAACGGGACCAACTGGTGCCATAGGACCTATTGGTGCTAGCGGTCCTCCAGGGCCCGTG GGAGCAGCAGGGCCGGCTGGACCTCGCGGTGACGCTGGGCCACCGGGGATGACGGGTTTTCCCGGTGCA GCGGGACGGGTCGGACCCCCGGGGCCCGCTGGCATTACCGGACCGCCTGGGCCGCCCGGCCCTGCTGG GAAAGATGGCCCCAGAGGGCTGCGCGGGGACGTTGGCCCAGTAGGGCGAACAGGCGAGCAGGGTATAGC CGGACCGCCAGGTTTTGCCGGTGAAAAGGGCCCTTCGGGCGAAGCGGGAGCGGCGGGTCCACCAGGCAC TCCTGGACCTCAAGGTATTTTAGGCGCGCCAGGCATCCTGGGCTTACCTGGCTCTCGTGGTGAAAGAGGTC TACCAGGTATCGCAGGGGCAACTGGTGAGCCCGGCCCCTTAGGTGTCAGTGGGCCGCCGGGTGCGCGTG GCCCTAGCGGCCCTGTCGGCTCCCCCGGGCCTAATGGTGCACCGGGCGAGGCGGGGCGAGATGGTAACC CGGGAAATGACGGCCCTCCAGGAAGGGATGGTGCTCCTGGTTTTAAGGGTGAACGAGGGGCCCCTGGTAA CCCAGGGCCCTCAGGTGCGTTGGGCGCTCCAGGGCCGCATGGACAGGTTGGACCGAGTGGCAAGCCGGG GAACCGAGGCGATCCGGGTCCAGTAGGTCCCGTGGGTCCAGCTGGCGCATTCGGACCCAGGGGGCTCGC GGGACCACAAGGACCCCGGGGAGAGAAGGGTGAACCCGGGGACAAAGGGCACAGGGGCCTCCCGGGGCT GAAAGGTCATAATGGTCTTCAGGGCTTGCCGGGTTTAGCCGGGCAGCACGGTGATCAAGGTCCCCCGGGC AACAACGGGCCCGCAGGCCCCCGGGGTCCGCCAGGCCCTTCAGGCCCTCCGGGAAAAGACGGACGCAAT GGGCTACCAGGACCAATCGGCCCGGCAGGTGTAAGAGGGTCTCATGGCTCTCAAGGACCCGCAGGCCCGC CAGGGCCACCCGGACCTCCAGGACCTCCAGGACCCAATGGAGGAGGGTACGAAGTTGGGTTCGATGCCGA GTACTATCGTtaa SEQ ID NO: 52 C13 chicken DAGPPGMTGFPGAAGRVGPPGPAGITGPPGPPGPAGKDGPRGLRGDVGPVGRTGEQGIAGPPGFAGEKGPSG EAGAAGPPGTPGPQGILGAPGILGLPGSRGERGLPGIAGATGEPGPLGVSGPPGARGPSGPVGSPGPNGAPGE AGRDGNPGNDGPPGRDGAPGFKGERGAPGNPGPSGALGAPGPHGQVGPSGKPGNRGDPGPVGPVGPAGAF GPRGLAGPQGPRGEKGEPGDKGHRGLPGLKGHNGLQGLPGLAGQHGDQGPPGNNGPAGPRGPPGPSGPPG KDGRNGLPGPIGPAGVRGSHGSQGPAGPPGPPGPPGPPGPNGGGYEVGFDAEYYR SEQ ID NO: 53 C13 chicken DNA GACGCTGGGCCACCGGGGATGACGGGTTTTCCCGGTGCAGCGGGACGGGTCGGACCCCCGGGGCCCGCT GGCATTACCGGACCGCCTGGGCCGCCCGGCCCTGCTGGGAAAGATGGCCCCAGAGGGCTGCGCGGGGAC GTTGGCCCAGTAGGGCGAACAGGCGAGCAGGGTATAGCCGGACCGCCAGGTTTTGCCGGTGAAAAGGGCC CTTCGGGCGAAGCGGGAGCGGCGGGTCCACCAGGCACTCCTGGACCTCAAGGTATTTTAGGCGCGCCAGG CATCCTGGGCTTACCTGGCTCTCGTGGTGAAAGAGGTCTACCAGGTATCGCAGGGGCAACTGGTGAGCCCG GCCCCTTAGGTGTCAGTGGGCCGCCGGGTGCGCGTGGCCCTAGCGGCCCTGTCGGCTCCCCCGGGCCTA ATGGTGCACCGGGCGAGGCGGGGCGAGATGGTAACCCGGGAAATGACGGCCCTCCAGGAAGGGATGGTG CTCCTGGTTTTAAGGGTGAACGAGGGGCCCCTGGTAACCCAGGGCCCTCAGGTGCGTTGGGCGCTCCAGG GCCGCATGGACAGGTTGGACCGAGTGGCAAGCCGGGGAACCGAGGCGATCCGGGTCCAGTAGGTCCCGT GGGTCCAGCTGGCGCATTCGGACCCAGGGGGCTCGCGGGACCACAAGGACCCCGGGGAGAGAAGGGTGA ACCCGGGGACAAAGGGCACAGGGGCCTCCCGGGGCTGAAAGGTCATAATGGTCTTCAGGGCTTGCCGGGT TTAGCCGGGCAGCACGGTGATCAAGGTCCCCCGGGCAACAACGGGCCCGCAGGCCCCCGGGGTCCGCCA GGCCCTTCAGGCCCTCCGGGAAAAGACGGACGCAATGGGCTACCAGGACCAATCGGCCCGGCAGGTGTAA GAGGGTCTCATGGCTCTCAAGGACCCGCAGGCCCGCCAGGGCCACCCGGACCTCCAGGACCTCCAGGACC CAATGGAGGAGGGTACGAAGTTGGGTTCGATGCCGAGTACTATCGTtaa SEQ ID NO: 54 C22x chicken APGKDGARGLTGPIGPPGPAGPNGEKGESGPPGPSGAAGARGAPGERGEPGAPGPAGFAGPPGADGQPGAK GEQGEPGQKGDAGAPGPQGPSGAPGPQGPTGVTGPKGARGAQGPPGATGFPGAAGRVGPPGPNGNPGPPG PPGSAGKDGPKGVRGDAGPPGRAGDPGLQGPAGPPGEKGEPGEDGPAGPDGPPGPQGLAGQRGIVGLPGQR GERGFPGLPGPSGEPGKQGAPGSAGDRGPPGPVGPPGLTGPAGEPGREGNPGADGPPGRDGAAGVKGDRG ETGPVGAPGAPGAPGAPGPVGPTGKQGDRGETGAQGPMGPSGPAGARGMPGPQGPRGDKGETGEAGERGL KGHRGFTGLQGLPGPPGPSGDQGAAGPAGPSGPRGPPGPVGPSGKDGSNGMPGPIGPPGPRGRSGEPGPAG PPGNPGPPGPPGPPGTGIDMSAFAGLGQTEKGPDPIRYMRADEAAGGLRQHDVEVDATLKSLNNQIESIRSPEG SKKNPARTCRDIKLCHPEWKSGDYWIDPN SEQ ID NO: 55 C22x chicken DNA GCCCCAGGCAAGGATGGAGCTAGAGGACTAACAGGACCAATCGGACCGCCTGGTCCTGCGGGGCCTAACG GAGAGAAAGGTGAAAGTGGGCCGCCTGGACCATCTGGAGCCGCCGGTGCCAGGGGTGCTCCTGGCGAGC GAGGAGAACCAGGCGCGCCCGGGCCTGCAGGCTTCGCTGGCCCCCCGGGTGCTGACGGCCAACCCGGGG CGAAGGGGGAGCAGGGGGAACCAGGCCAAAAGGGAGATGCAGGAGCCCCTGGTCCCCAGGGACCCAGCG GTGCACCGGGACCCCAGGGTCCTACGGGAGTGACAGGTCCTAAAGGGGCCCGGGGGGCGCAGGGCCCGC CAGGGGCCACCGGCTTCCCAGGGGCTGCAGGGCGGGTAGGACCCCCAGGCCCCAACGGTAACCCAGGCC CGCCTGGTCCGCCTGGCTCGGCGGGTAAGGACGGGCCGAAAGGTGTTCGGGGCGACGCCGGCCCCCCTG GACGTGCAGGCGATCCGGGCTTACAGGGCCCTGCTGGTCCTCCCGGTGAAAAGGGGGAGCCGGGCGAAG ATGGCCCTGCCGGACCGGACGGTCCACCGGGACCGCAGGGCCTGGCAGGACAACGGGGAATTGTGGGGC TCCCTGGTCAACGAGGGGAGCGCGGGTTCCCTGGTTTACCGGGTCCGTCCGGGGAACCGGGCAAACAAGG GGCTCCAGGCTCTGCAGGAGACCGAGGGCCACCAGGCCCCGTTGGACCACCCGGATTGACGGGGCCAGC GGGCGAACCAGGCCGTGAGGGCAATCCCGGAGCGGATGGACCACCCGGAAGGGACGGCGCTGCTGGTGT CAAAGGGGATAGGGGTGAAACAGGTCCAGTAGGCGCTCCCGGTGCTCCTGGTGCGCCAGGGGCTCCAGGA CCTGTCGGACCCACGGGGAAACAGGGCGATCGAGGTGAGACTGGAGCCCAAGGACCAATGGGTCCCAGTG GTCCAGCAGGTGCACGCGGGATGCCTGGACCACAAGGGCCGCGCGGAGACAAAGGTGAGACCGGTGAGG CAGGGGAGAGAGGTCTCAAGGGGCACAGAGGGTTTACGGGTCTGCAAGGTCTTCCAGGGCCTCCGGGGCC CTCAGGTGATCAGGGCGCGGCAGGTCCGGCAGGGCCTTCCGGTCCGCGTGGTCCGCCCGGACCTGTCGG CCCCTCTGGGAAAGACGGATCGAACGGTATGCCGGGTCCGATAGGGCCCCCTGGACCTCGTGGTAGATCC GGGGAACCCGGCCCCGCTGGGCCACCCGGCAACCCCGGCCCGCCCGGCCCGCCGGGGCCGCCTGGCAC CGGTATCGATATGAGCGCGTTTGCTGGGCTGGGGCAAACAGAGAAGGGTCCCGACCCGATACGCTACATG CGTGCGGATGAGGCCGCTGGCGGACTCCGACAGCATGATGTTGAAGTGGACGCCACTCTTAAGAGTTTGAA TAATCAAATTGAAAGCATAAGGTCACCAGAAGGATCAAAGAAAAATCCTGCACGCACTTGCCGTGATATCAAA CTATGTCACCCTGAGTGGAAGTCGGGGGACTATTGGATTGACCCAAATTAA SEQ ID NO: 56 C22 chicken APGKDGARGLTGPIGPPGPAGPNGEKGESGPPGPSGAAGARGAPGERGEPGAPGPAGFAGPPGADGQPGAK GEQGEPGQKGDAGAPGPQGPSGAPGPQGPTGVTGPKGARGAQGPPGATGFPGAAGRVGPPGPNGNPGPPG PPGSAGKDGPKGVRGDAGPPGRAGDPGLQGPAGPPGEKGEPGEDGPAGPDGPPGPQGLAGQRGIVGLPGQR GERGFPGLPGPSGEPGKQGAPGSAGDRGPPGPVGPPGLTGPAGEPGREGNPGADGPPGRDGAAGVKGDRG ETGPVGAPGAPGAPGAPGPVGPTGKQGDRGETGAQGPMGPSGPAGARGMPGPQGPRGDKGETGEAGERGL KGHRGFTGLQGLPGPPGPSGDQGAAGPAGPSGPRGPPGPVGPSGKDGSNGMPGPIGPPGPRGRSGEPGPAG PPGNPGPPGPPGPPGTGIDMSAFAGLGQTEKGPDPIRYMRA SEQ ID NO: 57 C22 chicken DNA GCCCCAGGCAAGGATGGAGCTAGAGGACTAACAGGACCAATCGGACCGCCTGGTCCTGCGGGGCCTAACG GAGAGAAAGGTGAAAGTGGGCCGCCTGGACCATCTGGAGCCGCCGGTGCCAGGGGTGCTCCTGGCGAGC GAGGAGAACCAGGCGCGCCCGGGCCTGCAGGCTTCGCTGGCCCCCCGGGTGCTGACGGCCAACCCGGGG CGAAGGGGGAGCAGGGGGAACCAGGCCAAAAGGGAGATGCAGGAGCCCCTGGTCCCCAGGGACCCAGCG GTGCACCGGGACCCCAGGGTCCTACGGGAGTGACAGGTCCTAAAGGGGCCCGGGGGGCGCAGGGCCCGC CAGGGGCCACCGGCTTCCCAGGGGCTGCAGGGCGGGTAGGACCCCCAGGCCCCAACGGTAACCCAGGCC CGCCTGGTCCGCCTGGCTCGGCGGGTAAGGACGGGCCGAAAGGTGTTCGGGGCGACGCCGGCCCCCCTG GACGTGCAGGCGATCCGGGCTTACAGGGCCCTGCTGGTCCTCCCGGTGAAAAGGGGGAGCCGGGCGAAG ATGGCCCTGCCGGACCGGACGGTCCACCGGGACCGCAGGGCCTGGCAGGACAACGGGGAATTGTGGGGC TCCCTGGTCAACGAGGGGAGCGCGGGTTCCCTGGTTTACCGGGTCCGTCCGGGGAACCGGGCAAACAAGG GGCTCCAGGCTCTGCAGGAGACCGAGGGCCACCAGGCCCCGTTGGACCACCCGGATTGACGGGGCCAGC GGGCGAACCAGGCCGTGAGGGCAATCCCGGAGCGGATGGACCACCCGGAAGGGACGGCGCTGCTGGTGT CAAAGGGGATAGGGGTGAAACAGGTCCAGTAGGCGCTCCCGGTGCTCCTGGTGCGCCAGGGGCTCCAGGA CCTGTCGGACCCACGGGGAAACAGGGCGATCGAGGTGAGACTGGAGCCCAAGGACCAATGGGTCCCAGTG GTCCAGCAGGTGCACGCGGGATGCCTGGACCACAAGGGCCGCGCGGAGACAAAGGTGAGACCGGTGAGG CAGGGGAGAGAGGTCTCAAGGGGCACAGAGGGTTTACGGGTCTGCAAGGTCTTCCAGGGCCTCCGGGGCC CTCAGGTGATCAGGGCGCGGCAGGTCCGGCAGGGCCTTCCGGTCCGCGTGGTCCGCCCGGACCTGTCGG CCCCTCTGGGAAAGACGGATCGAACGGTATGCCGGGTCCGATAGGGCCCCCTGGACCTCGTGGTAGATCC GGGGAACCCGGCCCCGCTGGGCCACCCGGCAACCCCGGCCCGCCCGGCCCGCCGGGGCCGCCTGGCAC CGGTATCGATATGAGCGCGTTTGCTGGGCTGGGGCAAACAGAGAAGGGTCCCGACCCGATACGCTACATG CGTGCGTAA SEQ ID NO: 58 C23 chicken AGRVGPPGPNGNPGPPGPPGSAGKDGPKGVRGDAGPPGRAGDPGLQGPAGPPGEKGEPGEDGPAGPDGPP GPQGLAGQRGIVGLPGQRGERGFPGLPGPSGEPGKQGAPGSAGDRGPPGPVGPPGLTGPAGEPGREGNPGA DGPPGRDGAAGVKGDRGETGPVGAPGAPGAPGAPGPVGPTGKQGDRGETGAQGPMGPSGPAGARGMPGPQ GPRGDKGETGEAGERGLKGHRGFTGLQGLPGPPGPSGDQGAAGPAGPSGPRGPPGPVGPSGKDGSNGMPG PIGPPGPRGRSGEPGPAGPPGNPGPPGPPGPPGTGIDMSAFAGLGQTEKGPDPIRYMRA SEQ ID NO: 59 C23 chicken DNA GCAGGGCGGGTAGGACCCCCAGGCCCCAACGGTAACCCAGGCCCGCCTGGTCCGCCTGGCTCGGCGGGT AAGGACGGGCCGAAAGGTGTTCGGGGCGACGCCGGCCCCCCTGGACGTGCAGGCGATCCGGGCTTACAG GGCCCTGCTGGTCCTCCCGGTGAAAAGGGGGAGCCGGGCGAAGATGGCCCTGCCGGACCGGACGGTCCA CCGGGACCGCAGGGCCTGGCAGGACAACGGGGAATTGTGGGGCTCCCTGGTCAACGAGGGGAGCGCGGG TTCCCTGGTTTACCGGGTCCGTCCGGGGAACCGGGCAAACAAGGGGCTCCAGGCTCTGCAGGAGACCGAG GGCCACCAGGCCCCGTTGGACCACCCGGATTGACGGGGCCAGCGGGCGAACCAGGCCGTGAGGGCAATC CCGGAGCGGATGGACCACCCGGAAGGGACGGCGCTGCTGGTGTCAAAGGGGATAGGGGTGAAACAGGTC CAGTAGGCGCTCCCGGTGCTCCTGGTGCGCCAGGGGCTCCAGGACCTGTCGGACCCACGGGGAAACAGG GCGATCGAGGTGAGACTGGAGCCCAAGGACCAATGGGTCCCAGTGGTCCAGCAGGTGCACGCGGGATGCC TGGACCACAAGGGCCGCGCGGAGACAAAGGTGAGACCGGTGAGGCAGGGGAGAGAGGTCTCAAGGGGCA CAGAGGGTTTACGGGTCTGCAAGGTCTTCCAGGGCCTCCGGGGCCCTCAGGTGATCAGGGCGCGGCAGGT CCGGCAGGGCCTTCCGGTCCGCGTGGTCCGCCCGGACCTGTCGGCCCCTCTGGGAAAGACGGATCGAAC GGTATGCCGGGTCCGATAGGGCCCCCTGGACCTCGTGGTAGATCCGGGGAACCCGGCCCCGCTGGGCCA CCCGGCAACCCCGGCCCGCCCGGCCCGCCGGGGCCGCCTGGCACCGGTATCGATATGAGCGCGTTTGCT GGGCTGGGGCAAACAGAGAAGGGTCCCGACCCGATACGCTACATGCGTGCGTAA SEQ ID NO: 60 C23x chicken AGQRGIVGLPGQRGERGFPGLPGPSGEPGKQGAPGSAGDRGPPGPVGPPGLTGPAGEPGREGNPGADGPPG RDGAAGVKGDRGETGPVGAPGAPGAPGAPGPVGPTGKQGDRGETGAQGPMGPSGPAGARGMPGPQGPRGD KGETGEAGERGLKGHRGFTGLQGLPGPPGPSGDQGAAGPAGPSGPRGPPGPVGPSGKDGSNGMPGPIGPPG PRGRSGEPGPAGPPGNPGPPGPPGPPGTGIDMSAFAGLGQTEKGPDPIRYMRADEAAGGLRQHDVEVDATLKS LNNQIESIRSPEGSKKNPARTCRDIKLCHPEWKSGDYWIDPN SEQ ID NO: 61 C23x chicken DNA GCAGGACAACGGGGAATTGTGGGGCTCCCTGGTCAACGAGGGGAGCGCGGGTTCCCTGGTTTACCGGGTC CGTCCGGGGAACCGGGCAAACAAGGGGCTCCAGGCTCTGCAGGAGACCGAGGGCCACCAGGCCCCGTTG GACCACCCGGATTGACGGGGCCAGCGGGCGAACCAGGCCGTGAGGGCAATCCCGGAGCGGATGGACCAC CCGGAAGGGACGGCGCTGCTGGTGTCAAAGGGGATAGGGGTGAAACAGGTCCAGTAGGCGCTCCCGGTG CTCCTGGTGCGCCAGGGGCTCCAGGACCTGTCGGACCCACGGGGAAACAGGGCGATCGAGGTGAGACTG GAGCCCAAGGACCAATGGGTCCCAGTGGTCCAGCAGGTGCACGCGGGATGCCTGGACCACAAGGGCCGC GCGGAGACAAAGGTGAGACCGGTGAGGCAGGGGAGAGAGGTCTCAAGGGGCACAGAGGGTTTACGGGTC TGCAAGGTCTTCCAGGGCCTCCGGGGCCCTCAGGTGATCAGGGCGCGGCAGGTCCGGCAGGGCCTTCCG GTCCGCGTGGTCCGCCCGGACCTGTCGGCCCCTCTGGGAAAGACGGATCGAACGGTATGCCGGGTCCGAT AGGGCCCCCTGGACCTCGTGGTAGATCCGGGGAACCCGGCCCCGCTGGGCCACCCGGCAACCCCGGCCC GCCCGGCCCGCCGGGGCCGCCTGGCACCGGTATCGATATGAGCGCGTTTGCTGGGCTGGGGCAAACAGA GAAGGGTCCCGACCCGATACGCTACATGCGTGCGGATGAGGCCGCTGGCGGACTCCGACAGCATGATGTT GAAGTGGACGCCACTCTTAAGAGTTTGAATAATCAAATTGAAAGCATAAGGTCACCAGAAGGATCAAAGAAA AATCCTGCACGCACTTGCCGTGATATCAAACTATGTCACCCTGAGTGGAAGTCGGGGGACTATTGGATTGAC CCAAATTAA SEQ ID NO: 62 C31 chicken SFSPQYDSYDVKAGSVGMGYPPQPISGFPGPPGPSGPPGPPGHAGPPGSNGYQGPPGEPGQPGPSGPPGPA GMIGPAGPPGKDGEPGRPGRNGDRGIPGLPGHKGHPGMPGMPGMKGARGFDGKDGAKGDSGAPGPKGEAG QPGANGSPGQPGPGGPTGERGRPGNPGGPGAHGKDGAPGTAGPLGPPGPPGTAGFPGSPGFKGEAGPPGP AGASGNPGERGEPGPQGQAGPPGPQGPPGRAGSPGGKGEMGPSGIPGGPGPPGGRGLPGPPGTSGNPGAK GTPGEPGKNGAKGDPGPKGERGENGTPGARGPPGEEGKRGANGEPGQNGVPGTPGERGSPGFRGLPGSNG LPGEKGPAGERGSPGPPGPSGPAGDRGQDGGPGLPGMRGLPGIPGSPGSDGKPGPPGNQGEPGRSGPPGPA GPRGQPGVMGFPGPKGNEGAPGKNGERGPGGPPGTPGPAGKNGDVGLPGPPGPAGPAGDRGEPGPSGSPG LQGLPGGPGPAGENGKPGEPGPKGDIGGPGFPGPKGENGIPGERGPQGPPGPTGARGGPGPAGSEGAKGPP GPPGAPGGTGLPGLQGMPGERGASGSPGPKGDKGEPGGKGADGLPGARGERGNVGPIGPPGPAGPPGDKGE TGPAGAPGPAGSRGGPGERGEQGLPGPAGFPGAPGQNGEPGGKGERGPPGLRGEAGPPGAAGPQGGPGAP GPPGPQGVKGERGSPGGPGAAGFPGARGPPGPPGNNGDRGESGPPGVPGPPGHPGPAGNNGAPGKAGERG FQGPLGPQGAIGSPGASGARGPPGPAGPPGKDGRGGYPGPIGPPGPRGNRGESGPAGPPGQPGLPGPSGPP GPCCGGGVASLGAGEKGPVGYGYEYR SEQ ID NO: 63 C31 chicken DNA TCcTTCTCTCCCCAGTACGACTCGTATGATGTTAAAGCCGGGAGTGTCGGCATGGGCTACCCACCACAGCCC ATCAGTGGATTCCCAGGTCCTCCCGGACCGTCTGGACCGCCAGGACCGCCCGGGCACGCAGGGCCGCCT GGTTCAAATGGTTACCAAGGCCCGCCAGGGGAACCGGGTCAACCGGGTCCTTCTGGGCCACCTGGCCCGG CGGGGATGATAGGTCCGGCCGGACCCCCGGGAAAGGACGGAGAGCCGGGTCGTCCTGGCAGAAACGGAG ATCGGGGAATCCCAGGGCTCCCCGGCCATAAAGGGCATCCAGGGATGCCAGGTATGCCGGGGATGAAGGG GGCCAGGGGGTTTGATGGGAAAGACGGGGCGAAGGGAGATTCAGGGGCACCTGGGCCGAAAGGTGAAGC GGGCCAACCAGGTGCTAACGGCTCCCCCGGACAACCGGGGCCGGGCGGTCCAACAGGTGAGCGCGGACG ACCCGGAAATCCAGGTGGTCCAGGCGCACACGGCAAAGACGGAGCCCCCGGAACTGCTGGTCCGTTGGGC CCCCCCGGACCTCCGGGCACGGCTGGATTTCCTGGCTCACCGGGGTTTAAGGGCGAAGCCGGTCCCCCCG GACCGGCGGGCGCCTCCGGTAATCCTGGTGAGCGTGGAGAGCCAGGTCCCCAAGGTCAGGCCGGTCCGC CGGGACCTCAAGGCCCTCCAGGTCGTGCGGGAAGCCCCGGTGGTAAAGGTGAAATGGGCCCTTCGGGGAT TCCAGGTGGCCCCGGTCCGCCCGGTGGACGGGGCTTACCAGGTCCACCAGGAACATCCGGTAATCCCGGG GCCAAAGGAACTCCCGGGGAGCCTGGCAAAAACGGAGCTAAGGGTGACCCCGGACCCAAAGGTGAAAGGG GGGAGAATGGAACCCCTGGGGCCAGAGGGCCTCCAGGAGAAGAGGGCAAACGAGGGGCTAACGGTGAAC CAGGCCAAAATGGGGTACCTGGCACTCCGGGAGAGAGAGGTTCTCCGGGTTTTCGTGGTTTACCGGGGTCA AACGGTCTTCCCGGAGAGAAGGGCCCTGCTGGGGAACGCGGCAGTCCTGGTCCTCCAGGACCTTCGGGCC CTGCAGGAGATAGGGGTCAGGACGGTGGCCCCGGTCTGCCCGGGATGCGCGGACTGCCCGGAATCCCTG GTAGCCCAGGCTCAGATGGGAAGCCTGGCCCCCCTGGGAACCAGGGAGAGCCCGGACGCAGCGGACCAC CTGGGCCCGCAGGGCCTCGTGGTCAACCAGGGGTGATGGGTTTTCCGGGTCCAAAGGGAAATGAGGGCGC CCCAGGTAAGAATGGGGAGCGCGGACCCGGAGGGCCGCCGGGTACGCCTGGTCCTGCGGGCAAAAACGG CGACGTCGGACTGCCGGGTCCACCCGGGCCCGCCGGCCCGGCGGGTGATCGTGGCGAGCCCGGGCCGA GTGGAAGTCCCGGATTGCAAGGTCTACCCGGTGGTCCTGGGCCTGCGGGCGAAAACGGAAAACCGGGTGA ACCAGGCCCTAAGGGAGACATTGGAGGACCAGGGTTTCCGGGACCGAAGGGCGAAAACGGAATACCTGGG GAGCGCGGACCCCAGGGTCCTCCCGGGCCCACAGGCGCGCGAGGCGGCCCAGGTCCGGCAGGAAGCGA GGGAGCAAAAGGGCCCCCTGGGCCGCCTGGGGCACCAGGAGGCACGGGGCTACCGGGCCTCCAGGGAAT GCCTGGGGAACGGGGTGCTTCTGGTAGCCCGGGACCAAAGGGGGATAAAGGTGAGCCAGGTGGCAAAGG TGCGGACGGGTTACCAGGGGCAAGAGGGGAACGGGGGAATGTTGGACCCATTGGCCCCCCTGGGCCTGC TGGTCCACCGGGGGATAAGGGCGAGACTGGCCCTGCAGGGGCCCCCGGCCCTGCCGGAAGCAGGGGGG GACCAGGGGAGCGTGGCGAACAAGGGCTCCCAGGACCTGCTGGCTTTCCCGGGGCTCCTGGCCAGAACG GAGAACCAGGCGGGAAGGGTGAACGGGGCCCCCCGGGCCTACGTGGCGAGGCGGGTCCACCAGGGGCG GCTGGCCCGCAAGGCGGGCCAGGCGCCCCGGGCCCGCCCGGCCCTCAGGGCGTGAAGGGGGAAAGGGG CTCGCCTGGTGGCCCTGGCGCTGCTGGGTTCCCTGGAGCAAGAGGGCCACCGGGTCCTCCGGGAAATAAT GGAGACCGAGGTGAATCCGGTCCTCCGGGAGTGCCAGGGCCTCCGGGGCATCCAGGGCCCGCCGGTAAC AATGGGGCACCCGGAAAGGCAGGTGAACGGGGTTTCCAAGGCCCTCTTGGTCCACAGGGGGCGATAGGTT CTCCTGGGGCATCAGGCGCTCGTGGTCCGCCCGGACCGGCAGGCCCCCCGGGCAAAGATGGAAGGGGCG GCTATCCAGGGCCAATTGGTCCACCGGGTCCTAGAGGAAACAGAGGAGAATCGGGACCTGCTGGCCCCCC CGGTCAGCCAGGATTGCCGGGTCCTTCCGGGCCTCCTGGGCCTTGCTGTGGTGGCGGGGTAGCTTCGCTT GGCGCTGGCGAGAAAGGCCCCGTAGGGTATGGATATGAGTACCGTtaa SEQ ID NO: 64 C32 chicken SFSPQYDSYDVKAGSVGMGYPPQPISGFPGPPGPSGPPGPPGHAGPPGSNGYQGPPGEPGQPGPSGPPGPA GMIGPAGPPGKDGEPGRPGRNGDRGIPGLPGHKGHPGMPGMPGMKGARGFDGKDGAKGDSGAPGPKGEAG QPGANGSPGQPGPGGPTGERGRPGNPGGPGAHGKDGAPGTAGPLGPPGPPGTAGFPGSPGFKGEAGPPGP AGASGNPGERGEPGPQGQAGPPGPQGPPGRAGSPGGKGEMGPSGIPGGPGPPGGRGLPGPPGTSGNPGAK GTPGEPGKNGAKGDPGPKGERGENGTPGARGPPGEEGKRGANGEPGQNGVPGTPGERGSPGFRGLPGSNG LPGEKGPAGERGSPGPPGPSGPAGDRGQDGGPGLPGMRGLPGIPGSPGSDGKPGPPGNQGEPGRSGPPGPA GPRGQPGVMGFPGPKGNEGAPGKNGERGPGGPPG SEQ ID NO: 65 C32 chicken DNA TCcTTCTCTCCCCAGTACGACTCGTATGATGTTAAAGCCGGGAGTGTCGGCATGGGCTACCCACCACAGCCC ATCAGTGGATTCCCAGGTCCTCCCGGACCGTCTGGACCGCCAGGACCGCCCGGGCACGCAGGGCCGCCT GGTTCAAATGGTTACCAAGGCCCGCCAGGGGAACCGGGTCAACCGGGTCCTTCTGGGCCACCTGGCCCGG CGGGGATGATAGGTCCGGCCGGACCCCCGGGAAAGGACGGAGAGCCGGGTCGTCCTGGCAGAAACGGAG ATCGGGGAATCCCAGGGCTCCCCGGCCATAAAGGGCATCCAGGGATGCCAGGTATGCCGGGGATGAAGGG GGCCAGGGGGTTTGATGGGAAAGACGGGGCGAAGGGAGATTCAGGGGCACCTGGGCCGAAAGGTGAAGC GGGCCAACCAGGTGCTAACGGCTCCCCCGGACAACCGGGGCCGGGCGGTCCAACAGGTGAGCGCGGACG ACCCGGAAATCCAGGTGGTCCAGGCGCACACGGCAAAGACGGAGCCCCCGGAACTGCTGGTCCGTTGGGC CCCCCCGGACCTCCGGGCACGGCTGGATTTCCTGGCTCACCGGGGTTTAAGGGCGAAGCCGGTCCCCCCG GACCGGCGGGCGCCTCCGGTAATCCTGGTGAGCGTGGAGAGCCAGGTCCCCAAGGTCAGGCCGGTCCGC CGGGACCTCAAGGCCCTCCAGGTCGTGCGGGAAGCCCCGGTGGTAAAGGTGAAATGGGCCCTTCGGGGAT TCCAGGTGGCCCCGGTCCGCCCGGTGGACGGGGCTTACCAGGTCCACCAGGAACATCCGGTAATCCCGGG GCCAAAGGAACTCCCGGGGAGCCTGGCAAAAACGGAGCTAAGGGTGACCCCGGACCCAAAGGTGAAAGGG GGGAGAATGGAACCCCTGGGGCCAGAGGGCCTCCAGGAGAAGAGGGCAAACGAGGGGCTAACGGTGAAC CAGGCCAAAATGGGGTACCTGGCACTCCGGGAGAGAGAGGTTCTCCGGGTTTTCGTGGTTTACCGGGGTCA AACGGTCTTCCCGGAGAGAAGGGCCCTGCTGGGGAACGCGGCAGTCCTGGTCCTCCAGGACCTTCGGGCC CTGCAGGAGATAGGGGTCAGGACGGTGGCCCCGGTCTGCCCGGGATGCGCGGACTGCCCGGAATCCCTG GTAGCCCAGGCTCAGATGGGAAGCCTGGCCCCCCTGGGAACCAGGGAGAGCCCGGACGCAGCGGACCAC CTGGGCCCGCAGGGCCTCGTGGTCAACCAGGGGTGATGGGTTTTCCGGGTCCAAAGGGAAATGAGGGCGC CCCAGGTAAGAATGGGGAGCGCGGACCCGGAGGGCCGCCGGGTtaa SEQ ID NO: 66 C33 chicken SFSPQYDSYDVKAGSVGMGYPPQPISGFPGPPGPSGPPGPPGHAGPPGSNGYQGPPGEPGQPGPSGPPGPA GMIGPAGPPGKDGEPGRPGRNGDRGIPGLPGHKGHPGMPGMPGMKGARGFDGKDGAKGDSGAPGPKGEAG QPGANGSPGQPGPGGPTGERGRPGNPGGPGAHGKDGAPGTAGPLGPPGPPGTAGFPGSPGFKGEAGPPGP AGASGNPGERGEPGPQGQAGPPGPQGPPGRAGSPGGKGEMGPSGIPGGPGPPGGRGLPGPPGTSGNPGAK GTPGEPGKNGAKGDPGPKGERGENGTPGARGPPGEEGKRGANGEPGQNGVPGTPGER SEQ ID NO: 67 C33 chicken DNA TCcTTCTCTCCCCAGTACGACTCGTATGATGTTAAAGCCGGGAGTGTCGGCATGGGCTACCCACCACAGCCC ATCAGTGGATTCCCAGGTCCTCCCGGACCGTCTGGACCGCCAGGACCGCCCGGGCACGCAGGGCCGCCT GGTTCAAATGGTTACCAAGGCCCGCCAGGGGAACCGGGTCAACCGGGTCCTTCTGGGCCACCTGGCCCGG CGGGGATGATAGGTCCGGCCGGACCCCCGGGAAAGGACGGAGAGCCGGGTCGTCCTGGCAGAAACGGAG ATCGGGGAATCCCAGGGCTCCCCGGCCATAAAGGGCATCCAGGGATGCCAGGTATGCCGGGGATGAAGGG GGCCAGGGGGTTTGATGGGAAAGACGGGGCGAAGGGAGATTCAGGGGCACCTGGGCCGAAAGGTGAAGC GGGCCAACCAGGTGCTAACGGCTCCCCCGGACAACCGGGGCCGGGCGGTCCAACAGGTGAGCGCGGACG ACCCGGAAATCCAGGTGGTCCAGGCGCACACGGCAAAGACGGAGCCCCCGGAACTGCTGGTCCGTTGGGC CCCCCCGGACCTCCGGGCACGGCTGGATTTCCTGGCTCACCGGGGTTTAAGGGCGAAGCCGGTCCCCCCG GACCGGCGGGCGCCTCCGGTAATCCTGGTGAGCGTGGAGAGCCAGGTCCCCAAGGTCAGGCCGGTCCGC CGGGACCTCAAGGCCCTCCAGGTCGTGCGGGAAGCCCCGGTGGTAAAGGTGAAATGGGCCCTTCGGGGAT TCCAGGTGGCCCCGGTCCGCCCGGTGGACGGGGCTTACCAGGTCCACCAGGAACATCCGGTAATCCCGGG GCCAAAGGAACTCCCGGGGAGCCTGGCAAAAACGGAGCTAAGGGTGACCCCGGACCCAAAGGTGAAAGGG GGGAGAATGGAACCCCTGGGGCCAGAGGGCCTCCAGGAGAAGAGGGCAAACGAGGGGCTAACGGTGAAC CAGGCCAAAATGGGGTACCTGGCACTCCGGGAGAGAGAtaa
Claims
CLAIMS 1. A recombinant collagen-derived polypeptide based on an animal collagen protein, expressed in a recombinant host cell, wherein the polypeptide consists of an amino acid sequence identical to an internal portion of the collagen protein upon which it is based, or a substantially similar variant thereof, and an optional tag or modification.
2. The polypeptide of claim 1 wherein the host cell is a non-animal host cell.
3. The polypeptide of claim 1 or 2 wherein the animal collagen protein is a mammalian, fish or avian collagen protein.
4. The polypeptide of claim 3 wherein the animal collagen is a human, bovine, salmon, chicken or pig collagen.
5. The polypeptide of any one of claims 2 to 4, wherein the recombinant peptide is expressed in a yeast or fungal host.
6. The polypeptide of claim 5 wherein the host is Komagataella, preferably Komagataella phaffii.
7. The polypeptide of any one of claims 1 to 6 wherein the collagen-derived polypeptide has a glycine content of greater than about 25% and a proline content of greater than about 15%.
8. The polypeptide of claim 7 which has an amino acid profile: Gly % Pro % Ala % Arg % Glu % Lys % Ser % Asp % Gln % Leu % 29-35 16-30 5-15 2-8 2-8 1-6 1-6 1-6 0-5 0-5 Val % Thr % Phe % Asn % Ile % Met % His % Tyr % Cys % Trp % 0-5 0-5 0-3 0-3 0-3 0-3 0-3 0-3 0-1 0-1 9. The polypeptide of claim 7 or 8 wherein one or more proline residues are hydroxylated.
10. The polypeptide of any one of claims 1 to 9 wherein the sequence identical to an internal portion of the collagen protein upon which it is based is at least about 100 amino acids and less than about 1200 amino acids in length, or about 300 and 1100 amino acids in length.
11. The polypeptide of any one of claims 1 to 10, wherein the collagen protein upon which it is based is a Type I, Type II or Type III collagen.
12. The polypeptide of any one of claims 1 to 11, which comprises one or more of:(a) an N-terminal modification; (b) a C-terminal modification; (c) a signal sequence which may support secretion of the polypeptide; and / or (d) a protease cleavage site; wherein the N-terminal or C-terminal modification enhances one or more functional properties of the polypeptide.
13. The polypeptide of claim 11 wherein the wherein the N-terminal or C-terminal modification comprises a GlyProPro, GlyProHyp or GlyHypPro repeating sequence.
14. The polypeptide of any one of claims 1 to 11, selected from the group consisting of SEQ ID NO: 1, SEQ ID NO: 2, SEQ ID NO: 3, SEQ ID NO: 7, SEQ ID NO: 8, SEQ ID NO: 10, SEQ ID NO: 12, SEQ ID NO: 14, SEQ ID NO: 16, SEQ ID NO: 18, SEQ ID NO: 20, SEQ ID NO: 22, SEQ ID NO: 24, SEQ ID NO: 26, SEQ ID NO: 28, SEQ ID NO: 30, SEQ ID NO: 32, SEQ ID NO: 34, SEQ ID NO: 36, SEQ ID NO: 38, SEQ ID NO: 40, SEQ ID NO: 42, SEQ ID NO: 44, SEQ ID NO: 46, SEQ ID NO: 48, SEQ ID NO: 50, SEQ ID NO: 52, SEQ ID NO: 54, SEQ ID NO: 56, SEQ ID NO: 58, SEQ ID NO: 60, SEQ ID NO: 62, SEQ ID NO: 64, SEQ ID NO: 66, and substantially similar polypeptides thereof.
15. The polypeptide of any one of claims 1-14 which has one or more of the following properties: a. forms a clear solution at a concentration of at least 1% wt, preferably at least 5%, or more preferably at least 10%, in water or buffer between about pH 3.0 to about 10.0, at a temperature between about 4° C to about 100° C, preferably between about 15° to about 80° C; b. forms a gel, at a concentration of at least 5% wt, in a pH of between about 3.0 to 10.0; and / or c. forms a viscous solution at a concentration of at least 1% wt, having a viscosity between about 10 mP and 5000 cP, preferably between about 1 cP to about 2000 cP, more preferably between about 10 cP to about 2000 cP, at 20° C.
16. The polypeptide of claim 15 which forms a reversible gel.
17. A method of producing a polypeptide of any one of claims 1 to 14, wherein the host is a fermenting microorganism, comprising the step of growing the host in a liquid growth medium comprising a carbon source, collecting the liquid growth medium and isolating the polypeptide.
18. The method of claim 17 wherein the host is a fungal host, preferably a Komagataella, and the carbon source comprises a fermentable sugar, preferably produced by enzyme treated starch.
19. A composition comprising a polypeptide of any one of claims 1 to 16, or a mixture of peptides produced by digesting or hydrolyzing a polypeptide of any one of claims 1 to 16.
20. The composition of claim 19 which is an edible product and which is a protein or amino acid supplement, a gelling agent, stabilizing agent, foaming agent, film-forming agent, emulsifier or thickening agent.
21. The composition of claim 20 which is an edible vegan product used to substitute for a animal-based food or beverage.
22. The composition of claim 19 which is a cell scaffolding additive or agent.
23. A polynucleotide encoding a polypeptide of any one of claims 1-16.
24. The polynucleotide of claim 22 selected from the group consisting of SEQ ID NO: 4, SEQ ID NO:5 and SEQ ID NO: 6, SEQ ID NO: 9, SEQ ID NO: 11, SEQ ID NO: 13, SEQ ID NO: 15, SEQ ID NO: 17, SEQ ID NO: 19, SEQ ID NO: 21, SEQ ID NO: 23, SEQ ID NO: 25, SEQ ID NO: 27, SEQ ID NO: 29, SEQ ID NO: 31, SEQ ID NO: 33, SEQ ID NO: 35, SEQ ID NO: 37, SEQ ID NO: 39, SEQ ID NO: 41, SEQ ID NO: 43, SEQ ID NO: 45, SEQ ID NO: 47, SEQ ID NO: 49, SEQ ID NO: 51, SEQ ID NO: 53, SEQ ID NO: 55, SEQ ID NO: 57, SEQ ID NO: 59, SEQ ID NO: 61, SEQ ID NO: 63, SEQ ID NO: 65, and SEQ ID NO:
67.
25. An expression vector comprising the polynucleotide of claim 23 or 24.
26. A host cell comprising the expression vector of claim 24, which is preferably a non-animal host cell, preferably Komagataella phaffii.
Citation Information
Patent Citations
Recombinant gelatins with uniform molecular weight
CA2388477A1
Animal collagens and gelatins
CA2399371A1