Single construct platform for simultaneous delivery of gene editing machinery and nucleic acid cargo

WO2025224182A3PCT designated stage Publication Date: 2025-11-27BASECAMP RESEARCH LTD
View PDF 2 Cites 0 Cited by

Patent Information

Application Number
PCT/EP2025/061088
Authority / Receiving Office
WO · WO
Patent Type
Applications
Current Assignee / Owner
Priority Date
2024-04-23
Filing Date
2025-04-23
Publication Date
2025-11-27

AI Technical Summary

Technical Problem

Current genome editing techniques require double strand breaks, which evoke DNA damage responses and are inactive in terminally differentiated cells, and CRISPR-based approaches are limited to short sequence modifications.

Method used

A helper-dependent adenovirus (HDAd) is engineered to deliver components for site-specific integration of large nucleic acid cargo into a cellular genome, using a single construct that includes a prime editor system, guide RNAs, and an integrase, avoiding multiple delivery steps and intramolecular recombination.

Benefits of technology

Enables efficient and precise integration of large nucleic acid sequences into any genomic site, overcoming limitations of existing methods and allowing broad applications in therapeutic, diagnostic, agricultural, and research contexts.

✦ Generated by Eureka AI based on patent content.
Patent Text Reader

Abstract

The present disclosure provides nucleic acid constructs (e.g., HDAd vectors), set of nucleic acid constructs (e.g., one or more HDAd vectors), HDAd virions, and HDAd virus comprising all the components for site-specifically integrating an exogenous nucleic acid into a cellular genome at a desired target sequence. The present disclosure also provides methods of using the same.
Need to check novelty before this filing date? Find Prior Art

Description

SINGLE CONSTRUCT PLATFORM FOR SIMULTANEOUS DELIVERY OF GENE EDITING MACHINERY AND NUCLEIC ACID CARGO1. CROSS REFERENCE TO RELATED APPLICATIONS

[0001] This application claims priority under 35 U.S.C. § 119(e) to U.S. Provisional PatentApplication Serial No. 63 / 637,868, “Novel Crispr Enzymes, Systems and Uses Thereof,” filedApril 23, 2024. The subject matter of the foregoing is incorporated herein by reference in itsentirety.2. SEQUENCE LISTING

[0002] The instant application contains a Sequence Listing which has been submittedelectronically and is hereby incorporated by reference in its entirety. Said XML copy, created onApril 15, 2025, is named 55806WO_CRF_sequencelisting.xml, and is 942,080 bytes in size.3. BACKGROUND

[0003] Programmable, efficient, and multiplexed genome integration of large, diverse DNAcargo independent of DNA repair remains an unsolved challenge of genome editing. Current geneintegration approaches require double strand breaks that evoke DNA damage responses and relyon repair pathways that are inactive in terminally differentiated cells. Furthermore, CRISPR-based approaches that bypass double stranded breaks, such as Prime editing, are limited to modification or insertion of short sequences.

[0004] There is a need in the art for techniques which address and overcome theseshortcomings and enable the insertion and / or deletion of large sequences into cells for therapeutic and circuit-based uses for broad purposes, across eukaryotic as well as prokaryotic systems.4. SUMMARY

[0005] This disclosure is based in part on the discovery that a helper-dependent adenovirus(HDAd) can be used to efficiently deliver the components for site-specifically integrating anexogenous nucleic acid into a cellular genome at a desired target sequence. This avoids having to use multiple steps to deliver the reagents, which can negatively impact efficiency. However, with all the components present on a single construct, intramolecular recombination is likely and has ahigh probability of disrupting HDAd virus genome stability. Careful consideration is needed toavoid intramolecular recombination. Despite these challenges, Applicant has engineered an HDAdthat enables delivery of all the components needed for site-specifically integrating an exogenousnucleic acid into a cellular genome at a desired target sequence.

[0006] In one embodiment, the present disclosure provides reagents for deliving thecomponents for use in site-specific genetic engineering using Programmable Addition via Site-Specific Targeting Elements (PASTE) (see Ionnidi et al.; Nat. Biotech.41: 500–512 (2023)); theentirety of Ionnidi et al. is incorporated by reference), transposon-mediated gene editing, or othersuitable gene editing or gene incorporation technology. Non-limiting examples of PASTE are also described in U.S. Pat. 11,572,556 and PCT Publication Nos. WO 2022 / 087235A and WO 2023 / 077148A1, each of which are hereby incorporated by reference in their entireties. Described herein are “installer” nucleic constructs that encode for a prime editor system or a gene writer protein, one or more attachment site-containing guide RNA (atgRNA), optionally a nickase guideRNA (ngRNA), an integrase, a nucleic acid cargo, and optionally a recombinase. The integrasemay be directly linked, for example by a peptide linker, to the prime editor fusion or gene writer protein. The nucleic acid construct described herein can be used to introduce, delete, or delete and introduce large pieces of DNA (as well as small pieces of DNA) to any genomic site in any organism. The technology described herein can be used broadly in therapeutic, diagnostic,agricultural, research, and for the general inclusion of genetic- and protein-based circuits.

[0007] A single nucleic acid construct is described herein that allows for incorporation of anytemplate into any DNA locus using DNA delivery of a single component DNA. Additionally, a physical portion of the nucleic acid construct is capable of self-circularizing, forming a circular construct that contains a DNA template. Further, the nucleic acid construct can be packaged and delivered in any viral or non-viral delivery vector including a recombinant adenovirus, helperdependent adenovirus, AAV, HSV, annelovirus, retrovirus, lentivirus, Doggybone™ DNA(dbDNA™), minicircle, plasmid, miniDNA, LNP, or nanoplasmid. Delivery of the nucleic acid construct can also be by fusosome or exosome, (See, e.g., WO2019222403 which is incorporated by reference herein). Delivery of nucleic acid construct can also be by VesiCas (See, e.g., US20210261957A1 which is incorporated by reference herein).

[0008] The present disclosure provides a nucleic acid construct, comprising: a polynucleotideencoding an integration enzyme, wherein the polynucleotide comprises an intron, whereby the intron prevents the expression of the integration enzyme in prokaryotic cells.

[0009] In some embodiments, the nucleic acid construct further comprises: (a) apolynucleotide encoding a gene editor polypeptide; (b) a polynucleotide encoding a first attachment site-containing guide RNA (atgRNA), wherein the first atgRNA comprises a sequence encoding at least a portion of a first integration recognition site recognizable by the encoded integration enzyme; and (c) a polynucleotide encoding a second atgRNA, wherein the second atgRNA comprises a sequence encoding at least a portion of the first integration recognition site. In certain embodiments, the first atgRNA and the second atgRNA have an overlap of 20 bp or less at the sequence encoding at least a portion of the first integration recognition site.

[0010] In some embodiments, the nucleic acid construct further comprises a cargopolynucleotide linked to a polynucleotide encoding a second integration recognition site recognized by the encoded integrase, wherein the second integration recognition site is a cognate of the first integration recognition site.

[0011] The present disclosure further provides a nucleic acid construct, comprising: (a) apolynucleotide encoding a gene editor polypeptide; (b) a polynucleotide encoding a first attachment site-containing guide RNA (atgRNA), wherein the first atgRNA comprises a sequence encoding at least a portion of a first integration recognition site recognizable by the encoded integration enzyme; (c) a polynucleotide encoding a second atgRNA, wherein the second atgRNA comprises a sequence encoding at least a portion of the first integration recognition site; (d) a polynucleotide encoding an integration enzyme, wherein the polynucleotide comprises an intron; and (e) a cargo polynucleotide linked to a polynucleotide encoding a second integration recognition site, wherein the second integration recognition site is a cognate of the first integration recognition site.

[0012] In some embodiments, the nucleic acid construct is part of a recombinant viral genome.In certain embodiments, the viral construct is an adenoviral construct. In certain embodiments, the adenoviral construct is a helper-dependent adenoviral (HDAd) construct.

[0013] The present disclosure further provides a method of making a helper-dependentadenovirus (HDAd) virion, comprising: (a) introducing into a cell line suitable for making HDAd: (i) the nucleic acid construct or the HDAd virion of the present disclosure and (ii) a helper virus (HV); (b) culturing the cell line under conditions suitable for encapsidating the HDAd genome into the HDAd virion capsid; (c) collecting the HDAd; and (d) purifying the HDAd, wherein the HDAd genome is not recombined in the HDAd virion.

[0014] The present disclosure further provides an engineered cell line suitable for makingHDAd, wherein the cell line is engineered to prevent the expression of an integration enzyme or to inactivate an integration enzyme.

[0015] The present disclosure further provides a method for site-specifically integrating anexogenous nucleic acid into a genome of a cell at a target sequence, the method comprising: (a) introducing into the cell a nucleic acid construct or the HDAd virion of the present disclosure; and culturing the cell under conditions sufficient to activate the first expression control sequence, thereby driving expression of the integration enzyme.

[0016] The present disclosure further provides an in vivo method for site-specificallyintegrating an exogenous nucleic acid into a cellular genome at a target sequence, the method comprising: administering to a subject the HDAd virion of present disclosure and an agent, wherein the agent activates the first expression control sequence, thereby allowing expression ofthe integration enzyme. The present disclosure further provides an in vivo method for site-specifically integrating an exogenous nucleic acid into a cellular genome at a target sequence, themethod comprising: administering to a subject the HDAd virion of present disclosure in the absence of an agent, wherein the agent inhibits the first expression control sequence, thereby allowing expression of the integration enzyme.5. BRIEF DESCRIPTION OF THE DRAWINGS

[0017] These and other features, aspects, and advantages of the present invention will becomebetter understood with regard to the following description, and accompanying drawings, where:

[0018] FIG. 1 illustrates a single construct that contains a prime editor fusion protein or genewriter protein, the attachment site-containing guide RNA (atgRNA), a nickase guide RNA(ngRNA), an integrase, a recombinase, recombination target sites, integration target site, a DNA of interest, and flanking ITRs. Recombinase expression leads to self-circularization of a sub- sequence of the single nucleic acid construct. DNA of interest contained within the self- circularized nucleic acid is capable of being integrated into a genomic locus of interest via an integrase.

[0019] FIG. 2 illustrates a single construct that contains a prime editor fusion protein or genewriter protein, the attachment site-containing guide RNA (atgRNA), a nickase guide RNA(ngRNA), an integrase, integration target sites, a DNA of interest, and flanking ITRs. Integraseexpression leads to self-circularization of a subsequence of the single nucleic acid construct. Optionally, the integrase may be directly linked or fused to the prime editor protein or Gene Writerand expression driven from a single promoter. Self-circularization occurs at an integraserecognition target sequence (attB2 / attP2). Additionally, a DNA of interest contained within the self-circularized nucleic acid is capable of being integrated into a genomic locus of interest via theintegrase at an orthogonal integration target site (i.e., cognate pairs (e.g., attP1 / attB1)). Initial self-circularization, prior to genomic integration, is achieved via the use of att integrase recognitiontarget sites (i.e., attB2 / attP2 and attP1 / attB1) that are cognate pairs. The orthogonal integrase sitesdisplay an integrase-mediated recombination rate difference to allow for template / cargo circularization prior to genomic integration.

[0020] FIGs. 3A-3E show multiplex and orthogonal gene insertion with PASTE. FIG. 3Ashows a schematic of AttP mutations tested for improving integration efficiency (SEQ ID NOS394 and 540-542, respectively, in order of appearance). FIG. 3B shows integration efficiencies ofwildtype and mutant AttP sites across a panel of AttB lengths. FIG. 3C shows a schematic ofmultiplexed integration of different cargo sets at specific genomic loci. Three fluorescent cargos (GFP, mCherry, and YFP) are inserted orthogonally at three different loci (ACTB, LMNB1,NOLC1) for in-frame gene tagging. FIG. 3D shows orthogonality of top 4 AttB / AttP dinucleotidepairs evaluated for GFP integration with PASTE at the ACTB locus. FIG. 3E shows efficiency ofmultiplexed PASTE insertion of combinations of fluorophores at ACTB, LMNB1, and NOLC1 loci. Data are mean (n= 3) ± s.e.m.

[0021] FIGs. 4A-4E show additional characterization of AttP mutants for improved editingand multiplexing. FIG. 4A shows AttP single mutants are characterized for PASTE EGFPintegration at the ACTB locus. FIG. 4B shows characterization of integration of a 5 kb payload atthe ACTB locus with all 16 possible dinucleotides for AttB / AttP pairs between the atgRNA andminicircle. FIG. 4C shows a schematic of the pooled AttB / AttP dinucleotide orthogonality assay.Each AttB dinucleotide sequence is cotransfected with a barcoded pool of all 16 AttP dinucleotide sequences and BxbINT, and relative integration efficiencies are determined by next generation sequencing of barcodes. All 16 AttB dinucleotides are profiled in an arrayed format with AttPpools. FIG. 4D illustrates relative insertion preferences for all possible AttB / AttP dinucleotidepairs determined by the pooled orthogonality assay. FIG. 4E shows orthogonality of BxbINTdinucleotides as measured by a pooled reporter assay. Each web logo motif shows the relative integration of different AttP sequences in a pool at a denoted AttB sequence with the listed dinucleotide.

[0022] FIG. 5 illustrates a schematic of single atgRNA and dual atgRNA approaches forbeacon placement.

[0023] FIG. 6 illustrates the six different C-terminus to N-terminus arrangements (C-to-N) ofexemplary nucleic acid programmable DNA binding proteins (napDNAbp), the RT, and theintegrase is be fused or linked.

[0024] FIG. 7 illustrates the extrachromosomal circular DNA (EccDNA) sensor assay todetect template circularization, beacon placement, and gene insertion. AttP (GT) for genome insertion. AttB’-AG and AttP’-AG at both ends for circularization in presence of Bxb1. EF1a promoter will drive NanoLuc and GFP expression. Screen for efficient di-nucleotides andconfiguration. Based on FG- and HD- AdV vector, tested in plasmid and virus formatAbbreviations: Nanoluc = Nanoluc luciferase; GFP = green fluorescent protein; EF1α = elongation factor 1 alpha promoter; ori = origin of replication; and AmpR = gene encoding an Ampicillin resistance protein.

[0025] FIG. 8 illustrates transfection screening conditions for circularization detection andACTB beacon placement and gene insertion.

[0026] FIG. 9 illustrates EccDNA ddPCR analysis.

[0027] FIG. 10 illustrates EccDNA ddPCR analysis with PE2, atgRNA, ngRNA componentsco-transfected.

[0028] FIG. 11 illustrates ACTB beacon placement analysis.

[0029] FIG. 12 illustrates EccDNA ACTB gene insertion analysis at a placed beacon.

[0030] FIG. 13 illustrates transfection screening conditions for circularization detection andLMNB beacon placement and gene insertion.

[0031] FIG. 14 illustrates in cell EccDNA circularization detection by GFP detection.

[0032] FIG. 15 illustrates EccDNA ddPCR analysis.

[0033] FIG. 16 illustrates EccDNA LMNB beacon placement analysis.

[0034] FIG. 17 illustrates LMNB gene insertion analysis at a placed beacon.

[0035] FIG. 18A shows an expression cassette of a helper dependent adenovirus (HDAd).PASTE components include: a promoter (e.g., a constitutive promoter) driving expression of a gene editor polypeptide (e.g., a nCas9-RT), an inducible promoter driving expression of a integration enzyme (e.g., a BxB1 integrase), a first U6 promoter driving expression of a first atgRNA, a second U6 promoter driving expression of a second atgRNA (where the first atgRNA and atgRNA encode a first integration recognition site), and a donor DNA sequence comprising at least a second integration recognition site, a promoter driving expression of a transgene.Abbreviation: ITR = inverted terminal repeat (ITR); Ad5 ^ = adenovirus 5 packaging signal; atgR= a “reverse” atgRNA; U6 = U6 promoter; atgF = a “forward” atgRNA; gene editor = gene editor polypeptide; CMV = Cytomegalovrius; Tet-off = tetracyline off promoter; BxB1 = BxB1integrase; EF1α = Elongation factor 1 alpha promoter; mScarlet = mScarlet fluorescent protein;AttP = AttP integration recognition site; Nluc-GFP = luciferase – GFP reporter protein; ori = originof replication; and AmpR = ampicillin resistance gene.

[0036] FIG. 18B shows a schematic identifying a first polynucleotide segment, a secondpolynucleotide segment, and a third polynucleotide segment. The first polynucleotide segment includes a promoter driving expression of a gene editor polypeptide (“PE2”) and a first U6 promoter driving expression of a first atgRNA (atgR) and a second U6 promoter driving expression of a second atgRNA (atgF), where the atgR and atgF collectively encode the entirety of the first integration recognition site, whereby the first integration recognition site is integrated into the genome of the cell at the target sequence. The second polynucleotide segment includes a promoter driving expression of an integration enzyme (e.g., a BxB1 integrase). The third polynucleotidesegment includes a transgene and a second integration recognition site that is a cognate of the firstintegration recognition site. After integration, the BxB1 mediates integration using the first andsecond integration recognition sites.

[0037] FIG. 18C shows a schematic identifying a first polynucleotide segment, a secondpolynucleotide segment, and a third polynucleotide segment. The first polynucleotide segment includes a promoter driving expression of a gene editor polypeptide (“PE2”). The first polynucleotide segment also includes a first U6 promoter driving expression of a first atgRNA (atgR), a second U6 promoter driving expression of a second atgRNA (atgF), a third U6 promoter driving expression of a third atgRNA (atgR), and a fourth U6 promoter driving expression of a fourth atgRNA (atgfF). The first atgRNA and the second atgRNA collectively encode the entirety of a first integration recognition site and the third atgRNA and the fourth atgRNA collectively encode the entirety of a second integration recognition site. The second polynucleotide segment includes a promoter driving expression of an integration enzyme (e.g., a BxB1 integrase). The third polynucleotide segment includes a transgene and a third integration recognition site and a fourth integration recognition site. The third integration recognition site is a cognate pair with the first integration recognition site, and the fourth integration recognition site is a cognate pair with the second integration recognition site. After integration, the BxB1 mediates integration using the first and third integration recognition sites as a first cognate pair and the second and fourth integration recognition sites as a second cognate pair.

[0038] FIG. 19 shows representative images of HDAd virus production when virus productioninclude introducing a helper virus (HV) at an MOI = 1. Top row shows representative bright field images. Middle row shows representative images of mScarlet. Bottom row shows representativeimages of GFP. “P0” refers to the “rescue” of HDAd vector, which was conducted by transfecting HEK293Cre cells with linearized HDAd plasmid and then infecting cells with helper virus to startthe amplification of HDAd. P1 to P6 indicate the passage number after P0. For each passage,HDAd from cell lysate of previous passage and helper virus (HV) were used to co-infect HEK293Cre cells to amplify HDAd.

[0039] FIG. 20 shows representative images of HDAd virus production when virus productioninclude introducing a helper virus (HV) at an MOI = 2. Top row shows representative bright field images. Middle row shows representative images of mScarlet. Bottom row shows representative images of GFP. “P0” refers to the “rescue” of HDAd vector, which was conducted by transfecting HEK293Cre cells with linearized HDAd plasmid and then infecting cells with helper virus to start the amplification of HDAd. P1 to P6 indicate the passage number after P0. For each passage, HDAd from cell lysate of previous passage and helper virus (HV) were used to co-infect HEK293Cre cells to amplify HDAd.

[0040] FIG. 21 shows quality control data from HDAd virus production (HDAd-AIO (hF9)virus). Table shows data for measurement of titer (as measured by mScarlet expression in infected cells or nLuc in infected cells); ratio of intact versus recombined HDAd; helper virus titer; and ratio of helper virus (HV) to HDAd. Images shows purification gradients for product of AdVG012.

[0041] FIG. 22 shows restriction enzyme digestion of viral DNA from an HDAd production.Digestion patterns serve as an indication of intra-molecular recombination. Left panel shows DNAladder. Middle panel shows agarose gel of digested viral DNA. Right panel shows a schematic of the expected digestion pattern, with sample 1 representing the digestion pattern of HDAdAdVG012 cut with BglII and sample 2 representing the digestion pattern of HDAd AdVG012 cutwith ApaLI.

[0042] FIG. 23 shows PCR data of viral DNA from an HDAd production. PCR primers weredesigned to amplify individual components within the HDAd (see, e.g., FIGs. 18A-18B).

[0043] FIG.24 shows representative images of HDAd infection of HEK293A at 48 hours afterinfection. HEK293A were infected with HDAd at MOIs of 10, 100, and 1000. A no infection control was used as a negative control.

[0044] FIGs. 25A-25C shows data for intramolecular recombination between atgRNA attBand cargo attP. FIG. 25A shows a schematic of an intramolecular recombination in a HDAd.FIG. 25B shows a representative graphic summary of the outcome intramolecular recombinationwith the resulting deletion of the sequences encoding RT, Cas9, BxB1, rTA, and mScarlet. FIG.25C shows a sequence alignment of the query sequence (HDAd vector sequence withoutrecombination “AdVG012 ref”) and the subject (HDAd vector sequence with recombination“AdVG012 UI vDNA”). Figure discloses SEQ ID NOS 584-587, respectively, in order ofappearance.

[0045] FIG. 26 shows a sequence alignment of the results of sanger sequencing of viral DNAand intramolecular recombination between atgRNA AttB (first integration recognition site) andcargo AttP (second integration recognition site). Figure discloses SEQ ID NOS 588-589, and 426,respectively, in order of appearance.

[0046] FIGs. 27A-27C shows beacon placement, PGI, and beacon occupancy data inHEK293A cells infected with HDAd-AIO (hF9). FIG. 27A shows beacon placement inHEK293A at days 3 and day 6 after infection with HDAd-AIO (hF9). FIG. 27B shows PGI inHEK293A at days 3 and day 6 after infection with HDAd-AIO (hF9). FIG. 27C shows beaconoccupancy in HEK293A at days 3 and day 6 after infection with HDAd-AIO (hF9).

[0047] FIG. 28A-28B shows beacon placement and PGI data in HEK293-attB cells infectedwith HDAd-AIO (hF9). FIG. 28A shows beacon placement in HEK293-attB at days 3 and day 6after infection with HDAd-AIO (hF9). FIG. 28B shows PGI in HEK293-attB at days 3 and day 6after infection with HDAd-AIO (hF9).

[0048] FIGs. 29A-29D shows PGI data in HEK293-lenti-AttB cells infected with HDAd-AIO(hF9). FIG. 29A shows ddPCR data for PGI in HEK293-lenti-attB at days 3 and day 6 afterinfection with HDAd-AIO (hF9). FIG. 29B shows raw ddPCR data for PGI primer set and Ref-RRE control. FIG. 29C shows a schematic of an intramolecular recombination in a HDAd. FIG.29D shows raw ddPCR data for attB-attP recombination primers (see FIG. 29C) and the RNasePRef control.

[0049] FIG. 30 shows a schematic that illustrates the competition between intramolecularrecombination (i.e., recombination between the AttB and the AttP sites present in the nucleic acidconstruct) and recombination between an integrated AttB and the AttP site in the nucleic acidconstruct.

[0050] FIG. 31 shows the schematics of HDAd AIO plasmids with chimeric Bxb1-intron ascompared to HDAd vector AdVG012, which include Bxb1 without intron. The HDAd vector AdVG068 includes a Bxb1 with a chimeric intron, under the control of a Tet-off promoter. HDAdvectors AdVG102 (with symmetric attB atgRNAs F29+R29), AdVG092 (with asymmetric attBatgRNAs F22+R33), and AdVG093 (with asymmetric attB atgRNAs F22+R29), includes a Bxb1 with a chimeric intron, under the control of a Tet-on promoter.

[0051] FIGs. 32A and 32B show the recombination between attB site and attP site asmeasured by ddPCR, with FIG. 32A showing the percentage of AIO plasmid recombination andFIG. 32B showing raw ddPCR data with AttL recombination primers and the Nanoluc control.

[0052] FIGs. 33A and 33B show the percentages of beacon placement (BP) andprogrammable gene insertion (PGI) achieved with HDAd vector AdVG102, with FIG. 33Ashowing the percentage BP and FIG. 33B showing the percentage PGI.

[0053] FIGs. 34A and 34B show the percentages of beacon placement (BP) andprogrammable gene insertion (PGI) achieved with HDAd vector AdVG092, with FIG. 34Ashowing the percentage BP and FIG. 34B showing the percentage PGI.

[0054] FIGs. 35A and 35B show the percentages of beacon placement (BP) andprogrammable gene insertion (PGI) achieved with HDAd vector AdVG093, with FIG. 35Ashowing the percentage BP and FIG. 35B showing the percentage PGI.

[0055] FIG. 36 shows beacon placement (BP) efficiency with HDAd vectors AdVG102,AdVG092, and AdVG093.

[0056] FIG. 37 shows programmable gene insertion (PGI) efficiency with HDAd vectorsAdVG102, AdVG092, and AdVG093.

[0057] FIG. 38 shows the Bxb1-shRNA design for producing the Bxb1 knockdown cell line.Figure discloses SEQ ID NOS 590-592, respectively, in order of appearance.

[0058] FIGs. 39A and 39B show the Bxb1 knockdown efficiency of 116 Bxb1-shRNA cellclones, with FIG. 39A showing the Bxb1 knockdown efficiency as determined by Western blotand FIG. 39B showing the Bxb1 knockdown efficiency as determined by DNA cargocircularization assay.

[0059] FIG. 40 shows the expression of the HDAd AIO reporter gene mScarlet in the 116Bxb1-shRNA cell line and the control 116 cells without Bxb1-shRNA.

[0060] FIG. 41 shows the purity of virus with intact genome, measured as ratio of intact virusover total virus. The intact virus titer and the total virus titer were measured by ddPCR targetingmScarlet and Nanoluc respectively on PHH sample.

[0061] FIGs 42A and 42B show the toxicity and transduction efficiency with the HDAd AIOconstruct AdVG012 at different titers, with FIG. 42A showing the toxicity measured by GTC atdifferent titers and FIG. 42B showing the copy numbers of intact virus per human genome copiesat different titers.

[0062] FIGs 43A and 43B show the gene editing efficiency of HDAd AIO constructAdVG012, with FIG.43A showing the percentages of beacon placement (BP) and attL integration(PGI) and FIG. 43B showing the percentage occupancy. The percentage occupancy wascalculated as PGI% / (BP%+PGI%).6. DETAILED DESCRIPTION

[0063] This disclosure features a nucleic acid construct, for example, helper-dependentadenovirus (HDAd), that can be used to deliver all the components for site-specifically integratingan exogenous nucleic acid into a cellular genome at a desired target sequence. This avoids havingto use multiple steps to deliver the reagnets, which can negatively impact efficiency. However,with all the components present on a single construct, intramolecular recombination is likely and has a high probability of disrupting HDAd virus production. Careful consideration is needed to avoid intramolecular recombination. Despite these challenges, Applicant has engineered an HDAdthat enable delivery of all the components needed for site-specifically integrating an exogenous nucleic acid into a cellular genome at a desired target sequence. In one non-limiting example, this disclosure features a nucleic acid construct (e.g., an HDAd vector) comprising: a first polynucleotide segment that includes a gene editor polynucleotide encoding a gene editor polypeptide, a polynucleotide sequence encoding a first attachment site-containing guide RNA (atgRNA) and a polynucleotide sequence encoding a second attachment site-containing guide RNA (atgRNA), where the first atgRNA and the second atgRNA collectively encode a first integration recognition site; a second polynucleotide segment comprising a polynucleotide sequence encoding an integration enzyme, and a third polynucleotide segment comprising a polynucleotide sequence encoding a cargo linked to a polynucleotide encoding a second integration recognition site, where the second integration recognition site is a cognate pair of the first integration recognition site. 6.1. Gene Editors

[0064] Unless defined otherwise, all technical and scientific terms used herein have themeaning commonly understood by a person skilled in the art to which this invention belongs. Asused herein, the following terms have the meanings ascribed to them below.

[0065] “Gene editor” as used herein, is a protein that that can be used to perform gene editing,gene modification, gene insertion, gene deletion, or gene inversion. As used herein, the terms “gene editor polynucleotide” refers to polynucleotide sequence encoding the gene editor protein.In various embodiments, the gene editor comprises DNA- or RNA-targetable nuclease protein (i.e.,Cas protein) wherein target specificity is mediated by a complexed nucleic acid (i.e., guide RNA). In various embodiments, the gene editor is a DNA-targetable or RNA-targetable protein in which target specificity is mediated by internal, conjugated, fused, or linked amino acids, such as within TALENs, ZFNs, or meganucleases. The skilled person in the art would appreciate that the gene editor can demonstrate targeted nuclease activity, targeted binding with no nuclease activity, targeted nickase activity (or cleavase activity). A gene editor comprising a targetable protein may be fused, linked, complexed, operate in cis or trans to one or more proteins or protein fragment motifs. Gene editors may be fused or linked to one or more integrase, recombinase, polymerase, telomerase, reverse transcriptase, or invertase. A gene editor can be an alpha editor fusion proteinor a gene writer fusion protein.

[0066] Base editors such as ADAR or ADAT may be delivered as cargo in variousembodiments, as described herein.

[0067] “Alpha editor protein or fusion protein” as used herein, is a gene editor protein.“Alpha editor system” as used herein describes the components used in alpha editing and alpha editing and alpha editor are used interchangeably herein with the terms “prime editing or primeeditor (PE). Alpha editing uses a CRISPR protein, which has enzymatic activity that nicks or cutsonly single strand of double stranded DNA, i.e., a nickase; the nickase can occur either naturally or by mutation or modification of a nuclease that makes double stranded cuts. Prime editing (PE) and prime editing components (pegRNA) can be utilized as well. The nickase is programmed (targeted) with an alpha-editing guide RNA (aeg RNA or a pegRNA). The skilled person in the art would appreciate that the pegRNA both specifies the target site and encodes the desired edit. Attachment site containing guide RNA (atgRNA) that both specifies the target and encodes for the desired integrase target recognition site are provided. The nickase may be programmed (targeted) with an atgRNA. Advantageously the nickase is a catalytically impaired Cas9 endonuclease, i.e., a Cas9 nickase, that is fused to a reverse transcriptase. The reverser transcriptase can also be provided in the alpha editor system split from the Cas9 nickase. During gene editing, the Cas9 nickase part of the protein is guided to the DNA target site by the atgRNA (or pegRNA), wherebya nick or single stranded cut occurs. The reverse transcriptase domain then uses the atgRNA (orpegRNA) to template reverse transcription of the desired edit, directly polymerizing DNA ontothe nicked target DNA strand. The edited DNA strand replaces the original DNA strand, creating aheteroduplex containing one edited strand and one unedited strand. Afterward, optionally, thealpha editor (AE) guides resolution of the heteroduplex to favor copying the edit onto the uneditedstrand, completing the process (typically achieved with a nickase gRNA). Other enzymes that canbe used to nick or cut only a single strand of double stranded DNA includes a cleavase (e.g., cleavase I enzyme).

[0068] In some embodiments, an additional agent or agents may be added that improve theefficiency and outcome purity of the alpha or prime edit. In some embodiments, the agent may bechemical or biological and disrupt DNA mismatch repair (MMR) processes at or near the edit site (i.e., PE4 and PE5 and PEmax architecture by Chen et al. Cell, 184, 1-18, October 28, 2021; Chenet al. is incorporated herein by reference). In typical embodiments, the agent is a MMR-inhibitingprotein. In certain embodiments, the MMR-inhibiting protein is dominant negative MMR protein. In certain embodiments, the dominant negative MMR protein is MLH1dn. In particular embodiments, the MMR-inhibiting agent is incorporated into the multicomponent delivery method described herein. In some embodiments, the MMR-inhibiting agent is linked or fused to the alpha editor protein fusion, which may or may not have a linked or fused integrase. In someembodiments, the MMR-inhibiting agent is linked or fused to the Gene Writer™ protein, whichmay or may not have a linked or fused integrase.

[0069] The alpha editor or gene editor system can be used to achieve DNA deletion andreplacement. In some embodiments, the DNA deletion replacement is induced using a pair ofatgRNAs or pegRNA that target opposite DNA strands, programming not only the sites that arenicked but also the outcome of the repair (i.e., PrimeDel by Choi et al. Nat. Biotechnology, October14, 2021; Choi et al. is incorporated herein by reference and TwinPE by Anzalone et al. BioRxiv,November 2, 2021; Anzalone et al. is incorporated herein by reference). In some embodiments described herein, the DNA deletion is induced using a single atgRNA. In some embodiments, the DNA deletion and replacement is induced using a wild type Cas9 alpha or prime editor (AE-Cas9 or PE-Cas9) system (i.e., PEDAR by Jiang et al. Nat. Biotechnology, October 14, 2021; Jiang et al. is incorporated herein by reference in its entirety). In some embodiments, the DNA replacement is an integrase target recognition site or recombinase target recognition site. In certain embodiments, the constructs and methods described herein may be utilized to incorporate the pair of pegRNAs (or atgRNAs) used in PrimeDel, TwinPE (WO2021226558 incorporated by referenceherein in its entirety), or PEDAR, the alpha editor fusion protein or Gene Writer protein, optionallya nickase guide RNA (ngRNA), an integrase, a nucleic acid cargo, and optionally a recombinase into a LNP delivery system or vector delivery system (e.g., AAV or Adenovirus). The integrasemay be directly linked, for example by a peptide linker, to the prime editor fusion or gene writerprotein.

[0070] In some embodiments, the prime editors can refer to a retrovirus or lentivirus reversetranscriptase such as a Moloney Murine Leukemia Virus (M-MLV) reverse transcriptase (RT) fused to a CRISPR enzyme nickase such as a Cas9 H840A nickase, a Cas9nickase. In some embodiments, the prime editors can refer to a retrovirus or lentivirus reverse transcriptase such as a Moloney Murine Leukemia Virus (M-MLV) reverse transcriptase (RT) fused to a cleavase. Insome embodiments the RT can be fused at, near or to the C-terminus of a Cas9nickase, e.g., Cas9 H840A. Fusing the RT to the C-terminus region, e.g., to the C-terminus, of the Cas9 nickase may result in higher editing efficiency. Such a complex is called PEI. In some embodiments, the CRISPR enzyme nickase, e.g., Cas9(H840A), i.e., a Cas9nickase, can be linked to a non-M-MLV reverse transcriptase such as an AMV-RT or XRT (Cas9(H840A)-AMV-RT or XRT). In some embodiments, instead of the CRISPR enzyme nickase being a Cas9 (H840A), i.e., instead of being a Cas9 nickase, the CRISPR enzyme nickase instead can be a CRISPR enzyme that naturally is a nickase or cuts a single strand of double stranded DNA; for instance, the CRISPR enzyme nickase can be Casl2a / b. Alternatively, the CRISPR enzyme nickase can be another mutation of Cas9, such as Cas9(Dl0A). A CRISPR enzyme, such as a CRISPR enzyme nickase, such as Cas9 (wild type), Cas9(H840A), Cas9(Dl0A) or Cas 12a / b nickase can be fused in some embodiments to a pentamutant of M-MLV RT (D200N / L603W / T330P / T306K / W313F), whereby there can be up to about 45-fold higher efficiency, and this is called PE2. In some embodiments, the M-MLV RT comprise one or more of the mutations Y8H, P51L, S56A, S67R, E69K, Vl29P, L139P, Tl97A, H204R, V223H, T246E, N249D, E286R, Q2911, E302K, E302R, F309N, M320L, P330E, L435G, L435R, N454K, D524A, D524G, D524N, E562Q, D583N, H594Q, E607K, D653N, and L671P. Specific M-MLV RT mutations are shown in Table 1. Table 1 SEQ ID NO Description Forward Sequence (5’-3’)SEQ ID NO:01RT_mut_L139P ttgagcgggCCCccaccgtSEQ ID NO:02RT_mut_E562Q cagcgggctCAGctgatagcaSEQ ID NO:03RT_mut_D653N cggatggctAACcaagcggcc

[0071] In some embodiments, the reverse transcriptase can also be a wild-type or modifiedtranscription xenopolymerase (RTX), avian myeloblastosis virus reverse transcriptase (AMV RT),Feline Immunodeficiency Virus reverse transcriptase (FIV-RT), FeLV-RT (Feline leukemia virus reverse transcriptase), HIV-RT (Human Immunodeficiency Virus reverse transcriptase). In some embodiments, the reverse transcriptase can be a fusion of MMuLV to the Sto7d DNA bindingdomain (see Ionnidi et al.; https: / / doi.org / 10.1101 / 2021.11.01.466786). The fusion of MMuLV tothe Sto7d DNA binding domain sequence is given in Table 2. Table 2 Description Forward Sequence (5’-3’) SEQID NO: RT(1- atgactcactatcaggccttgcttttggacacggaccgggtccagttcggaccggtggtagccctgaac 4 478)_Sto7d ccggctacgctgctcccactgcctgaggaagggctgcaacacaactgccttgatGGGACAGGT fusion GGCGGTGGTGTCACCGTCAAGTTCAAGTACAAGGGTGAGGAAC [MMulv TTGAAGTTGATATTAGCAAAATCAAGAAGGTTTGGCGCGTTGG sequence (in TAAAATGATATCTTTTACTTATGACGACAACGGCAAGACAGGT bold), Sto7d AGAGGGGCAGTGTCTGAGAAAGACGCCCCCAAGGAGCTGTTGC sequence] AAATGTTGGAAAAGTCTGGGAAAAAGtctggcggctcaaaaagaaccgccga cggcagcgaattcgagcccaagaagaagaggaaagtc

[0072] PE3, PE3b, PE4, PE5, and / or PEmax, which a skilled person can incorporate intothe gene editor (and express from a single nucleic acid construct, e.g., any of the single nucleicacid constructs described herein), involves nicking the non-edited strand, potentially causingthe cell to remake that strand using the edited strand as the template to induce HR. The nicking of the non-edited strand can involve the use of a nicking guide RNA (ngRNA).

[0073] The skilled person can readily incorporate into a gene editor single nucleic acidconstruct (“installer”) described herein a prime editing or CRISPR system. Examples of primeeditors can be found in the following: WO2020 / 191153, WO2020 / 191171, WO2020 / 191233, WO2020 / 191234, WO2020 / 191239, WO2020 / 191241, WO2020 / 191242, WO2020 / 191243, WO2020 / 191245, WO2020 / 191246, WO2020 / 191248, WO2020 / 191249, each of which is incorporated by reference herein in its entirety. In addition, mention is made, and can be usedherein, of CRISPR Patent Applications and Patents of the Zhang laboratory and / or BroadInstitute, Inc. and Massachusetts Institute of Technology and / or Broad Institute, Inc., Massachusetts Institute of Technology and President and Fellows of Harvard College and / or Editas Medicine, Inc. Broad Institute, Inc., The University of Iowa Research Foundation and Massachusetts Institute of Technology, including those claiming priority to US Application61 / 736,527, filed December 12, 2012, including US Patents 11,104,937, 11,091,798,11,060,115, 11,041,173, 11,021,740, 11,008,588, 11,001,829, 10,968,257, 10,954,514,10,946,108, 10,930,367, 10,876,100, 10,851,357, 10,781,444, 10,711,285, 10,689,691, 10,648,020, 10,640,788, 10,577,630, 10,550,372, 10,494,621, 10,377,998, 10,266,887, 10,266,886, 10,190,137, 9,840,713, 9,822,372, 9,790,490, 8,999,641, 8,993,233, 8,945,839, 8,932,814, 8,906,616, 8,895,308, 8,889,418, 8,889,356, 8,871,445, 8,865,406, 8,795,965, 8,771,945, and 8,697,359; CRISPR Patent Applications and Patents of the Doudna laboratory and / or of Regents of the University of California, the University of Vienna and Emmanuelle Charpentier, including those claiming priority to US application 61 / 652,086, filed May 25, 2012, and / or 61 / 716,256, filed October 19, 2012, and / or 61 / 757,640, filed January 28, 2013, and / or 61 / 765,576, filed February 15, 2013 and / or 13 / 842,859, including US Patents 11,028,412, 11,008,590, 11,008,589, 11,001,863, 10,988,782, 10,988,780, 10,982,231, 10,982,230, 10,900,054, 10,793,878, 10,774,344, 10,752,920, 10,676,759, 10,669,560, 10,640,791, 10,626,419, 10,612,045, 10,597,680, 10,577,631, 10,570,419, 10,563,227, 10,550,407, 10,533,190, 10,526,619, 10,519,467, 10,513,712, 10,487,341, 10,443,076, 10,428,352, 10,421,980, 10,415,061, 10,407,697, 10,400,253, 10,385,360, 10,358,659, 10,358,658, 10,351,878, 10,337,029, 10,308,961, 10,301,651, 10,266,850, 10,227,611, 10,113,167, and 10,000,772; CRISPR Patent Applications and Patents of Vilnius University and / or the Siksnys laboratory, including those claiming priority to US application 62 / 046384 and / or 61 / 625,420 and / or 61 / 613,373 and / or PCT / IB2015 / 056756, including US Patent 10,385,336; CRISPR Patent Applications and Patents of the President and Fellows of Harvard College, including those of George Church’s laboratory and / or claiming priority to US application 61 / 738,355, filed December 17, 2012, including 11,111,521, 11,085,072, 11,064,684, 10,959,413, 10,925,263, 10,851,369, 10,787,684, 10,767,194, 10,717,990, 10,683,490, 10,640,789, 10,563,225, 10,435,708, 10,435,679, 10,375,938, 10,329,587, 10,273,501, 10,100,291, 9,970,024, 9,914,939, 9,777,262, 9,587,252, 9,267,135, 9,260,723, 9,074,199, 9,023,649; CRISPR Patent Applications and Patents of the President and Fellows of Harvard College, including those of David Liu’s laboratory, including 11,111,472, 11,104,967, 11,078,469, 11,071,790, 11,053,481, 11,046,948, 10,954,548, 10,947,530, 10,912,833, 10,858,639, 10,745,677, 10,704,062, 10,682,410, 10,612,011, 10,597,679, 10,508,298, 10,465,176, 10,323,236, 10,227,581, 10,167,457, 10,113,163, 10,077,453,9,999,671, 9,840,699, 9,737,604, 9,526,784, 9,388,430, 9,359,599, 9,340,800, 9,340,799,9,322,037, 9,322,006, 9,228,207, 9,163,284, and 9,068,179; and CRISPR Patent Applicationsand Patents of Toolgen Incorporated and / or the Kim laboratory and / or claiming priority to US application 61 / 717,324, filed October 23, 2012 and / or 61 / 803,599, filed March 20, 2013 and / or 61 / 837,481, filed June 20, 2013 and / or 62 / 033,852, filed August 6, 2014 and / or PCT / KR2013 / 009488 and / or PCT / KR2015 / 008269, including US Patent 10,851,380, and 10,519,454; and CRISPR Patent Applications and Patents of Sigma and / or Millipore and / or the Chen laboratory and / or claiming priority to US application 61 / 734,256, filed December 6, 2012 and / or 61 / 758,624, filed January 30, 2013 and / or 61 / 761,046, filed February 5, 2013 and / or 61 / 794,422, filed March 15, 2013, including US Patent 10,731,181, each of which is hereby incorporated herein by reference, and from the disclosures of the foregoing, the skilled person can readily make and use a prime editing or CRISPR system, and can especially appreciate impaired endonucleases, such as a mutated Cas9 that only nicks a single strand of DNA and is hence a nickase, or a CRISPR enzyme that only makes a single-stranded cut that can be employed in a PASTE system of the invention. Further, from the disclosures of the foregoing, the skilled person can incorporate the selected CRISPR enzyme, as part of theprime editor fusion or gene editor fusion, into a single nucleic acid construct (“installer”)described herein.

[0074] Prior to RT-mediated edit incorporation, the prime editor protein (1) site-specifically targets a genomic locus and (2) performs a catalytic cut or nick. These steps are typically performed by a CRISPR-Cas. However, in some embodiments the Cas protein may be substituted by other nucleic acid programmable DNA binding proteins (napDNAbp) suchas zinc finger nucleases (ZFNs), transcription activator-like effector nucleases (TALENs), ormeganucleases. In addition, to the extent the “targeting rules” of other napDNAbp are known or are newly determined, it becomes possible to use new napDNAbp, beyond Cas9, to site specifically target and modify genomic sites of interest.

[0075] Similar to a prime editor protein, a Gene Writer can introduce novel DNA elements,such as an integration target site, into a DNA locus. A Gene Writer protein comprises: (A) a polypeptide or a nucleic acid encoding a polypeptide, wherein the polypeptide comprises (i) a reverse transcriptase domain, and either (x) an endonuclease domain that contains DNA binding functionality or (y) an endonuclease domain and separate DNA binding domain; and (B) a template RNA comprising (i) a sequence that binds the polypeptide and (ii) a heterologous insert sequence.Examples of such Gene Writer™ proteins and related systems can be found in US20200109398,which is incorporated by reference herein in its entirety.

[0076] In some embodiments, the prime editor or Gene Writer protein fusion or prime editorprotein linked or fused to an integrase is expressed as a split construct. In typical embodiments, the split construct in reconstituted in a cell. In some embodiments, the split construct can be fused or ligated via intein protein splicing. In some embodiments, the split construct can be reconstituted via protein-protein inter-molecular bonding and / or interactions. In some embodiments, the split construct can be reconstituted via chemical, biological, or environmental induced oligomerization. In certain embodiments, the split construct can be adapted into one or more single nucleic acid constructs described herein.

[0077] In some embodiments, an integrase or recombinase is directly linked or fused, forexample by a peptide linker, which may be cleavable or non-cleavable, to the prime editor fusion protein (i.e., fused Cas9 nickase-reverse transcriptase) or Gene Writer protein. Suitable linkers, for example between the Cas9, RT, and integrase, may be selected from Table 3: Table 3. Table 3. Sequence (5’-3’) SEQ ID Amino acid sequence SEQ IDNO: NO: A- P2A GGAAGCGGAGCTACTAACTTC 5 GSGATNFSLLKQAG13 AGCCTGCTGAAGCAGGCTGGC DVEENPGP GACGTGGAGG AGAACCCTGGACCT B - GGGGGAGGAGGTTCTGGAGGC6 GGGGSGGGGSGGGG14 (GGGS)3 GGAGG S CTCCGGAGGCGGAGGGTCA C -GGAGGTGGCGGGAGC 7 GGGGS 15GGGGS D -CCCGCACCAGCGCCT 8 PAPAP 16PAPAP E - GAGGCAGCTGCCAAGGAAGCC9 EAAAKEAAAKEAAA17 (EAAAK) GCTGCCAAGGAGGCGGCCGCA K 3 AAGTable 3. Sequence (5’-3’) SEQ ID Amino acid sequence SEQ IDNO: NO: F- XTEN AGTGGGAGCGAGACCCCTGGG 10 SGSETPGTSESATPES 18ACTAGCGAGTCAGCTACACCCG AAAGC G - GGGGGGTCAGGTGGATCCGGC11 GGSGGSGGSGGSGG19 (GGS)6 GGAAGTGGCGGATCCGGTGGA SGGS TCTGGCGGCAGT H -GAAGCTGCTGCTAAG 12 EAAAK 20EAAAK (GGGGS) GGCGGCGGCGGCAGCGGCGGC 4 GGCGGCAGCGGCGGCGGCGGC GGGGSGGGGSGGGG AGCGGCGGCGGCGGCAGC 543 SGGGGS 551GGCGGCGCGAGCCCGGCGGGC PAS8GGC 544 GGASPAGG 552GGCGGCGCGAGCCCGGCGGCG PAS12CCGGCGCCGGCGGGC 545 GGASPAAPAPAG 553GCGGAAGCGGCGAAAGAAGCG GCGAAAGAAGCGGCGAAAGAA GCGGCGAAAGCGCTGGAAGCG AEAAKEAAKEAAKE A(EAAK) GAAGCGGCGGCGAAAGAAGCG AAKALEAEAAAKEA 4ALEA(E GCGGCGAAAGAAGCGGCGGCG AAKEAAAKEAAAK AAAK)4AAAAGAAGCGGCGGCGAAAGCG 546 A 554GCGCATCATAGCGAAGATCCG GGCGGCGGCGGCAGCGGCGGC GGCGGCAGCGGCGGCGGCGGC AHHSEDPGGGGSGG CamelAGC 547 GGSGGGGS 555GGCGGCGGCGGCAGCGAAGCG GCGGCGAAAGGCGGCGGCGGC GGGGSEAAAKGGGG FRFAGC 548 S 556GAAGCGGCGGCGAAAGGCGGC GGCGGCAGCGAAGCGGCGGCG EAAAKGGGGSEAAA RFRAAA 549 K 557AGCGGCGGCAGCAGCGGCGGC AGCAGCGGCAGCGAAACCCCG Modified GGCACCAGCGAAAGCGCGACC SGGSSGGSSGSETPG XTEN CCGGAAAGCAGCGGCGGCAGC TSESATPESSGGSSG (mXTEN)AGCGGCGGCAGCAGCACC 550 GSST 558

[0078] In some embodiments, the prime editor or Gene Writer protein fusion or prime editorprotein linked or fused to an integrase is expressed as a split construct. In typical embodiments,the split construct in reconstituted in a cell. In some embodiments, the split construct can be fused or ligated via intein protein splicing. In some embodiments, the split construct can be reconstituted via protein-protein inter-molecular bonding and / or interactions. In some embodiments, the split construct can be reconstituted via chemical, biological, or environmental induced oligomerization. In certain embodiments, the split construct can be adapted into one or more nucleic acid constructs described herein. 6.2. Type II CRISPR proteins

[0079] The skilled person can incorporate a selected CRISPR enzyme, described below,as part of the prime editor fusion, into a single nucleic acid construct (“installer”) describedherein. Streptococcus pyogenes Cas9 (SpCas9), the most common enzyme used in genome-editingapplications, is a large nuclease of 1368 amino acid residues. Advantages of SpCas9 include its short, 5′-NGG-3′ PAM and very high average editing efficiency. SpCas9 consists of two lobes: arecognition (REC) lobe and a nuclease (NUC) lobe. The REC lobe can be divided into threeregions, a long a helix referred to as the bridge helix (residues 60–93), the REC1 (residues 94–179 and 308–713) domain, and the REC2 (residues 180–307) domain. The NUC lobe consists of the RuvC (residues 1–59, 718–769, and 909–1098), HNH (residues 775–908), and PAM-interacting (PI) (residues 1099–1368) domains. The negatively charged sgRNA:target DNA heteroduplex is accommodated in a positively charged groove at the interface between the REC and NUC lobes. In the NUC lobe, the RuvC domain is assembled from the three split RuvC motifs (RuvC I–III) and interfaces with the PI domain to form a positively charged surface that interacts with the 30 tail of the sgRNA. The HNH domain lies between the RuvC II–III motifs and forms only a few contacts with the rest of the protein. Structural aspects of SpCas9 are described by Nishimasu et al., Crystal Structure of Cas9 in Complex with Guide RNA and Target DNA, Cell 156, 935-949, February 27, 2014.

[0080] REC lobe: The REC lobe includes the REC1 and REC2 domains. The REC2 domaindoes not contact the bound guide:target heteroduplex, indicating that truncation of REC lobe may be tolerated by SpCas9. Further, SpCas9 mutant lacking the REC2 domain (D175–307) retained ~50% of the wild-type Cas9 activity, indicating that the REC2 domain is not critical for DNA cleavage. In striking contrast, the deletion of either the repeat-interacting region (D97–150) or the anti-repeat-interacting region (D312–409) of the REC1 domain abolished the DNA cleavageactivity, indicating that the recognition of the repeat:anti-repeat duplex by the REC1 domain is critical for the Cas9 function.

[0081] PAM-Interacting domain: The NUC lobe contains the PAM-interacting (PI) domainthat is positioned to recognize the PAM sequence on the noncomplementary DNA strand. The PI domain of SpCas9 is required for the recognition of 5’-NGG-3’ PAM, and deletion of the PI domain (Δ1099-1368) abolished the cleavage activity, indicating that the PI domain is critical for SpCas9 function and a major determinant for the PAM specificity.

[0082] RuvC domain: The RuvC nucleases of SpCas9 have an RNase H fold and four catalyticresidues, Asp10 (Ala), Glu762, His983, and Asp986, that are critical for the two-metal cleavage of the noncomplementary strand of the target DNA. In addition to the conserved RNase H fold, the Cas9 RuvC domain has other structural elements involved in interactions with the guide:target heteroduplex (an end-capping loop between α42 and α43) and the PI domain / stem loop 3 (β hairpin formed by β3 and β4).

[0083] HNH domain: SpCas9 HNH nucleases have three catalytic residues, Asp839, His840,and Asn863 and cleave the complementary strand of the target DNA through a single-metal mechanism.

[0084] sgRNA:DNA recognition: The sgRNA guide region is primarily recognized by the REClobe. The backbone phosphate groups of the guide region (nucleotides 2, 4–6, and 13–20) interact with the REC1 domain (Arg165, Gly166, Arg403, Asn407, Lys510, Tyr515, and Arg661) and the bridge helix (Arg63, Arg66, Arg70, Arg71, Arg74, and Arg78). The 20-hydroxyl groups of G1, C15, U16, and G19 hydrogen bond with Val1009, Tyr450, Arg447 / Ile448, and Thr404, respectively.

[0085] A mutational analysis demonstrated that the R66A, R70A, and R74A mutations on thebridge helix markedly reduced the DNA cleavage activities, highlighting the functional significance of the recognition of the sgRNA ‘‘seed’’ region by the bridge helix. Although Arg78 and Arg165 also interact with the ‘‘seed’’ region, the R78A and R165A mutants showed only moderately decreased activities. These results are consistent with the fact that Arg66, Arg70, andArg74 form multiple salt bridges with the sgRNA backbone, whereas Arg78 and Arg165 form asingle salt bridge with the sgRNA backbone. Moreover, the alanine mutations of the repeat:anti- repeat duplex-interacting residues (Arg75 and Lys163) and the stemloop-1-interacting residue (Arg69) resulted in decreased DNA cleavage activity, confirming the functional importance of the recognition of the repeat:anti-repeat duplex and stem loop 1 by Cas9.

[0086] RNA-guided DNA targeting: SpCas9 recognizes the guide:target heteroduplex in asequence-independent manner. The backbone phosphate groups of the target DNA (nucleotides 1, 9–11, 13, and 20) interact with the REC1 (Asn497, Trp659, Arg661, and Gln695), RuvC (Gln926), and PI (Glu1108) domains. The C2’ atoms of the target DNA (nucleotides 5, 7, 8, 11, 19, and 20) form van der Waals interactions with the REC1 domain (Leu169, Tyr450, Met495, Met694, andHis698) and the RuvC domain (Ala728). The terminal base pair of the guide:target heteroduplex(G1:C20’) is recognized by the RuvC domain via end-capping interactions; the sgRNA G1 and target DNA C20’ nucleobases interact with the Tyr1013 and Val1015 side chains, respectively, whereas the 20-hydroxyl and phosphate groups of sgRNA G1 interact with Val1009 and Gln926, respectively.

[0087] Repeat:Anti-Repeat duplex recognition: The nucleobases of U23 / A49 and A42 / G43hydrogen bond with the side chain of Arg1122 and the main-chain carbonyl group of Phe351,respectively. The nucleobase of the flipped U44 is sandwiched between Tyr325 and His328, withits N3 atom hydrogen bonded with Tyr325, whereas the nucleobase of the unpaired G43 stacks with Tyr359 and hydrogen bonds with Asp364.

[0088] The nucleobases of G21 and U50 in the G21:U50 wobble pair stack with the terminalC20:G10 pair in the guide:target heteroduplex and Tyr72 on the bridge helix, respectively, with the U50 O4 atom hydrogen bonded with Arg75. Notably, A51 adopts the syn conformation and is oriented in the direction opposite to U50. The nucleobase of A51 is sandwiched between Phe1105 and U63, with its N1, N6, and N7 atoms hydrogen bonded with G62, Gly1103, and Phe1105, respectively.

[0089] Stem-loop recognition: Stem loop 1 is primarily recognized by the REC lobe, togetherwith the PI domain. The backbone phosphate groups of stem loop 1 (nucleotides 52, 53, and 59– 61) interact with the REC1 domain (Leu455, Ser460, Arg467, Thr472, and Ile473), the PI domain (Lys1123 and Lys1124), and the bridge helix (Arg70 and Arg74), with the 20-hydroxyl group ofG58 hydrogen bonded with Leu455. A52 interacts with Phe1105 through a face-to-edge p-p stacking interaction, and the flipped U59 nucleobase hydrogen bonds with Asn77.

[0090] The single-stranded linker and stem loops 2 and 3 are primarily recognized by the NUClobe. The backbone phosphate groups of the linker (nucleotides 63–65 and 67) interact with the RuvC domain (Glu57, Lys742, and Lys1097), the PI domain (Thr1102), and the bridge helix (Arg69), with the 20-hydroxyl groups of U64 and A65 hydrogen bonded with Glu57 and His721, respectively. The C67 nucleobase forms two hydrogen bonds with Val1100.

[0091] Stem loop 2 is recognized by Cas9 via the interactions between the NUC lobe and thenon-Watson-Crick A68:G81 pair, which is formed by direct (between the A68 N6 and G81 O6 atoms) and water-mediated (between the A68 N1 and G81 N1 atoms) hydrogen-bonding interactions. The A68 and G81 nucleobases contact Ser1351 and Tyr1356, respectively, whereas the A68:G81 pair interacts with Thr1358 via a water-mediated hydrogen bond. The 20-hydroxyl group of A68 hydrogen bonds with His1349, whereas the G81 nucleobase hydrogen bonds with Lys33.

[0092] Stem loop 3 interacts with the NUC lobe more extensively, as compared to stem loop2. The backbone phosphate group of G92 interacts with the RuvC domain (Arg40 and Lys44), whereas the G89 and U90 nucleobases hydrogen bond with Gln1272 and Glu1225 / Ala1227, respectively. The A88 and C91 nucleobases are recognized by Asn46 via multiple hydrogen- bonding interactions.

[0093] Cas9 proteins smaller than SpCas9 allow more efficient packaging of nucleic acidsencoding CRISPR systems, e.g., Cas9 and sgRNA into one rAAV (“all-in-one-AAV”) particle. Inaddition, efficient packaging of CRISPR systems can be achieved in other viral vector systems(i.e., lentiviral, integration deficient lentiviral, hd-AAV, etc.) and non-viral vector systems (i.e.,lipid nanoparticle). Small Cas9 proteins can be advantageous for multidomain-Cas-nuclease-based systems for prime editing. Well characterized smaller Cas9 proteins include Staphylococcusaureus (SauCas9, 1053 amino acid residues) and Campylobacter jejuni (CjCas9, 984 aminoresidues). However, both recognize longer PAMs, 5′-NNGRRT-3′ for SauCas9 (R = A or G) and 5′-NNNNRYAC-3′ for CjCas9 (Y = C or T), which reduces the number of uniquely addressable target sites in the genome, in comparison to the NGG SpCas9 PAM. Among smaller Cas9s,Schmidt et al. identified Staphylococcus lugdunensis (Slu) Cas9 as having genome-editing activityand provided homology mapping to SpCas9 and SauCas9 to facilitate generation of nickases and inactive (“dead”) enzymes (Schmidt et al., 2021, Improved CRISPR genome editing using smallhighly active and specific engineered RNA-guided nucleases. Nat Commun 12, 4219.doi.org / 10.1038 / s41467-021-24454-5) and engineered nucleases with higher cleavage activity by fragmenting and shuffling Cas9 DNAs. The small Cas9s and nickases are useful in the instant invention.

[0094] Besides dead Cas9 and Cas9 nickase variants, the Cas9 proteins used herein may alsoinclude other “Cas9 variants” having at least about 70% identical, at least about 80% identical, at least about 90% identical, at least about 95% identical, at least about 96% identical, at least about 97% identical, at least about 98% identical, at least about 99% identical, at least about 99.5% identical, or at least about 99.9% identical to any reference Cas9 protein, including any wild type Cas9, or mutant Cas9 (e.g., a dead Cas9 or Cas9 nickase), or fragment Cas9, or circular permutant Cas9, or other variant of Cas9 disclosed herein or known in the art. In some embodiments, a Cas9variant may have 1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15, 16, 17, 18, 19, 20, 21, 22, 21, 24,25, 26, 27, 28, 29, 30, 31, 32, 33, 34, 35, 36, 37, 38, 39, 40, 41, 42, 43, 44, 45, 46, 47, 48, 49, 50 or more amino acid changes compared to a reference Cas9. In some embodiments, the Cas9 variant comprises a fragment of a reference Cas9 (e.g., a gRNA binding domain or a DNA-cleavage domain), such that the fragment is at least about 70% identical, at least about 80% identical, at least about 90% identical, at least about 95% identical, at least about 96% identical, at least about 97% identical, at least about 98% identical, at least about 99% identical, at least about 99.5% identical, or at least about 99.9% identical to the corresponding fragment of wild type Cas9. In some embodiments, the fragment is at least 30%, at least 35%, at least 40%, at least 45%, at least 50%, at least 55%, at least 60%, at least 65%, at least 70%, at least 75%, at least 80%, at least 85%, at least 90%, at least 95% identical, at least 96%, at least 97%, at least 98%, at least 99%, or at least 99.5% of the amino acid length of a corresponding wild type Cas9.

[0095] In some embodiments, the disclosure also may utilize Cas9 fragments that retain theirfunctionality and that are fragments of any herein disclosed Cas9 protein. In some embodiments, the Cas9 fragment is at least 100 amino acids in length. In some embodiments, the fragment is atleast 100, 150, 200, 250, 300, 350, 400, 450, 500, 550, 600, 650, 700, 750, 800, 850, 900, 950, 1000, 1050, 1100, 1150, 1200, 1250, or at least 1300 amino acids in length.

[0096] In various embodiments, the prime editors disclosed herein may comprise one of theCas9 variants described as follows, or a Cas9 variant thereof having at least about 70% identical,at least about 80% identical, at least about 90% identical, at least about 95% identical, at leastabout 96% identical, at least about 97% identical, at least about 98% identical, at least about 99% identical, at least about 99.5% identical, or at least about 99.9% identical to any reference Cas9 variants. Table 4. Table 4- Cas9 orthologsStreptococcus MDKKYSIGLD IGTNSVGWAV ITDEYKVPSK KFKVLGNTDR HSIKKNLIGA (SEQ LLFDSGETAE ATRLKRTARR RYTRRKNRIC YLQEIFSNEM AKVDDSFFHR pyogenes ID LEESFLVEED KKHERHPIFG NIVDEVAYHE KYPTIYHLRK KLVDSTDKAD AJN60024.1 LRLIYLALAH MIKFRGHFLI EGDLNPDNSD VDKLFIQLVQ TYNQLFEENP NO: 5980 INASGVDAKA ILSARLSKSR R 21) GI: 75701 LENLIAQLP GEKKNGLFGN LIALSLGLTP NFKSNFDLAE DAKLQLSKDT YDDDLDNLLA QIGDQYADLF LAAKNLSDAI WP_01092225 LLSDILRVNT EITKAPLSAS MIKRYDEHHQ DLTLLKALVR QQLPEKYKEI 1.1 FFDQSKNGYA GYIDGGASQE EFYKFIKPIL EKMDGTEELL VKLNREDLLR KQRTFDNGSI PHQIHLGELH AILRRQEDFY PFLKDNREKI EKILTFRIPY YVGPLARGNS RFAWMTRKSE ETITPWNFEE VVDKGASAQS FIERMTNFDK NLPNEKVLPK HSLLYEYFTV YNELTKVKYV TEGMRKPAFL SGEQKKAIVD LLFKTNRKVT VKQLKEDYFK KIECFDSVEI SGVEDRFNAS LGTYHDLLKI IKDKDFLDNE ENEDILEDIV LTLTLFEDRE MIEERLKTYA HLFDDKVMKQ LKRRRYTGWG RLSRKLINGI RDKQSGKTIL DFLKSDGFAN RNFMQLIHDD SLTFKEDIQK AQVSGQGDSL HEHIANLAGS PAIKKGILQT VKVVDELVKV MGRHKPENIV IEMARENQTT QKGQKNSRER MKRIEEGIKE LGSQILKEHP VENTQLQNEK LYLYYLQNGR DMYVDQELDI NRLSDYDVDH IVPQSFLKDD SIDNKVLTRS DKNRGKSDNV PSEEVVKKMK NYWRQLLNAK LITQRKFDNL TKAERGGLSE LDKAGFIKRQ LVETRQITKH VAQILDSRMN TKYDENDKLI REVKVITLKS KLVSDFRKDF QFYKVREINN YHHAHDAYLN AVVGTALIKK YPKLESEFVY GDYKVYDVRK MIAKSEQEIG KATAKYFFYS NIMNFFKTEI TLANGEIRKR PLIETNGETG EIVWDKGRDF ATVRKVLSMP QVNIVKKTEV QTGGFSKESI LPKRNSDKLI ARKKDWDPKK YGGFDSPTVA YSVLVVAKVE KGKSKKLKSV KELLGITIME RSSFEKNPID FLEAKGYKEV KKDLIIKLPK YSLFELENGR KRMLASAGEL QKGNELALPS KYVNFLYLAS HYEKLKGSPE DNEQKQLFVE QHKHYLDEII EQISEFSKRV ILADANLDKV LSAYNKHRDK PIREQAENII HLFTLTNLGA PAAFKYFDTT IDRKRYTSTK EVLDATLIHQ SITGLYETRI DLS AJN60021.1 MKRNYILGLD IGITSVGYGI IDYETRDVID AGVRLFKEAN VENNEGRRSK (SEQ RGARRLKRRR RHRIQRVKKL LFDYNLLTDH SELSGINPYE ARVKGLSQKL GI: 757015977 ID SEEEFSAALL HLAKRRGVHN VNEVEEDTGN ELSTKEQISR NSKALEEKYV AELQLERLKK DGE NO: J7RUA5.1 VRGSINR FKTSDYVKEA KQLLKVQKAY HQLDQSFIDT YIDLLETRRT YYEGPGEGSP FGWKDIKEWY EMLMGHCTYF PEELRSVKYA 22) YNADLYNALN DLNNLVITRD ENEKLEYYEK FQIIENVFKQ KKKPTLKQIATable 4- Cas9 orthologsWP_05301979 KEILVNEEDI KGYRVTSTGK PEFTNLKVYH DIKDITARKE IIENAELLDQ 4.1 IAKILTIYQS SEDIQEELTN LNSELTQEEI EQISNLKGYT GTHNLSLKAI NLILDELWHT NDNQIAIFNR LKLVPKKVDL SQQKEIPTTL VDDFILSPVV Staphylococcu KRSFIQSIKV INAIIKKYGL PNDIIIELAR EKNSKDAQKM INEMQKRNRQ TNERIEEIIR TTGKENAKYL IEKIKLHDMQ EGKCLYSLEA IPLEDLLNNP s aureus FNYEVDHIIP RSVSFDNSFN NKVLVKQEEN SKKGNRTPFQ YLSSSDSKIS YETFKKHILN LAKGKGRISK TKKEYLLEER DINRFSVQKD FINRNLVDTR YATRGLMNLL RSYFRVNNLD VKVKSINGGF TSFLRRKWKF KKERNKGYKH HAEDALIIAN ADFIFKEWKK LDKAKKVMEN QMFEEKQAES MPEIETEQEY KEIFITPHQI KHIKDFKDYK YSHRVDKKPN RELINDTLYS TRKDDKGNTL IVNNLNGLYD KDNDKLKKLI NKSPEKLLMY HHDPQTYQKL KLIMEQYGDE KNPLYKYYEE TGNYLTKYSK KDNGPVIKKI KYYGNKLNAH LDITDDYPNS RNKVVKLSLK PYRFDVYLDN GVYKFVTVKN LDVIKKENYY EVNSKCYEEA KKLKKISNQA EFIASFYNND LIKINGELYR VIGVNNDLLN RIEVNMIDIT YREYLENMND KRPPRIIKTI ASKTQSIKKY STDILGNLYE VKSKKHPQII KKG AJN60008.1 MARILAFDIG ISSIGWAFSE NDELKDCGVR IFTKVENPKT GESLALPRRL (SEQ ARSARKRLAR RKARLNHLKH LIANEFKLNY EDYQSFDESL AKAYKGSLIS GI: 757015964 ID PYELRFRALN ELLSKQDFAR VILHIAKRRG YDDIKNSDDK EKGAILKAIK QNEEKLANYQ SVGEYLYKEY FQKFKENSKE FTNVRNKKES YERCIAQSFL NO: WP_00286448 KDELKLIFKK QREFGFSFSK KFEEEVLSV 23) 5.1 A FYKRALKDFS HLVGNCSFFT DEKRAPKNSP LAFMFVALTR IINLLNNLKN TEGILYTKDD LNALLNEVLK NGTLTYKQTK KLLGLSDDYE FKGEKGTYFI EFKKYKEFIK ALGEHNLSQD Campylobacter DLNEIAKDIT LIKDEIKLKK ALAKYDLNQN QIDSLSKLEF KDHLNISFKA jejuni subsp. LKLVTPLMLE GKKYDEACNE LNLKVAINED KKDFLPAFNE TYYKDEVTNP jejuni NCTC VVLRAIKEYR KVLNALLKKY GKVHKINIEL AREVGKNHSQ RAKIEKEQNE 11168 = NYKAKKDAEL ECEKLGLKIN SKNILKLRLF KEQKEFCAYS GEKIKISDLQ ATCC 700819 DEKMLEIDHI YPYSRSFDDS YMNKVLVFTK QNQEKLNQTP FEAFGNDSAK WQKIEVLAKN LPTKKQKRIL DKNYKDKEQK NFKDRNLNDT RYIARLVLNY TKDYLDFLPL SDDENTKLND TQKGSKVHVE AKSGMLTSAL RHTWGFSAKD RNNHLHHAID AVIIAYANNS IVKAFSDFKK EQESNSAELY AKKISELDYK NKRKFFEPFS GFRQKVLDKI DEIFVSKPER KKPSGALHEE TFRKEEEFYQ SYGGKEGVLK ALELGKIRKV NGKIVKNGDM FRVDIFKHKK TNKFYAVPIY TMDFALKVLP NKAVARSKKG EIKDWILMDE NYEFCFSLYK DSLILIQTKD MQEPEFVYYN AFTSSTVSLI VSKHDNKFET LSKNQKILFK NANEKEVIAK SIGIQNLKVF EKYIVSALGE VTKAEFRQRE DFKK Streptococcus MSDLVLGLDI GIGSVGVGIL NKVTGEIIHK NSRIFPAAQA ENNLVRRTNR (SEQ thermophilus QGRRLARRKK HRRVRLNRLF EESGLITDFT KISINLNPYQ LRVKGLTDEL ID LMD-9 SNEELFIALK NMVKHRGISY LDDASDDGNS SVGDYAQIVK ENSKQLETKT PGQIQLERYQ TYGQLRGDFT VEKDGKKHRL INVFPTSAYR SEALRILQTQ NO: QEFNPQITDE FINRYLEILT GKRKYYHGPG NEKSRTDYGR YRTSGETLDN 24) AJN60026.1 IFGILIGKCT FYPDEFRAAK ASYTAQEFNL LNDLNNLTVP TETKKLSKEQ GI: 757015982 KNQIINYVKN EKAMGPAKLF KYIAKLLSCD VADIKGYRID KSGKAEIHTF WP_01168095 EAYRKMKTLE TLDIEQMDRE TLDKLAYVLT LNTEREGIQE ALEHEFADGS FSQKQVDELV QFRKANSSIF GKGWHNFSVK LMMELIPELY ETSEEQMTIL 7.1 TRLGKQKTTS SSNKTKYIDE KLLTEEIYNP VVAKSVRQAI KIVNAAIKEY GDFDNIVIEM ARETNEDDEK KAIQKIQKAN KDEKDAAMLK AANQYNGKAE LPHSVFHGHK QLATKIRLWH QQGERCLYTG KTISIHDLIN NSNQFEVDHI LPLSITFDDS LANKVLVYAT ANQEKGQRTP YQALDSMDDA WSFRELKAFV RESKTLSNKK KEYLLTEEDI SKFDVRKKFI ERNLVDTRYA SRVVLNALQE HFRAHKIDTK VSVVRGQFTS QLRRHWGIEK TRDTYHHHAV DALIIAASSQ LNLWKKQKNT LVSYSEDQLL DIETGELISD DEYKESVFKA PYQHFVDTLKTable 4- Cas9 orthologsSKEFEDSILF SYQVDSKFNR KISDATIYAT RQAKVGKDKA DETYVLGKIK DIYTQDGYDA FMKIYKKDKS KFLMYRHDPQ TFEKVIEPIL ENYPNKQINE KGKEVPCNPF LKYKEEHGYI RKYSKKGNGP EIKSLKYYDS KLGNHIDITP KDSNNKVVLQ SVSPWRADVY FNKTTGKYEI LGLKYADLQF EKGTGTYKIS QEKYNDIKKK EGVDSDSEFK FTLYKNDLLL VKDTETKEQQ LFRFLSRTMP KQKHYVELKP YDKQKFEGGE ALIKVLGNVA NSGQCKKGLG KSNISIYKVR TDVLGNQHII KNEGDKPKLD F Parvibaculum MERIFGFDIG TTSIGFSVID YSSTQSAGNI QRLGVRIFPE ARDPDGTPLN (SEQ lavamentivora QQRRQKRMMR RQLRRRRIRR KALNETLHEA GFLPAYGSAD WPVVMADEPY ID ns DS-1 ELRRRGLEEG LSAYEFGRAI YHLAQHRHFK GRELEESDTP DPDVDDEKEA ANERAATLKA LKNEQTTLGA WLARRPPSDR KRGIHAHRNV VAEEFERLWE NO: VQSKFHPALK SEEMRARISD TIFAQRPVFW RKNTLGECRF MPGEPLCPKG 25) AJN60020.1 SWLSQQRRML EKLNNLAIAG GNARPLDAEE RDAILSKLQQ QASMSWPGVR GI: 757015976 SALKALYKQR GEPGAEKSLK FNLELGGESK LLGNALEAKL ADMFGPDWPA WP_011995013. HPRKQEIRHA VHERLWAADY GETPDKKRVI ILSEKDRKAH REAAANSFVA 1 DFGITGEQAA QLQALKLPTG WEPYSIPALN LFLAELEKGE RFGALVNGPD WEGWRRTNFP HRNQPTGEIL DKLPSPASKE ERERISQLRN PTVVRTQNEL RKVVNNLIGL YGKPDRIRIE VGRDVGKSKR EREEIQSGIR RNEKQRKKAT EDLIKNGIAN PSRDDVEKWI LWKEGQERCP YTGDQIGFNA LFREGRYEVE HIWPRSRSFD NSPRNKTLCR KDVNIEKGNR MPFEAFGHDE DRWSAIQIRL QGMVSAKGGT GMSPGKVKRF LAKTMPEDFA ARQLNDTRYA AKQILAQLKR LWPDMGPEAP VKVEAVTGQV TAQLRKLWTL NNILADDGEK TRADHRHHAI DALTVACTHP GMTNKLSRYW QLRDDPRAEK PALTPPWDTI RADAEKAVSE IVVSHRVRKK VSGPLHKETT YGDTGTDIKT KSGTYRQFVT RKKIESLSKG ELDEIRDPRI KEIVAAHVAG RGGDPKKAFP PYPCVSPGGP EIRKVRLTSK QQLNLMAQTG NGYADLGSNH HIAIYRLPDG KADFEIVSLF DASRRLAQRN PIVQRTRADG ASFVMSLAAG EAIMIPEGSK KGIWIVQGVW ASGQVVLERD TDADHSTTTR PMPNPILKDD AKKVSIDPIG RVRPSND Corynebacteriu MKYHVGIDVG TFSVGLAAIE VDDAGMPIKT LSLVSHIHDS GLDPDEIKSA (SEQ m diphtheriae VTRLASSGIA RRTRRLYRRK RRRLQQLDKF IQRQGWPVIE LEDYSDPLYP ID NCTC 13129 WKVRAELAAS YIADEKERGE KLSVALRHIA RHRGWRNPYA KVSSLYLPDG PSDAFKAIRE EIKRASGQPV PETATVGQMV TLCELGTLKL RGEGGVLSAR NO: LQQSDYAREI QEICRMQEIG QELYRKIIDV VFAAESPKGS ASSRVGKDPL 26) AJN60012.1 QPGKNRALKA SDAFQRYRIA ALIGNLRVRV DGEKRILSVE EKNLVFDHLV GI: 757015968 NLTPKKEPEW VTIAEILGID RGQLIGTATM TDDGERAGAR PPTHDTNRSI WP_01093396 VNSRIAPLVD WWKTASALEQ HAMVKALSNA EVDDFDSPEG AKVQAFFADL DDDVHAKLDS LHLPVGRAAY SEDTLVRLTR RMLSDGVDLY TARLQEFGIE 8.1 PSWTPPTPRI GEPVGNPAVD RVLKTVSRWL ESATKTWGAP ERVIIEHVRE GFVTEKRARE MDGDMRRRAA RNAKLFQEMQ EKLNVQGKPS RADLWRYQSV QRQNCQCAYC GSPITFSNSE MDHIVPRAGQ GSTNTRENLV AVCHRCNQSK GNTPFAIWAK NTSIEGVSVK EAVERTRHWV TDTGMRSTDF KKFTKAVVER FQRATMDEEI DARSMESVAW MANELRSRVA QHFASHGTTV RVYRGSLTAE ARRASGISGK LKFFDGVGKS RLDRRHHAID AAVIAFTSDY VAETLAVRSN LKQSQAHRQE APQWREFTGK DAEHRAAWRV WCQKMEKLSA LLTEDLRDDR VVVMSNVRLR LGNGSAHKET IGKLSKVKLS SQLSVSDIDK ASSEALWCAL TREPGFDPKE GLPANPERHI RVNGTHVYAG DNIGLFPVSA GSIALRGGYA ELGSSFHHAR VYKITSGKKP AFAMLRVYTI DLLPYRNQDL FSVELKPQTM SMRQAEKKLR DALATGNAEY LGWLVVDDEL VVDTSKIATD QVKAVEAELG TIRRWRVDGF FSPSKLRLRP LQMSKEGIKK ESAPELSKII DRPGWLPAVN KLFSDGNVTV VRRDSLGRVR LESTAHLPVT WKVQTable 4- Cas9 orthologsStreptococcus MTNGKILGLD IGIASVGVGI IEAKTGKVVH ANSRLFSAAN AENNAERRGF (SEQ pasteurianus RGSRRLNRRK KHRVKRVRDL FEKYGIVTDF RNLNLNPYEL RVKGLTEQLK ID NEELFAALRT ISKRRGISYL DDAEDDSTGS TDYAKSIDEN RRLLKNKTPG 1385204 QIQLERLEKY G NO: WP_0 QLRGNFTVY DENGEAHRLI NVFSTSDYEK EARKILETQA DYNKKITAEF IDDYVEILTQ KRKYYHGPGN EKSRTDYGRF RTDGTTLENI 27) 8.1 FGILIGKCNF YPDEYRASKA SYTAQEYNFL NDLNNLKVST ETGKLSTEQK ESLVEFAKNT ATLGPAKLLK EIAKILDCKV DEIKGYREDD KGKPDLHTFE PYRKLKFNLE SINIDDLSRE VIDKLADILT LNTEREGIED AIKRNLPNQF TEEQISEIIK VRKSQSTAFN KGWHSFSAKL MNELIPELYA TSDEQMTILT RLEKFKVNKK SSKNTKTIDE KEVTDEIYNP VVAKSVRQTI KIINAAVKKY GDFDKIVIEM PRDKNADDEK KFIDKRNKEN KKEKDDALKR AAYLYNSSDK LPDEVFHGNK QLETKIRLWY QQGERCLYSG KPISIQELVH NSNNFEIDHI LPLSLSFDDS LANKVLVYAW TNQEKGQKTP YQVIDSMDAA WSFREMKDYV LKQKGLGKKK RDYLLTTENI DKIEVKKKFI ERNLVDTRYA SRVVLNSLQS ALRELGKDTK VSVVRGQFTS QLRRKWKIDK SRETYHHHAV DALIIAASSQ LKLWEKQDNP MFVDYGKNQV VDKQTGEILS VSDDEYKELV FQPPYQGFVN TISSKGFEDE ILFSYQVDSK YNRKVSDATI YSTRKAKIGK DKKEETYVLG KIKDIYSQNG FDTFIKKYNK DKTQFLMYQK DSLTWENVIE VILRDYPTTK KSEDGKNDVK CNPFEEYRRE NGLICKYSKK GKGTPIKSLK YYDKKLGNCI DITPEESRNK VILQSINPWR ADVYFNPETL KYELMGLKYS DLSFEKGTGN YHISQEKYDA IKEKEGIGKK SEFKFTLYRN DLILIKDIAS GEQEIYRFLS RTMPNVNHYV ELKPYDKEKF DNVQELVEAL GEADKVGRCI KGLNKPNISI YKVRTDVLGN KYFVKKKGDK PKLDFKNNK K Neisseria MAAFKPNPMN YILGLDIGIA SVGWAIVEID EEENPIRLID LGVRVFERAE (SEQ cinerea ATCC VPKTGDSLAA ARRLARSVRR LTRRRAHRLL RARRLLKREG VLQAADFDEN ID 14685 GLIKSLPNTP WQLRAAALDR KLTPLEWSAV LLHLIKHRGY LSQRKNEGET ADKELGALLK GVADNTHALQ TGDFRTPAEL ALNKFEKESG HIRNQRGDYS NO: HTFNRKDLQA ELNLLFEKQK EFGNPHVSDG LKEGIETLLM TQRPALSGDA 28) AJN60019.1 VQKMLGHCTF EPTEPKAAKN TYTAERFVWL TKLNNLRILE QGSERPLTDT GI: 757015975 ERATLMDEPY RKSKLTYAQA RKLLDLDDTA FFKGLRYGKD NAEASTLMEM WP_00367641 KAYHAISRAL EKEGLKDKKS PLNLSPELQD EIGTAFSLFK TDEDITGRLK DRVQPEILEA LLKHISFDKF VQISLKALRR IVPLMEQGNR YDEACTEIYG 0.1 DHYGKKNTEE KIYLPPIPAD EIRNPVVLRA LSQARKVING VVRRYGSPAR IHIETAREVG KSFKDRKEIE KRQEENRKDR EKSAAKFREY FPNFVGEPKS KDILKLRLYE QQHGKCLYSG KEINLGRLNE KGYVEIDHAL PFSRTWDDSF NNKVLALGSE NQNKGNQTPY EYFNGKDNSR EWQEFKARVE TSRFPRSKKQ RILLQKFDED GFKERNLNDT RYINRFLCQF VADHMLLTGK GKRRVFASNG QITNLLRGFW GLRKVRAEND RHHALDAVVV ACSTIAMQQK ITRFVRYKEM NAFDGKTIDK ETGEVLHQKA HFPQPWEFFA QEVMIRVFGK PDGKPEFEEA DTPEKLRTLL AEKLSSRPEA VHKYVTPLFI SRAPNRKMSG QGHMETVKSA KRLDEGISVL RVPLTQLKLK DLEKMVNRER EPKLYEALKA RLEAHKDDPA KAFAEPFYKY DKAGNRTQQV KAVRVEQVQK TGVWVHNHNG IADNATIVRV DVFEKGGKYY LVPIYSWQVA KGILPDRAVV QGKDEEDWTV MDDSFEFKFV LYANDLIKLT AKKNEFLGYF VSLNRATGAI DIRTHDTDST KGKNGIFQSV GVKTALSFQK YQIDELGKEI RPCRLKKRPP VR AJN60009.1 MSDLVLGLDI GIGSVGVGIL NKVTGEIIHK NSRIFPAAQA ENNLVRRTNR (SEQ QGRRLARRKK HRRVRLNRLF EESGLITDFT KISINLNPYQ LRVKGLTDEL GI: 757015965 ID SNEELFIALK NMVKHRGISY LDDASDDGNS SVGDYAQIVK ENSKQLETKT PGQIQLERYQ TYGQLRGDFT VEKDGKKHRL INVFPTSAYR SEALRILQTQ NO: QEFNPQITDE FINRYLEILT GKRKYYHGPG NEKSRTDYGR YRTSGETLDN 29) St1Cas9+SpCa IFGILIGKCT FYPDEFRAAK ASYTAQEFNL LNDLNNLTVP TETKKLSKEQ s9 KNQIINYVKN EKAMGPAKLF KYIAKLLSCD VADIKGYRID KSGKAEIHTFTable 4- Cas9 orthologsEAYRKMKTLE TLDIEQMDRE TLDKLAYVLT LNTEREGIQE ALEHEFADGS FSQKQVDELV QFRKANSSIF GKGWHNFSVK LMMELIPELY ETSEEQMTIL TRLGKQKTTS SSNKTKYIDE KLLTEEIYNP VVAKSVRQAI KIVNAAIKEY GDFDNIVIEM ARENQTTQKG QKNSRERMKR IEEGIKELGS QILKEHPVEN TQLQNEKLYL YYLQNGRDMY VDQELDINRL SDYDVDHIVP QSFLKDDSID NKVLTRSDKN RGKSDNVPSE EVVKKMKNYW RQLLNAKLIT QRKFDNLTKA ERGGLSELDK AGFIKRQLVE TRQITKHVAQ ILDSRMNTKY DENDKLIREV KVITLKSKLV SDFRKDFQFY KVREINNYHH AHDAYLNAVV GTALIKKYPK LESEFVYGDY KVYDVRKMIA KSEQEIGKAT AKYFFYSNIM NFFKTEITLA NGEIRKRPLI ETNGETGEIV WDKGRDFATV RKVLSMPQVN IVKKTEVQTG GFSKESILPK RNSDKLIARK KDWDPKKYGG FDSPTVAYSV LVVAKVEKGK SKKLKSVKEL LGITIMERSS FEKNPIDFLE AKGYKEVKKD LIIKLPKYSL FELENGRKRM LASAGELQKG NELALPSKYV NFLYLASHYE KLKGSPEDNE QKQLFVEQHK HYLDEIIEQI SEFSKRVILA DANLDKVLSA YNKHRDKPIR EQAENIIHLF TLTNLGAPAA FKYFDTTIDR KRYTSTKEVL DATLIHQSIT GLYETRIDLS QLGGD Campylobacter MRILGFDIGI NSIGWAFVEN DELKDCGVRI FTKAENPKNK ESLALPRRNA (SEQ lari Cas9 RSSRRRLKRR KARLIAIKRI LAKELKLNYK DYVAADGELP KAYEGSLASV ID BAK69486.1 YELRYKALTQ NLETKDLARV ILHIAKHRGY MNKNEKKSND AKKGKILSAL KNNALKLENY QSVGEYFYKE FFQKYKKNTK NFIKIRNTKD NYNNCVLSSD NO: LEKELKLILE KQKEFGYNYS EDFINEILKV AFFQRPLKDF SHLVGACTFF 30) EEEKRACKNS YSAWEFVALT KIINEIKSLE KISGEIVPTQ TINEVLNLIL DKGSITYKKF RSCINLHESI SFKSLKYDKE NAENAKLIDF RKLVEFKKAL GVHSLSRQEL DQISTHITLI KDNVKLKTVL EKYNLSNEQI NNLLEIEFND YINLSFKALG MILPLMREGK RYDEACEIAN LKPKTVDEKK DFLPAFCDSI FAHELSNPVV NRAISEYRKV LNALLKKYGK VHKIHLELAR DVGLSKKARE KIEKEQKENQ AVNAWALKEC ENIGLKASAK NILKLKLWKE QKEICIYSGN KISIEHLKDE KALEVDHIYP YSRSFDDSFI NKVLVFTKEN QEKLNKTPFE AFGKNIEKWS KIQTLAQNLP YKKKNKILDE NFKDKQQEDF ISRNLNDTRY IATLIAKYTK EYLNFLLLSE NENANLKSGE KGSKIHVQTI SGMLTSVLRH TWGFDKKDRN NHLHHALDAI IVAYSTNSII KAFSDFRKNQ ELLKARFYAK ELTSDNYKHQ VKFFEPFKSF REKILSKIDE IFVSKPPRKR ARRALHKDTF HSENKIIDKC SYNSKEGLQI ALSCGRVRKI GTKYVENDTI VRVDIFKKQN KFYAIPIYAM DFALGILPNK IVITGKDKNN NPKQWQTIDE SYEFCFSLYK NDLILLQKKN MQEPEFAYYN DFSISTSSIC VEKHDNKFEN LTSNQKLLFS NAKEGSVKVE SLGIQNLKVF EKYIITPLGD KIKADFQPRE NISLKTSKKY GLR AJN60010.1 MDKKYSIGLD IGTNSVGWAV ITDEYKVPSK KFKVLGNTDR HSIKKNLIGA (SEQ LLFDSGETAE ATRLKRTARR RYTRRKNRIC YLQEIFSNEM AKVDDSFFHR GI: 757015966 ID LEESFLVEED KKHERHPIFG NIVDEVAYHE KYPTIYHLRK KLVDSTDKAD LRLIYLALAH MIKFRGHFLI EGDLNPDNSD VDKLFIQLVQ TYNQLFEENP NO: INASGVDAKA ILSARLSKSR RLENLIAQLP GEKKNGLFGN LIALSLGLTP 31) SpCas9+St1Ca NFKSNFDLAE DAKLQLSKDT YDDDLDNLLA QIGDQYADLF LAAKNLSDAI s9 LLSDILRVNT EITKAPLSAS MIKRYDEHHQ DLTLLKALVR QQLPEKYKEI FFDQSKNGYA GYIDGGASQE EFYKFIKPIL EKMDGTEELL VKLNREDLLR KQRTFDNGSI PHQIHLGELH AILRRQEDFY PFLKDNREKI EKILTFRIPY YVGPLARGNS RFAWMTRKSE ETITPWNFEE VVDKGASAQS FIERMTNFDK NLPNEKVLPK HSLLYEYFTV YNELTKVKYV TEGMRKPAFL SGEQKKAIVD LLFKTNRKVT VKQLKEDYFK KIECFDSVEI SGVEDRFNAS LGTYHDLLKI IKDKDFLDNE ENEDILEDIV LTLTLFEDRE MIEERLKTYA HLFDDKVMKQ LKRRRYTGWG RLSRKLINGI RDKQSGKTIL DFLKSDGFAN RNFMQLIHDD SLTFKEDIQK AQVSGQGDSL HEHIANLAGS PAIKKGILQT VKVVDELVKVTable 4- Cas9 orthologsMGRHKPENIV IEMARETNED DEKKAIQKIQ KANKDEKDAA MLKAANQYNG KAELPHSVFH GHKQLATKIR LWHQQGERCL YTGKTISIHD LINNSNQFEV DHILPLSITF DDSLANKVLV YATANQEKGQ RTPYQALDSM DDAWSFRELK AFVRESKTLS NKKKEYLLTE EDISKFDVRK KFIERNLVDT RYASRVVLNA LQEHFRAHKI DTKVSVVRGQ FTSQLRRHWG IEKTRDTYHH HAVDALIIAA SSQLNLWKKQ KNTLVSYSED QLLDIETGEL ISDDEYKESV FKAPYQHFVD TLKSKEFEDS ILFSYQVDSK FNRKISDATI YATRQAKVGK DKADETYVLG KIKDIYTQDG YDAFMKIYKK DKSKFLMYRH DPQTFEKVIE PILENYPNKQ INEKGKEVPC NPFLKYKEEH GYIRKYSKKG NGPEIKSLKY YDSKLGNHID ITPKDSNNKV VLQSVSPWRA DVYFNKTTGK YEILGLKYAD LQFEKGTGTY KISQEKYNDI KKKEGVDSDS EFKFTLYKND LLLVKDTETK EQQLFRFLSR TMPKQKHYVE LKPYDKQKFE GGEALIKVLG NVANSGQCKK GLGKSNISIY KVRTDVLGNQ HIIKNEGDKP KLDF SpCas9 MDKKYSIGLD IGTNSVGWAV ITDEYKVPSK KFKVLGNTDR HSIKKNLIGA (SEQ LLFDSGETAE ATRLKRTARR RYTRRKNRIC YLQEIFSNEM AKVDDSFFHR inactive ID LEESFLVEED KKHERHPIFG NIVDEVAYHE KYPTIYHLRK KLVDSTDKAD AJN60011.1 LRLIYLALAH MIKFRGHFLI EGDLNPDNSD VDKLFIQLVQ TYNQLFEENP NO: INASGVDAKA ILSARLSKSR RLENLIAQLP GEKKNGLFGN LIAL 32) GI: 757015967 SLGLTP NFKSNFDLAE DAKLQLSKDT YDDDLDNLLA QIGDQYADLF LAAKNLSDAI LLSDILRVNT EITKAPLSAS MIKRYDEHHQ DLTLLKALVR QQLPEKYKEI FFDQSKNGYA GYIDGGASQE EFYKFIKPIL EKMDGTEELL VKLNREDLLR KQRTFDNGSI PHQIHLGELH AILRRQEDFY PFLKDNREKI EKILTFRIPY YVGPLARGNS RFAWMTRKSE ETITPWNFEE VVDKGASAQS FIERMTNFDK NLPNEKVLPK HSLLYEYFTV YNELTKVKYV TEGMRKPAFL SGEQKKAIVD LLFKTNRKVT VKQLKEDYFK KIECFDSVEI SGVEDRFNAS LGTYHDLLKI IKDKDFLDNE ENEDILEDIV LTLTLFEDRE MIEERLKTYA HLFDDKVMKQ LKRRRYTGWG RLSRKLINGI RDKQSGKTIL DFLKSDGFAN RNFMQLIHDD SLTFKEDIQK AQVSGQGDSL HEHIANLAGS PAIKKGILQT VKVVDELVKV MGRHKPENIV IAMARENQTT QKGQKNSRER MKRIEEGIKE LGSQILKEHP VENTQLQNEK LYLYYLQNGR DMYVDQELDI NRLSDYDVDA IVPQSFLKDD SIDAKVLTRS DKARGKSDNV PSEEVVKKMK NYWRQLLNAK LITQRKFDNL TKAERGGLSE LDKAGFIKRQ LVETRQITKH VAQILDSRMN TKYDENDKLI REVKVITLKS KLVSDFRKDF QFYKVREINN YHHAHAAYLN AVVGTALIKK YPKLESEFVY GDYKVYDVRK MIAKSEQEIG KATAKYFFYS NIMNFFKTEI TLANGEIRKR PLIETNGETG EIVWDKGRDF ATVRKVLSMP QVNIVKKTEV QTGGFSKESI LPKRNSDKLI ARKKDWDPKK YGGFDSPTVA YSVLVVAKVE KGKSKKLKSV KELLGITIME RSSFEKNPID FLEAKGYKEV KKDLIIKLPK YSLFELENGR KRMLASAGEL QKGNELALPS KYVNFLYLAS HYEKLKGSPE DNEQKQLFVE QHKHYLDEII EQISEFSKRV ILADANLDKV LSAYNKHRDK PIREQAENII HLFTLTNLGA PAAFKYFDTT IDRKRYTSTK EVLDATLIHQ SITGLYETRI DLSQLGGD AJN60013.1 MTQSERRFSC SIGIDMGAKY TGVFYALFDR EELPTNLNSK AMTLVMPETG (SEQ PRYVQAQRTA VRHRLRGQKR YTLARKLAFL VVDDMIKKQE KRLTDEEWKR GI: 757015969 ID GREALSGLLK RRGYSRPNAD GEDLTPLENV RADVFAAHPA FSTYFSEVRS LAEQWEEFTA NISNVEKFLG DPNIPAD NO: WP_00543065 KEF IEFAVAEGLI DKTEKKAYQS ALSTLRANAN VLTGLRQMGH KPRSEYFKAI EADLKKDSRL AKINEAF 33) 8.1 GGA ERLARLLGNL SNLQLRAERW YFNAPDIMKD RGWEPDRFKK TLVRAFKFFH PAKDQNKQHL ELIKQIENSE DIIETLCTLD PNRTIPPYED QNNRRPPLDQ Sutterella TLLLSPEKLT RQYGEIWKTW SARLTSAEPT LAPAAEILER STDRKSRVAV wadsworthensi NGHEPLPTLA YQLSYALQRA FDRSKALDPY ALRALAAGSK SNKLTSARTA s 3_1_45B LENCIGGQNV KTFLDCARRY YREADDAKVG LWFDNADGLL ERSDLHPPMK KKILPLLVAN ILQTDETTGQ KFLDEIWRKQ IKGRETVASR CARIETVRKSTable 4- Cas9 orthologsFGGGFNIAYN TAQYREVNKL PRNAQDKELL TIRDRVAETA DFIAANLGLS DEQKRKFANP FSLAQFYTLI ETEVSGFSAT TLAVHLENAW RMTIKDAVIN GETVRAAQCS RLPAETARPF DGLVRRLVDR QAWEIAKRVS TDIQSKVDFS NGIVDVSIFV EENKFEFSAS VADLKKNKRV KDKMLSEAEK LETRWLIKNE RIKKASRGTC PYTGDRLAEG GEIDHILPRS LIKDARGIVF NAEPNLIYAS SRGNQLKKNQ RYSLSDLKAN YRNEIFKTSN IAAITAEIED VVTKLQQTHR LKFFDLLNEH EQDCVRHALF LDDGSEARDA VLELLATQRR TRVNGTQIWM IKNLANKIRE ELQNWCKTTN NRLHFQAAAT NVSDAKNLRL KLAQNQPDFE KPDIQPIASH SIDALCSFAV GSADAERDQN GFDYLDGKTV LGLYPQSCEV IHLQAKPQEE KSHFDSVAIF KEGIYAEQFL PIFTLNEKIW IGYETLNAKG ERCGAIEVSG KQPKELLEML APFFNKPVGD LSAHATYRIL KKPAYEFLAK AALQPLSAEE KRLAALLDAL RYCTSRKSLM SLFMAANGKS LKKREDVLKP KLFQLKVELK GEKSFKLNGS LTLPVKQDWL RICDSPELAD AFGKPCSADE LTSKLARIWK RPVMRDLAHA PVRREFSLPA IDNPSGGFRI RRTNLFGNEL YQVHAINAKK YRGFASAGSN VDWSKGILFN ELQHENLTEC GGRFITSADV TPMSEWRKVV AEDNLSIWIA PGTEGRRYVR VETTFIQASH WFEQSVENWA ITSPLSLPAS FKVDKPAEFQ KAVGTELSEL LGQPRSEIFI ENVGNAKHIR FWYIVVSSNK KMNESYNNVS KS AJN60014.1 MESSQILSPI GIDLGGKFTG VCLSHLEAFA ELPNHANTKY SVILIDHNNF (SEQ QLSQAQRRAT RHRVRNKKRN QFVKRVALQL FQHILSRDLN AKEETALCHY GI: 757015970 ID LNNRGYTYVD TDLDEYIKDE TTINLLKELL PSESEHNFID WFLQKMQSSE FRKILVSKVE EKKDDKELK NO: WP_01121279 N AVKNIKNFIT GFEKNSVEGH RHRKVYFENI KSDITKDNQL DSIKKKIPSV CLSNLLGHLS NLQWKNLHR 34) 2.1 Y LAKNPKQFDE QTFGNEFLRM LKNFRHLKGS QESLAVRNLI QQLEQSQDYI SILEKTPPEI TIPPYEARTN TGMEKDQSLL LNPEKLNNLY PNWRNLIPGI IDAHPFLEKD Legionella LEHTKLRDRK RIISPSKQDE KRDSYILQRY LDLNKKIDKF KIKKQLSFLG pneumophila QGKQLPANLI ETQKEMETHF NSSLVSVLIQ IASAYNKERE DAAQGIWFDN str. Paris AFSLCELSNI NPPRKQKILP LLVGAILSED FINNKDKWAK FKIFWNTHKI GRTSLKSKCK EIEEARKNSG NAFKIDYEEA LNHPEHSNNK ALIKIIQTIP DIIQAIQSHL GHNDSQALIY HNPFSLSQLY TILETKRDGF HKNCVAVTCE NYWRSQKTEI DPEISYASRL PADSVRPFDG VLARMMQRLA YEIAMAKWEQ IKHIPDNSSL LIPIYLEQNR FEFEESFKKI KGSSSDKTLE QAIEKQNIQW EEKFQRIINA SMNICPYKGA SIGGQGEIDH IYPRSLSKKH FGVIFNSEVN LIYCSSQGNR EKKEEHYLLE HLSPLYLKHQ FGTDNVSDIK NFISQNVANI KKYISFHLLT PEQQKAARHA LFLDYDDEAF KTITKFLMSQ QKARVNGTQK FLGKQIMEFL STLADSKQLQ LEFSIKQITA EEVHDHRELL SKQEPKLVKS RQQSFPSHAI DATLTMSIGL KEFPQFSQEL DNSWFINHLM PDEVHLNPVR SKEKYNKPNI SSTPLFKDSL YAERFIPVWV KGETFAIGFS EKDLFEIKPS NKEKLFTLLK TYSTKNPGES LQELQAKSKA KWLYFPINKT LALEFLHHYF HKEIVTPDDT TVCHFINSLR YYTKKESITV KILKEPMPVL SVKFESSKKN VLGSFKHTIA LPATKDWERL FNHPNFLALK ANPAPNPKEF NEFIRKYFLS DNNPNSDIPN NGHNIKPQKH KAVRKVFSLP VIPGNAGTMM RIRRKDNKGQ PLYQLQTIDD TPSMGIQINE DRLVKQEVLM DAYKTRNLST IDGINNSEGQ AYATFDNWLT LPVSTFKPEI IKLEMKPHSK TRRYIRITQS LADFIKTIDE ALMIKPSDSI DDPLNMPNEI VCKNKLFGNE LKPRDGKMKI VSTGKIVTYE FESDSTPQWI QTLYVTQLKK QP AJN60015.1 MKKEIKDYFL GLDVGTGSVG WAVTDTDYKL LKANRKDLWG MRCFETAETA (SEQ EVRRLHRGAR RRIERRKKRI KLLQELFSQE IAKTDEGFFQ RMKESPFYAE GI: 757015971 ID DKTILQENTL FNDKDFADKT YHKAYPTINH LIKAWIENKV KPDPRLLYLA CHNIIKKRGH FLFEGDFDSE NQFDTSIQAL FEYLREDMEV NO: WP_00268128 DIDADSQKVK EILKDSSLKN SEKQSRLN 35) 9.1 KI LGLKPSDKQK KAITNLISGN KINFADLYDN PDLKDAEKNS ISFSKDDFDA LSDDLASILG DSFELLLKAK AVYNCSVLSKTable 4- Cas9 orthologsTreponema VIGDEQYLSF AKVKIYEKHK TDLTKLKNVI KKHFPKDYKK VFGYNKNEKN denticola NNNYSGYVGV CKTKSKKLII NNSVNQEDFY KFLKTILSAK SEIKEVNDIL ATCC 35405 TEIETGTFLP KQISKSNAEI PYQLRKMELE KILSNAEKHF SFLKQKDEKG LSHSEKIIML LTFKIPYYIG PINDNHKKFF PDRCWVVKKE KSPSGKTTPW NFFDHIDKEK TAEAFITSRT NFCTYLVGES VLPKSSLLYS EYTVLNEINN LQIIIDGKNI CDIKLKQKIY EDLFKKYKKI TQKQISTFIK HEGICNKTDE VIILGIDKEC TSSLKSYIEL KNIFGKQVDE ISTKNMLEEI IRWATIYDEG EGKTILKTKI KAEYGKYCSD EQIKKILNLK FSGWGRLSRK FLETVTSEMP GFSEPVNIIT AMRETQNNLM ELLSSEFTFT ENIKKINSGF EDAEKQFSYD GLVKPLFLSP SVKKMLWQTL KLVKEISHIT QAPPKKIFIE MAKGAELEPA RTKTRLKILQ DLYNNCKNDA DAFSSEIKDL SGKIENEDNL RLRSDKLYLY YTQLGKCMYC GKPIEIGHVF DTSNYDIDHI YPQSKIKDDS ISNRVLVCSS CNKNKEDKYP LKSEIQSKQR GFWNFLQRNN FISLEKLNRL TRATPISDDE TAKFIARQLV ETRQATKVAA KVLEKMFPET KIVYSKAETV SMFRNKFDIV KCREINDFHH AHDAYLNIVV GNVYNTKFTN NPWNFIKEKR DNPKIADTYN YYKVFDYDVK RNNITAWEKG KTIITVKDML KRNTPIYTRQ AACKKGELFN QTIMKKGLGQ HPLKKEGPFS NISKYGGYNK VSAAYYTLIE YEEKGNKIRS LETIPLYLVK DIQKDQDVLK SYLTDLLGKK EFKILVPKIK INSLLKINGF PCHITGKTND SFLLRPAVQF CCSNNEVLYF KKIIRFSEIR SQREKIGKTI SPYEDLSFRS YIKENLWKKT KNDEIGEKEF YDLLQKKNLE IYDMLLTKHK DTIYKKRPNS ATIDILVKGK EKFKSLIIEN QFEVILEILK LFSATRNVSD LQHIGGSKYS GVAKIGNKIS SLDNCILIYQ SITGIFEKRI DLLKV AJN60016.1 MTKEYYLGLD VGTNSVGWAV TDSQYNLCKF KKKDMWGIRL FESANTAKDR (SEQ RLQRGNRRRL ERKKQRIDLL QEIFSPEICK IDPTFFIRLN ESRLHLEDKS GI: 757015972 ID NDFKYPLFIE KDYSDIEYYK EFPTIFHLRK HLIESEEKQD IRLIYLALHN IIKTRGHFLI DGDLQSAKQL RPI NO: EFE28295.1 LDTFLLS LQEEQNLSVS LSENQKDEYE EILKNRSIAK SEKVKKLKNL FEISDELEKE EKKAQSAVIE NFCKFIVGNK 36) Filifactor GDVCKFLRVS KEELEIDSFS FSEGKYEDDI VKNLEEKVPE KVYLFEQMKA MYDWNILVDI LETEEYISFA KVKQYEKHKT NLRLLRDIIL KYCTKDEYNR alocis ATCC MFNDEKEAGS YTAYVGKLKK NNKKYWIEKK RNPEEFYKSL GKLLDKIEPL 35896 KEDLEVLTMM IEECKNHTLL PIQKNKDNGV IPHQVHEVEL KKILENAKKY YSFLTETDKD GYSVVQKIES IFRFRIPYYV GPLSTRHQEK GSNVWMVRKP GREDRIYPWN MEEIIDFEKS NENFITRMTN KCTYLIGEDV LPKHSLLYSK YMVLNELNNV KVRGKKLPTS LKQKVFEDLF ENKSKVTGKN LLEYLQIQDK DIQIDDLSGF DKDFKTSLKS YLDFKKQIFG EEIEKESIQN MIEDIIKWIT IYGNDKEMLK RVIRANYSNQ LTEEQMKKIT GFQYSGWGNF SKMFLKGISG SDVSTGETFD IITAMWETDN NLMQILSKKF TFMDNVEDFN SGKVGKIDKI TYDSTVKEMF LSPENKRAVW QTIQVAEEIK KVMGCEPKKI FIEMARGGEK VKKRTKSRKA QLLELYAACE EDCRELIKEI EDRDERDFNS MKLFLYYTQF GKCMYSGDDI DINELIRGNS KWDRDHIYPQ SKIKDDSIDN LVLVNKTYNA KKSNELLSED IQKKMHSFWL SLLNKKLITK SKYDRLTRKG DFTDEELSGF IARQLVETRQ STKAIADIFK QIYSSEVVYV KSSLVSDFRK KPLNYLKSRR VNDYHHAKDA YLNIVVGNVY NKKFTSNPIQ WMKKNRDTNY SLNKVFEHDV VINGEVIWEK CTYHEDTNTY DGGTLDRIRK IVERDNILYT EYAYCEKGEL FNATIQNKNG NSTVSLKKGL DVKKYGGYFS ANTSYFSLIE FEDKKGDRAR HIIGVPIYIA NMLEHSPSAF LEYCEQKGYQ NVRILVEKIK KNSLLIINGY PLRIRGENEV DTSFKRAIQL KLDQKNYELV RNIEKFLEKY VEKKGNYPID ENRDHITHEK MNQLYEVLLS KMKKFNKKGM ADPSDRIEKS KPKFIKLEDL IDKINVINKM LNLLRCDNDT KADLSLIELP KNAGSFVVKK NTIGKSKIIL VNQSVTGLYE NRRELAJN60017.1 MGRKPYILSL DIGTGSVGYA CMDKGFNVLK YHDKDALGVY LFDGALTAQE(SEQ RRQFRTSRRR KNRRIKRLGL LQELLAPLVQ NPNFYQFQRQ FAWKNDNMDF IDTable 4- Cas9 orthologsGI: 757015973 KNKSLSEVLS FLGYESKKYP TIYHLQEALL LKDEKFDPEL IYMALYHLVK NO: YRGHFLFDHL KIENLTNNDN MHDFVELIET YENLNNIKLN LDYEKTKVIY WP_01461325 37) EILKDNEMTK NDRAKRVKNM EKKLEQFSIM LLGLKFNEGK LFNHADNAEE 9.1 LKGANQSHTF ADNYEENLTP FLTVEQSEFI ERANKIYLSL TLQDILKGKK SMAMSKVAAY DKFRNELKQV KDIVYKADST RTQFKKIFVS SKKSLKQYDA Staphylococcu TPNDQTFSSL CLFDQYLIRP KKQYSLLIKE LKKIIPQDSE LYFEAENDTL s LKVLNTTDNA SIPMQINLYE AETILRNQQK YHAEITDEMI EKVLSLIQFR pseudintermedi IPYYVGPLVN DHTASKFGWM ERKSNESIKP WNFDEVVDRS KSATQFIRRM us ED99 TNKCSYLINE DVLPKNSLLY QEMEVLNELN ATQIRLQTDP KNRKYRMMPQ IKLFAVEHIF KKYKTVSHSK FLEIMLNSNH RENFMNHGEK LSIFGTQDDK KFASKLSSYQ DMTKIFGDIE GKRAQIEEII QWITIFEDKK ILVQKLKECY PELTSKQINQ LKKLNYSGWG RLSEKLLTHA YQGHSIIELL RHSDENFMEI LTNDVYGFQN FIKEENQVQS NKIQHQDIAN LTTSPALKKG IWSTIKLVRE LTSIFGEPEK IIMEFATEDQ QKGKKQKSRK QLWDDNIKKN KLKSVDEYKY IIDVANKLNN EQLQQEKLWL YLSQNGKCMY SGQSIDLDAL LSPNATKHYE VDHIFPRSFI KDDSIDNKVL VIKKMNQTKG DQVPLQFIQQ PYERIAYWKS LNKAGLISDS KLHKLMKPEF TAMDKEGFIQ RQLVETRQIS VHVRDFLKEE YPNTKVIPMK AKMVSEFRKK FDIPKIRQMN DAHHAIDAYL NGVVYHGAQL AYPNVDLFDF NFKWEKVREK WKALGEFNTK QKSRELFFFK KLEKMEVSQG ERLISKIKLD MNHFKINYSR KLANIPQQFY NQTAVSPKTA ELKYESNKSN EVVYKGLTPY QTYVVAIKSV NKKGKEKMEY QMIDHYVFDF YKFQNGNEKE LALYLAQREN KDEVLDAQIV YSLNKGDLLY INNHPCYFVS RKEVINAKQF ELTVEQQLSL YNVMNNKETN VEKLLIEYDF IAEKVINEYH HYLNSKLKEK RVRTFFSESN QTHEDFIKAL DELFKVVTAS ATRSDKIGSR KNSMTHRAFL GKGKDVKIAY TSISGLKTTK PKSLFKLAES RNEL AJN60018.1 MTKIKDDYIV GLDIGTDSCG WVAMNSNNDI LKLQGKTAIG SRLFEGGKSA (SEQ AERRLFRTTH RRIKRRRWRL KLLEEFFDPY MAEVDPYFFA RLKESGLSPL GI: 757015974 ID DKRKTVSSIV FPTSAEDKKF YDDYPTIYHL RYKLMTEDEK FDLREVYLAI HHIIKYRGNF LYNTSVKDFK ASKIDVKSSI EKLNELYENL GLD NO: WP_01456756 LNVEFNI SNTAEIEKVL KDKQIFKRDK VK 38) 1.1 KIAELFAI KTDNKEQSKR IKDISKQVAN AVLGYKTRFD TIALKEISKD ELSDWNFKLS DIDADSKFEA LMGNLDENEQ AILLTIKELF NEVTLNGIVE DGNTLSESMI NKYNDHRDDL KLLKEVIENH Lactobacillus IDRKKAKELA LAYDLYVNNR HGQLLQAKKK LGKIKPRSKE DFYKVVNKNL johnsonii DPC DDSRASKEIK KKIELDSFMP KQRTNANGVI PYQLQQLELD KIIENQSKYY 6026 PFLKEINPVS SHLKEAPYKL DELIRFRVPY YVGPLISPNE STKDIQTKKN QNFAWMIRKE EGRITPWNFD QKVDRIESAN KFIKRMTTKD TYLFGEDVLP ANSLLYQKFT VLNELNNIRI NGKRISVDLK QEIYENLFKK HTTVTVKKLE NYLKENHNLV KVEIKGLADE KKFNSGLTTY NRFKNLNIFD NQIDDLKYRN DFEKIIEWST IFEDKSIYKE KLRSIDWLNE KQINALSNIR LQGWGRLSKK LLAQLHDHNG QTIIEQLWDS QNNFMQIVTQ ADFKDAIAKA NQNLLVATSV EDILNNAYTS PANKKAIRQV IKVVDDIVKA ASGKVPKQIA IEFTRDADEN PKRSQTRGSK LQKVYKDLST ELASKTIAEE LNEAIKDKKL VQDKYYLYFM QLGRDAYTGE PINIDEIQKY DIDHILPQSF IKDDALDNRV LVSRAVNNGK SDNVPVKLFG NEMAANLGMT IRKMWEEWKN IGLISKTKYN NLLTDPDHIN KYKSAGFIRR QLVETSQIIK LVSTILQSRY PNTEIITVKA KYNHYLREKF DLYKSREVND YHHAIDAYLS AICGNLLYQN YPNLRPFFVY GQYKKFSSDP DKEKAIFNKT RKFSFISQLL KNKSENSKEI AKKLKRAYQF KYMLVSRETE TRDQEMFKMT VYPRFSHDTV KAPRNLIPKK MGMSPDIYGG YTNNSDAYMV IVRIDKKKGT EYKILGIPTR ELVNLKKAEK EDHYKSYLKE ILTPRILYNK NGKRDKKITS FEIVKSKIPY KQVIQDGDKK FMLGSSTYVY NAKQLTLSTE SMKAITNNFD KDSDENDALI KAYDEILDKV DKYLPLFDIN KFREKLHSGR EKFIKLSLED KKDTILKVLE GLHDNAVMTK IPTIGLSTPL GFMQFPNGVITable 4- Cas9 orthologsLSENAKLIYQ SPTGLFKKSV KISDL Mycoplasma MNNSIKSKPE VTIGLDLGVG SVGWAIVDNE TNIIHHLGSR LFSQAKTAED (SEQ gallisepticum RRSFRGVRRL IRRRKYKLKR FVNLIWKYNS YFGFKNKEDI LNNYQEQQKL ID str. F HNTVLNLKSE ALNAKIDPKA LSWILHDYLK NRGHFYEDNR DFNVYPTKEL AKYFDKYGYY KGIIDSKEDN DNKLEEELTK YKFSNKHWLE EVKKVLSNQT NO: GLPEKFKEEY ESLFSYVRNY SEGPGSINSV SPYGIYHLDE KEGKVVQKYN 39) AJN60022.1 NIWDKTIGKC NIFPDEYRAP KNSPIAMIFN EINELSTIRS YSIYLTGWFI GI: 757015978 NQEFKKAYLN KLLDLLIKTN GEKPIDARQF KKLREETIAE SIGKETLKDV WP_01457478 ENEEKLEKED HKWKLKGLKL NTNGKIQYND LSSLAKFVHK LKQHLKLDFL LEDQYATLDK INFLQSLFVY LGKHLRYSNR VDSANLKEFS DSNKLFERIL 9.1 QKQKDGLFKL FEQTDKDDEK ILAQTHSLST KAMLLAITRM TNLDNDEDNQ KNNDKGWNFE AIKNFDQKFI DITKKNNNLS LKQNKRYLDD RFINDAILSP GVKRILREAT KVFNAILKQF SEEYDVTKVV IELARELSEE KELENTKNYK KLIKKNGDKI SEGLKALGIS EDEIKDILKS PTKSYKFLLW LQQDHIDPYS LKEIAFDDIF TKTEKFEIDH IIPYSISFDD SSSNKLLVLA ESNQAKSNQT PYEFISSGNA GIKWEDYEAY CRKFKDGDSS LLDSTQRSKK FAKMMKTDTS SKYDIGFLAR NLNDTRYATI VFRDALEDYA NNHLVEDKPM FKVVCINGSV TSFLRKNFDD SSYAKKDRDK NIHHAVDASI ISIFSNETKT LFNQLTQFAD YKLFKNTDGS WKKIDPKTGV VTEVTDENWK QIRVRNQVSE IAKVIEKYIQ DSNIERKARY SRKIENKTNI SLFNDTVYSA KKVGYEDQIK RKNLKTLDIH ESAKENKNSK VKRQFVYRKL VNVSLLNNDK LADLFAEKED ILMYRANPWV INLAEQIFNE YTENKKIKSQ NVFEKYMLDL TKEFPEKFSE FLVKSMLRNK TAIIYDDKKN IVHRIKRLKM LSSELKENKL SNVIIRSKNQ SGTKLSYQDT INSLALMIMR SIDPTAKKQY IRVPLNTLNL HLGDHDFDLH NMDAYLKKPK FVKYLKANEI GDEYKPWRVL TSGTLLIHKK DKKLMYISSF QNLNDVIEIK NLIETEYKEN DDSDSKKKKK ANRFLMTLST ILNDYILLDA KDNFDILGLS KNRIDEILNS KLGLDKIVK AJN60023.1 MRILGFDIGI NSIGWAFVEN DELKDCGVRI FTKAENPKNK ESLALPRRNA (SEQ RSSRRRLKRR KARLIAIKRI LAKELKLNYK DYVAADGELP KAYEGSLASV GI: 757015979 ID YELRYKALTQ NLETKDLARV ILHIAKHRGY MNKNEKKSND AKKGKILSAL KNNALKLENY QSVGEYFYKE FFQKYKKNTK NFIKIRNTKD NYNNCVLSSD NO: LEKELKLILE KQKEFGYNYS EDFINEILKV AFFQRPLKDF SHLVGACTFF 40) EEEKRACKNS YSAWEFVALT KIINEIKSLE KISGEIVPTQ TINEVLNLIL DKGSITYKKF RSCINLHESI SFKSLKYDKE NAENAKLIDF RKLVEFKKAL GVHSLSRQEL DQISTHITLI KDNVKLKTVL EKYNLSNEQI NNLLEIEFND YINLSFKALG MILPLMREGK RYDEACEIAN LKPKTVDEKK DFLPAFCDSI FAHELSNPVV NRAISEYRKV LNALLKKYGK VHKIHLELAR DVGLSKKARE KIEKEQKENQ AVNAWALKEC ENIGLKASAK NILKLKLWKE QKEICIYSGN KISIEHLKDE KALEVDHIYP YSRSFDDSFI NKVLVFTKEN QEKLNKTPFE AFGKNIEKWS KIQTLAQNLP YKKKNKILDE NFKDKQQEDF ISRNLNDTRY IATLIAKYTK EYLNFLLLSE NENANLKSGE KGSKIHVQTI SGMLTSVLRH TWGFDKKDRN NHLHHALDAI IVAYSTNSII KAFSDFRKNQ ELLKARFYAK ELTSDNYKHQ VKFFEPFKSF REKILSKIDE IFVSKPPRKR ARRALHKDTF HSENKIIDKC SYNSKEGLQI ALSCGRVRKI GTKYVENDTI VRVDIFKKQN KFYAIPIYAM DFALGILPNK IVITGKDKNN NPKQWQTIDE SYEFCFSLYK NDLILLQKKN MQEPEFAYYN DFSISTSSIC VEKHDNKFEN LTSNQKLLFS NAKEGSVKVE SLGIQNLKVF EKYIITPLGD KIKADFQPRE NISLKTSKKY GLR AJN60025.1 MSDLVLGLDI GIGSVGVGIL NKVTGEIIHK NSRIFPAAQA ENNLVRRTNR (SEQ QGRRLARRKK HRRVRLNRLF EESGLITDFT KISINLNPYQ LRVKGLTDEL GI: 757015981 ID SNEELFIALK NMVKHRGISY LDDASDDGNS SVGDYAQIVK ENSKQLETKT PGQIQLERYQ TYGQLRGDFT VEKDGKKHRL INVFPTSAYR SEALRILQTQTable 4- Cas9 orthologsQEFNPQITDE FINRYLEILT GKRKYYHGPG NEKSRTDYGR YRTSGETLDN NO: IFGILIGKCT FYPDEFRAAK ASYTAQEFNL LNDLNNLTVP TETKKLSKEQ 41) KNQIINYVKN EKAMGPAKLF KYIAKLLSCD VADIKGYRID KSGKAEIHTF EAYRKMKTLE TLDIEQMDRE TLDKLAYVLT LNTEREGIQE ALEHEFADGS FSQKQVDELV QFRKANSSIF GKGWHNFSVK LMMELIPELY ETSEEQMTIL TRLGKQKTTS SSNKTKYIDE KLLTEEIYNP VVAKSVRQAI KIVNAAIKEY GDFDNIVIEM ARETNEDDEK KAIQKIQKAN KDEKDAAMLK AANQYNGKAE LPHSVFHGHK QLATKIRLWH QQGERCLYTG KTISIHDLIN NSNQFEVDHI LPLSITFDDS LANKVLVYAT ANQEKGQRTP YQALDSMDDA WSFRELKAFV RESKTLSNKK KEYLLTEEDI SKFDVRKKFI ERNLVDTRYA SRVVLNALQE HFRAHKIDTK VSVVRGQFTS QLRRHWGIEK TRDTYHHHAV DALIIAASSQ LNLWKKQKNT LVSYSEDQLL DIETGELISD DEYKESVFKA PYQHFVDTLK SKEFEDSILF SYQVDSKFNR KISDATIYAT RQAKVGKDKA DETYVLGKIK DIYTQDGYDA FMKIYKKDKS KFLMYRHDPQ TFEKVIEPIL ENYPNKQINE KGKEVPCNPF LKYKEEHGYI RKYSKKGNGP EIKSLKYYDS KLGNHIDITP KDSNNKVVLQ SVSPWRADVY FNKTTGKYEI LGLKYADLQF EKGTGTYKIS QEKYNDIKKK EGVDSDSEFK FTLYKNDLLL VKDTETKEQQ LFRFLSRTMP KQKHYVELKP YDKQKFEGGE ALIKVLGNVA NSGQCKKGLG KSNISIYKVR TDVLGNQHII KNEGDKPKLM WP_00266404 MKHILGLDLG TNSIGWALIE RNIEEKYGKI IGMGSRIVPM GAELSKFEQG (SEQ 8.1 QAQTKNADRR TNRGARRLNK RYKQRRNKLI YILQKLDMLP SQIKLKEDFS ID DPNKIDKITI LPISKKQEQL TAFDLVSLRV KALTEKVGLE DLGKIIYKYN QLRGYAGGSL EPEKEDIFDE EQSKDKKNKS F NO: Bergeyella IAFSKIVFL GEPQEEIFKN KKLNRRAIIV ETEEGNFEGS TFLENIKVGD SLELLINISA SKSGDTITIK 42) zoohelcum LPNKTNWRKK MENIENQLKE KSKEMGREFY ISEFLLELLK ENRWAKIRNN ATCC 43767 TILRARYESE FEAIWNEQVK HYPFLENLDK KTLIEIVSFI FPGEKESQKK YRELGLEKGL KYIIKNQVVF YQRELKDQSH LISDCRYEPN EKAIAKSHPV FQEYKVWEQI NKLIVNTKIE AGTNRKGEKK YKYIDRPIPT ALKEWIFEEL QNKKEITFSA IFKKLKAEFD LREGIDFLNG MSPKDKLKGN ETKLQLQKSL GELWDVLGLD SINRQIELWN ILYNEKGNEY DLTSDRTSKV LEFINKYGNN IVDDNAEETA IRISKIKFAR AYSSLSLKAV ERILPLVRAG KYFNNDFSQQ LQSKILKLLN ENVEDPFAKA AQTYLDNNQS VLSEGGVGNS IATILVYDKH TAKEYSHDEL YKSYKEINLL KQGDLRNPLV EQIINEALVL IRDIWKNYGI KPNEIRVELA RDLKNSAKER ATIHKRNKDN QTINNKIKET LVKNKKELSL ANIEKVKLWE AQRHLSPYTG QPIPLSDLFD KEKYDVDHII PISRYFDDSF TNKVISEKSV NQEKANRTAM EYFEVGSLKY SIFTKEQFIA HVNEYFSGVK RKNLLATSIP EDPVQRQIKD TQYIAIRVKE ELNKIVGNEN VKTTTGSITD YLRNHWGLTD KFKLLLKERY EALLESEKFL EAEYDNYKKD FDSRKKEYEE KEVLFEEQEL TREEFIKEYK ENYIRYKKNK LIIKGWSKRI DHRHHAIDAL IVACTEPAHI KRLNDLNKVL QDWLVEHKSE FMPNFEGSNS ELLEEILSLP ENERTEIFTQ IEKFRAIEMP WKGFPEQVEQ KLKEIIISHK PKDKLLLQYN KAGDRQIKLR GQLHEGTLYG ISQGKEAYRI PLTKFGGSKF ATEKNIQKIV SPFLSGFIAN HLKEYNNKKE EAFSAEGIMD LNNKLAQYRN EKGELKPHTP ISTVKIYYKD PSKNKKKKDE EDLSLQKLDR EKAFNEKLYV KTGDNYLFAV LEGEIKTKKT SQIKRLYDII SFFDATNFLK EEFRNAPDKK TFDKDLLFRQ YFEERNKAKL LFTLKQGDFV YLPNENEEVI LDKESPLYNQ YWGDLKERGK NIYVVQKFSK KQIYFIKHTI ADIIKKDVEF GSQNCYETVE GRSIKENCFK LEIDRLGNIV KVIKRCBK78998.1 MKQEYFLGLD MGTGSLGWAV TDSTYQVMRK HGKALWGTRL FESASTAEER(SEQ RMFRTARRRL DRRNWRIQVL QEIFSEEISK VDPGFFLRMK ESKYYPEDKR ID DAEGNCPELP YALFVDDNYT DKNYHKDYPT IYHLRKMLME TTEIPDIRLV YLVLHHMMKH RGHFLLSGDI SQIKEFKSTF EQLIQNIQDE ELEWHISLDDTable 4- Cas9 orthologsCoprococcus AAIQFVEHVL KDRNLTRSTK KSRLIKQLNA KSACEKAILN LLSGGTVKLS NO: catus GD / 7 DIFNNKELDE SERPKVSFAD SGYDDYIGIV EAELAEQYYI IASAKAVYDW 43) SVLVEILGNS VSISEAKIKV YQKHQADLKT LKKIVRQYMT KEDYKRVFVD TEEKLNNYSA YIGMTKKNGK KVDLKSKQCT QADFYDFLKK NVIKVIDHKE ITQEIESEIE KENFLPKQVT KDNGVIPYQV HDYELKKILD NLGTRMPFIK ENAEKIQQLF EFRIPYYVGP LNRVDDGKDG KFTWSVRKSD ARIYPWNFTE VIDVEASAEK FIRRMTNKCT YLVGEDVLPK DSLVYSKFMV LNELNNLRLN GEKISVELKQ RIYEELFCKY RKVTRKKLER YLVIEGIAKK GVEITGIDGD FKASLTAYHD FKERLTDVQL SQRAKEAIVL NVVLFGDDKK LLKQRLSKMY PNLTTGQLKG ICSLSYQGWG RLSKTFLEEI TVPAPGTGEV WNIMTALWQT NDNLMQLLSR NYGFTNEVEE FNTLKKETDL SYKTVDELYV SPAVKRQIWQ TLKVVKEIQK VMGNAPKRVF VEMAREKQEG KRSDSRKKQL VELYRACKNE ERDWITELNA QSDQQLRSDK LFLYYIQKGR CMYSGETIQL DELWDNTKYD IDHIYPQSKT MDDSLNNRVL VKKNYNAIKS DTYPLSLDIQ KKMMSFWKML QQQGFITKEK YVRLVRSDEL SADELAGFIE RQIVETRQST KAVATILKEA LPDTEIVYVK AGNVSNFRQT YELLKVREMN DLHHAKDAYL NIVVGNAYFV KFTKNAAWFI RNNPGRSYNL KRMFEFDIER SGEIAWKAGN KGSIVTVKKV MQKNNILVTR KAYEVKGGLF DQQIMKKGKG QVPIKGNDER LADIEKYGGY NKAAGTYFML VKSLDKKGKE IRTIEFVPLY LKNQIEINHE SAIQYLAQER GLNSPEILLS KIKIDTLFKV DGFKMWLSGR TGNQLIFKGA NQLILSHQEA AILKGVVKYV NRKNENKDAK LSERDGMTEE KLLQLYDTFL DKLSNTVYSI RLSAQIKTLT EKRAKFIGLS NEDQCIVLNE ILHMFQCQSG SANLKLIGGP GSAGILVMNN NITACKQISV INQSPTGIYE KEIDLIKL WP_00223516 MAAFKPNPIN YILGLDIGIA SVGWAMVEID EDENPICLID LGVRVFERAE (SEQ 2.1 VPKTGDSLAM ARRLARSVRR LTRRRAHRLL RARRLLKREG VLQAADFDEN ID GLIKSLPNTP WQLRAAALDR KLTPLEWSAV LLHLIKHRGY LSQRKNEGET ADKELGALLK GVADNAHALQ TGDFRTPAEL AL NO: Neisseria NKFEKESG HIRNQRGDYS HTFSRKDLQA ELILLFEKQK EFGNPHVSGG LKEGIETLLM TQRPALSGDA 44) meningitidis VQKMLGHCTF EPAEPKAAKN TYTAERFIWL TKLNNLRILE QGSERPLTDT Z2491 ERATLMDEPY RKSKLTYAQA RKLLGLEDTA FFKGLRYGKD NAEASTLMEM KAYHAISRAL EKEGLKDKKS PLNLSPELQD EIGTAFSLFK TDEDITGRLK DRIQPEILEA LLKHISFDKF VQISLKALRR IVPLMEQGKR YDEACAEIYG DHYGKKNTEE KIYLPPIPAD EIRNPVVLRA LSQARKVING VVRRYGSPAR IHIETAREVG KSFKDRKEIE KRQEENRKDR EKAAAKFREY FPNFVGEPKS KDILKLRLYE QQHGKCLYSG KEINLGRLNE KGYVEIDHAL PFSRTWDDSF NNKVLVLGSE NQNKGNQTPY EYFNGKDNSR EWQEFKARVE TSRFPRSKKQ RILLQKFDED GFKERNLNDT RYVNRFLCQF VADRMRLTGK GKKRVFASNG QITNLLRGFW GLRKVRAEND RHHALDAVVV ACSTVAMQQK ITRFVRYKEM NAFDGKTIDK ETGEVLHQKT HFPQPWEFFA QEVMIRVFGK PDGKPEFEEA DTPEKLRTLL AEKLSSRPEA VHEYVTPLFV SRAPNRKMSG QGHMETVKSA KRLDEGVSVL RVPLTQLKLK DLEKMVNRER EPKLYEALKA RLEAHKDDPA KAFAEPFYKY DKAGNRTQQV KAVRVEQVQK TGVWVRNHNG IADNATMVRV DVFEKGDKYY LVPIYSWQVA KGILPDRAVV QGKDEEDWQL IDDSFNFKFS LHPNDLVEVI TKKARMFGYF ASCHRGTGNI NIRIHDLDHK IGKNGILEGI GVKTALSFQK YQIDELGKEI RPCRLKKRPP VR WP_01241442 MQKNINTKQN HIYIKQAQKI KEKLGDKPYR IGLDLGVGSI GFAIVSMEEN (SEQ 0.1 DGNVLLPKEI IMVGSRIFKA SAGAADRKLS RGQRNNHRHT RERMRYLWKV ID LAEQKLALPV PADLDRKENS SEGETSAKRF LGDVLQKDIY ELRVKSLDER LSLQELGYVL YHIAGHRGSS AIRTFENDSE EAQKENTENK KIAGNIKRLM NO: AKKNYRTYGE YLYKEFFENK EKHKREKISN AANNHKFSPT RDLVIKEAEA 45) ILKKQAGKDG FHKELTEEYI EKLTKAIGYE SEKLIPESGF CPYLKDEKRL PASHKLNEER RLWETLNNAR YSDPIVDIVT GEITGYYEKQ FTKEQKQKLFTable 4- Cas9 orthologsElusimicrobiu DYLLTGSELT PAQTKKLLGL KNTNFEDIIL QGRDKKAQKI KGYKLIKLES m minutum MPFWARLSEA QQDSFLYDWN SCPDEKLLTE KLSNEYHLTE EEIDNAFNEI Pei191 VLSSSYAPLG KSAMLIILEK IKNDLSYTEA VEEALKEGKL TKEKQAIKDR LPYYGAVLQE STQKIIAKGF SPQFKDKGYK TPHTNKYELE YGRIANPVVH QTLNELRKLV NEIIDILGKK PCEIGLETAR ELKKSAEDRS KLSREQNDNE SNRNRIYEIY IRPQQQVIIT RRENPRNYIL KFELLEEQKS QCPFCGGQIS PNDIINNQAD IEHLFPIAES EDNGRNNLVI SHSACNADKA KRSPWAAFAS AAKDSKYDYN RILSNVKENI PHKAWRFNQG AFEKFIENKP MAARFKTDNS YISKVAHKYL ACLFEKPNII CVKGSLTAQL RMAWGLQGLM IPFAKQLITE KESESFNKDV NSNKKIRLDN RHHALDAIVI AYASRGYGNL LNKMAGKDYK INYSERNWLS KILLPPNNIV WENIDADLES FESSVKTALK NAFISVKHDH SDNGELVKGT MYKIFYSERG YTLTTYKKLS ALKLTDPQKK KTPKDFLETA LLKFKGRESE MKNEKIKSAI ENNKRLFDVI QDNLEKAKKL LEEENEKSKA EGKKEKNIND ASIYQKAISL SGDKYVQLSK KEPGKFFAIS KPTPTTTGYG YDTGDSLCVD LYYDNKGKLC GEIIRKIDAQ QKNPLKYKEQ GFTLFERIYG GDILEVDFDI HSDKNSFRNN TGSAPENRVF IKVGTFTEIT NNNIQIWFGN IIKSTGGQDD SFTINSMQQY NPRKLILSSC GFIKYRSPIL KNKEG WP_00910577 MIMKLEKWRL GLDLGTNSIG WSVFSLDKDN SVQDLIDMGV RIFSDGRDPK (SEQ 7.1 TKEPLAVARR TARSQRKLIY RRKLRRKQVF KFLQEQGLFP KTKEECMTLK ID SLNPYELRIK ALDEKLEPYE LGRALFNLAV RRGFKSNRKD GSREEVSEKK SPDEIKTQAD MQTHLEKAIK ENGCRTITEF LY NO: Treponema sp. KNQGENGG IRFAPGRMTY YPTRKMYEEE FNLIRSKQEK YYPQVDWDDI YKAIFYQRPL KPQQRGYCIY 46) JC4 ENDKERTFKA MPCSQKLRIL QDIGNLAYYE GGSKKRVELN DNQDKVLYEL LNSKDKVTFD QMRKALCLAD SNSFNLEENR DFLIGNPTAV KMRSKNRFGK LWDEIPLEEQ DLIIETIITA DEDDAVYEVI KKYDLTQEQR DFIVKNTILQ SGTSMLCKEV SEKLVKRLEE IADLKYHEAV ESLGYKFADQ TVEKYDLLPY YGKVLPGSTM EIDLSAPETN PEKHYGKISN PTVHVALNQT RVVVNALIKE YGKPSQIAIE LSRDLKNNVE KKAEIARKQN QRAKENIAIN DTISALYHTA FPGKSFYPNR NDRMKYRLWS ELGLGNKCIY CGKGISGAEL FTKEIEIEHI LPFSRTLLDA ESNLTVAHSS CNAFKAERSP FEAFGTNPSG YSWQEIIQRA NQLKNTSKKN KFSPNAMDSF EKDSSFIARQ LSDNQYIAKA ALRYLKCLVE NPSDVWTTNG SMTKLLRDKW EMDSILCRKF TEKEVALLGL KPEQIGNYKK NRFDHRHHAI DAVVIGLTDR SMVQKLATKN SHKGNRIEIP EFPILRSDLI EKVKNIVVSF KPDHGAEGKL SKETLLGKIK LHGKETFVCR ENIVSLSEKN LDDIVDEKIK SKVKDYVAKH KGQKIEAVLS DFSKENGIKK VRCVNRVQTP IEITSGKISR YLSPEDYFAA VIWEIPGEKK TFKAQYIRRN EVEKNSKGLN VVKPAVLENG KPHPAAKQVC LLHKDDYLEF SDKGKMYFCR IAGYAATNNK LDIRPVYAVS YCADWINSTN ETMLTGYWKP TPTQNWVSVN VLFDKQKARL VTVSPIGRVF RK WP_00246084 MNQKFILGLD IGITSVGYGL IDYETKNIID AGVRLFPEAN VENNEGRRSK (SEQ 8.1 RGSRRLKRRR IHRLERVKKL LEDYNLLDQS QIPQSTNPYA IRVKGLSEAL ID SKDELVIALL HIAKRRGIHK IDVIDSNDDV GNELSTKEQL NKNSKLLKDK FVCQIQLERM NEGQVRGEKN RFKTADI NO: Staphylococcu IKE IIQLLNVQKN FHQLDENFIN KYIELVEMRR EYFEGPGKGS PYGWEGDPKA WYETLMGHCT YFPDELRSVK 47) s lugdunensis YAYSADLFNA LNDLNNLVIQ RDGLSKLEYH EKYHIIENVF KQKKKPTLKQ M23590 IANEINVNPE DIKGYRITKS GKPQFTEFKL YHDLKSVLFD QSILENEDVL DQIAEILTIY QDKDSIKSKL TELDILLNEE DKENIAQLTG YTGTHRLSLK CIRLVLEEQW YSSRNQMEIF THLNIKPKKI NLTAANKIPK AMIDEFILSP VVKRTFGQAI NLINKIIEKY GVPEDIIIEL ARENNSKDKQ KFINEMQKKN ENTRKRINEI IGKYGNQNAK RLVEKIRLHD EQEGKCLYSL ESIPLEDLLN NPNHYEVDHI IPRSVSFDNS YHNKVLVKQS ENSKKSNLTP YQYFNSGKSK LSYNQFKQHI LNLSKSQDRI SKKKKEYLLE ERDINKFEVQ KEFINRNLVDTable 4- Cas9 orthologsTRYATRELTN YLKAYFSANN MNVKVKTING SFTDYLRKVW KFKKERNHGY KHHAEDALII ANADFLFKEN KKLKAVNSVL EKPEIESKQL DIQVDSEDNY SEMFIIPKQV QDIKDFRNFK YSHRVDKKPN RQLINDTLYS TRKKDNSTYI VQTIKDIYAK DNTTLKKQFD KSPEKFLMYQ HDPRTFEKLE VIMKQYANEK NPLAKYHEET GEYLTKYSKK NNGPIVKSLK YIGNKLGSHL DVTHQFKSST KKLVKLSIKP YRFDVYLTDK GYKFITISYL DVLKKDNYYY IPEQKYDKLK LGKAIDKNAK FIASFYKNDL IKLDGEIYKI IGVNSDTRNM IELDLPDIRY KEYCELNNIK GEPRIKKTIG KKVNSIEKLT TDVLGNVFTN TQYTKPQLLF KRGN WP_01168147 MTKPYSIGLD IGTNSVGWAV TTDNYKVPSK KMKVLGNTSK KYIKKNLLGV (SEQ 0.1 LLFDSGITAE GRRLKRTARR RYTRRRNRIL YLQEIFSTEM ATLDDAFFQR ID LDDSFLVPDD KRDSKYPIFG NLVEEKAYHD EFPTIYHLRK YLADSTKKAD LRLVYLALAH MIKYRGHFLI EGEFNSKNN NO: Streptococcus D IQKNFQDFLD TYNAIFESDL SLENSKQLEE IVKDKISKLE KKDRILKLFP GEKNSGIFSE FLKLIVGNQA 48) thermophilus DFRKCFNLDE KASLHFSKES YDEDLETLLG YIGDDYSDVF LKAKKLYDAI LMD-9 LLSGFLTVTD NETEAPLSSA MIKRYNEHKE DLALLKEYIR NISLKTYNEV FKDDTKNGYA GYIDGKTNQE DFYVYLKKLL AEFEGADYFL EKIDREDFLR KQRTFDNGSI PYQIHLQEMR AILDKQAKFY PFLAKNKERI EKILTFRIPY YVGPLARGNS DFAWSIRKRN EKITPWNFED VIDKESSAEA FINRMTSFDL YLPEEKVLPK HSLLYETFNV YNELTKVRFI AESMRDYQFL DSKQKKDIVR LYFKDKRKVT DKDIIEYLHA IYGYDGIELK GIEKQFNSSL STYHDLLNII NDKEFLDDSS NEAIIEEIIH TLTIFEDREM IKQRLSKFEN IFDKSVLKKL SRRHYTGWGK LSAKLINGIR DEKSGNTILD YLIDDGISNR NFMQLIHDDA LSFKKKIQKA QIIGDEDKGN IKEVVKSLPG SPAIKKGILQ SIKIVDELVK VMGGRKPESI VVEMARENQY TNQGKSNSQQ RLKRLEKSLK ELGSKILKEN IPAKLSKIDN NALQNDRLYL YYLQNGKDMY TGDDLDIDRL SNYDIDHIIP QAFLKDNSID NKVLVSSASN RGKSDDVPSL EVVKKRKTFW YQLLKSKLIS QRKFDNLTKA ERGGLSPEDK AGFIQRQLVE TRQITKHVAR LLDEKFNNKK DENNRAVRTV KIITLKSTLV SQFRKDFELY KVREINDFHH AHDAYLNAVV ASALLKKYPK LEPEFVYGDY PKYNSFRERK SATEKVYFYS NIMNIFKKSI SLADGRVIER PLIEVNEETG ESVWNKESDL ATVRRVLSYP QVNVVKKVEE QNHGLDRGKP KGLFNANLSS KPKPNSNENL VGAKEYLDPK KYGGYAGISN SFTVLVKGTI EKGAKKKITN VLEFQGISIL DRINYRKDKL NFLLEKGYKD IELIIELPKY SLFELSDGSR RMLASILSTN NKRGEIHKGN QIFLSQKFVK LLYHAKRISN TINENHRKYV ENHKKEFEEL FYYILEFNEN YVGAKKNGKL LNSAFQSWQN HSIDELCSSF IGPTGSERKG LFELTSRGSA ADFEFLGVKI PRYRDYTPSS LLKDATLIHQ SVTGLYETRI DLAKLGEG WP_00929301 MKRILGLDLG TNSIGWALVN EAENKDERSS IVKLGVRVNP LTVDELTNFE (SEQ 0.1 KGKSITTNAD RTLKRGMRRN LQRYKLRRET LTEVLKEHKL ITEDTILSEN ID GNRTTFETYR LRAKAVTEEI SLEEFARVLL MINKKRGYKS SRKAKGVEEG TLIDGMDIAR ELYNNNLTPG ELCLQLLDAG KKFLPDFYRS DLQNELDR NO: Bacteroides IW EKQKEYYPEI LTDVLKEELR GKKRDAVWAI CAKYFVWKEN YTEWNKEKGK 49) fragilis NCTC TEQQEREHKL EGIYSKRKRD EAKRENLQWR VNGLKEKLSL EQLVIVFQEM 9343 Cas9 NTQINNSSGY LGAISDRSKE LYFNKQTVGQ YQMEMLDKNP NASLRNMVFY RQDYLDEFNM LWEKQAVYHK ELTEELKKEI RDIIIFYQRR LKSQKGLIGF CEFESRQIEV DIDGKKKIKT VGNRVISRSS PLFQEFKIWQ ILNNIEVTVV GKKRKRRKLK ENYSALFEEL NDAEQLELNG SRRLCQEEKE LLAQELFIRD KMTKSEVLKL LFDNPQELDL NFKTIDGNKT GYALFQAYSK MIEMSGHEPV DFKKPVEKVV EYIKAVFDLL NWNTDILGFN SNEELDNQPY YKLWHLLYSF EGDNTPTGNG RLIQKMTELY GFEKEYATIL ANVSFQDDYG SLSAKAIHKI LPHLKEGNRY DVACVYAGYR HSESSLTREE IANKVLKDRL MLLPKNSLHN PVVEKILNQM VNVINVIIDI YGKPDEIRVE LARELKKNAK EREELTKSIATable 4- Cas9 orthologsQTTKAHEEYK TLLQTEFGLT NVSRTDILRY KLYKELESCG YKTLYSNTYI SREKLFSKEF DIEHIIPQAR LFDDSFSNKT LEARSVNIEK GNKTAYDFVK EKFGESGADN SLEHYLNNIE DLFKSGKISK TKYNKLKMAE QDIPDGFIER DLRNTQYIAK KALSMLNEIS HRVVATSGSV TDKLREDWQL IDVMKELNWE KYKALGLVEY FEDRDGRQIG RIKDWTKRND HRHHAMDALT VAFTKDVFIQ YFNNKNASLD PNANEHAIKN KYFQNGRAIA PMPLREFRAE AKKHLENTLI SIKAKNKVIT GNINKTRKKG GVNKNMQQTP RGQLHLETIY GSGKQYLTKE EKVNASFDMR KIGTVSKSAY RDALLKRLYE NDNDPKKAFA GKNSLDKQPI WLDKEQMRKV PEKVKIVTLE AIYTIRKEIS PDLKVDKVID VGVRKILIDR LNEYGNDAKK AFSNLDKNPI WLNKEKGISI KRVTISGISN AQSLHVKKDK DGKPILDENG RNIPVDFVNT GNNHHVAVYY RPVIDKRGQL VVDEAGNPKY ELEEVVVSFF EAVTRANLGL PIIDKDYKTT EGWQFLFSMK QNEYFVFPNE KTGFNPKEID LLDVENYGLI SPNLFRVQKF SLKNYVFRHH LETTIKDTSS ILRGITWIDF RSSKGLDTIV KVRVNHIGQI VSVGEY AOL40912.1 METQTSNQLI TSHLKDYPKQ DYFVGLDIGT NSVGWAVTNT SYELLKFHSH (SEQ KMWGSRLFEE GESAVTRRGF RSMRRRLERR KLRLKLLEEL FADAMAQVDS Veillonella ID TFFIRLHESK YHYEDKTTGH SSKHILFIDE DYTDQDYFTE YPTIYHLRKD atypica ACS- LMENGTDDIR KLFLAVHHIL KYRGNFLYEG ATFNSNAFTF EDVLKQALVN NO: 134-V-Col7a ITFNCFDTNS AISSISNILM ESGKTKSDKA KAIERLVDTY TVFDEVNTPD 50) KPQKEQVKED KKTLKAFANL VLGLSANLID LFGSVEDIDD DLKKLQIVGD TYDEKRDELA KVWGDEIHII DDCKSVYDAI ILMSIKEPGL TISQSKVKAF DKHKEDLVIL KSLLKLDRNV YNEMFKSDKK GLHNYVHYIK QGRTEETSCS REDFYKYTKK IVEGLADSKD KEYILNEIEL QTLLPLQRIK DNGVIPYQLH LEELKVILDK CGPKFPFLHT VSDGFSVTEK LIKMLEFRIP YYVGPLNTHH NIDNGGFSWA VRKQAGRVTP WNFEEKIDRE KSAAAFIKNL TNKCTYLFGE DVLPKSSLLY SEFMLLNELN NVRIDGKALA QGVKQHLIDS IFKQDHKKMT KNRIELFLKD NNYITKKHKP EITGLDGEIK NDLTSYRDMV RILGNNFDVS MAEDIITDIT IFGESKKMLR QTLRNKFGSQ LNDETIKKLS KLRYRDWGRL SKKLLKGIDG CDKAGNGAPK TIIELMRNDS YNLMEILGDK FSFMECIEEE NAKLAQGQVV NPHDIIDELA LSPAVKRAVW QALRIVDEVA HIKKALPSRI FVEVARTNKS EKKKKDSRQK RLSDLYSAIK KDDVLQSGLQ DKEFGALKSG LANYDDAALR SKKLYLYYTQ MGRCAYTGNI IDLNQLNTDN YDIDHIYPRS LTKDDSFDNL VLCERTANAK KSDIYPIDNR IQTKQKPFWA FLKHQGLISE RKYERLTRIA PLTADDLSGF IARQLVETNQ SVKATTTLLR RLYPDIDVVF VKAENVSDFR HNNNFIKVRS LNHHHHAKDA YLNIVVGNVY HEKFTRNFRL FFKKNGANRT YNLAKMFNYD VICTNAQDGK AWDVKTSMNT VKKMMASNDV RVTRRLLEQS GALADATIYK ASVAAKAKDG AYIGMKTKYS VFADVTKYGG MTKIKNAYSI IVQYTGKKGE EIKEIVPLPI YLINRNATDI ELIDYVKSVI PKAKDISIKY RKLCINQLVK VNGFYYYLGG KTNDKIYIDN AIELVVPHDI ATYIKLLDKY DLLRKENKTL KASSITTSIY NINTSTVVSL SNKVGIDVFD YFMSKLRTPL YMKMKGNKVD ELSSTGRSKF IKMTLEEQSI YLLEVLNLLT NSKTTFDVKP LGITGSRSTI GVKIHNLDEF KIINESITGL YSNEVTIV WP_01338902 MKYSIGLDIG IASVGWSVIN KDKERIEDMG VRIFQKAENP KDGSSLASSR (SEQ 6.1 REKRGSRRRN RRKKHRLDRI KNILCESGLV KKNEIEKIYK NAYLKSPWEL ID RAKSLEAKIS NKEIAQILLH IAKRRGFKSF RKTDRNADDT GKLLSGIQEN KKIMEEKGYL TIGDMVAKDP KFNTHVRNKA GSYLFSFSRK L NO: Ilyobacter LEDEVRKIQ AKQKELGNTH FTDDVLEKYI EVFNSQRNFD EGPSKPSPYY SEIGQIAKMI 51) polytropus GNCTFESSEK RTAKNTWSGE RFVFLQKLNN FRIVGLSGKR PLTEEERDIV DSM 2926 EKEVYLKKEV RYEKLRKILY LKEEERFGDL NYSKDEKQDK KTEKTKFISL IGNYTIKKLN LSEKLKSEIE EDKSKLDKII EILTFNKSDK TIESNLKKLE LSREDIEILL SEEFSGTLNL SLKAIKKILP YLEKGLSYNE ACEKADYDYK NNGIKFKRGE LLPVVDKDLI ANPVVLRAIS QTRKVVNAII RKYGTPHTIHTable 4- Cas9 orthologsVEVARDLAKS YDDRQTIIKE NKKRELENEK TKKFISEEFG IKNVKGKLLL KYRLYQEQEG RCAYSRKELS LSEVILDESM TDIDHIIPYS RSMDDSYSNK VLVLSGENRK KSNLLPKEYF DRQGRDWDTF VLNVKAMKIH PRKKSNLLKE KFTREDNKDW KSRALNDTRY ISRFVANYLE NALEYRDDSP KKRVFMIPGQ LTAQLRARWR LNKVRENGDL HHALDAAVVA VTDQKAINNI SNISRYKELK NCKDVIPSIE YHADEETGEV YFEEVKDTRF PMPWSGFDLE LQKRLESENP REEFYNLLSD KRYLGWFNYE EGFIEKLRPV FVSRMPNRGV KGQAHQETIR SSKKISNQIA VSKKPLNSIK LKDLEKMQGR DTDRKLYEAL KNRLEEYDDK PEKAFAEPFY KPTNSGKRGP LVRGIKVEEK QNVGVYVNGG QASNGSMVRI DVFRKNGKFY TVPIYVHQTL LKELPNRAIN GKPYKDWDLI DGSFEFLYSF YPNDLIEIEF GKSKSIKNDN KLTKTEIPEV NLSEVLGYYR GMDTSTGAAT IDTQDGKIQM RIGIKTVKNI KKYQVDVLGN VYKVKREKRQ TF WP_00586426 MKKIVGLDLG TNSIGWALIN AYINKEHLYG IEACGSRIIP MDAAILGNFD (SEQ 3.1 KGNSISQTAD RTSYRGIRRL RERHLLRRER LHRILDLLGF LPKHYSDSLN ID RYGKFLNDIE CKLPWVKDET GSYKFIFQES FKEMLANFTE HHPILIANNK rabacteroide KVPYDWTIYY NO: Pa LRKKALTQKI SKEELAWILL NFNQKRGYYQ LRGEEEETPN KLVEYYSLKV EKVEDSGERK GKDTWYNVHL ENGMIYRRTS NIPLDWEGKT 52) s sp.20_3 KEFIVTTDLE ADGSPKKDKE GNIKRSFRAP KDDDWTLIKK KTEADIDKIK MTVGAYIYDT LLQKPDQKIR GKLVRTIERK YYKNELYQIL KTQSEFHEEL RDKQLYIACL NELYPNNEPR RNSISTRDFC HLFIEDIIFY QRPLKSKKSL IDNCPYEENR YIDKESGEIK HASIKCIAKS HPLYQEFRLW QFIVNLRIYR KETDVDVTQE LLPTEADYVT LFEWLNEKKE IDQKAFFKYP PFGFKKTTSN YRWNYVEDKP YPCNETHAQI IARLGKAHIP KAFLSKEKEE TLWHILYSIE DKQEIEKALH SFANKNNLSE EFIEQFKNFP PFKKEYGSYS AKAIKKLLPL MRMGKYWSIE NIDNGTRIRI NKIIDGEYDE NIRERVRQKA INLTDITHFR ALPLWLACYL VYDRHSEVKD IVKWKTPKDI DLYLKSFKQH SLRNPIVEQV ITETLRTVRD IWQQVGHIDE IHIELGREMK NPADKRARMS QQMIKNENTN LRIKALLTEF LNPEFGIENV RPYSPSQQDL LRIYEEGVLN SILELPEDIG IILGKFNQTD TLKRPTRSEI LRYKLWLEQK YRSPYTGEMI PLSKLFTPAY EIEHIIPQSR YFDDSLSNKV ICESEINKLK DRSLGYEFIK NHHGEKVELA FDKPVEVLSV EAYEKLVHES YSHNRSKMKK LLMEDIPDQF IERQLNDSRY ISKVVKSLLS NIVREENEQE AISKNVIPCT GGITDRLKKD WGINDVWNKI VLPRFIRLNE LTESTRFTSI NTNNTMIPSM PLELQKGFNK KRIDHRHHAM DAIIIACANR NIVNYLNNVS ASKNTKITRR DLQTLLCHKD KTDNNGNYKW VIDKPWETFT QDTLTALQKI TVSFKQNLRV INKTTNHYQH YENGKKIVSN QSKGDSWAIR KSMHKETVHG EVNLRMIKTV SFNEALKKPQ AIVEMDLKKK ILAMLELGYD TKRIKNYFEE NKDTWQDINP SKIKVYYFTK ETKDRYFAVR KPIDTSFDKK KIKESITDTG IQQIMLRHLE TKDNDPTLAF SPDGIDEMNR NILILNKGKK HQPIYKVRVY EKAEKFTVGQ KGNKRTKFVE AAKGTNLFFA IYETEEIDKD TKKVIRKRSY STIPLNVVIE RQKQGLSSAP EDENGNLPKY ILSPNDLVYV PTQEEINKGE VVMPIDRDRI YKMVDSSGIT ANFIPASTAN LIFALPKATA EIYCNGENCI QNEYGIGSPQ SKNQKAITGE MVKEICFPIK VDRLGNIIQV GSCILTN GAP01010.1 MVYDVGLDIG TGSVGWVALD ENGKLARAKG KNLVGVRLFD TAQTAADRRG (SEQ FRTTRRRLSR RKWRLRLLDE LFSAEINEID SSFFQRLKYS YVHPKDEENK ID Fructobacillus AHYYGGYLFP TEEETKKFHR SYPTIYHLRQ ELMAQPNKRF DIREIYLAIH HLVKYRGHFL SSQEKITIGS TYNPED NO: fructosus LANA IEVYADEKGL SWELNNPEQL TEIISGEAGY GLNKSMKADE ALKLFEFDNN QDKVAIKTLL AGLTGNQIDF 53) KCTC 3544 AKLFGKDISD KDEAKLWKLK LDDEALEEKS QTILSQLTDE EIELFHAVVQ AYDGFVLIGL LNGADSVSAA MVQLYDQHRE DRKLLKSLAQ KAGLKHKRFS EIYEQLALAT DEATIKNGIS TARELVEESN LSKEVKEDTL RRLDENEFLP KQRTKANSVI PHQLHLAELQ KILQNQGQYY PFLLDTFEKE DGQDNKIEELTable 4- Cas9 orthologsLRFRIPYYVG PLVTKKDVEH AGGDADNHWV ERNEGFEKSR VTPWNFDKVF NRDKAARDFI ERLTGNDTYL IGEKTLPQNS LRYQLFTVLN ELNNVRVNGK KFDSKTKADL INDLFKARKT VSLSALKDYL KAQGKGDVTI TGLADESKFN SSLSSYNDLK KTFDAEYLEN EDNQETLEKI IEIQTVFEDS KIASRELSKL PLDDDQVKKL SQTHYTGWGR LSEKLLDSKI IDERGQKVSI LDKLKSTSQN FMSIINNDKY GVQAWITEQN TGSSKLTFDE KVNELTTSPA NKRGIKQSFA VLNDIKKAMK EEPRRVYLEF AREDQTSVRS VPRYNQLKEK YQSKSLSEEA KVLKKTLDGN KNKMSDDRYF LYFQQQGKDM YTGRPINFER LSQDYDIDHI IPQAFTKDDS LDNRVLVSRP ENARKSDSFA YTDEVQKQDG SLWTSLLKSG FINRKKYERL TKAGKYLDGQ KTGFIARQLV ETRQIIKNVA SLIEGEYENS KAVAIRSEIT ADMRLLVGIK KHREINSFHH AFDALLITAA GQYMQNRYPD RDSTNVYNEF DRYTNDYLKN LRQLSSRDEV RRLKSFGFVV GTMRKGNEDW SEENTSYLRK VMMFKNILTT KKTEKDRGPL NKETIFSPKS GKKLIPLNSK RSDTALYGGY SNVYSAYMTL VRANGKNLLI KIPISIANQI EVGNLKINDY IVNNPAIKKF EKILISKLPL GQLVNEDGNL IYLASNEYRH NAKQLWLSTT DADKIASISE NSSDEELLEA YDILTSENVK NRFPFFKKDI DKLSQVRDEF LDSDKRIAVI QTILRGLQID AAYQAPVKII SKKVSDWHKL QQSGGIKLSD NSEMIYQSAT GIFETRVKIS DLL Bacillus MNYKMGLDIG IASVGWAVIN LDLKRIEDLG VRIFDKAEHP QNGESLALPR (SEQ smithii RIARSARRRL RRRKHRLERI RRLLVSENVL TKEEMNLLFK QKKQIDVWQL ID RVDALERKLN NDELARVLLH LAKRRGFKSN RKSERNSKES SEFLKNIEEN QSILAQYRSV GEMIVKDSK NO: WP_00335419 F AYHKRNKLDS YSNMIARDDL EREIKLIFEK QREFNNPVCT ERLEEKYLNI WSSQRPFASK EDIEKKVGFC TFEPKEKRAP 54) 6.1 KATYTFQSFI VWEHINKLRL VSPDETRALT EIERNLLYKQ AFSKNKMTYY DIRKLLNLSD DIHFKGLLYD PKSSLKQIEN IRFLELDSYH KIRKCIENVY GKDGIRMFNE TDIDTFGYAL TIFKDDEDIV AYLQNEYITK NGKRVSNLAN KVYDKSLIDE LLNLSFSKFA HLSMKAIRNI LPYMEQGEIY SKACELAGYN FTGPKKKEKA LLLPVIPNIA NPVVMRALTQ SRKVVNAIIK KYGSPVSIHI ELARDLSHSF DERKKIQKDQ TENRKKNETA IKQLIEYELT KNPTGLDIVK FKLWSEQQGR CMYSLKPIEL ERLLEPGYVE VDHILPYSRS LDDSYANKVL VLTKENREKG NHTPVEYLGL GSERWKKFEK FVLANKQFSK KKKQNLLRLR YEETEEKEFK ERNLNDTRYI SKFFANFIKE HLKFADGDGG QKVYTINGKI TAHLRSRWDF NKNREESDLH HAVDAVIVAC ATQGMIKKIT EFYKAREQNK ESAKKKEPIF PQPWPHFADE LKARLSKFPQ ESIEAFALGN YDRKKLESLR PVFVSRMPKR SVTGAAHQET LRRCVGIDEQ SGKIQTAVKT KLSDIKLDKD GHFPMYQKES DPRTYEAIRQ RLLEHNNDPK KAFQEPLYKP KKNGEPGPVI RTVKIIDTKN KVVHLDGSKT VAYNSNIVRT DVFEKDGKYY CVPVYTMDIM KGTLPNKAIE ANKPYSEWKE MTEEYTFQFS LFPNDLVRIV LPREKTIKTS TNEEIIIKDI FAYYKTIDSA TGGLELISHD RNFSLRGVGS KTLKRFEKYQ VDVLGNIHKV KGEKRVGLAA PTNQKKGKTV DSLQSVSD Mycoplasma MEKKRKVTLG FDLGIASVGW AIVDSETNQV YKLGSRLFDA PDTNLERRTQ (SEQ RGTRRLLRRR KYRNQKFYNL VKRTEVFGLS SREAIENRFR ELSIKYPNII canis PG 14 ID ELKTKALSQE VCPDEIAWIL HDYLKNRGYF YDEKETKEDF DQQTVESMPS EIE39736.1 YKLNEFYKKY GYFKGALSQP TESEMKDNKD LKEAFFFDFS NKEWLKEINY NO: FFNVQKNILS ETFIEEFKKI FSFTRDISKG PGSDNMP 55) WP_00479473 SPY GIFGEFGDNG QGGRYEHIWD KNIGKCSIFT NEQRAPKYLP SALIFNFLNE LANIRLYSTD 0.1 KKNIQPLWKL SSVDKLNILL NLFNLPISEK KKKLTSTNIN DIVKKESIKS IMISVEDIDM IKDEWAGKEP NVYGVGLSGL NIEESAKENK FKFQDLKILN VLINLLDNVG IKFEFKDRND IIKNLELLDN LYLFLIYQKE SNNKDSSIDL FIAKNESLNI ENLKLKLKEF LLGAGNEFEN HNSKTHSLSK KAIDEILPKL LDNNEGWNLE AIKNYDEEIK SQIEDNSSLM AKQDKKYLND NFLKDAILPP NVKVTFQQAI LIFNKIIQKF SKDFEIDKVV IELAREMTQD QENDALKGIATable 4- Cas9 orthologsKAQKSKKSLV EERLEANNID KSVFNDKYEK LIYKIFLWIS QDFKDPYTGA QISVNEIVNN KVEIDHIIPY SLCFDDSSAN KVLVHKQSNQ EKSNSLPYEY IKQGHSGWNW DEFTKYVKRV FVNNVDSILS KKERLKKSEN LLTASYDGYD KLGFLARNLN DTRYATILFR DQLNNYAEHH LIDNKKMFKV IAMNGAVTSF IRKNMSYDNK LRLKDRSDFS HHAYDAAIIA LFSNKTKTLY NLIDPSLNGI ISKRSEGYWV IEDRYTGEIK ELKKEDWTSI KNNVQARKIA KEIEEYLIDL DDEVFFSRKT KRKTNRQLYN ETIYGIATKT DEDGITNYYK KEKFSILDDK DIYLRLLRER EKFVINQSNP EVIDQIIEII ESYGKENNIP SRDEAINIKY TKNKINYNLY LKQYMRSLTK SLDQFSEEFI NQMIANKTFV LYNPTKNTTR KIKFLRLVND VKINDIRKNQ VINKFNGKNN EPKAFYENIN SLGAIVFKNS ANNFKTLSIN TQIAIFGDKN WDIEDFKTYN MEKIEKYKEI YGIDKTYNFH SFIFPGTILL DKQNKEFYYI SSIQTVRDII EIKFLNKIEF KDENKNQDTS KTPKRLMFGI KSIMNNYEQV DISPFGINKK IFE Odoribacter METTLGIDLG TNSIGLALVD QEEHQILYSG VRIFPEGINK DTIGLGEKEE (SEQ laneus YIT SRNATRRAKR QMRRQYFRKK LRKAKLLELL IAYDMCPLKP EDVRRWKNWD ID KQQKSTVRQF PDTPAFREWL KQNPYELRKQ AVTEDVTRPE LGRILYQMIQ RRGFLSSRKG KE NO: EHP49880.1 EGKIFTGK DRMVGIDETR KNLQKQTLGA YLYDIAPKNG EKYRFRTERV RARYTLRDMY IREFEIIWQR QAGHLGLAHE QATRKKNIFL 56) EGSATNVRNS KLITHLQAKY GRGHVLIEDT RITVTFQLPL KEVLGGKIEI EEEQLKFKSN ESVLFWQRPL RSQKSLLSKC VFEGRNFYDP VHQKWIIAGP TPAPLSHPEF EEFRAYQFIN NIIYGKNEHL TAIQREAVFE LMCTESKDFN FEKIPKHLKL FEKFNFDDTT KVPACTTISQ LRKLFPHPVW EEKREEIWHC FYFYDDNTLL FEKLQKDYAL QTNDLEKIKK IRLSESYGNV SLKAIRRINP YLKKGYAYST AVLLGGIRNS FGKRFEYFKE YEPEIEKAVC RILKEKNAEG EVIRKIKDYL VHNRFGFAKN DRAFQKLYHH SQAITTQAQK ERLPETGNLR NPIVQQGLNE LRRTVNKLLA TCREKYGPSF KFDHIHVEMG RELRSSKTER EKQSRQIREN EKKNEAAKVK LAEYGLKAYR DNIQKYLLYK EIEEKGGTVC CPYTGKTLNI SHTLGSDNSV QIEHIIPYSI SLDDSLANKT LCDATFNREK GELTPYDFYQ KDPSPEKWGA SSWEEIEDRA FRLLPYAKAQ RFIRRKPQES NEFISRQLND TRYISKKAVE YLSAICSDVK AFPGQLTAEL RHLWGLNNIL QSAPDITFPL PVSATENHRE YYVITNEQNE VIRLFPKQGE TPRTEKGELL LTGEVERKVF RCKGMQEFQT DVSDGKYWRR IKLSSSVTWS PLFAPKPISA DGQIVLKGRI EKGVFVCNQL KQKLKTGLPD GSYWISLPVI SQTFKEGESV NNSKLTSQQV QLFGRVREGI FRCHNYQCPA SGADGNFWCT LDTDTAQPAF TPIKNAPPGV GGGQIILTGD VDDKGIFHAD DDLHYELPAS LPKGKYYGIF TVESCDPTLI PIELSAPKTS KGENLIEGNI WVDEHTGEVR FDPKKNREDQ RHHAIDAIVI ALSSQSLFQR LSTYNARREN KKRGLDSTEH FPSPWPGFAQ DVRQSVVPLL VSYKQNPKTL CKISKTLYKD GKKIHSCGNA VRGQLHKETV YGQRTAPGAT EKSYHIRKDI RELKTSKHIG KVVDITIRQM LLKHLQENYH IDITQEFNIP SNAFFKEGVY RIFLPNKHGE PVPIKKIRMK EELGNAERLK DNINQYVNPR NNHHVMIYQD ADGNLKEEIV SFWSVIERQN QGQPIYQLPR EGRNIVSILQ INDTFLIGLK EEEPEVYRND LSTLSKHLYR VQKLSGMYYT FRHHLASTLN NEREEFRIQS LEAWKRANPV KVQIDEIGRI TFLNGPLC Akkermansia MSRSLTFSFD IGYASIGWAV IASASHDDAD PSVCGCGTVL FPKDDCQAFK (SEQ muciniphila RREYRRLRRN IRSRRVRIER IGRLLVQAQI ITPEMKETSG HPAPFYLASE ID ATCC BAA- ALKGHRTLAP IELWHVLRWY AHNRGYDNNA SWSNSLSEDG GNGEDTERVK HAQDLMDKHG TATMAETICR ELKLEEGKAD APMEVSTPAY KNLNTAFPRL NO: 835 IVEKEVRRIL ELSAPLIPGL TAEIIELIAQ HHPLTTEQRG VLLQHGIKLA 57) RRYRGSLLFG QLIPRFDNRI ISRCPVTWAQ VYEAELKKGN SEQSARERAE WP_01242103 KLSKVPTANC PEFYEYRMAR ILCNIRADGE PLSAEIRREL MNQARQEGKL 4.1 TKASLEKAIS SRLGKETETN VSNYFTLHPD SEEALYLNPA VEVLQRSGIG QILSPSVYRI AANRLRRGKS VTPNYLLNLL KSRGESGEAL EKKIEKESKKTable 4- Cas9 orthologsKEADYADTPL KPKYATGRAP YARTVLKKVV EEILDGEDPT RPARGEAHPD GELKAHDGCL YCLLDTDSSV NQHQKERRLD TMTNNHLVRH RMLILDRLLK DLIQDFADGQ KDRISRVCVE VGKELTTFSA MDSKKIQREL TLRQKSHTDA VNRLKRKLPG KALSANLIRK CRIAMDMNWT CPFTGATYGD HELENLELEH IVPHSFRQSN ALSSLVLTWP GVNRMKGQRT GYDFVEQEQE NPVPDKPNLH ICSLNNYREL VEKLDDKKGH EDDRRRKKKR KALLMVRGLS HKHQSQNHEA MKEIGMTEGM MTQSSHLMKL ACKSIKTSLP DAHIDMIPGA VTAEVRKAWD VFGVFKELCP EAADPDSGKI LKENLRSLTH LHHALDACVL GLIPYIIPAH HNGLLRRVLA MRRIPEKLIP QVRPVANQRH YVLNDDGRMM LRDLSASLKE NIREQLMEQR VIQHVPADMG GALLKETMQR VLSVDGSGED AMVSLSKKKD GKKEKNQVKA SKLVGVFPEG PSKLKALKAA IEIDGNYGVA LDPKPVVIRH IKVFKRIMAL KEQNGGKPVR ILKKGMLIHL TSSKDPKHAG VWRIESIQDS KGGVKLDLQR AHCAVPKNKT HECNWREVDL ISLLKKYQMK RYPTSYTGTP R Dinoroseobact MRLGLDIGTS SIGWWLYETD GAGSDARITG VVDGGVRIFS DGRDPKSGAS (SEQ er shibae DFL LAVDRRAARA MRRRRDRYLR RRATLMKVLA ETGLMPADPA EAKALEALDP ID 12 = DSM FALRAAGLDE PLPLPHLGRA LFHLNQRRGF KSNRKTDRGD NESGKIKDAT ARLDMEMMAN GARTYGEFLH KRRQKATDPR HVPSVRTRLS IANRGGPDGK NO: 16493 EEAGYDFYPD RRHLEEEFHK LWAAQGAHHP ELTETLRDLL FEKIFFQRPL 58) KEPEVGLCLF SGHHGVPPKD PRLPKAHPLT QRRVLYETVN QLRVTADGRE WP_01217707 ARPLTREERD QVIHALDNKK PTKSLSSMVL KLPALAKVLK LRDGERFTLE 9.1 TGVRDAIACD PLRASPAHPD RFGPRWSILD ADAQWEVISR IRRVQSDAEH AALVDWLTEA HGLDRAHAEA TAHAPLPDGY GRLGLTATTR ILYQLTADVV TYADAVKACG WHHSDGRTGE CFDRLPYYGE VLERHVIPGS YHPDDDDITR FGRITNPTVH IGLNQLRRLV NRIIETHGKP HQIVVELARD LKKSEEQKRA DIKRIRDTTE AAKKRSEKLE ELEIEDNGRN RMLLRLWEDL NPDDAMRRFC PYTGTRISAA MIFDGSCDVD HILPYSRTLD DSFPNRTLCL REANRQKRNQ TPWQAWGDTP HWHAIAANLK NLPENKRWRF APDAMTRFEG ENGFLDRALK DTQYLARISR SYLDTLFTKG GHVWVVPGRF TEMLRRHWGL NSLLSDAGRG AVKAKNRTDH RHHAIDAAVI AATDPGLLNR ISRAAGQGEA AGQSAELIAR DTPPPWEGFR DDLRVRLDRI IVSHRADHGR IDHAARKQGR DSTAGQLHQE TAYSIVDDIH VASRTDLLSL KPAQLLDEPG RSGQVRDPQL RKALRVATGG KTGKDFENAL RYFASKPGPY QAIRRVRIIK PLQAQARVPV PAQDPIKAYQ GGSNHLFEIW RLPDGEIEAQ VITSFEAHTL EGEKRPHPAA KRLLRVHKGD MVALERDGRR VVGHVQKMDI ANGLFIVPHN EANADTRNND KSDPFKWIQI GARPAIASGI RRVSVDEIGR LRDGGTRPI Wolinella MIERILGVDL GISSLGWAIV EYDKDDEAAN RIIDCGVRLF TAAETPKKKE (SEQ succinogenes SPNKARREAR GIRRVLNRRR VRMNMIKKLF LRAGLIQDVD LDGEGGMFYS ID DSM 1740 KANRADVWEL RHDGLYRLLK GDELARVLIH IAKHRGYKFI GDDEADEESG KVKKAGVVLR QNFEAAGCRT VGEWLWRERG ANGKKRNKHG DYEISIHRDL NO: LVEEVEAIFV AQQEMRSTIA TDALKAAYRE IAFFVRPMQR IEKMVGHCTY 59) WP_01113928 FPEERRAPKS APTAEKFIAI SKFFSTVIID NEGWEQKIIE RKTLEELLDF 9.1 AVSREKVEFR HLRKFLDLSD NEIFKGLHYK GKPKTAKKRE ATLFDPNEPT ELEFDKVEAE KKAWISLRGA AKLREALGNE FYGRFVALGK HADEATKILT YYKDEGQKRR ELTKLPLEAE MVERLVKIGF SDFLKLSLKA IRDILPAMES GARYDEAVLM LGVPHKEKSA ILPPLNKTDI DILNPTVIRA FAQFRKVANA LVRKYGAFDR VHFELAREIN TKGEIEDIKE SQRKNEKERK EAADWIAETS FQVPLTRKNI LKKRLYIQQD GRCAYTGDVI ELERLFDEGY CEIDHILPRS RSADDSFANK VLCLARANQQ KTDRTPYEWF GHDAARWNAF ETRTSAPSNR VRTGKGKIDR LLKKNFDENS EMAFKDRNLN DTRYMARAIK TYCEQYWVFK NSHTKAPVQV RSGKLTSVLR YQWGLESKDR ESHTHHAVDA IIIAFSTQGM VQKLSEYYRF KETHREKERP KLAVPLANFR DAVEEATRIE NTETVKEGVETable 4- Cas9 orthologsVKRLLISRPP RARVTGQAHE QTAKPYPRIK QVKNKKKWRL APIDEEKFES FKADRVASAN QKNFYETSTI PRVDVYHKKG KFHLVPIYLH EMVLNELPNL SLGTNPEAMD ENFFKFSIFK DDLISIQTQG TPKKPAKIIM GYFKNMHGAN MVLSSINNSP CEGFTCTPVS MDKKHKDKCK LCPEENRIAG RCLQGFLDYW SQEGLRPPRK EFECDQGVKF ALDVKKYQID PLGYYYEVKQ EKRLGTIPQM RSAKKLVKK Parasutterella MGKTHIIGVG LDLGGTYTGT FITSHPSDEA EHRDHSSAFT VVNSEKLSFS (SEQ excrementiho SKSRTAVRHR VRSYKGFDLR RRLLLLVAEY QLLQKKQTLA PEERENLRIA ID minis YIT LSGYLKRRGY ARTEAETDTS VLESLDPSVF SSAPSFTNFF NDSEPLNIQW EAIANSPETT KALNKELSGQ KEADFKKYIK TSFPEYSAKE ILANYVEGRR NO: 11859 AILDASKYIA NLQSLGHKHR SKYLSDILQD MKRDSRITRL SEAFGSTDNL 60) WRIIGNISNL QERAVRWYFN DAKFEQGQEQ LDAVKLKNVL VRALKYLRSD WP_00886484 DKEWSASQKQ IIQSLEQSGD VLDVLAGLDP DRTIPPYEDQ NNRRPPEDQT 3.1 LYLNPKALSS EYGEKWKSWA NKFAGAYPLL TEDLTEILKN TDRKSRIKIR SDVLPDSDYR LAYILQRAFD RSIALDECSI RRTAEDFENG VVIKNEKLED VLSGHQLEEF LEFANRYYQE TAKAKNGLWF PENALLERAD LHPPMKNKIL NVIVGQALGV SPAEGTDFIE EIWNSKVKGR STVRSICNAI ENERKTYGPY FSEDYKFVKT ALKEGKTEKE LSKKFAAVIK VLKMVSEVVP FIGKELRLSD EAQSKFDNLY SLAQLYNLIE TERNGFSKVS LAAHLENAWR MTMTDGSAQC CRLPADCVRP FDGFIRKAID RNSWEVAKRI AEEVKKSVDF TNGTVKIPVA IEANSFNFTA SLTDLKYIQL KEQKLKKKLE DIQRNEENQE KRWLSKEERI RADSHGICAY TGRPLDDVGE IDHIIPRSLT LKKSESIYNS EVNLIFVSAQ GNQEKKNNIY LLSNLAKNYL AAVFGTSDLS QITNEIESTV LQLKAAGRLG YFDLLSEKER ACARHALFLN SDSEARRAVI DVLGSRRKAS VNGTQAWFVR SIFSKVRQAL AAWTQETGNE LIFDAISVPA ADSSEMRKRF AEYRPEFRKP KVQPVASHSI DAMCIYLAAC SDPFKTKRMG SQLAIYEPIN FDNLFTGSCQ VIQNTPRNFS DKTNIANSPI FKETIYAERF LDIIVSRGEI FIGYPSNMPF EEKPNRISIG GKDPFSILSV LGAYLDKAPS SEKEKLTIYR VVKNKAFELF SKVAGSKFTA EEDKAAKILE ALHFVTVKQD VAATVSDLIK SKKELSKDSI ENLAKQKGCL KKVEYSSKEF KFKGSLIIPA AVEWGKVLWN VFKENTAEEL KDENALRKAL EAAWPSSFGT RNLHSKAKRV FSLPVVATQS GAVRIRRKTA FGDFVYQSQD TNNLYSSFPV KNGKLDWSSP IIHPALQNRN LTAYGYRFVD HDRSISMSEF REVYNKDDLM RIELAQGTSS RRYLRVEMPG EKFLAWFGEN SISLGSSFKF SVSEVFDNKI YTENAEFTKF LPKPREDNKH NGTIFFELVG PRVIFNYIVG GAASSLKEIF SEAGKERS Streptococcus MTKFNKNYSI GLDIGVSSVG YAVVTEDYRV PAFKFKVLGN TEKEKIKKNL (SEQ sanguinis IGSTTFVSAQ PAKGTRVFRV NRRRIDRRNH RITYLRDIFQ KEIEKVDKNF ID SK49 YRRLDESFRV LGDKSEDLQI KQPFFGDKEL ETAYHKKYPT IYHLRKHLAD ADKNSPVADI REVYMAISHI LKYRGHFLTL DKINPNNINM QNSWIDFIES NO: CQEVFDLEIS DESKNIADIF KSSENRQEKV KKILPYFQQE LLKKDKSIFK 61) WP_00293358 QLLQLLFGLK TKFKDCFELE EEPDLNFSKE NYDENLENFL GSLEEDFSDV 9.1 FAKLKVLRDT ILLSGMLTYT GATHARFSAT MVERYEEHRK DLQRFKFFIK QNLSEQDYLD IFGRKTQNGF DVDKETKGYV GYITNKMVLT NPQKQKTIQQ NFYDYISGKI TGIEGAEYFL NKISDGTFLR KLRTSDNGAI PNQIHAYELE KIIERQGKDY PFLLENKDKL LSILTFKIPY YVGPLAKGSN SRFAWIKRAT SSDILDDNDE DTRNGKIRPW NYQKLINMDE TRDAFITNLI GNDIILLNEK VLPKRSLIYE EVMLQNELTR VKYKDKYGKA HFFDSELRQN IINGLFKNNS KRVNAKSLIK YLSDNHKDLN AIEIVSGVEK GKSFNSTLKT YNDLKTIFSE ELLDSEIYQK ELEEIIKVIT VFDDKKSIKN YLTKFFGHLE ILDEEKINQL SKLRYSGWGR YSAKLLLDIR DEDTGFNLLQ FLRNDEENRN LTKLISDNTL SFEPKIKDIQ SKSTIEDDIF DEIKKLAGSP AIKRGILNSI KIVDELVQII GYPPHNIVIE MARENMTTEE GQKKAKTRKT KLESALKNIE NSLLENGKVPTable 4- Cas9 orthologsHSDEQLQSEK LYLYYLQNGK DMYTLDKTGS PAPLYLDQLD QYEVDHIIPY SFLPIDSIDN KVLTHRENNQ QKLNNIPDKE TVANMKPFWE KLYNAKLISQ TKYQRLTTSE RTPDGVLTES MKAGFIERQL VETRQIIKHV ARILDNRFSD TKIITLKSQL ITNFRNTFHI AKIRELNDYH HAHDAYLAVV VGQTLLKVYP KLAPELIYGH HAHFNRHEEN KATLRKHLYS NIMRFFNNPD SKVSKDIWDC NRDLPIIKDV IYNSQINFVK RTMIKKGAFY NQNPVGKFNK QLAANNRYPL KTKALCLDTS IYGGYGPMNS ALSIIIIAER FNEKKGKIET VKEFHDIFII DYEKFNNNPF QFLNDTSENG FLKKNNINRV LGFYRIPKYS LMQKIDGTRM LFESKSNLHK ATQFKLTKTQ NELFFHMKRL LTKSNLMDLK SKSAIKESQN FILKHKEEFD NISNQLSAFS QKMLGNTTSL KNLIKGYNER KIKEIDIRDE TIKYFYDNFI KMFSFVKSGA PKDINDFFDN KCTVARMRPK PDKKLLNATL IHQSITGLYE TRIDLSKLGE D Actinomyces MLHCIAVIRV PPSEEPGFFE THADSCALCH HGCMTYAAND KAIRYRVGID (SEQ sp. oral taxon VGLRSIGFCA VEVDDEDHPI RILNSVVHVH DAGTGGPGET ESLRKRSGVA ID 180 str. F0310 ARARRRGRAE KQRLKKLDVL LEELGWGVSS NELLDSHAPW HIRKRLVSEY IEDETERRQC LSVAMAHIAR HRGWRNSFSK VDTLLLEQAP SDRMQGLKER NO: VEDRTGLQFS EEVTQGELVA TLLEHDGDVT IRGFVRKGGK ATKVHGVLEG 62) AOL41039.1 KYMQSDLVAE LRQICRTQRV SETTFEKLVL SIFHSKEPAP SAARQRERVG LDELQLALDP AAKQPRAERA HPAFQKFKVV ATLANMRIRE QSAGERSLTS EELNRVARYL LNHTESESPT WDDVARKLEV PRHRLRGSSR ASLETGGGLT YPPVDDTTVR VMSAEVDWLA DWWDCANDES RGHMIDAISN GCGSEPDDVE DEEVNELISS ATAEDMLKLE LLAKKLPSGR VAYSLKTLRE VTAAILETGD DLSQAITRLY GVDPGWVPTP APIEAPVGNP SVDRVLKQVA RWLKFASKRW GVPQTVNIEH TREGLKSASL LEEERERWER FEARREIRQK EMYKRLGISG PFRRSDQVRY EILDLQDCAC LYCGNEINFQ TFEVDHIIPR VDASSDSRRT NLAAVCHSCN SAKGGLAFGQ WVKRGDCPSG VSLENAIKRV RSWSKDRLGL TEKAMGKRKS EVISRLKTEM PYEEFDGRSM ESVAWMAIEL KKRIEGYFNS DRPEGCAAVQ VNAYSGRLTA CARRAAHVDK RVRLIRLKGD DGHHKNRFDR RNHAMDALVI ALMTPAIART IAVREDRREA QQLTRAFESW KNFLGSEERM QDRWESWIGD VEYACDRLNE LIDADKIPVT ENLRLRNSGK LHADQPESLK KARRGSKRPR PQRYVLGDAL PADVINRVTD PGLWTALVRA PGFDSQLGLP ADLNRGLKLR GKRISADFPI DYFPTDSPAL AVQGGYVGLE FHHARLYRII GPKEKVKYAL LRVCAIDLCG IDCDDLFEVE LKPSSISMRT ADAKLKEAMG NGSAKQIGWL VLGDEIQIDP TKFPKQSIGK FLKECGPVSS WRVSALDTPS KITLKPRLLS NEPLLKTSRV GGHESDLVVA ECVEKIMKKT GWVVEINALC QSGLIRVIRR NALGEVRTSP KSGLPISLNL R Rhodovulum MGIRFAFDLG TNSIGWAVWR TGPGVFGEDT AASLDGSGVL IFKDGRNPKD (SEQ sp. PH10 GQSLATMRRV PRQSRKRRDR FVLRRRDLLA ALRKAGLFPV DVEEGRRLAA ID TDPYHLRAKA LDESLTPHEM GRVIFHLNQR RGFRSNRKAD RQDREKGKIA EGSKRLAETL AATNCRTLGE FLWSRHRGTP RTRSPTRIRM NO: WP_00838698 EGEGAKALYA FYPTREMVRA EFERLWTAQS RFAPDLLTPE RHEEIAGILF RQRDLAPPKI 63) 3.1 GCCTFEPSER RLPRALPSVE ARGIYERLAH LRITTGPVSD RGLTRPERDV LASALLAGKS LTFKAVRKTL KILPHALVNF EEAGEKGLDG ALTAKLLSKP DHYGAAWHGL SFAEKDTFVG KLLDEADEER LIRRLVTENR LSEDAARRCA SIPLADGYGR LGRTANTEIL AALVEETDET GTVVTYAEAV RRAGERTGRN WHHSDERDGV ILDRLPYYGE ILQRHVVPGS GEPEEKNEAA RWGRLANPTV HIGLNQLRKV VNRLIAAHGR PDQIVVELAR ELKLNREQKE RLDRENRKNR EENERRTAIL AEHGQRDTAE NKIRLRLFEE QARANAGIAL CPYTGRAIGI AELFTSEVEI DHILPVSLTL DDSLANRVLC RREANREKRR QTPFQAFGAT PAWNDIVARA AKLPPNKRWR FDPAALERFE REGGFLGRQL NETKYLSRLA KIYLGKICDP DRVYVTPGTL TGLLRARWGL NSILSDSNFK NRSDHRHHAV DAVVIGVLTR GMIQRIAHDA ARAEDQDLDR VFRDVPVPFE DFRDHVRERVTable 4- Cas9 orthologsSTITVAVKPE HGKGGALHED TSYGLVPDTD PNAALGNLVV RKPIRSLTAG EVDRVRDRAL RARLGALAAP FRDESGRVRD AKGLAQALEA FGAENGIRRV RILKPDASVV TIADRRTGVP YRAVAPGENH HVDIVQMRDG SWRGFAASVF EVNRPGWRPE WEVKKLGGKL VMRLHKGDMV ELSDKDGQRR VKVVQQIEIS ANRVRLSPHN DGGKLQDRHA DADDPFRWDL ATIPLLKDRG CVAVRVDPIG VVTLRRSNV Bifidobacteriu MSRKNYVDDY AISLDIGNAS VGWSAFTPNY RLVRAKGHEL IGVRLFDPAD (SEQ m bifidum S17 TAESRRMART TRRRYSRRRW RLRLLDALFD QALSEIDPSF LARRKYSWVH ID PDDENNADCW YGSVLFDSNE QDKRFYEKYP TIYHLRKALM EDDSQHDIRE IYLAIHHMVK YRGNFLVEGT LESSNA NO: WP_01336299 FKED ELLKLLGRIT RYEMSEGEQN SDIEQDDENK LVAPANGQLA DALCATRGSR SMRVDNALEA LSAVNDLSRE 64) 5.1 QRAIVKAIFA GLEGNKLDLA KIFVSKEFSS ENKKILGIYF NKSDYEEKCV QIVDSGLLDD EEREFLDRMQ GQYNAIALKQ LLGRSTSVSD SKCASYDAHR ANWNLIKLQL RTKENEKDIN ENYGILVGWK IDSGQRKSVR GESAYENMRK KANVFFKKMI ETSDLSETDK NRLIHDIEED KLFPIQRDSD NGVIPHQLHQ NELKQIIKKQ GKYYPFLLDA FEKDGKQINK IEGLLTFRVP YFVGPLVVPE DLQKSDNSEN HWMVRKKKGE ITPWNFDEMV DKDASGRKFI ERLVGTDSYL LGEPTLPKNS LLYQEYEVLN ELNNVRLSVR TGNHWNDKRR MRLGREEKTL LCQRLFMKGQ TVTKRTAENL LRKEYGRTYE LSGLSDESKF TSSLSTYGKM CRIFGEKYVN EHRDLMEKIV ELQTVFEDKE TLLHQLRQLE GISEADCALL VNTHYTGWGR LSRKLLTTKA GECKISDDFA PRKHSIIEIM RAEDRNLMEI ITDKQLGFSD WIEQENLGAE NGSSLMEVVD DLRVSPKVKR GIIQSIRLID DISKAVGKRP SRIFLELADD IQPSGRTISR KSRLQDLYRN ANLGKEFKGI ADELNACSDK DLQDDRLFLY YTQLGKDMYT GEELDLDRLS SAYDIDHIIP QAVTQNDSID NRVLVARAEN ARKTDSFTYM PQIADRMRNF WQILLDNGLI SRVKFERLTR QNEFSEREKE RFVQRSLVET RQIMKNVATL MRQRYGNSAA VIGLNAELTK EMHRYLGFSH KNRDINDYHH AQDALCVGIA GQFAANRGFF ADGEVSDGAQ NSYNQYLRDY LRGYREKLSA EDRKQGRAFG FIVGSMRSQD EQKRVNPRTG EVVWSEEDKD YLRKVMNYRK MLVTQKVGDD FGALYDETRY AATDPKGIKG IPFDGAKQDT SLYGGFSSAK PAYAVLIESK GKTRLVNVTM QEYSLLGDRP SDDELRKVLA KKKSEYAKAN ILLRHVPKMQ LIRYGGGLMV IKSAGELNNA QQLWLPYEEY CYFDDLSQGK GSLEKDDLKK LLDSILGSVQ CLYPWHRFTE EELADLHVAF DKLPEDEKKN VITGIVSALH ADAKTANLSI VGMTGSWRRM NNKSGYTFSD EDEFIFQSPS GLFEKRVTVG ELKRKAKKEV NSKYRTNEKR LPTLSGASQP Barnesiella MKNILGLDLG LSSIGWSVIR ENSEEQELVA MGSRVVSLTA AELSSFTQGN (SEQ intestinihomini GVSINSQRTQ KRTQRKGYDR YQLRRTLLRN KLDTLGMLPD DSLSYLPKLQ ID s YIT 11860 LWGLRAKAVT QRIELNELGR VLLHLNQKRG YKSIKSDFSG DKKITDYVKT VKTRYDELKE MRLTIGELFF RRLTENAFFR CKEQVYPRQA YVEEFDCIMN NO: CQRKFYPDIL TDETIRCIRD EIIYYQRPLK SCKYLVSRCE FEKRFYLNAA 65) WP_00886324 GKKTEAGPKV SPRTSPLFQV CRLWESINNI VVKDRRNEIV FISAEQRAAL 5.1 FDFLNTHEKL KGSDLLKLLG LSKTYGYRLG EQFKTGIQGN KTRVEIERAL GNYPDKKRLL QFNLQEESSS MVNTETGEII PMISLSFEQE PLYRLWHVLY SIDDREQLQS VLRQKFGIDD DEVLERLSAI DLVKAGFGNK SSKAIRRILP FLQLGMNYAE ACEAAGYNHS NNYTKAENEA RALLDRLPAI KKNELRQPVV EKILNQMVNV VNALMEKYGR FDEIRVELAR ELKQSKEERS NTYKSINKNQ RENEQIAKRI VEYGVPTRSR IQKYKMWEES KHCCIYCGQP VDVGDFLRGF DVEVEHIIPK SLYFDDSFAN KVCSCRSCNK EKNNRTAYDY MKSKGEKALS DYVERVNTMY TNNQISKTKW QNLLTPVDKI SIDFIDRQLR ESQYIARKAK EILTSICYNV TATSGSVTSF LRHVWGWDTV LHDLNFDRYK KVGLTEVIEV NHRGSVIRRE QIKDWSKRFD HRHHAIDALT IACTKQAYIQ RLNNLRAEEGTable 4- Cas9 orthologsPDFNKMSLER YIQSQPHFSV AQVREAVDRI LVSFRAGKRA VTPGKRYIRK NRKRISVQSV LIPRGALSEE SVYGVIHVWE KDEQGHVIQK QRAVMKYPIT SINREMLDKE KVVDKRIHRI LSGRLAQYND NPKEAFAKPV YIDKECRIPI RTVRCFAKPA INTLVPLKKD DKGNPVAWVN PGNNHHVAIY RDEDGKYKER TVTFWEAVDR CRVGIPAIVT QPDTIWDNIL QRNDISENVL ESLPDVKWQF VLSLQQNEMF ILGMNEEDYR YAMDQQDYAL LNKYLYRVQK LSKSDYSFRY HTETSVEDKY DGKPNLKLSM QMGKLKRVSI KSLLGLNPHK VHISVLGEIK EIS Aminomonas MIGEHVRGGC LFDDHWTPNW GAFRLPNTVR TFTKAENPKD GSSLAEPRRQ (SEQ paucivorans ARGLRRRLRR KTQRLEDLRR LLAKEGVLSL SDLETLFRET PAKDPYQLRA ID DSM 12260 EGLDRPLSFP EWVRVLYHIT KHRGFQSNRR NPVEDGQERS RQEEEGKLLS GVGENERLLR EGGYRTAGEM LARDPKFQDH RRNRAGDYSH TLSRSLLLEE NO: ARRLFQSQRT LGNPHASSNL EEAFLHLVAF QNPFASGEDI RNKAGHCSLE 66) WP_00629985 PDQIRAPRRS ASAETFMLLQ KTGNLRLIHR RTGEERPLTD KEREQIHLLA 0.1 WKQEKVTHKT LRRHLEIPEE WLFTGLPYHR SGDKAEEKLF VHLAGIHEIR KALDKGPDPA VWDTLRSRRD LLDSIADTLT FYKNEDEILP RLESLGLSPE NARALAPLSF SGTAHLSLSA LGKLLPHLEE GKSYTQARAD AGYAAPPPDR HPKLPPLEEA DWRNPVVFRA LTQTRKVVNA LVRRYGPPWC IHLETARELS QPAKVRRRIE TEQQANEKKK QQAEREFLDI VGTAPGPGDL LKMRLWREQG GFCPYCEEYL NPTRLAEPGY AEMDHILPYS RSLDNGWHNR VLVHGKDNRD KGNRTPFEAF GGDTARWDRL VAWVQASHLS APKKRNLLRE DFGEEAEREL KDRNLTDTRF ITKTAATLLR DRLTFHPEAP KDPVMTLNGR LTAFLRKQWG LHKNRKNGDL HHALDAAVLA VASRSFVYRL SSHNAAWGEL PRGREAENGF SLPYPAFRSE VLARLCPTRE EILLRLDQGG VGYDEAFRNG LRPVFVSRAP SRRLRGKAHM ETLRSPKWKD HPEGPRTASR IPLKDLNLEK LERMVGKDRD RKLYEALRER LAAFGGNGKK AFVAPFRKPC RSGEGPLVRS LRIFDSGYSG VELRDGGEVY AVADHESMVR VDVYAKKNRF YLVPVYVADV ARGIVKNRAI VAHKSEEEWD LVDGSFDFRF SLFPGDLVEI EKKDGAYLGY YKSCHRGDGR LLLDRHDRMP RESDCGTFYV STRKDVLSMS KYQVDPLGEI RLVGSEKPPF VL Ralstonia MAEKQHRWGL DIGTNSIGWA VIALIEGRPA GLVATGSRIF SDGRNPKDGS (SEQ syzygii R24 SLAVERRGPR QMRRRRDRYL RRRDRFMQAL INVGLMPGDA AARKALVTEN ID PYVLRQRGLD QALTLPEFGR ALFHLNQRRG FQSNRKTDRA TAKESGKVKN AIAAFRAGMG NARTVGEALA RRLEDGRPVR ARMVGQ NO: CCA84553.1 GKDE HYELYIAREW IAQEFDALWA SQQRFHAEVL ADAARDRLRA ILLFQRKLLP VPVGKCFLEP 67) NQPRVAAALP SAQRFRLMQE LNHLRVMTLA DKRERPLSFQ ERNDLLAQLV ARPKCGFDML RKIVFGANKE AYRFTIESER RKELKGCDTA AKLAKVNALG TRWQALSLDE QDRLVCLLLD GENDAVLADA LREHYGLTDA QIDTLLGLSF EDGHMRLGRS ALLRVLDALE SGRDEQGLPL SYDKAVVAAG YPAHTADLEN GERDALPYYG ELLWRYTQDA PTAKNDAERK FGKIANPTVH IGLNQLRKLV NALIQRYGKP AQIVVELARN LKAGLEEKER IKKQQTANLE RNERIRQKLQ DAGVPDNREN RLRMRLFEEL GQGNGLGTPC IYSGRQISLQ RLFSNDVQVD HILPFSKTLD DSFANKVLAQ HDANRYKGNR GPFEAFGANR DGYAWDDIRA RAAVLPRNKR NRFAETAMQD WLHNETDFLA RQLTDTAYLS RVARQYLTAI CSKDDVYVSP GRLTAMLRAK WGLNRVLDGV MEEQGRPAVK NRDDHRHHAI DAVVIGATDR AMLQQVATLA ARAREQDAER LIGDMPTPWP NFLEDVRAAV ARCVVSHKPD HGPEGGLHND TAYGIVAGPF EDGRYRVRHR VSLFDLKPGD LSNVRCDAPL QAELEPIFEQ DDARAREVAL TALAERYRQR KVWLEELMSV LPIRPRGEDG KTLPDSAPYK AYKGDSNYCY ELFINERGRW DGELISTFRA NQAAYRRFRN DPARFRRYTA GGRPLLMRLC INDYIAVGTA AERTIFRVVK MSENKITLAE HFEGGTLKQR DADKDDPFKY LTKSPGALRD LGARRIFVDL IGRVLDPGIK GDTable 4- Cas9 orthologsCatenibacteriu IVDYCIGLDL GTGSVGWAVV DMNHRLMKRN GKHLWGSRLF SNAETAANRR (SEQ m mitsuokai ASRSIRRRYN KRRERIRLLR AILQDMVLEK DPTFFIRLEH TSFLDEEDKA ID DSM 15897 KYLGTDYKDN YNLFIDEDFN DYTYYHKYPT IYHLRKALCE STEKADPRLI YLALHHIVKY RGNFLYEGQK FNMDASNIED KLSDIFTQFT SFNNIPYEDD NO: EKKNLEILEI LKKPLSKKAK VDEVMTLIAP EKDYKSAFKE LVTGIAGNKM 68) WP_00650669 NVTKMILCEP IKQGDSEIKL KFSDSNYDDQ FSEVEKDLGE YVEFVDALHN 6.1 VYSWVELQTI MGATHTDNAS ISEAMVSRYN KHHDDLKLLK DCIKNNVPNK YFDMFRNDSE KSKGYYNYIN RPSKAPVDEF YKYVKKCIEK VDTPEAKQIL NDIELENFLL KQNSRTNGSV PYQMQLDEMI KIIDNQAEYY PILKEKREQL LSILTFRIPY YFGPLNETSE HAWIKRLEGK ENQRILPWNY QDIVDVDATA EGFIKRMRSY CTYFPDEEVL PKNSLIVSKY EVYNELNKIR VDDKLLEVDV KNDIYNELFM KNKTVTEKKL KNWLVNNQCC SKDAEIKGFQ KENQFSTSLT PWIDFTNIFG KIDQSNFDLI ENIIYDLTVF EDKKIMKRRL KKKYALPDDK VKQILKLKYK DWSRLSKKLL DGIVADNRFG SSVTVLDVLE MSRLNLMEII NDKDLGYAQM IEEATSCPED GKFTYEEVER LAGSPALKRG IWQSLQIVEE ITKVMKCRPK YIYIEFERSE EAKERTESKI KKLENVYKDL DEQTKKEYKS VLEELKGFDN TKKISSDSLF LYFTQLGKCM YSGKKLDIDS LDKYQIDHIV PQSLVKDDSF DNRVLVVPSE NQRKLDDLVV PFDIRDKMYR FWKLLFDHEL ISPKKFYSLI KTEYTERDEE RFINRQLVET RQITKNVTQI IEDHYSTTKV AAIRANLSHE FRVKNHIYKN RDINDYHHAH DAYIVALIGG FMRDRYPNMH DSKAVYSEYM KMFRKNKNDQ KRWKDGFVIN SMNYPYEVDG KLIWNPDLIN EIKKCFYYKD CYCTTKLDQK SGQLFNLTVL SNDAHADKGV TKAVVPVNKN RSDVHKYGGF SGLQYTIVAI EGQKKKGKKT ELVKKISGVP LHLKAASINE KINYIEEKEG LSDVRIIKDN IPVNQMIEMD GGEYLLTSPT EYVNARQLVL NEKQCALIAD IYNAIYKQDY DNLDDILMIQ LYIELTNKMK VLYPAYRGIA EKFESMNENY VVISKEEKAN IIKQMLIVMH RGPQNGNIVY DDFKISDRIG RLKTKNHNLN NIVFISQSPT GIYTKKYKL Mycoplasma MLRLYCANNL VLNNVQNLWK YLLLLIFDKK IIFLFKIKVI LIRRYMENNN (SEQ synoviae 53 KEKIVIGFDL GVASVGWSIV NAETKEVIDL GVRLFSEPEK ADYRRAKRTT ID RRLLRRKKFK REKFHKLILK NAEIFGLQSR NEILNVYKDQ SSKYRNILKL KINALKEEIK PSELV NO: AOL40776.1 WILRD YLQNRGYFYK NEKLTDEFVS NSFPSKKLHE HYEKYGFFRG SVKLDNKLDN KKDKAKEKDE EEESDAKKES EELIFSNKQW 69) INEIVKVFEN QSYLTESFKE EYLKLFNYVR PFNKGPGSKN SRTAYGVFST DIDPETNKFK DYSNIWDKTI GKCSLFEEEI RAPKNLPSAL IFNLQNEICT IKNEFTEFKN WWLNAEQKSE ILKFVFTELF NWKDKKYSDK KFNKNLQDKI KKYLLNFALE NFNLNEEILK NRDLENDTVL GLKGVKYYEK SNATADAALE FSSLKPLYVF IKFLKEKKLD LNYLLGLENT EILYFLDSIY LAISYSSDLK ERNEWFKKLL KELYPKIKNN NLEIIENVED IFEITDQEKF ESFSKTHSLS REAFNHIIPL LLSNNEGKNY ESLKHSNEEL KKRTEKAELK AQQNQKYLKD NFLKEALVPL SVKTSVLQAI KIFNQIIKNF GKKYEISQVV IEMARELTKP NLEKLLNNAT NSNIKILKEK LDQTEKFDDF TKKKFIDKIE NSVVFRNKLF LWFEQDRKDP YTQLDIKINE IEDETEIDHV IPYSKSADDS WFNKLLVKKS TNQLKKNKTV WEYYQNESDP EAKWNKFVAW AKRIYLVQKS DKESKDNSEK NSIFKNKKPN LKFKNITKKL FDPYKDLGFL ARNLNDTRYA TKVFRDQLNN YSKHHSKDDE NKLFKVVCMN GSITSFLRKS MWRKNEEQVY RFNFWKKDRD QFFHHAVDAS IIAIFSLLTK TLYNKLRVYE SYDVQRREDG VYLINKETGE VKKADKDYWK DQHNFLKIRE NAIEIKNVLN NVDFQNQVRY SRKANTKLNT QLFNETLYGV KEFENNFYKL EKVNLFSRKD LRKFILEDLN EESEKNKKNE NGSRKRILTE KYIVDEILQI LENEEFKDSK SDINALNKYM DSLPSKFSEF FSQDFINKCK KENSLILTFD AIKHNDPKKV IKIKNLKFFR EDATLKNKQA VHKDSKNQIK SFYESYKCVG FIWLKNKNDL EESIFVPINS RVIHFGDKDK DIFDFDSYNK EKLLNEINLK RPENKKFNSI NEIEFVKFVK PGALLLNFENTable 4- Cas9 orthologsQQIYYISTLE SSSLRAKIKLLNKMDKGKAVS MKKITNPDEY KIIEHVNPL GINLNWTKKL ENNN Flavobacteriu MAKILGLDLG TNSIGWAVVE RENIDFSLID KGVRIFSEGV KSEKGIESSR (SEQ m AAERTGYRSA RKIKYRRKLR KYETLKVLSL NRMCPLSIEE VEEWKKSGFK ID branchiophilu DYPLNPEFLK WLSTDEESNV NPYFFRDRAS KHKVSLFELG RAFYHIAQRR GFLSNRLDQS AEGILEEHCP KIEAIVEDLI SIDEISTNIT DYFFETGILD NO: m FL-15 SNEKNGYAKD LDEGDKKLVS LYKSLLAILK KNESDFENCK SEIIERLNKK 70) DVLGKVKGKI KDISQAMLDG NYKTLGQYFY SLYSKEKIRN QYTSREEHYL WP_01408415 SEFITICKVQ GIDQINEEEK INEKKFDGLA KDLYKAIFFQ RPLKSQKGLI 1.1 GKCSFEKSKS RCAISHPDFE EYRMWTYLNT IKIGTQSDKK LRFLTQDEKL KLVPKFYRKN DFNFDVLAKE LIEKGSSFGF YKSSKKNDFF YWFNYKPTDT VAACQVAASL KNAIGEDWKT KSFKYQTINS NKEQVSRTVD YKDLWHLLTV ATSDVYLYEF AIDKLGLDEK NAKAFSKTKL KKDFASLSLS AINKILPYLK EGLLYSHAVF VANIENIVDE NIWKDEKQRD YIKTQISEII ENYTLEKSRF EIINGLLKEY KSENEDGKRV YYSKEAEQSF ENDLKKKLVL FYKSNEIENK EQQETIFNEL LPIFIQQLKD YEFIKIQRLD QKVLIFLKGK NETGQIFCTE EKGTAEEKEK KIKNRLKKLY HPSDIEKFKK KIIKDEFGNE KIVLGSPLTP SIKNPMAMRA LHQLRKVLNA LILEGQIDEK TIIHIEMARE LNDANKRKGI QDYQNDNKKF REDAIKEIKK LYFEDCKKEV EPTEDDILRY QLWMEQNRSE IYEEGKNISI CDIIGSNPAY DIEHTIPRSR SQDNSQMNKT LCSQRFNREV KKQSMPIELN NHLEILPRIA HWKEEADNLT REIEIISRSI KAAATKEIKD KKIRRRHYLT LKRDYLQGKY DRFIWEEPKV GFKNSQIPDT GIITKYAQAY LKSYFKKVES VKGGMVAEFR KIWGIQESFI DENGMKHYKV KDRSKHTHHT IDAITIACMT KEKYDVLAHA WTLEDQQNKK EARSIIEASK PWKTFKEDLL KIEEEILVSH YTPDNVKKQA KKIVRVRGKK QFVAEVERDV NGKAVPKKAA SGKTIYKLDG EGKKLPRLQQ GDTIRGSLHQ DSIYGAIKNP LNTDEIKYVI RKDLESIKGS DVESIVDEVV KEKIKEAIAN KVLLLSSNAQ QKNKLVGTVW MNEEKRIAIN KVRIYANSVK NPLHIKEHSL LSKSKHVHKQ KVYGQNDENY AMAIYELDGK RDFELINIFN LAKLIKQGQG FYPLHKKKEI KGKIVFVPIE KRNKRDVVLK RGQQVVFYDK EVENPKDISE IVDFKGRIYI IEGLSIQRIV RPSGKVDEYG VIMLRYFKEA RKADDIKQDN FKPDGVFKLG ENKPTRKMNH NQFTAFVEGI DFKVLPSGKF EKI Eubacterium MENKQYYIGL DVGTNSVGWA VTDTSYNLLR AKGKDMWGAR LFEKANTAAE (SEQ yurii subsp. RRTKRTSRRR SEREKARKAM LKELFADEIN RVDPSFFIRL EESKFFLDDR ID margaretiae SENNRQRYTL FNDATFTDKD YYEKYKTIFH LRSALINSDE KFDVRLVFLA ILNLFSHRGH FLNASLKGDG DIQGMDVFYN DLVESCEYFE IELPRITNID NO: ATCC 43715 NFEKILSQKG KSRTKILEEL SEELSISKKD KSKYNLIKLI SGLEASVVEL 71) YNIEDIQDEN KKIKIGFRES DYEESSLKVK EIIGDEYFDL VERAKSVHDM EFM38267.1 GLLSNIIGNS KYLCEARVEA YENHHKDLLK IKELLKKYDK KAYNDMFRKM TDKNYSAYVG SVNSNIAKER RSVDKRKIED LYKYIEDTAL KNIPDDNKDK IEILEKIKLG EFLKKQLTAS NGVIPNQLQS RELRAILKKA ENYLPFLKEK GEKNLTVSEM IIQLFEFQIP YYVGPLDKNP KKDNKANSWA KIKQGGRILP WNFEDKVDVK GSRKEFIEKM VRKCTYISDE HTLPKQSLLY EKFMVLNEIN NIKIDGEKIS VEAKQKIYND LFVKGKKVSQ KDIKKELISL NIMDKDSVLS GTDTVCNAYL SSIGKFTGVF KEEINKQSIV DMIEDIIFLK TVYGDEKRFV KEEIVEKYGD EIDKDKIKRI LGFKFSNWGN LSKSFLELEG ADVGTGEVRS IIQSLWETNF NLMELLSSRF TYMDELEKRV KKLEKPLSEW TIEDLDDMYL SSPVKRMIWQ SMKIVDEIQT VIGYAPKRIF VEMTRSEGEK VRTKSRKDRL KELYNGIKED SKQWVKELDS KDESYFRSKK MYLYYLQKGR CMYSGEVIEL DKLMDDNLYD IDHIYPRSFV KDDSLDNLVL VKKEINNRKQ NDPITPQIQA SCQGFWKILH DQGFMSNEKY SRLTRKTQEF SDEEKLSFIN RQIVETGQAT KCMAQILQKS MGEDVDVVFS KARLVSEFRH KFELFKSRLI NDFHHANDAYTable 4- Cas9 orthologsLNIVVGNSYF VKFTRNPANF IKDARKNPDN PVYKYHMDRF FERDVKSKSE VAWIGQSEGN SGTIVIVKKT MAKNSPLITK KVEEGHGSIT KETIVGVKEI KFGRNKVEKA DKTPKKPNLQ AYRPIKTSDE RLCNILRYGG RTSISISGYC LVEYVKKRKT IRSLEAIPVY LGRKDSLSEE KLLNYFRYNL NDGGKDSVSD IRLCLPFIST NSLVKIDGYL YYLGGKNDDR IQLYNAYQLK MKKEEVEYIR KIEKAVSMSK FDEIDREKNP VLTEEKNIEL YNKIQDKFEN TVFSKRMSLV KYNKKDLSFG DFLKNKKSKF EEIDLEKQCK VLYNIIFNLS NLKEVDLSDI GGSKSTGKCR CKKNITNYKE FKLIQQSITG LYSCEKDLMT I Acidovorax MAQHVFGLDI GIASVGWAIL GEQRIIDLGV RCFDKAETAK EGDPLNLTRR (SEQ ebreus QARLLRRRLY RRAWRLTQLS RLLKRKGLIA DAKLFAKAPS YGDSAWELRR ID QGLDRLLTPL EWARVIYHQC KHRGFHWTSK AEEAKADSDA EGGRVKQGLA HTK NO: WP_01265517 ALMQAKN YRSAAEMVLA EFPDAQRNKR GQYDKALSRV LLGEELALLF ATQRRLGNPH ASDFFEKLIL GDGDRKSGLF WQQKPALSGA DLLKMLGKCT 72) 6.1 FEKGEYRAPK ASFSVERHVW LTRLNNLRIV VDGRSRPLNE AERQAALLLP YQTETSKYKT LKNAFIKAGL WGDGVRFGGL AYPSQAQIDA EKTKDPEDQF LVKLPAWHEL RKAFKAAGHE ALWQQISTPA LDGDPTLLDQ IATVLSVYKD GAEVVQQLRQ LALPEPAASI AVLEKISFDK FSSLSLKALR RIVPLMQSGL RYDEAVAQIP EYGHHSQRIE PGAAKHLYLP PFYEAQRKYA GKGDHIGSMQ FRDDADIPRN PVVLRALNQA RKVVNALIRE YGSPIAVNIE MARDLSRPLD ERNKVKRAQE EFRDRNDRAR SEFERDFGYK PKAAAFEKWM LYREQLGQCA YSQQPLDIQR VLDDHNYAQV DHALPYSRSY DDSKNNKVLV LTHENQNKGN RTAFEYLTSF PDGEDGERWR TFVAWVQGNK AYRMAKRNRL LRKNYGVDES KGFIDRNLND TRYICKFFKN YVEEHLQLAA RADGDTARRC VVVNGQLTAF LRARWGLTKV RGDSDRHHAL DAAVVAACTH GMVKALADYS RRKEISFLQE GFPDPETGEI LNPAAFDRAR QHFPEPWTHF AHELKARLFT DDLAALREDM QRLGSYTTED LGRLRTLFVS RAPQRRSGGA VHKETIYAQP ESLKQQGGVI EKILLTSLKL QDFDKLLNPE SNDHFVEPHR NERLYAAIRQ RLEQFGGRAD KAFGPDNLFH KPDKNNQPTG PVVRSIKLVR GKQTGIPIRG GLAKNDSMLR VDIFTKAGKF HLVPVYVHHR VTGLPNRAIV AFKDEDEWTL IDESFAFLFS VYPNDYVKVT LKKEQQSGYY SGADRSTGAM NLWAHDRAAS VGKDGLIRGI GVKTALSVEK FNVDVLGRIY LAPPETRSGL A Porphyromona MLMSKHVLGL DLGVGSIGWC LIALDAQGDP AEILGMGSRV VPLNNATKAI (SEQ s sp. oral taxon EAFNAGAAFT ASQERTARRT MRRGFARYQL RRYRLRRELE KVGMLPDAAL ID 279 str. F0450 IQLPLLELWE LRERAATAGR RLTLPELGRV LCHINQKRGY RHVKSDAAAI VGDEGEKKKD SNSAYLAGIR ANDEKLQAEH KTVGQYFAEQ LRQNQSESPT NO: GGISYRIKDQ IFSRQCYIDE YDQIMAVQRV HYPDILTDEF IRMLRDEVIF 73) WP_00943351 MQRPLKSCKH LVSLCEFEKQ ERVMRVQQDD GKGGWQLVER RVKFGPKVAP 8.1 KSSPLFQLCC IYEAVNNIRL TRPNGSPCDI TPEERAKIVA HLQSSASLSF AALKKLLKEK ALIADQLTSK SGLKGNSTRV ALASALQPYP QYHHLLDMEL ETRMMTVQLT DEETGEVTER EVAVVTDSYV RKPLYRLWHI LYSIEEREAM RRALITQLGM KEEDLDGGLL DQLYRLDFVK PGYGNKSAKF ICKLLPQLQQ GLGYSEACAA VGYRHSNSPT SEEITERTLL EKIPLLQRNE LRQPLVEKIL NQMINLVNAL KAEYGIDEVR VELARELKMS REERERMARN NKDREERNKG VAAKIRECGL YPTKPRIQKY MLWKEAGRQC LYCGRSIEEE QCLREGGMEV EHIIPKSVLY DDSYGNKTCA CRRCNKEKGN RTALEYIRAK GREAEYMKRI NDLLKEKKIS YSKHQRLRWL KEDIPSDFLE RQLRLTQYIS RQAMAILQQG IRRVSASEGG VTARLRSLWG YGKILHTLNL DRYDSMGETE RVSREGEATE ELHITNWSKR MDHRHHAIDA LVVACTRQSY IQRLNRLSSE FGREDKKKED QEAQEQQATE TGRLSNLERW LTQRPHFSVR TVSDKVAEIL ISYRPGQRVV TRGRNIYRKK MADGREVSCV QRGVLVPRGE LMEASFYGKI LSQGRVRIVK RYPLHDLKGE VVDPHLRELI TTYNQELKSR EKGAPIPPLC LDKDKKQEVR SVRCYAKTLS LDKAIPMCFD EKGEPTAFVK SASNHHLALY RTPKGKLVESTable 4- Cas9 orthologsIVTFWDAVDR ARYGIPLVIT HPREVMEQVL QRGDIPEQVL SLLPPSDWVF VDSLQQDEMV VIGLSDEELQ RALEAQNYRK ISEHLYRVQK MSSSYYVFRY HLETSVADDK NTSGRIPKFH RVQSLKAYEE RNIRKVRVDL LGRISLL Mycoplasma MHNKKNITIG FDLGIASIGW AIIDSTTSKI LDWGTRTFEE RKTANERRAF (SEQ ovipneumoniae RSTRRNIRRK AYRNQRFINL ILKYKDLFEL KNISDIQRAN KKDTENYEKI ID SC01 ISFFTEIYKK CAAKHSNILE VKVKALDSKI EKLDLIWILH DYLENRGFFY DLEEENVADK YEGIEHPSIL LYDFFKKNGF FKSNSSIPKD LGGYSFSNLQ NO: WVNEIKKLFE VQEINPEFSE KFLNLFTSVR DYAKGPGSEH SASEYGIFQK 74) WP_01032092 DEKGKVFKKY DNIWDKTIGK CSFFVEENRS PVNYPSYEIF NLLNQLINLS 2.1 TDLKTTNKKI WQLSSNDRNE LLDELLKVKE KAKIISISLK KNEIKKIILK DFGFEKSDID DQDTIEGRKI IKEEPTTKLE VTKHLLATIY SHSSDSNWIN INNILEFLPY LDAICIILDR EKSRGQDEVL KKLTEKNIFE VLKIDREKQL DFVKSIFSNT KFNFKKIGNF SLKAIREFLP KMFEQNKNSE YLKWKDEEIR RKWEEQKSKL GKTDKKTKYL NPRIFQDEII SPGTKNTFEQ AVLVLNQIIK KYSKENIIDA IIIESPREKN DKKTIEEIKK RNKKGKGKTL EKLFQILNLE NKGYKLSDLE TKPAKLLDRL RFYHQQDGID LYTLDKINID QLINGSQKYE IEHIIPYSMS YDNSQANKIL TEKAENLKKG KLIASEYIKR NGDEFYNKYY EKAKELFINK YKKNKKLDSY VDLDEDSAKN RFRFLTLQDY DEFQVEFLAR NLNDTRYSTK LFYHALVEHF ENNEFFTYID ENSSKHKVKI STIKGHVTKY FRAKPVQKNN GPNENLNNNK PEKIEKNREN NEHHAVDAAI VAIIGNKNPQ IANLLTLADN KTDKKFLLHD ENYKENIETG ELVKIPKFEV DKLAKVEDLK KIIQEKYEEA KKHTAIKFSR KTRTILNGGL SDETLYGFKY DEKEDKYFKI IKKKLVTSKN EELKKYFENP FGKKADGKSE YTVLMAQSHL SEFNKLKEIF EKYNGFSNKT GNAFVEYMND LALKEPTLKA EIESAKSVEK LLYYNFKPSD QFTYHDNINN KSFKRFYKNI RIIEYKSIPI KFKILSKHDG GKSFKDTLFS LYSLVYKVYE NGKESYKSIP VTSQMRNFGI DEFDFLDENL YNKEKLDIYK SDFAKPIPVN CKPVFVLKKG SILKKKSLDI DDFKETKETE EGNYYFISTI SKRFNRDTAY GLKPLKLSVV KPVAEPSTNP IFKEYIPIHL DELGNEYPVK IKEHTDDEKL MCTIK Wolinella MLVSPISVDL GGKNTGFFSF TDSLDNSQSG TVIYDESFVL SQVGRRSKRH (SEQ succinogenes SKRNNLRNKL VKRLFLLILQ EHHGLSIDVL PDEIRGLFNK RGYTYAGFEL ID DEKKKDALES DTLKEFLSEK LQSIDRDSDV EDFLNQIASN AESFKDYKKG FEAVFASATH S NO: WP_01113943 PNKKLELKD ELKSEYGENA KELLAGLRVT KEILDEFDKQ ENQGNLPRAK YFEELGEYIA TNEKVKSFFD SNSLKLTDMT KLIGNISNYQ 75) 1.1 LKELRRYFND KEMEKGDIWI PNKLHKITER FVRSWHPKND ADRQRRAELM KDLKSKEIME LLTTTEPVMT IPPYDDMNNR GAVKCQTLRL NEEYLDKHLP NWRDIAKRLN HGKFNDDLAD STVKGYSEDS TLLHRLLDTS KEIDIYELRG KKPNELLVKT LGQSDANRLY GFAQNYYELI RQKVRAGIWV PVKNKDDSLN LEDNSNMLKR CNHNPPHKKN QIHNLVAGIL GVKLDEAKFA EFEKELWSAK VGNKKLSAYC KNIEELRKTH GNTFKIDIEE LRKKDPAELS KEEKAKLRLT DDVILNEWSQ KIANFFDIDD KHRQRFNNLF SMAQLHTVID TPRSGFSSTC KRCTAENRFR SETAFYNDET GEFHKKATAT CQRLPADTQR PFSGKIERYI DKLGYELAKI KAKELEGMEA KEIKVPIILE QNAFEYEESL RKSKTGSNDR VINSKKDRDG KKLAKAKENA EDRLKDKDKR IKAFSSGICP YCGDTIGDDG EIDHILPRSH TLKIYGTVFN PEGNLIYVHQ KCNQAKADSI YKLSDIKAGV SAQWIEEQVA NIKGYKTFSV LSAEQQKAFR YALFLQNDNE AYKKVVDWLR TDQSARVNGT QKYLAKKIQE KLTKMLPNKH LSFEFILADA TEVSELRRQY ARQNPLLAKA EKQAPSSHAI DAVMAFVARY QKVFKDGTPP NADEVAKLAM LDSWNPASNE PLTKGLSTNQ KIEKMIKSGD YGQKNMREVF GKSIFGENAI GERYKPIVVQ EGGYYIGYPA TVKKGYELKN CKVVTSKNDI AKLEKIIKNQ DLISLKENQY IKIFSINKQT ISELSNRYFN MNYKNLVERD KEIVGLLEFI VENCRYYTKK VDVKFAPKYI HETKYPFYDD WRRFDEAWRY LQENQNKTSSTable 4- Cas9 orthologsKDRFVIDKSS LNEYYQPDKN EYKLDVDTQP IWDDFCRWYF LDRYKTANDK KSIRIKARKT FSLLAESGVQ GKVFRAKRKI PTGYAYQALP MDNNVIAGDY ANILLEANSK TLSLVPKSGI SIEKQLDKKL DVIKKTDVRG LAIDNNSFFN ADFDTHGIRL IVENTSVKVG NFPISAIDKS AKRMIFRALF EKEKGKRKKK TTISFKESGP VQDYLKVFLK KIVKIQLRTD GSISNIVVRK NAADFTLSFR SEHIQKLLK Streptococcus MKKPYSIGLD IGTNSVGWAV VTDDYKVPAK KMKVLGNTDK SHIEKNLLGA (SEQ mutans UA159 LLFDSGNTAE DRRLKRTARR RYTRRRNRIL YLQEIFSEEM GKVDDSFFHR ID LEDSFLVTED KRGERHPIFG NLEEEVKYHE NFPTIYHLRQ YLADNPEKVD LRLVYLALAH IIKFRGHFLI EGKFDTRNND VQRLFQEFL NO: WP_00226354 A VYDNTFENSS LQEQNVQVEE ILTDKISKSA KKDRVLKLFP NEKSNGRFAE FLKLIVGNQA 76) 9.1 DFKKHFELEE KAPLQFSKDT YEEELEVLLA QIGDNYAELF LSAKKLYDSI LLSGILTVTD VGTKAPLSAS MIQRYNEHQM DLAQLKQFIR QKLSDKYNEV FSDVSKDGYA GYIDGKTNQE AFYKYLKGLL NKIEGSGYFL DKIEREDFLR KQRTFDNGSI PHQIHLQEMR AIIRRQAEFY PFLADNQDRI EKLLTFRIPY YVGPLARGKS DFAWLSRKSA DKITPWNFDE IVDKESSAEA FINRMTNYDL YLPNQKVLPK HSLLYEKFTV YNELTKVKYK TEQGKTAFFD ANMKQEIFDG VFKVYRKVTK DKLMDFLEKE FDEFRIVDLT GLDKENKVFN ASYGTYHDLC KILDKDFLDN SKNEKILEDI VLTLTLFEDR EMIRKRLENY SDLLTKEQVK KLERRHYTGW GRLSAELIHG IRNKESRKTI LDYLIDDGNS NRNFMQLIND DALSFKEEIA KAQVIGETDN LNQVVSDIAG SPAIKKGILQ SLKIVDELVK IMGHQPENIV VEMARENQFT NQGRRNSQQR LKGLTDSIKE FGSQILKEHP VENSQLQNDR LFLYYLQNGR DMYTGEELDI DYLSQYDIDH IIPQAFIKDN SIDNRVLTSS KENRGKSDDV PSKDVVRKMK SYWSKLLSAK LITQRKFDNL TKAERGGLTD DDKAGFIKRQ LVETRQITKH VARILDERFN TETDENNKKI RQVKIVTLKS NLVSNFRKEF ELYKVREIND YHHAHDAYLN AVIGKALLGV YPQLEPEFVY GDYPHFHGHK ENKATAKKFF YSNIMNFFKK DDVRTDKNGE IIWKKDEHIS NIKKVLSYPQ VNIVKKVEEQ TGGFSKESIL PKGNSDKLIP RKTKKFYWDT KKYGGFDSPI VAYSILVIAD IEKGKSKKLK TVKALVGVTI MEKMTFERDP VAFLERKGYR NVQEENIIKL PKYSLFKLEN GRKRLLASAR ELQKGNEIVL PNHLGTLLYH AKNIHKVDEP KHLDYVDKHK DEFKELLDVV SNFSKKYTLA EGNLEKIKEL YAQNNGEDLK ELASSFINLL TFTAIGAPAT FKFFDKNIDR KRYTSTTEIL NATLIHQSIT GLYETRIDLN KLGGD Prevotella MNKRILGLDT GTNSLGWAVV DWDEHAQSYE LIKYGDVIFQ EGVKIEKGIE (SEQ timonensis SSKAAERSGY KAIRKQYFRR RLRKIQVLKV LVKYHLCPYL SDDDLRQWHL ID CRIS 5C-B1 QKQYPKSDEL MLWQRTSDEE GKNPYYDRHR CLHEKLDLTV EADRYTLGRA LYHLTQRRGF LSNRLDTSAD NKEDGVVKSG ISQLSTEMEE AGCEYLGDYF NO: YKLYDAQGNK VRIRQRYTDR NKHYQHEFDA ICEKQELSSE LIEDLQRAIF 77) WP_00812271 FQLPLKSQRH GVGRCTFERG KPRCADSHPD YEEFRMLCFV NNIQVKGPHD 8.1 LELRPLTYEE REKIEPLFFR KSKPNFDFED IAKALAGKKN YAWIHDKEER AYKFNYRMTQ GVPGCPTIAQ LKSIFGDDWK TGIAETYTLI QKKNGSKSLQ EMVDDVWNVL YSFSSVEKLK EFAHHKLQLD EESAEKFAKI KLSHSFAALS LKAIRKFLPF LRKGMYYTHA SFFANIPTIV GKEIWNKEQN RKYIMENVGE LVFNYQPKHR EVQGTIEMLI KDFLANNFEL PAGATDKLYH PSMIETYPNA QRNEFGILQL GSPRTNAIRN PMAMRSLHIL RRVVNQLLKE SIIDENTEVH VEYARELNDA NKRRAIADRQ KEQDKQHKKY GDEIRKLYKE ETGKDIEPTQ TDVLKFQLWE EQNHHCLYTG EQIGITDFIG SNPKFDIEHT IPQSVGGDST QMNLTLCDNR FNREVKKAKL PTELANHEEI LTRIEPWKNK YEQLVKERDK QRTFAGMDKA VKDIRIQKRH KLQMEIDYWR GKYERFTMTE VPEGFSRRQG TGIGLISRYA GLYLKSLFHQ ADSRNKSNVY VVKGVATAEF RKMWGLQSEY EKKCRDNHSH HCMDAITIAC IGKREYDLMA EYYRMEETFK QGRGSKPKFS KPWATFTEDV LNIYKNLLVV HDTPNNMPKH TKKYVQTSIG KVLAQGDTARTable 4- Cas9 orthologsGSLHLDTYYG AIERDGEIRY VVRRPLSSFT KPEELENIVD ETVKRTIKEA IADKNFKQAI AEPIYMNEEK GILIKKVRCF AKSVKQPINI RQHRDLSKKE YKQQYHVMNE NNYLLAIYEG LVKNKVVREF EIVSYIEAAK YYKRSQDRNI FSSIVPTHST KYGLPLKTKL LMGQLVLMFE ENPDEIQVDN TKDLVKRLYK VVGIEKDGRI KFKYHQEARK EGLPIFSTPY KNNDDYAPIF RQSINNINIL VDGIDFTIDI LGKVTLKE Clostridium MKYTLGLDVG IASVGWAVID KDNNKIIDLG VRCFDKAEES KTGESLATAR (SEQ cellulolyticum RIARGMRRRI SRRSQRLRLV KKLFVQYEII KDSSEFNRIF DTSRDGWKDP ID H10 WELRYNALSR ILKPYELVQV LTHITKRRGF KSNRKEDLST TKEGVVITSI KNNSEMLRTK NYRTIGEMIF METPENSNKR NKVDEYIHTI AREDLLNEIK NO: YIFSIQRKLG SPFVTEKLEH DFLNIWEFQR PFASGDSILS KVGKCTLLKE 78) ACL77411.1 ELRAPTSCYT SEYFGLLQSI NNLVLVEDNN TLTLNNDQRA KIIEYAHFKN EIKYSEIRKL LDIEPEILFK AHNLTHKNPS GNNESKKFYE MKSYHKLKST LPTDIWGKLH SNKESLDNLF YCLTVYKNDN EIKDYLQANN LDYLIEYIAK LPTFNKFKHL SLVAMKRIIP FMEKGYKYSD ACNMAELDFT GSSKLEKCNK LTVEPIIENV TNPVVIRALT QARKVINAII QKYGLPYMVN IELAREAGMT RQDRDNLKKE HENNRKAREK ISDLIRQNGR VASGLDILKW RLWEDQGGRC AYSGKPIPVC DLLNDSLTQI DHIYPYSRSM DDSYMNKVLV LTDENQNKRS YTPYEVWGST EKWEDFEARI YSMHLPQSKE KRLLNRNFIT KDLDSFISRN LNDTRYISRF LKNYIESYLQ FSNDSPKSCV VCVNGQCTAQ LRSRWGLNKN REESDLHHAL DAAVIACADR KIIKEITNYY NERENHNYKV KYPLPWHSFR QDLMETLAGV FISRAPRRKI TGPAHDETIR SPKHFNKGLT SVKIPLTTVT LEKLETMVKN TKGGISDKAV YNVLKNRLIE HNNKPLKAFA EKIYKPLKNG TNGAIIRSIR VETPSYTGVF RNEGKGISDN SLMVRVDVFK KKDKYYLVPI YVAHMIKKEL PSKAIVPLKP ESQWELIDST HEFLFSLYQN DYLVIKTKKG ITEGYYRSCH RGTGSLSLMP HFANNKNVKI DIGVRTAISI EKYNVDILGN KSIVKGEPRR GMEKYNSFKS N Francisella MNFKILPIAI DLGVKNTGVF SAFYQKGTSL ERLDNKNGKV YELSKDSYTL (SEQ tularensis LMNNRTARRH QRRGIDRKQL VKRLFKLIWT EQLNLEWDKD TQQAISFLFN ID subsp. RRGFSFITDG YSPEYLNIVP EQVKAILMDI FDDYNGEDDL DSYLKLATEQ ESKISEIYNK LMQKILEFKL MKLCTDIKDD KVSTKTLKEI TSYEFELLAD NO: novicida U112 YLANYSESLK TQKFSYTDKQ GNLKELSYYH HDKYNIQEFL KRHATINDRI 79) LDTLLTDDLD IWNFNFEKFD FDKNEEKLQN QEDKDHIQAH LHHFVFAVNK WP_00303894 IKSEMASGGR HRSQYFQEIT NVLDENNHQE GYLKNFCENL HNKKYSNLSV 1.1 KNLVNLIGNL SNLELKPLRK YFNDKIHAKA DHWDEQKFTE TYCHWILGEW RVGVKDQDKK DGAKYSYKDL CNELKQKVTK AGLVDFLLEL DPCRTIPPYL DNNNRKPPKC QSLILNPKFL DNQYPNWQQY LQELKKLQSI QNYLDSFETD LKVLKSSKDQ PYFVEYKSSN QQIASGQRDY KDLDARILQF IFDRVKASDE LLLNEIYFQA KKLKQKASSE LEKLESSKKL DEVIANSQLS QILKSQHTNG IFEQGTFLHL VCKYYKQRQR ARDSRLYIMP EYRYDKKLHK YNNTGRFDDD NQLLTYCNHK PRQKRYQLLN DLAGVLQVSP NFLKDKIGSD DDLFISKWLV EHIRGFKKAC EDSLKIQKDN RGLLNHKINI ARNTKGKCEK EIFNLICKIE GSEDKKGNYK HGLAYELGVL LFGEPNEASK PEFDRKIKKF NSIYSFAQIQ QIAFAERKGN ANTCAVCSAD NAHRMQQIKI TEPVEDNKDK IILSAKAQRL PAIPTRIVDG AVKKMATILA KNIVDDNWQN IKQVLSAKHQ LHIPIITESN AFEFEPALAD VKGKSLKDRR KKALERISPE NIFKDKNNRI KEFAKGISAY SGANLTDGDF DGAKEELDHI IPRSHKKYGT LNDEANLICV TRGDNKNKGN RIFCLRDLAD NYKLKQFETT DDLEIEKKIA DTIWDANKKD FKFGNYRSFI NLTPQEQKAF RHALFLADEN PIKQAVIRAI NNRNRTFVNG TQRYFAEVLA NNIYLRAKKE NLNTDKISFD YFGIPTIGNG RGIAEIRQLY EKVDSDIQAY AKGDKPQASY SHLIDAMLAF CIAADEHRND GSIGLEIDKN YSLYPLDKNT GEVFTKDIFS QIKITDNEFS DKKLVRKKAI EGFNTHRQMT RDGIYAENYLTable 4- Cas9 orthologsPILIHKELNE VRKGYTWKNS EEIKIFKGKK YDIQQLNNLV YCLKFVDKPI SIDIQISTLE ELRNILTTNN IAATAEYYYI NLKTQKLHEY YIENYNTALG YKKYSKEMEF LRSLAYRSER VKIKSIDDVK QVLDKDSNFI IGKITLPFKK EWQRLYREWQ NTTIKDDYEF LKSFFNVKSI TKLHKKVRKD FSLPISTNEG KFLVKRKTWD NNFIYQILND SDSRADGTKP FIPAFDISKN EIVEAIIDSF TSKNIFWLPK NIELQKVDNK NIFAIDTSKW FEVETPSDLR DIGIATIQYK IDNNSRPKVR VKLDYVIDDD SKINYFMNHS LLKSRYPDKV LEILKQSTII EFESSGFNKT IKEMLGMKLA GIYNETSNN Azospirillum MARPAFRAPR REHVNGWTPD PHRISKPFFI LVSWHLLSRV VIDSSSGCFP (SEQ sp. B510 GTSRDHTDKF AEWECAVQPY RLSFDLGTNS IGWGLLNLDR QGKPREIRAL ID GSRIFSDGRD PQDKASLAVA RRLARQMRRR RDRYLTRRTR LMGALVRFGL MPADPA NO: AOL40891.1 ARKR LEVAVDPYLA RERATRERLE PFEIGRALFH LNQRRGYKPV RTATKPDEEA GKVKEAVERL EAAIAAAGAP TLGAWFAWRK TRGETLRARL 80) AGKGKEAAYP FYPARRMLEA EFDTLWAEQA RHHPDLLTAE AREILRHRIF HQRPLKPPPV GRCTLYPDDG RAPRALPSAQ RLRLFQELAS LRVIHLDLSE RPLTPAERDR IVAFVQGRPP KAGRKPGKVQ KSVPFEKLRG LLELPPGTGF SLESDKRPEL LGDETGARIA PAFGPGWTAL PLEEQDALVE LLLTEAEPER AIAALTARWA LDEATAAKLA GATLPDFHGR YGRRAVAELL PVLERETRGD PDGRVRPIRL DEAVKLLRGG KDHSDFSREG ALLDALPYYG AVLERHVAFG TGNPADPEEK RVGRVANPTV HIALNQLRHL VNAILARHGR PEEIVIELAR DLKRSAEDRR REDKRQADNQ KRNEERKRLI LSLGERPTPR NLLKLRLWEE QGPVENRRCP YSGETISMRM LLSEQVDIDH ILPFSVSLDD SAANKVVCLR EANRIKRNRS PWEAFGHDSE RWAGILARAE ALPKNKRWRF APDALEKLEG EGGLRARHLN DTRHLSRLAV EYLRCVCPKV RVSPGRLTAL LRRRWGIDAI LAEADGPPPE VPAETLDPSP AEKNRADHRH HALDAVVIGC IDRSMVQRVQ LAAASAEREA AAREDNIRRV LEGFKEEPWD GFRAELERRA RTIVVSHRPE HGIGGALHKE TAYGPVDPPE EGFNLVVRKP IDGLSKDEIN SVRDPRLRRA LIDRLAIRRR DANDPATALA KAAEDLAAQP ASRGIRRVRV LKKESNPIRV EHGGNPSGPR SGGPFHKLLL AGEVHHVDVA LRADGRRWVG HWVTLFEAHG GRGADGAAAP PRLGDGERFL MRLHKGDCLK LEHKGRVRVM QVVKLEPSSN SVVVVEPHQV KTDRSKHVKI SCDQLRARGA RRVTVDPLGR VRVHAPGARV GIGGDAGRTA MEPAEDIS Peptoniphilus MKNLKEYYIG LDIGTASVGW AVTDESYNIP KFNGKKMWGV RLFDDAKTAE (SEQ duerdenii ATCC ERRTQRGSRR RLNRRKERIN LLQDLFATEI SKVDPNFFLR LDNSDLYRED ID BAA-1640 KDEKLKSKYT LFNDKDFKDR DYHKKYPTIH HLIMDLIEDE GKKDIRLLYL ACHYLLKNRG HFIFEGQKFD TKNSFDKSIN DLKIHLRDEY NIDLEFNNED NO: LIEIITDTTL NKTNKKKELK N 81) WP_008901059. IVGDTKFLK AISAIMIGSS QKLVDLFEDG 1 EFEETTVKSV DFSTTAFDDK YSEYEEALGD TISLLNILKS IYDSSILENL LKDADKSKDG NKYISKAFVK KFNKHGKDLK TLKRIIKKYL PSEYANIFRN KSINDNYVAY TKSNITSNKR TKASKFTKQE DFYKFIKKHL DTIKETKLNS SENEDLKLID EMLTDIEFKT FIPKLKSSDN GVIPYQLKLM ELKKILDNQS KYYDFLNESD EYGTVKDKVE SIMEFRIPYY VGPLNPDSKY AWIKRENTKI TPWNFKDIVD LDSSREEFID RLIGRCTYLK EEKVLPKASL IYNEFMVLNE LNNLKLNEFL ITEEMKKAIF EELFKTKKKV TLKAVSNLLK KEFNLTGDIL LSGTDGDFKQ GLNSYIDFKN IIGDKVDRDD YRIKIEEIIK LIVLYEDDKT YLKKKIKSAY KNDFTDDEIK KIAALNYKDW GRLSKRFLTG IEGVDKTTGE KGSIIYFMRE YNLNLMELMS GHYTFTEEVE KLNPVENREL CYEMVDELYL SPSVKRMLWQ SLRVVDEIKR IIGKDPKKIF IEMARAKEAK NSRKESRKNK LLEFYKFGKK AFINEIGEER YNYLLNEINS EEESKFRWDN LYLYYTQLGR CMYSLEPIDL ADLKSNNIYD QDHIYPKSKI YDDSLENRVL VKKNLNHEKG NQYPIPEKVL NKNAYGFWKI LFDKGLIGQK KYTRLTRRTP FEERELAEFI ERQIVETRQA TKETANLLKN ICQDSEIVYS KAENASRFRQ EFDIIKCRTVTable 4- Cas9 orthologsNDLHHMHDAY LNIVVGNVYN TKFTKNPLNF IKDKDNVRSY NLENMFKYDV VRGSYTAWIA DDSEGNVKAA TIKKVKRELE GKNYRFTRMS YIGTGGLYDQ NLMRKGKGQI PQKENTNKSN IEKYGGYNKA SSAYFALIES DGKAGRERTL ETIPIMVYNQ EKYGNTEAVD KYLKDNLELQ DPKILKDKIK INSLIKLDGF LYNIKGKTGD SLSIAGSVQL IVNKEEQKLI KKMDKFLVKK KDNKDIKVTS FDNIKEEELI KLYKTLSDKL NNGIYSNKRN NQAKNISEAL DKFKEISIEE KIDVLNQIIL LFQSYNNGCN LKSIGLSAKT GVVFIPKKLN YKECKLINQS ITGLFENEVD LLNL Lactobacillus MGYRIGLDVG ITSTGYAVLK TDKNGLPYKI LTLDSVIYPR AENPQTGASL (SEQ coryniformis AEPRRIKRGL RRRTRRTKFR KQRTQQLFIH SGLLSKPEIE QILATPQAKY ID subsp. torquens SVYELRVAGL DRRLTNSELF RVLYFFIGHR GFKSNRKAEL NPENEADKKQ MGQL NO: KCTC 3535 LNSIEE IRKAIAEKGY RTVGELYLKD PKYNDHKRNK GYIDGYLSTP NRQMLVDEIK QILDKQRELG NEKLTDEFYA TYLLGDENRA GIFQAQRDFD 82) WP_01001440 EGPGAGPYAG DQIKKMVGKD IFEPTEDRAA KATYTFQYFN LLQKMTSLNY QNTTGDTWHT LNGLDRQAII DAVFAKAEKP TKTYKPTDFG ELRKLLKLPD 6.1 DARFNLVNYG SLQTQKEIET VEKKTRFVDF KAYHDLVKVL PEEMWQSRQL LDHIGTALTL YSSDKRRRRY FAEELNLPAE LIEKLLPLNF SKFGHLSIKS MQNIIPYLEM GQVYSEATTN TGYDFRKKQI SKDTIREEIT NPVVRRAVTK TIKIVEQIIR RYGKPDGINI ELARELGRNF KERGDIQKRQ DKNRQTNDKI AAELTELGIP VNGQNIIRYK LHKEQNGVDP YTGDQIPFER AFSEGYEVDH IIPYSISWDD SYTNKVLTSA KCNREKGNRI PMVYLANNEQ RLNALTNIAD NIIRNSRKRQ KLLKQKLSDE ELKDWKQRNI NDTRFITRVL YNYFRQAIEF NPELEKKQRV LPLNGEVTSK IRSRWGFLKV REDGDLHHAI DATVIAAITP KFIQQVTKYS QHQEVKNNQA LWHDAEIKDA EYAAEAQRMD ADLFNKIFNG FPLPWPEFLD ELLARISDNP VEMMKSRSWN TYTPIEIAKL KPVFVVRLAN HKISGPAHLD TIRSAKLFDE KGIVLSRVSI TKLKINKKGQ VATGDGIYDP ENSNNGDKVV YSAIRQALEA HNGSGELAFP DGYLEYVDHG TKKLVRKVRV AKKVSLPVRL KNKAAADNGS MVRIDVFNTG KKFVFVPIYI KDTVEQVLPN KAIARGKSLW YQITESDQFC FSLYPGDMVH IESKTGIKPK YSNKENNTSV VPIKNFYGYF DGADIATASI LVRAHDSSYT ARSIGIAGLL KFEKYQVDYF GRYHKVHEKK RQLFVKRDE Ignavibacteriu MEFKKVLGLD IGTNSIGCAL LSLPKSIQDY GKGGRLEWLT SRVIPLDADY (SEQ m album JCM MKAFIDGKNG LPQVITPAGK RRQKRGSRRL KHRYKLRRSR LIRVFKTLNW ID 16511 LPEDFPLDNP KRIKETISTE GKFSFRISDY VPISDESYRE FYREFGYPEN EIEQVIEEIN FRRKTKGKNK NPMIKLLPED WVVYYLRKKA LIKPTTKEEL NO: IRIIYLFNQR RGFKSSRKDL TETAILDYDE FAKRLAEKEK YSAENYETKF 83) WP_01456187 VSITKVKEVV ELKTDGRKGK KRFKVILEDS RIEPYEIERK EKPDWEGKEY 3.1 TFLVTQKLEK GKFKQNKPDL PKEEDWALCT TALDNRMGSK HPGEFFFDEL LKAFKEKRGY KIRQYPVNRW RYKKELEFIW TKQCQLNPEL NNLNINKEIL RKLATVLYPS QSKFFGPKIK EFENSDVLHI ISEDIIYYQR DLKSQKSLIS ECRYEKRKGI DGEIYGLKCI PKSSPLYQEF RIWQDIHNIK VIRKESEVNG KKKINIDETQ LYINENIKEK LFELFNSKDS LSEKDILELI SLNIINSGIK ISKKEEETTH RINLFANRKE LKGNETKSRY RKVFKKLGFD GEYILNHPSK LNRLWHSDYS NDYADKEKTE KSILSSLGWK NRNGKWEKSK NYDVFNLPLE VAKAIANLPP LKKEYGSYSA LAIRKMLVVM RDGKYWQHPD QIAKDQENTS LMLFDKNLIQ LTNNQRKVLN KYLLTLAEVQ KRSTLIKQKL NEIEHNPYKL ELVSDQDLEK QVLKSFLEKK NESDYLKGLK TYQAGYLIYG KHSEKDVPIV NSPDELGEYI RKKLPNNSLR NPIVEQVIRE TIFIVRDVWK SFGIIDEIHI ELGRELKNNS EERKKTSESQ EKNFQEKERA RKLLKELLNS SNFEHYDENG NKIFSSFTVN PNPDSPLDIE KFRIWKNQSG LTDEELNKKL KDEKIPTEIE VKKYILWLTQ KCRSPYTGKI IPLSKLFDSN VYEIEHIIPR SKMKNDSTNN LVICELGVNK AKGDRLAANF ISESNGKCKF GEVEYTLLKY GDYLQYCKDTTable 4- Cas9 orthologsFKYQKAKYKN LLATEPPEDF IERQINDTRY IGRKLAELLT PVVKDSKNII FTIGSITSEL KITWGLNGVW KDILRPRFKR LESIINKKLI FQDEDDPNKY HFDLSINPQL DKEGLKRLDH RHHALDATII AATTREHVRY LNSLNAADND EEKREYFLSL CNHKIRDFKL PWENFTSEVK SKLLSCVVSY KESKPILSDP FNKYLKWEYK NGKWQKVFAI QIKNDRWKAV RRSMFKEPIG TVWIKKIKEV SLKEAIKIQA IWEEVKNDPV RKKKEKYIYD DYAQKVIAKI VQELGLSSSM RKQDDEKLNK FINEAKVSAG VNKNLNTTNK TIYNLEGRFY EKIKVAEYVL YKAKRMPLNK KEYIEKLSLQ KMFNDLPNFI LEKSILDNYP EILKELESDN KYIIEPHKKN NPVNRLLLEH ILEYHNNPKE AFSTEGLEKL NKKAINKIGK PIKYITRLDG DINEEEIFRG AVFETDKGSN VYFVMYENNQ TKDREFLKPN PSISVLKAIE HKNKIDFFAP NRLGFSRIIL SPGDLVYVPT NDQYVLIKDN SSNETIINWD DNEFISNRIY QVKKFTGNSC YFLKNDIASL ILSYSASNGV GEFGSQNISE YSVDDPPIRI KDVCIKIRVD RLGNVRPL uncultured delta MSSKAIDSLE QLDLFKPQEY TLGLDLGIKS IGWAILSGER IANAGVYLFE (SEQ proteobacterium TAEELNSTGN KLISKAAERG RKRRIRRMLD RKARRGRHIR YLLEREGLPT ID HF0070_07E19 DELEEVVVHQ SNRTLWDVRA EAVERKLTKQ ELAAVLFHLV RHRGYFPNTK KLPPDDESDS ADEEQGKINR ATSRLREELK ASDCKTIGQF LAQNRDRQRN NO: REGDYSN 84) ADI19058.1 LMA RKLVFEEALQ ILAFQRKQGH ELSKDFEKTY LDVLMGQRSG RSPKLGNCSL IPSELRAPSS APSTEWFKFL QNLGNLQISN AYREEWSIDA PRRAQIIDAC SQRSTSSYWQ IRRDFQIPDE YRFNLVNYER RDPDVDLQEY LQQQERKTLA NFRNWKQLEK IIGTGHPIQT LDEAARLITL IKDDEKLSDQ LADLLPEASD KAITQLCELD FTTAAKISLE AMYRILPHMN QGMGFFDACQ QESLPEIGVP PAGDRVPPFD EMYNPVVNRV LSQSRKLINA VIDEYGMPAK IRVELARDLG KGRELRERIK LDQLDKSKQN DQRAEDFRAE FQQAPRGDQS LRYRLWKEQN CTCPYSGRMI PVNSVLSEDT QIDHILPISQ SFDNSLSNKV LCFTEENAQK SNRTPFEYLD AADFQRLEAI SGNWPEAKRN KLLHKSFGKV AEEWKSRALN DTRYLTSALA DHLRHHLPDS KIQTVNGRIT GYLRKQWGLE KDRDKHTHHA VDAIVVACTT PAIVQQVTLY HQDIRRYKKL GEKRPTPWPE TFRQDVLDVE EEIFITRQPK KVSGGIQTKD TLRKHRSKPD RQRVALTKVK LADLERLVEK DASNRNLYEH LKQCLEESGD QPTKAFKAPF YMPSGPEAKQ RPILSKVTLL REKPEPPKQL TELSGGRRYD SMAQGRLDIY RYKPGGKRKD EYRVVLQRMI DLMRGEENVH VFQKGVPYDQ GPEIEQNYTF LFSLYFDDLV EFQRSADSEV IRGYYRTFNI ANGQLKISTY LEGRQDFDFF GANRLAHFAK VQVNLLGKVI K Ruminococcus MGNYYLGLDV GIGSIGWAVI NIEKKRIEDF NVRIFKSGEI QEKNRNSRAS (SEQ albus 8 QQCRRSRGLR RLYRRKSHRK LRLKNYLSII GLTTSEKIDY YYETADNNVI ID QLRNKGLSEK LTPEEIAACL IHICNNRGYK DFYEVNVEDI EDPDERNEYK EEHDSIVLIS NLM NO: WP_00284692 NEGGYCT PAEMICNCRE FDEPNSVYRK FHNSAASKNH YLITRHMLVK EVDLILENQS KYYGILDDKT IAKIKDIIFA QRDFEIGPGK 85) 6.1 NERFRRFTGY LDSIGKCQFF KDQERGSRFT VIADIYAFVN VLSQYTYTNN RGESVFDTSF ANDLINSALK NGSMDKRELK AIAKSYHIDI SDKNSDTSLT KCFKYIKVVK PLFEKYGYDW DKLIENYTDT DNNVLNRIGI VLSQAQTPKR RREKLKALNI GLDDGLINEL TKLKLSGTAN VSYKYMQGSI EAFCEGDLYG KYQAKFNKEI PDIDENAKPQ KLPPFKNEDD CEFFKNPVVF RSINETRKLI NAIIDKYGYP AAVNIETADE LNKTFEDRAI DTKRNNDNQK ENDRIVKEII ECIKCDEVHA RHLIEKYKLW EAQEGKCLYS GETITKEDML RDKDKLFEVD HIVPYSLILD NTINNKALVY AEENQKKGQR TPLMYMNEAQ AADYRVRVNT MFKSKKCSKK KYQYLMLPDL NDQELLGGWR SRNLNDTRYI CKYLVNYLRK NLRFDRSYES SDEDDLKIRD HYRVFPVKSR FTSMFRRWWL NEKTWGRYDK AELKKLTYLD HAADAIIIAN CRPEYVVLAG EKLKLNKMYH QAGKRITPEY EQSKKACIDN LYKLFRMDRR TAEKLLSGHG RLTPIIPNLS EEVDKRLWDK NIYEQFWKDD KDKKSCEELY RENVASLYKG DPKFASSLSM PVISLKPDHKTable 4- Cas9 orthologsYRGTITGEEA IRVKEIDGKL IKLKRKSISE ITAESINSIY TDDKILIDSL KTIFEQADYK DVGDYLKKTN QHFFTTSSGK RVNKVTVIEK VPSRWLRKEI DDNNFSLLND SSYYCIELYK DSKGDNNLQG IAMSDIVHDR KTKKLYLKPD FNYPDDYYTH VMYIFPGDYL RIKSTSKKSG EQLKFEGYFI SVKNVNENSF RFISDNKPCA KDKRVSITKK DIVIKLAVDL MGKVQGENNG KGISCGEPLS LLKEKN Lactobacillus MTKKEQPYNI GLDIGTSSVG WAVTNDNYDL LNIKKKNLWG VRLFEEAQTA (SEQ farciminis KETRLNRSTR RRYRRRKNRI NWLNEIFSEE LAKTDPSFLI RLQNSWVSKK ID KCTC 3681 DPDRKRDKYN LFIDGPYTDK EYYREFPTIF HLRKELILNK DKADIRLIYL ALHNILKYRG NFTYEHQKFN ISNLNNNLSK ELIELNQQLI KYDISFPDDC NO: DWNHISDILI GRGNATQKSS NILKDFTLDK ETKKLLKEVI NLILGNVAHL 86) WP_01001894 NTIFKTSLTK DEEKLNFSGK DIESKLDDLD SILDDDQFTV LDAANRIYST 9.1 ITLNEILNGE SYFSMAKVNQ YENHAIDLCK LRDMWHTTKN EEAVEQSRQA YDDYINKPKY GTKELYTSLK KFLKVALPTN LAKEAEEKIS KGTYLVKPRN SENGVVPYQL NKIEMEKIID NQSQYYPFLK ENKEKLLSIL SFRIPYYVGP LQSAEKNPFA WMERKSNGHA RPWNFDEIVD REKSSNKFIR RMTVTDSYLV GEPVLPKNSL IYQRYEVLNE LNNIRITENL KTNPIGSRLT VETKQRIYNE LFKKYKKVTV KKLTKWLIAQ GYYKNPILIG LSQKDEFNST LTTYLDMKKI FGSSFMEDNK NYDQIEELIE WLTIFEDKQI LNEKLHSSKY SYTPDQIKKI SNMRYKGWGR LSKKILMDIT TETNTPQLLQ LSNYSILDLM WATNNNFISI MSNDKYDFKN YIENHNLNKN EDQNISDLVN DIHVSPALKR GITQSIKIVQ EIVKFMGHAP KHIFIEVTRE TKKSEITTSR EKRIKRLQSK LLNKANDFKP QLREYLVPNK KIQEELKKHK NDLSSERIML YFLQNGKSLY SEESLNINKL SDYQVDHILP RTYIPDDSLE NKALVLAKEN QRKADDLLLN SNVIDRNLER WTYMLNNNMI GLKKFKNLTR RVITDKDKLG FIHRQLVQTS QMVKGVANIL DNMYKNQGTT CIQARANLST AFRKALSGQD DTYHFKHPEL VKNRNVNDFH HAQDAYLASF LGTYRLRRFP TNEMLLMNGE YNKFYGQVKE LYSKKKKLPD SRKNGFIISP LVNGTTQYDR NTGEIIWNVG FRDKILKIFN YHQCNVTRKT EIKTGQFYDQ TIYSPKNPKY KKLIAQKKDM DPNIYGGFSG DNKSSITIVK IDNNKIKPVA IPIRLINDLK DKKTLQNWLE ENVKHKKSIQ IIKNNVPIGQ IIYSKKVGLL SLNSDREVAN RQQLILPPEH SALLRLLQIP DEDLDQILAF YDKNILVEIL QELITKMKKF YPFYKGEREF LIANIENFNQ ATTSEKVNSL EELITLLHAN STSAHLIFNN IEKKAFGRKT HGLTLNNTDF IYQSVTGLYE TRIHIE Eubacterium MMEVFMGRLV LGLDIGITSV GFGIIDLDES EIVDYGVRLF KEGTAAENET (SEQ dolichum DSM RRTKRGGRRL KRRRVTRRED MLHLLKQAGI ISTSFHPLNN PYDVRVKGLN ID 3991 ERLNGEELAT ALLHLCKHRG SSVETIEDDE AKAKEAGETK KVLSMNDQLL KSGKYVCEIQ KERLRTNGHI RGHENNFKTR AYVDEAFQIL SHQDLSNELK NO: SAIITIISRK RMYYDGPGGP LSPTPYGRYT YFGQKEPIDL IEKMRGKCSL 87) WP_00480045 FPNEPRAPKL AYSAELFNLL NDLNNLSIEG EKLTSEQKAM ILKIVHEKGK 7.1 ITPKQLAKEV GVSLEQIRGF RIDTKGSPLL SELTGYKMIR EVLEKSNDEH LEDHVFYDEI AEILTKTKDI EGRKKQISEL SSDLNEESVH QLAGLTKFTA YHSLSFKALR LINEEMLKTE LNQMQSITLF GLKQNNELSV KGMKNIQADD TAILSPVAKR AQRETFKVVN RLREIYGEFD SIVVEMAREK NSEEQRKAIR ERQKFFEMRN KQVADIIGDD RKINAKLREK LVLYQEQDGK TAYSLEPIDL KLLIDDPNAY EVDHIIPISI SLDDSITNKV LVTHRENQEK GNLTPISAFV KGRFTKGSLA QYKAYCLKLK EKNIKTNKGY RKKVEQYLLN ENDIYKYDIQ KEFINRNLVD TSYASRVVLN TLTTYFKQNE IPTKVFTVKG SLTNAFRRKI NLKKDRDEDY GHHAIDALII ASMPKMRLLS TIFSRYKIED IYDESTGEVF SSGDDSMYYD DRYFAFIASL KAIKVRKFSH KIDTKPNRSV ADETIYSTRV IDGKEKVVKK YKDIYDPKFT ALAEDILNNA YQEKYLMALH DPQTFDQIVK VVNYYFEEMS KSEKYFTKDK KGRIKISGMN PLSLYRDEHG MLKKYSKKGDTable 4- Cas9 orthologsGPAITQMKYF DGVLGNHIDI SAHYQVRDKK VVLQQISPYR TDFYYSKENG YKFVTIRYKD VRWSEKKKKY VIDQQDYAMK KAEKKIDDTY EFQFSMHRDE LIGITKAEGE ALIYPDETWH NFNFFFHAGE TPEILKFTAT NNDKSNKIEV KPIHCYCKMR LMPTISKKIV RIDKYATDVV GNLYKVKKNT LKFEFD Nitratifractor MKKILGVDLG ITSFGYAILQ ETGKDLYRCL DNSVVMRNNP YDEKSGESSQ (SEQ salsuginis SIRSTQKSMR RLIEKRKKRI RCVAQTMERY GILDYSETMK INDPKNNPIK ID DSM 16511 NRWQLRAVDA WKRPLSPQEL FAIFAHMAKH RGYKSIATED LIYELELELG LNDPEKESEK KADERRQVYN ALRHLEELRK KYGGETIAQT IHRAVEAGDL NO: RSYRNHDDYE KMIRREDIEE EIEKVLLRQA ELGALGLPEE QVSELIDELK 88) ADV46720.1 ACITDQEMPT IDESLFGKCT FYKDELAAPA YSYLYDLYRL YKKLADLNID GYEVTQEDRE KVIEWVEKKI AQGKNLKKIT HKDLRKILGL APEQKIFGVE DERIVKGKKE PRTFVPFFFL ADIAKFKELF ASIQKHPDAL QIFRELAEIL QRSKTPQEAL DRLRALMAGK GIDTDDRELL ELFKNKRSGT RELSHRYILE ALPLFLEGYD EKEVQRILGF DDREDYSRYP KSLRHLHLRE GNLFEKEENP INNHAVKSLA SWALGLIADL SWRYGPFDEI ILETTRDALP EKIRKEIDKA MREREKALDK IIGKYKKEFP SIDKRLARKI QLWERQKGLD LYSGKVINLS QLLDGSADIE HIVPQSLGGL STDYNTIVTL KSVNAAKGNR LPGDWLAGNP DYRERIGMLS EKGLIDWKKR KNLLAQSLDE IYTENTHSKG IRATSYLEAL VAQVLKRYYP FPDPELRKNG IGVRMIPGKV TSKTRSLLGI KSKSRETNFH HAEDALILST LTRGWQNRLH RMLRDNYGKS EAELKELWKK YMPHIEGLTL ADYIDEAFRR FMSKGEESLF YRDMFDTIRS ISYWVDKKPL SASSHKETVY SSRHEVPTLR KNILEAFDSL NVIKDRHKLT TEEFMKRYDK EIRQKLWLHR IGNTNDESYR AVEERATQIA QILTRYQLMD AQNDKEIDEK FQQALKELIT SPIEVTGKLL RKMRFVYDKL NAMQIDRGLV ETDKNMLGIH ISKGPNEKLI FRRMDVNNAH ELQKERSGIL CYLNEMLFIF NKKGLIHYGC LRSYLEKGQG SKYIALFNPR FPANPKAQPS KFTSDSKIKQ VGIGSATGII KAHLDLDGHV RSYEVFGTLP EGSIEWFKEE SGYGRVEDDP HH Rhodospirillu MRPIEPWILG LDIGTDSLGW AVFSCEEKGP PTAKELLGGG VRLFDSGRDA (SEQ m rubrum KDHTSRQAER GAFRRARRQT RTWPWRRDRL IALFQAAGLT PPAAETRQIA ID ATCC 11170 LALRREAVSR PLAPDALWAA LLHLAHHRGF RSNRIDKRER AAAKALAKAK PAKATAKATA PAKEADDEAG FWEGAEAALR QRMAASGAPT VGALLADDLD NO: RGQPVRMRYN QSDRDGVVAP TRALIAEELA EIVARQSSAY PGLDWPAVTR 89) WP_01138821 LVLDQRPLRS KGAGPCAFLP GEDRALRALP TVQDFIIRQT LANLRLPSTS 2.1 ADEPRPLTDE EHAKALALLS TARFVEWPAL RRALGLKRGV KFTAETERNG AKQAARGTAG NLTEAILAPL IPGWSGWDLD RKDRVFSDLW AARQDRSALL ALIGDPRGPT RVTEDETAEA VADAIQIVLP TGRASLSAKA ARAIAQAMAP GIGYDEAVTL ALGLHHSHRP RQERLARLPY YAAALPDVGL DGDPVGPPPA EDDGAAAEAY YGRIGNISVH IALNETRKIV NALLHRHGPI LRLVMVETTR ELKAGADERK RMIAEQAERE RENAEIDVEL RKSDRWMANA RERRQRVRLA RRQNNLCPYT STPIGHADLL GDAYDIDHVI PLARGGRDSL DNMVLCQSDA NKTKGDKTPW EAFHDKPGWI AQRDDFLARL DPQTAKALAW RFADDAGERV ARKSAEDEDQ GFLPRQLTDT GYIARVALRY LSLVTNEPNA VVATNGRLTG LLRLAWDITP GPAPRDLLPT PRDALRDDTA ARRFLDGLTP PPLAKAVEGA VQARLAALGR SRVADAGLAD ALGLTLASLG GGGKNRADHR HHFIDAAMIA VTTRGLINQI NQASGAGRIL DLRKWPRTNF EPPYPTFRAE VMKQWDHIHP SIRPAHRDGG SLHAATVFGV RNRPDARVLV QRKPVEKLFL DANAKPLPAD KIAEIIDGFA SPRMAKRFKA LLARYQAAHP EVPPALAALA VARDPAFGPR GMTANTVIAG RSDGDGEDAG LITPFRANPK AAVRTMGNAV YEVWEIQVKG RPRWTHRVLT RFDRTQPAPP PPPENARLVM RLRRGDLVYW PLESGDRLFL VKKMAVDGRL ALWPARLATG KATALYAQLS CPNINLNGDQ GYCVQSAEGI RKEKIRTTSC TALGRLRLSK KATTable 4- Cas9 orthologsFinegoldia MKSEKKYYIG LDVGTNSVGW AVTDEFYNIL RAKGKDLWGV RLFEKADTAA (SEQ magna ATCC NTRIFRSGRR RNDRKGMRLQ ILREIFEDEI KKVDKDFYDR LDESKFWAED ID 29328 KKVSGKYSLF NDKNFSDKQY FEKFPTIFHL RKYLMEEHGK VDIRYYFLAI NQMMKRRGHF LIDGQISHVT DDKPLKEQLI LLINDLLKIE LEEELMDSIF NO: EILADVNEKR TDKKNNLKEL IKGQDFNKQE GNILNSIFES IVTGKAKIKN 90) WP_01229014 IISDEDILEK IKEDNKEDFV LTGDSYEENL QYFEEVLQEN ITLFNTLKST 1.1 YDFLILQSIL KGKSTLSDAQ VERYDEHKKD LEILKKVIKK YDEDGKLFKQ VFKEDNGNGY VSYIGYYLNK NKKITAKKKI SNIEFTKYVK GILEKQCDCE DEDVKYLLGK IEQENFLLKQ ISSINSVIPH QIHLFELDKI LENLAKNYPS FNNKKEEFTK IEKIRKTFTF RIPYYVGPLN DYHKNNGGNA WIFRNKGEKI RPWNFEKIVD LHKSEEEFIK RMLNQCTYLP EETVLPKSSI LYSEYMVLNE LNNLRINGKP LDTDVKLKLI EELFKKKTKV TLKSIRDYMV RNNFADKEDF DNSEKNLEIA SNMKSYIDFN NILEDKFDVE MVEDLIEKIT IHTGNKKLLK KYIEETYPDL SSSQIQKIIN LKYKDWGRLS RKLLDGIKGT KKETEKTDTV INFLRNSSDN LMQIIGSQNY SFNEYIDKLR KKYIPQEISY EVVENLYVSP SVKKMIWQVI RVTEEITKVM GYDPDKIFIE MAKSEEEKKT TISRKNKLLD LYKAIKKDER DSQYEKLLTG LNKLDDSDLR SRKLYLYYTQ MGRDMYTGEK IDLDKLFDST HYDKDHIIPQ SMKKDDSIIN NLVLVNKNAN QTTKGNIYPV PSSIRNNPKI YNYWKYLMEK EFISKEKYNR LIRNTPLTNE ELGGFINRQL VETRQSTKAI KELFEKFYQK SKIIPVKASL ASDLRKDMNT LKSREVNDLH HAHDAFLNIV AGDVWNREFT SNPINYVKEN REGDKVKYSL SKDFTRPRKS KGKVIWTPEK GRKLIVDTLN KPSVLISNES HVKKGELFNA TIAGKKDYKK GKIYLPLKKD DRLQDVSKYG GYKAINGAFF FLVEHTKSKK RIRSIELFPL HLLSKFYEDK NTVLDYAINV LQLQDPKIII DKINYRTEII IDNFSYLIST KSNDGSITVK PNEQMYWRVD EISNLKKIEN KYKKDAILTE EDRKIMESYI DKIYQQFKAG KYKNRRTTDT IIEKYEIIDL DTLDNKQLYQ LLVAFISLSY KTSNNAVDFT VIGLGTECGK PRITNLPDNT YLVYKSITGI YEKRIRIK Eubacterium MNYTEKEKLF MKYILALDIG IASVGWAILD KESETVIEAG SNIFPEASAA (SEQ rectale ATCC DNQLRRDMRG AKRNNRRLKT RINDFIKLWE NNNLSIPQFK STEIVGLKVR ID 33656 AITEEITLDE LYLILYSYLK HRGISYLEDA LDDTVSGSSA YANGLKLNAK ELETHYPCEI QQERLNTIGK YRGQSQIINE NGEVLDLSNV FTIGAYRKEI NO: QRVFEIQKKY HPELTDEFCD GYMLIFNRKR KYYEGPGNEK SRTDYGRFTT 91) WP_01274255 KLDANGNYIT EDNIFEKLIG KCSVYPDELR AAAASYTAQE YNVLNDLNNL 5.1 TINGRKLEEN EKHEIVERIK SSNTINMRKI ISDCMGENID DFAGARIDKS GKEIFHKFEV YNKMRKALLE IGIDISNYSR EELDEIGYIM TINTDKEAMM EAFQKSWIDL SDDVKQCLIN MRKTNGALFN KWQSFSLKIM NELIPEMYAQ PKEQMTLLTE MGVTKGTQEE FAGLKYIPVD VVSEDIFNPV VRRSVRISFK ILNAVLKKYK ALDTIVIEMP RDRNSEEQKK RINDSQKLNE KEMEYIEKKL AVTYGIKLSP SDFSSQKQLS LKLKLWNEQD GICLYSGKTI DPNDIINNPQ LFEIDHIIPR SISFDDARSN KVLVYRSENQ KKGNQTPYYY LTHSHSEWSF EQYKATVMNL SKKKEYAISR KKIQNLLYSE DITKMDVLKG FINRNINDTS YASRLVLNTI QNFFMANEAD TKVKVIKGSY THQMRCNLKL DKNRDESYSH HAVDAMLIGY SELGYEAYHK LQGEFIDFET GEILRKDMWD ENMSDEVYAD YLYGKKWANI RNEVVKAEKN VKYWHYVMRK SNRGLCNQTI RGTREYDGKQ YKINKLDIRT KEGIKVFAKL AFSKKDSDRE RLLVYLNDRR TFDDLCKIYE DYSDAANPFV QYEKETGDII RKYSKKHNGP RIDKLKYKDG EVGACIDISH KYGFEKGSKK VILESLVPYR MDVYYKEENH SYYLVGVKQS DIKFEKGRNV IDEEAYARIL VNEKMIQPGQ SRADLENLGF KFKLSFYKND IIEYEKDGKI YTERLVSRTM PKQRNYIETK PIDKAKFEKQ NLVGLGKTKF IKKYRYDILG NKYSCSEEKF TSFCTable 4- Cas9 orthologsCorynebacteriu MKYHVGIDVG TFSVGLAAIE VDDAGMPIKT LSLVSHIHDS GLDPDKIKSA (SEQ m diphtheriae VTRLASSGIA RRTRRLYRRK RRRLQQLDKF IQRQGWPVIE LEDYSDPLYP ID C7 (beta) WKVRAELAAS YIADEKERGE KLSVALRHIA RHRGWRNPYA KVSSLYLPDE PSDAFKAIRE EIKRASGQPV PETATVGQMV TLCELGTLKL RGEGGVLSAR NO: LQQSDHAREI QEICRMQEIG QELYRKIIDV VFAAESPKGS ASSRVGKDPL 92) AEX66236.1 QPGKNRALKA SDAFQRYRIA ALIGNLRVRV DGEKRILSVE EKNLVFDHLV NLAPKKEPEW VTIAEILGID RGQLIGTATM TDDGERAGAR PPTHDTNRSI WP_01431843 VNSRIAPLVD WWKTASALEQ HAMVKALSNA EVDDFDSPEG AKVQAFFADL 1.1 DDDVHAKLDS LHLPVGRAAY SEDTLVRLTR RMLADGVDLY TARLQEFGIE PSWTPPAPRI GEPVGNPAVD RVLKTVSRWL ESATKTWGAP ERVIIEHVRE GFVTEKRARE MDGDMRRRAA RNAKLFQEMQ EKLNVQGKPS RADLWRYQSV QRQNCQCAYC GSPITFSNSE MDHIVPRAGQ GSTNTRENLV AVCHRCNQSK GNTPFAIWAK NTSIEGVSVK EAVERTRHWV TDTGMRSTDF KKFTKAVVER FQRATMDEEI DARSMESVAW MANELRSRVA QHFASHGTTV RVYRGSLTAE ARRASGISGK LEFLDGVGKS RLDRRHHAID AAVIAFTSDY VAETLAVRSN LKQSQAHRQE APQWREFTGK DAEHRAAWRV WCQKMEKLSA LLTEDLRDDR VVVMSNVRLR LGNGSAHEET IGKLSKVKLG SQLSVSDIDK ASSEALWCAL TREPDFDPKD GLPANPERHI RVNGTHVYAG DNIGLFPVSA GSIALRGGYA ELGSSFHHAR VYKITSGKKP AFAMLRVYTI DLLPYRNQDL FSVELKPQTM SMRQAEKKLR DALATGNAEY LGWLVVDDEL VVDTSKIATD QVKAVEAELG TIRRWRVDGF FGDTRLRLRP LQMSKEGIKK ESAPELSKII DRPGWLPAVN KLFSEGNVTV VRRDSLGRVR LESTAHLPVT WKVQ Roseburia MNAEHGKEGL LIMEENFQYR IGLDIGITSV GWAVLQNNSQ DEPVRITDLG (SEQ inulinivorans VRIFDVAENP KNGDALAAPR RDARTTRRRL RRRRHRLERI KFLLQENGLI ID DSM 16841 EMDSFMERYY KGNLPDVYQL RYEGLDRKLK DEELAQVLIH IAKHRGFRST RKAETKEKEG GAVLKATTEN QKIMQEKGYR TVGEMLYLDE AFHTECLWNE NO: KGYVLTPRNR PDDYKHTILR SMLVEEVHAI FAAQRAHGNQ KATEGLEEAY 93) WP_00788930 VEIMTSQRSF DMGPGLQPDG KPSPYAMEGF GDRVGKCTFE KDEYRAPKAT 5.1 YTAELFVALQ KINHTKLIDE FGTGRFFSEE ERKTIIGLLL SSKELKYGTI RKKLNIDPSL KFNSLNYSAK KEGETEEERV LDTEKAKFAS MFWTYEYSKC LKDRTEEMPV GEKADLFDRI GEILTAYKND DSRSSRLKEL GLSGEEIDGL LDLSPAKYQR VSLKAMRKMQ PYLEDGLIYD KACEAAGYDF RALNDGNKKH LLKGEEINAI VNDITNPVVK RSVSQTIKVI NAIIQKYGSP QAVNIELARE MSKNFQDRTN LEKEMKKRQQ ENERAKQQII ELGKQNPTGQ DILKYRLWND QGGYCLYSGK KIPLEELFDG GYDIDHILPY SITFDDSYRN KVLVTAQENR QKGNRTPYEY FGADEKRWED YEASVRLLVR DYKKQQKLLK KNFTEEERKE FKERNLNDTK YITRVVYNMI RQNLELEPFN HPEKKKQVWA VNGAVTSYLR KRWGLMQKDR STDRHHAMDA VVIACCTDGM IHKISRYMQG RELAYSRNFK FPDEETGEIL NRDNFTREQW DEKFGVKVPL PWNSFRDELD IRLLNEDPKN FLLTHADVQR ELDYPGWMYG EEESPIEEGR YINYIRPLFV SRMPNHKVTG SAHDATIRSA RDYETRGVVI TKVPLTDLKL NKDNEIEGYY DKDSDRLLYQ ALVRQLLLHG NDGKKAFAED FHKPKADGTE GPVVRKVKIE KKQTSGVMVR GGTGIAANGE MVRIDVFREN GKYYFVPVYT ADVVRKVLPN RAATHTKPYS EWRVMDDANF VFSLYSRDLI HVKSKKDIKT NLVNGGLLLQ KEIFAYYTGA DIATASIAGF ANDSNFKFRG LGIQSLEIFE KCQVDILGNI SVVRHENRQE FH Alicycliphilus MRSLRYRLAL DLGSTSLGWA LFRLDACNRP TAVIKAGVRI FSDGRNPKDG (SEQ denitrificans SSLAVTRRAA RAMRRRRDRL LKRKTRMQAK LVEHGFFPAD AGKRKALEQL ID K601 NPYALRAKGL QEALLPGEFA RALFHINQRR GFKSNRKTDK KDNDSGVLKK AIGQLRQQMA EQGSRTVGEY LWTRLQQGQG VRARYREKPY TTEEGKKRID NO: KSYDLYIDRA MIEQEFDALW AAQAAFNPTL FHEAARADLK DTLLHQRPLR 94) PVKPGRCTLL PEEERAPLAL PSTQRFRIHQ EVNHLRLLDE NLREVALTLATable 4- Cas9 orthologsWP_01351712 QRDAVVTALE TKAKLSFEQI RKLLKLSGSV QFNLEDAKRT ELKGNATSAA 7.1 LARKELFGAA WSGFDEALQD EIVWQLVTEE GEGALIAWLQ THTGVDEARA QAIVDVSLPE GYGNLSRKAL ARIVPALRAA VITYDKAVQA AGFDHHSQLG FEYDASEVED LVHPETGEIR SVFKQLPYYG KALQRHVAFG SGKPEDPDEK RYGKIANPTV HIGLNQVRMV VNALIRRYGR PTEVVIELAR DLKQSREQKV EAQRRQADNQ RRNARIRRSI AEVLGIGEER VRGSDIQKWI CWEELSFDAA DRRCPYSGVQ ISAAMLLSDE VEVEHILPFS KTLDDSLNNR TVAMRQANRI KRNRTPWDAR AEFEAQGWSY EDILQRAERM PLRKRYRFAP DGYERWLGDD KDFLARALND TRYLSRVAAE YLRLVCPGTR VIPGQLTALL RGKFGLNDVL GLDGEKNRND HRHHAVDACV IGVTDQGLMQ RFATASAQAR GDGLTRLVDG MPMPWPTYRD HVERAVRHIW VSHRPDHGFE GAMMEETSYG IRKDGSIKQR RKADGSAGRE ISNLIRIHEA TQPLRHGVSA DGQPLAYKGY VGGSNYCIEI TVNDKGKWEG EVISTFRAYG VVRAGGMGRL RNPHEGQNGR KLIMRLVIGD SVRLEVDGAE RTMRIVKISG SNGQIFMAPI HEANVDARNT DKQDAFTYTS KYAGSLQKAK TRRVTISPIGEVRDPGFKG Sphaerochaeta MSKKVSRRYE EQAQEICQRL GSRPYSIGLD LGVGSIGVAV AAYDPIKKQP (SEQ globosa str. SDLVFVSSRI FIPSTGAAER RQKRGQRNSL RHRANRLKFL WKLLAERNLM ID Buddy LSYSEQDVPD PARLRFEDAV VRANPYELRL KGLNEQLTLS ELGYALYHIA NHRGSSSVRT FLDEEKSSDD KKLEEQQAMT EQLAKEKGIS TFIEVLTAFN NO: TNGLIGYRNS ESVKSKGVPV PTRDIISNEI DVLLQTQKQF YQEILSDEYC 95) WP_01360784 DRIVSAILFE NEKIVPEAGC CPYFPDEKKL PRCHFLNEER RLWEAINNAR 9.1 IKMPMQEGAA KRYQSASFSD EQRHILFHIA RSGTDITPKL VQKEFPALKT SIIVLQGKEK AIQKIAGFRF RRLEEKSFWK RLSEEQKDDF FSAWTNTPDD KRLSKYLMKH LLLTENEVVD ALKTVSLIGD YGPIGKTATQ LLMKHLEDGL TYTEALERGM ETGEFQELSV WEQQSLLPYY GQILTGSTQA LMGKYWHSAF KEKRDSEGFF KPNTNSDEEK YGRIANPVVH QTLNELRKLM NELITILGAK PQEITVELAR ELKVGAEKRE DIIKQQTKQE KEAVLAYSKY CEPNNLDKRY IERFRLLEDQ AFVCPYCLEH ISVADIAAGR ADVDHIFPRD DTADNSYGNK VVAHRQCNDI KGKRTPYAAF SNTSAWGPIM HYLDETPGMW RKRRKFETNE EEYAKYLQSK GFVSRFESDN SYIAKAAKEY LRCLFNPNNV TAVGSLKGME TSILRKAWNL QGIDDLLGSR HWSKDADTSP TMRKNRDDNR HHGLDAIVAL YCSRSLVQMI NTMSEQGKRA VEIEAMIPIP GYASEPNLSF EAQRELFRKK ILEFMDLHAF VSMKTDNDAN GALLKDTVYS ILGADTQGED LVFVVKKKIK DIGVKIGDYE EVASAIRGRI TDKQPKWYPM EMKDKIEQLQ SKNEAALQKY KESLVQAAAV LEESNRKLIE SGKKPIQLSE KTISKKALEL VGGYYYLISN NKRTKTFVVK EPSNEVKGFA FDTGSNLCLD FYHDAQGKLC GEIIRKIQAM NPSYKPAYMK QGYSLYVRLY QGDVCELRAS DLTEAESNLA KTTHVRLPNA KPGRTFVIII TFTEMGSGYQ IYFSNLAKSK KGQDTSFTLT TIKNYDVRKV QLSSAGLVRY VSPLLVDKIE KDEVALCGE Fusobacterium MKKQKFSDYY LGFDIGTNSV GWCVTDLDYN VLRFNKKDMW GSRLFDEAKT (SEQ nucleatum AAERRVQRNS RRRLKRRKWR LNLLEEIFSD EIMKIDSNFF RRLKESSLWL ID subsp. EDKNSKEKFT LFNDDNYKDY DFYKQYPTIF HLRDELIKNP EKKDIRLIYL ALHSIFKSRG HFLFEGQNLK EIKNFETLYN NLISFLEDNG INKSIDKDNI NO: vincentii EKLEKIICDS GKGLKDKEKE FKGIFNSDKQ LVAIFKLSVG SSVSLNDLFD 96) ATCC 49256 TDEYKKEEVE KEKISFREQI YEDDKPIYYS ILGEKIELLD IAKSFYDFMV LNNILSDSNY ISEAKVKLYE EHKKDLKNLK YIIRKYNKEN YDKLFKDKNE WP_00588864 NNYPAYIGLN KEKDKKEVVE KSRLKIDDLI KVIKGYLPKP ERIEEKDKTI 9.1 FNEILNKIEL KTILPKQRIS DNGTLPYQIH EVELEKILEN QSKYYDFLNY EENGVSTKDK LLKTFKFRIP YYVGPLNSYH KDKGGNSWIV RKEEGKILPW NFEQKVDIEK SAEEFIKRMT NKCTYLNGED VIPKDSFLYS EYIILNELNK VQVNDEFLNE ENKRKIIDEL FKENKKVSEK KFKEYLLVNQ IANRTVELKG IKDSFNSNYV SYIKFKDIFG EKLNLDIYKE ISEKSILWKC LYGDDKKIFETable 4- Cas9 orthologsKKIKNEYGDI LNKDEIKKIN SFKFNTWGRL SEKLLTGIEF INLETGECYS SVMEALRRTN YNLMELLSSK FTLQESIDNE NKEMNEVSYR DLIEESYVSP SLKRAILQTL KIYEEIKKIT GRVPKKVFIE MARGGDESMK NKKIPARQEQ LKKLYDSCGN DIANFSIDIK EMKNSLSSYD NNSLRQKKLY LYYLQFGKCM YTGREIDLDR LLQNNDTYDI DHIYPRSKVI KDDSFDNLVL VLKNENAEKS NEYPVKKEIQ EKMKSFWRFL KEKNFISDEK YKRLTGKDDF ELRGFMARQL VNVRQTTKEV GKILQQIEPE IKIVYSKAEI ASSFREMFDF IKVRELNDTH HAKDAYLNIV AGNVYNTKFT EKPYRYLQEI KENYDVKKIY NYDIKNAWDK ENSLEIVKKN MEKNTVNITR FIKEEKGELF NLNPIKKGET SNEIISIKPK LYDGKDNKLN EKYGYYTSLK AAYFIYVEHE KKNKKVKTFE RITRIDSTLI KNEKNLIKYL VSQKKLLNPK IIKKIYKEQT LIIDSYPYTF TGVDSNKKVE LKNKKQLYLE KKYEQILKNA LKFVEDNQGE TEENYKFIYL KKRNNNEKNE TIDAVKERYN IEFNEMYDKF LEKLSSKDYK NYINNKLYTN FLNSKEKFKK LKLWEKSLIL REFLKIFNKN TYGKYEIKDS QTKEKLFSFP EDTGRIRLGQ SSLGNNKELL EESVTGLFVK KIKL Pasteurella MQTTNLSYIL GLDLGIASVG WAVVEINENE DPIGLIDVGV RIFERAEVPK (SEQ multocida TGESLALSRR LARSTRRLIR RRAHRLLLAK RFLKREGILS TIDLEKGLPN ID subsp. QAWELRVAGL ERRLSAIEWG AVLLHLIKHR GYLSKRKNES QTNNKELGAL LSGVAQNHQL LQSDDYRTPA ELALKKFAKE NO: multocida str. EGHIRNQRGA YTHTFNRLDL LAELNL 97) Pm70 LFAQ QHQFGNPHCK EHIQQYMTEL LMWQKPALSG EAILKMLGKC THEKNEFKAA KHTYSAERFV WLTKLNNLRI LEDGAERALN EEERQLLINH PYEKSKLTYA QVRKLLGLSE QAIFKHLRYS KENAESATFM ELKAWHAIRK WP_01090703 ALENQGLKDT WQDLAKKPDL LDEIGTAFSL YKTDEDIQQY LTNKVPNSVI 3.1 NALLVSLNFD KFIELSLKSL RKILPLMEQG KRYDQACREI YGHHYGEANQ KTSQLLPAIP AQEIRNPVVL RTLSQARKVI NAIIRQYGSP ARVHIETGRE LGKSFKERRE IQKQQEDNRT KRESAVQKFK ELFSDFSSEP KSKDILKFRL YEQQHGKCLY SGKEINIHRL NEKGYVEIDH ALPFSRTWDD SFNNKVLVLA SENQNKGNQT PYEWLQGKIN SERWKNFVAL VLGSQCSAAK KQRLLTQVID DNKFIDRNLN DTRYIARFLS NYIQENLLLV GKNKKNVFTP NGQITALLRS RWGLIKAREN NNRHHALDAI VVACATPSMQ QKITRFIRFK EVHPYKIENR YEMVDQESGE IISPHFPEPW AYFRQEVNIR VFDNHPDTVL KEMLPDRPQA NHQFVQPLFV SRAPTRKMSG QGHMETIKSA KRLAEGISVL RIPLTQLKPN LLENMVNKER EPALYAGLKA RLAEFNQDPA KAFATPFYKQ GGQQVKAIRV EQVQKSGVLV RENNGVADNA SIVRTDVFIK NNKFFLVPIY TWQVAKGILP NKAIVAHKNE DEWEEMDEGA KFKFSLFPND LVELKTKKEY FFGYYIGLDR ATGNISLKEH DGEISKGKDG VYRVGVKLAL SFEKYQVDEL GKNRQICRPQ QRQPVR Alcanivorax MRYRVGLDLG TASVGAAVFS MDEQGNPMEL IWHYERLFSE PLVPDMGQLK (SEQ pacificus W11- PKKAARRLAR QQRRQIDRRA SRLRRIAIVS RRLGIAPGRN DSGVHGNDVP ID 5 TLRAMAVNER IELGQLRAVL LRMGKKRGYG GTFKAVRKVG EAGEVASGAS RLEEEMVALA SVQNKDSVTV GEYLAARVEH GLPSKLKVAA NNEYYAPEYA NO: LFRQYLGLPA IKGRPDCLPN MYALRHQIEH EFERIWATQS QFHDVMKDHG 98) WP_00873826 VKEEIRNAIF FQRPLKSPAD KVGRCSLQTN LPRAPRAQIA AQNFRIEKQM 9.1 ADLRWGMGRR AEMLNDHQKA VIRELLNQQK ELSFRKIYKE LERAGCPGPE GKGLNMDRAA LGGRDDLSGN TTLAAWRKLG LEDRWQELDE VTQIQVINFL ADLGSPEQLD TDDWSCRFMG KNGRPRNFSD EFVAFMNELR MTDGFDRLSK MGFEGGRSSY SIKALKALTE WMIAPHWRET PETHRVDEEA AIRECYPESL ATPAQGGRQS KLEPPPLTGN EVVDVALRQV RHTINMMIDD LGSVPAQIVV EMAREMKGGV TRRNDIEKQN KRFASERKKA AQSIEENGKT PTPARILRYQ LWIEQGHQCP YCESNISLEQ ALSGAYTNFE HILPRTLTQI GRKRSELVLA HRECNDEKGN RTPYQAFGHD DRRWRIVEQR ANALPKKSSR KTRLLLLKDF EGEALTDESI DEFADRQLHE SSWLAKVTTQ WLSSLGSDVY VSRGSLTAELTable 4- Cas9 orthologsRRRWGLDTVI PQVRFESGMP VVDEEGAEIT PEEFEKFRLQ WEGHRVTREM RTDRRPDKRI DHRHHLVDAI VTALTSRSLY QQYAKAWKVA DEKQRHGRVD VKVELPMPIL TIRDIALEAV RSVRISHKPD RYPDGRFFEA TAYGIAQRLD ERSGEKVDWL VSRKSLTDLA PEKKSIDVDK VRANISRIVG EAIRLHISNI FEKRVSKGMT PQQALREPIE FQGNILRKVR CFYSKADDCV RIEHSSRRGH HYKMLLNDGF AYMEVPCKEG ILYGVPNLVR PSEAVGIKRA PESGDFIRFY KGDTVKNIKT GRVYTIKQIL GDGGGKLILT PVTETKPADL LSAKWGRLKV GGRNIHLLRL CAE Mycoplasma (SEQ mobile 163K MYFYKNKENK LNKKVVLGLD LGIASVGWCL TDISQKEDNK FPIILHGVRL ID FETVDDSDDK LLNETRRKKR GQRRRNRRLF TRKRDFIKYL IDNNIIELEF DKNPKILVRN FIEKYINPFS KNLELKYKSV TNLPIGFHNL RKAAINEK NO: AAT27519.1 YK LDKSELIVLL YFYLSLRGAF FDNPEDTKSK EMNKNEIEIF DKNESIKNAE 99) FPIDKIIEFY KISGKIRSTI NLKFGHQDYL KEIKQVFEKQ NIDFMNYEKF AMEEKSFFSR IRNYSEGPGN EKSFSKYGLY ANENGNPELI INEKGQKIYT KIFKTLWESK IGKCSYDKKL YRAPKNSFSA KVFDITNKLT DWKHKNEYIS ERLKRKILLS RFLNKDSKSA VEKILKEENI KFENLSEIAY NKDDNKINLP IINAYHSLTT IFKKHLINFE NYLISNENDL SKLMSFYKQQ SEKLFVPNEK GSYEINQNNN VLHIFDAISN ILNKFSTIQD RIRILEGYFE FSNLKKDVKS SEIYSEIAKL REFSGTSSLS FGAYYKFIPN LISEGSKNYS TISYEEKALQ NQKNNFSHSN LFEKTWVEDL IASPTVKRSL RQTMNLLKEI FKYSEKNNLE IEKIVVEVTR SSNNKHERKK IEGINKYRKE KYEELKKVYD LPNENTTLLK KLWLLRQQQG YDAYSLRKIE ANDVINKPWN YDIDHIVPRS ISFDDSFSNL VIVNKLDNAK KSNDLSAKQF IEKIYGIEKL KEAKENWGNW YLRNANGKAF NDKGKFIKLY TIDNLDEFDN SDFINRNLSD TSYITNALVN HLTFSNSKYK YSVVSVNGKQ TSNLRNQIAF VGIKNNKETE REWKRPEGFK SINSNDFLIR EEGKNDVKDD VLIKDRSFNG HHAEDAYFIT IISQYFRSFK RIERLNVNYR KETRELDDLE KNNIKFKEKA SFDNFLLINA LDELNEKLNQ MRFSRMVITK KNTQLFNETL YSGKYDKGKN TIKKVEKLNL LDNRTDKIKK IEEFFDEDKL KENELTKLHI FNHDKNLYET LKIIWNEVKI EIKNKNLNEK NYFKYFVNKK LQEGKISFNE WVPILDNDFK IIRKIRYIKF SSEEKETDEI IFSQSNFLKI DQRQNFSFHN TLYWVQIWVY KNQKDQYCFI SIDARNSKFE KDEIKINYEK LKTQKEKLQI INEEPILKIN KGDLFENEEK ELFYIVGRDE KPQKLEIKYI LGKKIKDQKQ IQKPVKKYFP NWKKVNLTYM GEIFKK gamma MTKNYISPIA IDLGAKFTGV ALYQYLEGAD CTQEVAKGLL VDDRGNVTWS (SEQ proteobacteriu QEGRRGKRHQ VRGYKRRKMA KRLLWLILDS EYGIKREEVT EPLLKFINGL ID m HTCC5015 LNRRGYTYIS EEVDEESMNV SPLPFSEMMP DYFNSSAPLL EQLAKLLSDK NKLVRFRAEG KIPSNKNEFK KLLDTALDGK YKDEKKELSE AWGNILIASE NO: NVLKSTVDGH KSRSEYLANI KEDIKSNEEL EKQISSKEID GFYNLVGHLS 100) WP_00828423 NFQLRLLRKY FNDPNMSGVS YWDEKRLEKY FYQWVQGWHT KGGTDEAEKK 9.1 NIILKTKGAP LLKTLKSLSA DLTIPPYEDQ NNRRPPKCQS VLLSDEKLTM HYPKWKEWVG QLVKQNDNAY LNENVTLANA LHRIVERSRS IDPYQLRLLI SITDAEKRND LAGYKRLKLS LGSEVDEFLL LVKNIVDETK EAREGLWFET ENKLFFKCGK TPPRKEKLKS TLLSAVLGKN LSDDEQSSFI EEFWKSGTPK IERRNVRGWC RLASQVQKTY GVYLKEYGLQ QLHKLEAGKK LDDKPLALLY KNSGLIASKI GEALNIEPDE VSRFASPHSL AQIFNIIEGD VAGFNKTCRA CTYENIWRMQ EEKVESLLTN QLLSEIHGER KVPLKSAMCT RLSADSTRPF DGQMASIIEH IARKIAQHKI AQINDVPKEF SIDIPIIIES NQFSFTAELE EIKRGRGSAK AKKAKELGEK SKAGWVSKTE RIKTSSEGIC PYTGAPLGGS GEIDHIIPRS LTGRTKKTVF NSEANLIYCS SKGNHDKGNR VYVIEQLNDK YLKKQFSTSD VNLIKKKIKT TIQRFTEGGE KLRSFSELSR EDQKAFRHALTable 4- Cas9 orthologsFVPELKSEVT SLLAVKNITR VNGTQAWLAK KIASLLAEHL DKQGRDYTLS AHQIDPWSVS KQRKMLASAE PIWAKKDPQP AASHVVDAVC TFLEALEQPH TASRLKTISS TSFEKTGWRS ALIPDLIKVD ALDRRPKYRR YNIGSTSLFK DGIYAERFLP ILIDENGLMA GYDIDNSLKA KGADVVFESL SPFLLFKGEE VGAQSLSDWQ ERIDGRYLYM SIDKVKAFDY LQEKVGEKDI AAELLNSIHF TQRKTELRAK FSDDSGKKMK TLDAIRKSLK LTVTVNEIGK RKEKCGFSGT IGIPAKSAWE NLLDEPLLET YWGTKMPPQE IWEKVYRKHF PRNIPNQAHR KVRKDFSLPV VDSVSGGFRV KRKTPNGYNY QLLAIDGYSA VGFKKEGDNV DFKSPALVPQ IAESKSVTPI SSELVHLDKN EIVYFDEWRK IDISDSDLKQ FVSSLELAPG SQNRFYIRFT VDEDQFERHF KSALRVNGIQ DLDTVNKTFD WNREIPSLLI PPRSNLFLLE TGQKITFEYI ANGANAEVKK AYSLRRA Planococcus MKNYTIGLDI GVASVGWVCI DENYKILNYN NRHAFGVHEF ESAESAAGRR (SEQ antarcticus LKRGMRRRYN RRKKRLQLLQ SLFDSYITDS GFFSKTDSQH FWKNNNEFEN ID DSM 14505 RSLTEVLSSL RISSRKYPTI YHLRSDLIES NKKMDLRLVY LALHNLVKYR GHFLQEGNWS EAASAEGMDD QLLELVTRYA ELENLSPLDL SESQWKAAET NO: LLLNRNLTKT DQSKELTAMF GKEYEPFCKL VAGLGVSLHQ LFPSSEQALA 101) ANU10858.1 YKETKTKVQL SNENVEEVME LLLEEESALL EAVQPFYQQV VLYELLKGET YVAKAKVSAF KQYQKDMASL KNLLDKTFGE KVYRSYFISD KNSQREYQKS HKVEVLCKLD QFNKEAKFAE TFYKDLKKLL EDKSKTSIGT TEKDEMLRII KAIDSNQFLQ KQKGIQNAAI PHQNSLYEAE KILRNQQAHY PFITTEWIEK VKQILAFRIP YYIGPLVKDT TQSPFSWVER KGDAPITPWN FDEQIDKAAS AEAFISRMRK TCTYLKGQEV LPKSSLTYER FEVLNELNGI QLRTTGAESD FRHRLSYEMK CWIIDNVFKQ YKTVSTKRLL QELKKSPYAD ELYDEHTGEI KEVFGTQKEN AFATSLSGYI SMKSILGAVV DDNPAMTEEL IYWIAVFEDR EILHLKIQEK YPSITDVQRQ KLALVKLPGW GRFSRLLIDG LPLDEQGQSV LDHMEQYSSV FMEVLKNKGF GLEKKIQKMN QHQVDGTKKI RYEDIEELAG SPALKRGIWR SVKIVEELVS IFGEPANIVL EVAREDGEKK RTKSRKDQWE ELTKTTLKND PDLKSFIGEI KSQGDQRFNE QRFWLYVTQQ GKCLYTGKAL DIQNLSMYEV DHILPQNFVK DDSLDNLALV MPEANQRKNQ VGQNKMPLEI IEANQQYAMR TLWERLHELK LISSGKLGRL KKPSFDEVDK DKFIARQLVE TRQIIKHVRD LLDERFSKSD IHLVKAGIVS KFRRFSEIPK IRDYNNKHHA MDALFAAALI QSILGKYGKN FLAFDLSKKD RQKQWRSVKG SNKEFFLFKN FGNLRLQSPV TGEEVSGVEY MKHVYFELPW QTTKMTQTGD GMFYKESIFS PKVKQAKYVS PKTEKFVHDE VKNHSICLVE FTFMKKEKEV QETKFIDLKV IEHHQFLKEP ESQLAKFLAE KETNSPIIHA RIIRTIPKYQ KIWIEHFPYY FISTRELHNA RQFEISYELM EKVKQLSERS SVEELKIVFG LLIDQMNDNY PIYTKSSIQD RVQKFVDTQL YDFKSFEIGF EELKKAVAAN AQRSDTFGSR ISKKPKPEEV AIGYESITGL KYRKPRSVVG TKR Prevotella sp. MTQKVLGLDL GTNSIGSAVR NLDLSDDLQW QLEFFSSDIF RSSVNKESNG (SEQ C561 REYSLAAQRS AHRRSRGLNE VRRRRLWATL NLLIKHGFCP MSSESLMRWC ID TYDKRKGLFR EYPIDDKDFN AWILLDFNGD GRPDYSSPYQ LRRELVTRQF DFEQPIERYK LGRALYHIA NO: WP_00901330 Q HRGFKSSKGE TLSQQETNSK PSSTDEIPDV AGAMKASEEK LSKGLSTYMK EHNLLTVGAA FAQLEDEGVR VRNNNDYRAI 102) 3.1 RSQFQHEIET IFKFQQGLSV ESELYERLIS EKKNVGTIFY KRPLRSQRGN VGKCTLERSK PRCAIGHPLF EKFRAWTLIN NIKVRMSVDT LDEQLPMKLR LDLYNECFLA FVRTEFKFED IRKYLEKRLG IHFSYNDKTI NYKDSTSVAG CPITARFRKM LGEEWESFRV EGQKERQAHS KNNISFHRVS YSIEDIWHFC YDAEEPEAVL AFAQETLRLE RKKAEELVRI WSAMPQGYAM LSQKAIRNIN KILMLGLKYS DAVILAKVPE LVDVSDEELL SIAKDYYLVE AQVNYDKRIN SIVNGLIAKY KSVSEEYRFA DHNYEYLLDE SDEKDIIRQI ENSLGARRWS LMDANEQTDI LQKVRDRYQD FFRSHERKFV ESPKLGESFE NYLTKKFPMV EREQWKKLYH PSQITIYRPV SVGKDRSVLR LGNPDIGAIK NPTVLRVLNTTable 4- Cas9 orthologsLRRRVNQLLD DGVISPDETR VVVETARELN DANRKWALDT YNRIRHDENE KIKKILEEFY PKRDGISTDD IDKARYVIDQ REVDYFTGSK TYNKDIKKYK FWLEQGGQCM YTGRTINLSN LFDPNAFDIE HTIPESLSFD SSDMNLTLCD AHYNRFIKKN HIPTDMPNYD KAITIDGKEY PAITSQLQRW VERVERLNRN VEYWKGQARR AQNKDRKDQC MREMHLWKME LEYWKKKLER FTVTEVTDGF KNSQLVDTRV ITRHAVLYLK SIFPHVDVQR GDVTAKFRKI LGIQSVDEKK DRSLHSHHAI DATTLTIIPV SAKRDRMLEL FAKIEEINKM LSFSGSEDRT GLIQELEGLK NKLQMEVKVC RIGHNVSEIG TFINDNIIVN HHIKNQALTP VRRRLRKKGY IVGGVDNPRW QTGDALRGEI HKASYYGAIT QFAKDDEGKV LMKEGRPQVN PTIKFVIRRE LKYKKSAADS GFASWDDLGK AIVDKELFAL MKGQFPAETS FKDACEQGIY MIKKGKNGMP DIKLHHIRHV RCEAPQSGLK IKEQTYKSEK EYKRYFYAAV GDLYAMCCYT NGKIREFRIY SLYDVSCHRK SDIEDIPEFI TDKKGNRLML DYKLRTGDMI LLYKDNPAEL YDLDNVNLSR RLYKINRFES QSNLVLMTHH LSTSKERGRS LGKTVDYQNL PESIRSSVKS LNFLIMGENR DFVIKNGKII FNHR Alicyclobacillu MAYRLGLDIG ITSVGWAVVA LEKDESGLKP VRIQDLGVRI FDKAEDSKTG (SEQ s hesperidum ASLALPRREA RSARRRTRRR RHRLWRVKRL LEQHGILSME QIEALYAQRT ID URH17-3-68 SSPDVYALRV AGLDRCLIAE EIARVLIHIA HRRGFQSNRK SEIKDSDAGK LLKAVQENEN LMQSKGYRTV AEMLVSEATK TDAEGKLVHG KKHGYVSNVR NO: NKAGEYRHTV SRQAIVDEVR KIFAAQRALG NDVMSEELED SYLKILCSQR 103) WP_00644656 NFDDGPGGDS PYGHGSVSPD GVRQSIYERM VGSCTFETGE KRAPRSSYSF 6.1 ERFQLLTKVV NLRIYRQQED GGRYPCELTQ TERARVIDCA YEQTKITYGK LRKLLDMKDT ESFAGLTYGL NRSRNKTEDT VFVEMKFYHE VRKALQRAGV FIQDLSIETL DQIGWILSVW KSDDNRRKKL STLGLSDNVI EELLPLNGSK FGHLSLKAIR KILPFLEDGY SYDVACELAG YQFQGKTEYV KQRLLPPLGE GEVTNPVVRR ALSQAIKVVN AVIRKHGSPE SIHIELAREL SKNLDERRKI EKAQKENQKN NEQIKDEIRE ILGSAHVTGR DIVKYKLFKQ QQEFCMYSGE KLDVTRLFEP GYAEVDHIIP YGISFDDSYD NKVLVKTEQN RQKGNRTPLE YLRDKPEQKA KFIALVESIP LSQKKKNHLL MDKRAIDLEQ EGFRERNLSD TRYITRALMN HIQAWLLFDE TASTRSKRVV CVNGAVTAYM RARWGLTKDR DAGDKHHAAD AVVVACIGDS LIQRVTKYDK FKRNALADRN RYVQQVSKSE GITQYVDKET GEVFTWESFD ERKFLPNEPL EPWPFFRDEL LARLSDDPSK NIRAIGLLTY SETEQIDPIF VSRMPTRKVT GAAHKETIRS PRIVKVDDNK GTEIQVVVSK VALTELKLTK DGEIKDYFRP EDDPRLYNTL RERLVQFGGD AKAAFKEPVY KISKDGSVRT PVRKVKIQEK LTLGVPVHGG RGIAENGGMV RIDVFAKGGK YYFVPIYVAD VLKRELPNRL ATAHKPYSEW RVVDDSYQFK FSLYPNDAVM IKPSREVDIT YKDRKEPVGC RIMYFVSANI ASASISLRTH DNSGELEGLG IQGLEVFEKY VVGPLGDTHP VYKERRMPFR VERKMN Lactobacillus MTKLNQPYGI GLDIGSNSIG FAVVDANSHL LRLKGETAIG ARLFREGQSA (SEQ rhamnosus GG ADRRGSRTTR RRLSRTRWRL SFLRDFFAPH ITKIDPDFFL RQKYSEISPK ID DKDRFKYEKR LFNDRTDAEF YEDYPSMYHL RLHLMTHTHK ADPREIFLAI HHILKSRGHF LTPGAAKD NO: WP_01456997 FN TDKVDLEDIF PALTEAYAQV YPDLELTFDL AKADDFKAKL LDEQATPSDT QKALVNLLLS SDGEKEIVKK RKQVLTEFAK 104) 7.1 AITGLKTKFN LALGTEVDEA DASNWQFSMG QLDDKWSNIE TSMTDQGTEI FEQIQELYRA RLLNGIVPAG MSLSQAKVAD YGQHKEDLEL FKTYLKKLND HELAKTIRGL YDRYINGDDA KPFLREDFVK ALTKEVTAHP NEVSEQLLNR MGQANFMLKQ RTKANGAIPI QLQQRELDQI IANQSKYYDW LAAPNPVEAH RWKMPYQLDE LLNFHIPYYV GPLITPKQQA ESGENVFAWM VRKDPSGNIT PYNFDEKVDR EASANTFIQR MKTTDTYLIG EDVLPKQSLL YQKYEVLNEL NNVRINNECL GTDQKQRLIR EVFERHSSVT IKQVADNLVA HGDFARRPEI RGLADEKRFL SSLSTYHQLK EILHEAIDDP TKLLDIENII TWSTVFEDHT IFETKLAEIE WLDPKKINEL SGIRYRGWGQ FSRKLLDGLK LGNGHTVIQETable 4- Cas9 orthologsLMLSNHNLMQ ILADETLKET MTELNQDKLK TDDIEDVIND AYTSPSNKKA LRQVLRVVED IKHAANGQDP SWLFIETADG TGTAGKRTQS RQKQIQTVYA NAAQELIDSA VRGELEDKIA DKASFTDRLV LYFMQGGRDI YTGAPLNIDQ LSHYDIDHIL PQSLIKDDSL DNRVLVNATI NREKNNVFAS TLFAGKMKAT WRKWHEAGLI SGRKLRNLML RPDEIDKFAK GFVARQLVET RQIIKLTEQI AAAQYPNTKI IAVKAGLSHQ LREELDFPKN RDVNHYHHAF DAFLAARIGT YLLKRYPKLA PFFTYGEFAK VDVKKFREFN FIGALTHAKK NIIAKDTGEI VWDKERDIRE LDRIYNFKRM LITHEVYFET ADLFKQTIYA AKDSKERGGS KQLIPKKQGY PTQVYGGYTQ ESGSYNALVR VAEADTTAYQ VIKISAQNAS KIASANLKSR EKGKQLLNEI VVKQLAKRRK NWKPSANSFK IVIPRFGMGT LFQNAKYGLF MVNSDTYYRN YQELWLSREN QKLLKKLFSI KYEKTQMNHD ALQVYKAIID QVEKFFKLYD INQFRAKLSD AIERFEKLPI NTDGNKIGKT ETLRQILIGL QANGTRSNVK NLGIKTDLGL LQVGSGIKLD KDTQIVYQSP SGLFKRRIPL ADL Enterococcus MYSIGLDLGI SSVGWSVIDE RTGNVIDLGV RLFSAKNSEK NLERRTNRGG (SEQ faecalis RRLIRRKTNR LKDAKKILAA VGFYEDKSLK NSCPYQLRVK GLTEPLSRGE ID TX0012 IYKVTLHILK KRGISYLDEV DTEAAKESQD YKEQVRKNAQ LLTKYTPGQI QLQRLKENNR VKTGINAQGN YQLNVFKVSA YANELATILK TQQAFYPNEL NO: TDDWIALFVQ PGIAEEAGLI YRKRPYYHGP GNEANNSPYG RWSDFQKTGE 105) WP_00240890 PATNIFDKLI GKDFQGELRA SGLSLSAQQY NLLNDLTNLK IDGEVPLSSE 1.1 QKEYILTELM TKEFTRFGVN DVVKLLGVKK ERLSGWRLDK KGKPEIHTLK GYRNWRKIFA EAGIDLATLP TETIDCLAKV LTLNTEREGI ENTLAFELPE EFT93846.1 LSESVKLLVL DRYKELSQSI STQSWHRFSL KTLHLLIPEL MNATSEQNTL LEQFQLKSDV RKRYSEYKKL PTKDVLAEIY NPTVNKTVSQ AFKVIDALLV KYGKEQIRYI TIEMPRDDNE EDEKKRIKEL HAKNSQRKND SQSYFMQKSG WSQEKFQTTI QKNRRFLAKL LYYYEQDGIC AYTGLPISPE LLVSDSTEID HIIPISISLD DSINNKVLVL SKANQVKGQQ TPYDAWMDGS FKKINGKFSN WDDYQKWVES RHFSHKKENN LLETRNIFDS EQVEKFLARN LNDTRYASRL VLNTLQSFFT NQETKVRVVN GSFTHTLRKK WGADLDKTRE THHHHAVDAT LCAVTSFVKV SRYHYAVKEE TGEKVMREID FETGEIVNEM SYWEFKKSKK YERKTYQVKW PNFREQLKPV NLHPRIKFSH QVDRKANRKL SDATIYSVRE KTEVKTLKSG KQKITTDEYT IGKIKDIYTL DGWEAFKKKQ DKLLMKDLDE KTYERLLSIA ETTPDFQEVE EKNGKVKRVK RSPFAVYCEE NDIPAIQKYA KKNNGPLIRS LKYYDGKLNK HINITKDSQG RPVEKTKNGR KVTLQSLKPY RYDIYQDLET KAYYTVQLYY SDLRFVEGKY GITEKEYMKK VAEQTKGQVV RFCFSLQKND GLEIEWKDSQ RYDVRFYNFQ SANSINFKGL EQEMMPAENQ FKQKPYNNGA INLNIAKYGK EGKKLRKFNT DILGKKHYLF YEKEPKNIIK Candidatus MRRLGLDLGT NSIGWCLLDL GDDGEPVSIF RTGARIFSDG RDPKSLGSLK (SEQ Puniceispirillu ATRREARLTR RRRDRFIQRQ KNLINALVKY GLMPADEIQR QALAYKDPYP ID m marinum IRKKALDEAI DPYEMGRAIF HINQRRGFKS NRKSADNEAG VVKQSIADLE MKLGEAGART IGEFLADRQA TNDTVRARRL SGTNALYEFY PDRYMLEQEF NO: IMCC1322 DTLWAKQAAF NPSLYIEAAR ERLKEIVFFQ RKLKPQEVGR CIFLSDEDRI 106) SKALPSFQRF RIYQELSNLA WIDHDGVAHR ITASLALRDH LFDELEHKKK WP_01304741 LTFKAMRAIL RKQGVVDYPV GFNLESDNRD HLIGNLTSCI MRDAKKMIGS 3.1 AWDRLDEEEQ DSFILMLQDD QKGDDEVRSI LTQQYGLSDD VAEDCLDVRL PDGHGSLSKK AIDRILPVLR DQGLIYYDAV KEAGLGEANL YDPYAALSDK LDYYGKALAG HVMGASGKFE DSDEKRYGTI SNPTVHIALN QVRAVVNELI RLHGKPDEVV IEIGRDLPMG ADGKRELERF QKEGRAKNER ARDELKKLGH IDSRESRQKF QLWEQLAKEP VDRCCPFTGK MMSISDLFSD KVEIEHLLPF SLTLDDSMAN KTVCFRQANR DKGNRAPFDA FGNSPAGYDW QEILGRSQNL PYAKRWRFLP DAMKRFEADG GFLERQLNDT RYISRYTTEY ISTIIPKNKI WVVTGRLTSL LRGFWGLNSI LRGHNTDDGT PAKKSRDDHR HHAIDAIVVGTable 4- Cas9 orthologsMTSRGLLQKV SKAARRSEDL DLTRLFEGRI DPWDGFRDEV KKHIDAIIVS HRPRKKSQGA LHNDTAYGIV EHAENGASTV VHRVPITSLG KQSDIEKVRD PLIKSALLNE TAGLSGKSFE NAVQKWCADN SIKSLRIVET VSIIPITDKE GVAYKGYKGD GNAYMDIYQD PTSSKWKGEI VSRFDANQKG FIPSWQSQFP TARLIMRLRI NDLLKLQDGE IEEIYRVQRL SGSKILMAPH TEANVDARDR DKNDTFKLTS KSPGKLQSAS ARKVHISPTG LIREG Oenococcus MARDYSVGLD IGTSSVGWAA IDNKYHLIRA KSKNLIGVRL FDSAVTAEKR (SEQ kitaharae DSM RGYRTTRRRL SRRHWRLRLL NDIFAGPLTD FGDENFLARL KYSWVHPQDQ ID 17330 SNQAHFAAGL LFDSKEQDKD FYRKYPTIYH LRLALMNDDQ KHDLREVYLA IHHLVKYRGH FLIEGDVKAD SAFDVHTFAD AIQRYAESNN SDENLLGKID NO: EKKLSAALTD KHGSKSQRAE TAETAFDILD LQSKKQIQAI LKSVVGNQAN 107) EHN59352.1 LMAIFGLDSS AISKDEQKNY KFSFDDADID EKIADSEALL SDTEFEFLCD LKAAFDGLTL KMLLGDDKTV SAAMVRRFNE HQKDWEYIKS HIRNAKNAGN GLYEKSKKFD GINAAYLALQ SDNEDDRKKA KKIFQDEISS ADIPDDVKAD FLKKIDDDQF LPIQRTKNNG TIPHQLHRNE LEQIIEKQGI YYPFLKDTYQ ENSHELNKIT ALINFRVPYY VGPLVEEEQK IADDGKNIPD PTNHWMVRKS NDTITPWNLS QVVDLDKSGR RFIERLTGTD TYLIGEPTLP KNSLLYQKFD VLQELNNIRV SGRRLDIRAK QDAFEHLFKV QKTVSATNLK DFLVQAGYIS EDTQIEGLAD VNGKNFNNAL TTYNYLVSVL GREFVENPSN EELLEEITEL QTVFEDKKVL RRQLDQLDGL SDHNREKLSR KHYTGWGRIS KKLLTTKIVQ NADKIDNQTF DVPRMNQSII DTLYNTKMNL MEIINNAEDD FGVRAWIDKQ NTTDGDEQDV YSLIDELAGP KEIKRGIVQS FRILDDITKA VGYAPKRVYL EFARKTQESH LTNSRKNQLS TLLKNAGLSE LVTQVSQYDA AALQNDRLYL YFLQQGKDMY SGEKLNLDNL SNYDIDHIIP QAYTKDNSLD NRVLVSNITN RRKSDSSNYL PALIDKMRPF WSVLSKQGLL SKHKFANLTR TRDFDDMEKE RFIARSLVET RQIIKNVASL IDSHFGGETK AVAIRSSLTA DMRRYVDIPK NRDINDYHHA FDALLFSTVG QYTENSGLMK KGQLSDSAGN QYNRYIKEWI HAARLNAQSQ RVNPFGFVVG SMRNAAPGKL NPETGEITPE ENADWSIADL DYLHKVMNFR KITVTRRLKD QKGQLYDESR YPSVLHDAKS KASINFDKHK PVDLYGGFSS AKPAYAALIK FKNKFRLVNV LRQWTYSDKN SEDYILEQIR GKYPKAEMVL SHIPYGQLVK KDGALVTISS ATELHNFEQL WLPLADYKLI NTLLKTKEDN LVDILHNRLD LPEMTIESAF YKAFDSILSF AFNRYALHQN ALVKLQAHRD DFNALNYEDK QQTLERILDA LHASPASSDL KKINLSSGFG RLFSPSHFTL ADTDEFIFQS VTGLFSTQKT VAQLYQETK Helicobacter MIRTLGIDIG IASIGWAVIE GEYTDKGLEN KEIVASGVRV FTKAENPKNK (SEQ mustelae ESLALPRTLA RSARRRNARK KGRIQQVKHY LSKALGLDLE CFVQGEKLAT ID 12198 LFQTSKDFLS PWELRERALY RVLDKEELAR VILHIAKRRG YDDITYGVED NDSGKIKKAI AENSKRIKEE QCKTIGEMMY KLYFQKSLNV RNKKESYNRC NO: VGRSELREEL KTIFQIQQEL KSPWVNEELI YKLLGNPDAQ SKQEREGLIF 108) WP_01302238 YQRPLKGFGD KIGKCSHIKK GENSPYRACK HAPSAEEFVA LTKSINFLKN 9.1 LTNRHGLCFS QEDMCVYLGK ILQEAQKNEK GLTYSKLKLL LDLPSDFEFL GLDYSGKNPE KAVFLSLPST FKLNKITQDR KTQDKIANIL GANKDWEAIL KELESLQLSK EQIQTIKDAK LNFSKHINLS LEALYHLLPL MREGKRYDEG VEILQERGIF SKPQPKNRQL LPPLSELAKE ESYFDIPNPV LRRALSEFRK VVNALLEKYG GFHYFHIELT RDVCKAKSAR MQLEKINKKN KSENDAASQL LEVLGLPNTY NNRLKCKLWK QQEEYCLYSG EKITIDHLKD QRALQIDHAF PLSRSLDDSQ SNKVLCLTSS NQEKSNKTPY EWLGSDEKKW DMYVGRVYSS NFSPSKKRKL TQKNFKERNE EDFLARNLVD TGYIGRVTKE YIKHSLSFLP LPDGKKEHIR IISGSMTSTM RSFWGVQEKN RDHHLHHAQD AIIIACIEPS MIQKYTTYLK DKETHRLKSH QKAQILREGD HKLSLRWPMS NFKDKIQESI QNIIPSHHVS HKVTGELHQE TVRTKEFYYQ AFGGEEGVKK ALKFGKIREI NQGIVDNGAM VRVDIFKSKD KGKFYAVPIY TYDFAIGKLP NKAIVQGKKNTable 4- Cas9 orthologsGIIKDWLEMD ENYEFCFSLF KNDCIKIQTK EMQEAVLAIY KSTNSAKATI ELEHLSKYAL KNEDEEKMFT DTDKEKNKTM TRESCGIQGL KVFQKVKLSV LGEVLEHKPR NRQNIALKTT PKHV Bradyrhizobiu MKRTSLRAYR LGVDLGANSL GWFVVWLDDH GQPEGLGPGG VRIFPDGRNP (SEQ m sp. BTAi1 QSKQSNAAGR RLARSARRRR DRYLQRRGKL MGLLVKHGLM PADEPARKRL ID ECLDPYGLRA KALDEVLPLH HVGRALFHLN QRRGLFANRA IEQGDKDASA IKAAAG NO: WP_01204402 RLQT SMQACGARTL GEFLNRRHQL RATVRARSPV GGDVQARYEF YPTRAMVDAE FEAIWAAQAP HHPTMTAEAH DTIREAIFSQ RAMKRPSIGK 109) 6.1 CSLDPATSQD DVDGFRCAWS HPLAQRFRIW QDVRNLAVVE TGPTSSRLGK EDQDKVARAL LQTDQLSFDE IRGLLGLPSD ARFNLESDRR DHLKGDATGA ILSARRHFGP AWHDRSLDRQ IDIVALLESA LDEAAIIASL GTTHSLDEAA AQRALSALLP DGYCRLGLRA IKRVLPLMEA GRTYAEAASA AGYDHALLPG GKLSPTGYLP YYGQWLQNDV VGSDDERDTN ERRWGRLPNP TVHIGIGQLR RVVNELIRWH GPPAEITVEL TRDLKLSPRR LAELEREQAE NQRKNDKRTS LLRKLGLPAS THNLLKLRLW DEQGDVASEC PYTGEAIGLE RLVSDDVDID HLIPFSISWD DSAANKVVCM RYANREKGNR TPFEAFGHRQ GRPYDWADIA ERAARLPRGK RWRFGPGARA QFEELGDFQA RLLNETSWLA RVAKQYLAAV THPHRIHVLP GRLTALLRAT WELNDLLPGS DDRAAKSRKD HRHHAIDALV AALTDQALLR RMANAHDDTR RKIEVLLPWP TFRIDLETRL KAMLVSHKPD HGLQARLHED TAYGTVEHPE TEDGANLVYR KTFVDISEKE IDRIRDRRLR DLVRAHVAGE RQQGKTLKAA VLSFAQRRDI AGHPNGIRHV RLTKSIKPDY LVPIRDKAGR IYKSYNAGEN AFVDILQAES GRWIARATTV FQANQANESH DAPAAQPIMR VFKGDMLRID HAGAEKFVKI VRLSPSNNLL YLVEHHQAGV FQTRHDDPED SFRWLFASFD KLREWNAELV RIDTLGQPWR RKRGLETGSE DATRIGWTRP KKWP Acidaminococ MGKMYYLGLD IGTNSVGYAV TDPSYHLLKF KGEPMWGAHV FAAGNQSAER (SEQ cus sp. D21 RSFRTSRRRL DRRQQRVKLV QEIFAPVISP IDPRFFIRLH ESALWRDDVA ID ETDKHIFFND PTYTDKEYYS DYPTIHHLIV DLMESSEKHD PRLVYLAVAW 01621 LVAHRGHFLN EVDK NO: WP_009 DNIGDV LSFDAFYPEF LAFLSDNGVS PWVCESKALQ ATLLSRNSVN DKYKALKSLI FGSQKPEDNF DANISEDGLI QLLAGKKVKV 110) 9.1 NKLFPQESND ASFTLNDKED AIEEILGTLT PDECEWIAHI RRLFDWAIMK HALKDGRTIS ESKVKLYEQH HHDLTQLKYF VKTYLAKEYD DIFRNVDSET TKNYVAYSYH VKEVKGTLPK NKATQEEFCK YVLGKVKNIE CSEADKVDFD EMIQRLTDNS FMPKQVSGEN RVIPYQLYYY ELKTILNKAA SYLPFLTQCG KDAISNQDKL LSIMTFRIPY FVGPLRKDNS EHAWLERKAG KIYPWNFNDK VDLDKSEEAF IRRMTNTCTY YPGEDVLPLD SLIYEKFMIL NEINNIRIDG YPISVDVKQQ VFGLFEKKRR VTVKDIQNLL LSLGALDKHG KLTGIDTTIH SNYNTYHHFK SLMERGVLTR DDVERIVERM TYSDDTKRVR LWLNNNYGTL TADDVKHISR LRKHDFGRLS KMFLTGLKGV HKETGERASI LDFMWNTNDN LMQLLSECYT FSDEITKLQE AYYAKAQLSL NDFLDSMYIS NAVKRPIYRT LAVVNDIRKA CGTAPKRIFI EMARDGESKK KRSVTRREQI KNLYRSIRKD FQQEVDFLEK ILENKSDGQL QSDALYLYFA QLGRDMYTGD PIKLEHIKDQ SFYNIDHIYP QSMVKDDSLD NKVLVQSEIN GEKSSRYPLD AAIRNKMKPL WDAYYNHGLI SLKKYQRLTR STPFTDDEKW DFINRQLVET RQSTKALAIL LKRKFPDTEI VYSKAGLSSD FRHEFGLVKS RNINDLHHAK DAFLAIVTGN VYHERFNRRW FMVNQPYSVK TKTLFTHSIK NGNFVAWNGE EDLGRIVKML KQNKNTIHFT RFSFDRKEGL FDIQPLKAST GLVPRKAGLD VVKYGGYDKS TAAYYLLVRF TLEDKKTQHK LMMIPVEGLY KARIDHDKEF LTDYAQTTIS EILQKDKQKV INIMFPMGTR HIKLNSMISI DGFYLSIGGK SSKGKSVLCH AMVPLIVPHK IECYIKAMES FARKFKENNK LRIVEKFDKI TVEDNLNLYE LFLQKLQHNP YNKFFSTQFD VLTNGRSTFT KLSPEEQVQT LLNILSIFKT CRSSGCDLKS INGSAQAARI MISADLTGLS KKYSDIRLVE QSASGLFVSKTable 4- Cas9 orthologsSQNLLEYL Methylosinus MRVLGLDAGI ASLGWALIEI EESNRGELSQ GTIIGAGTWM FDAPEEKTQA (SEQ trichosporium GAKLKSEQRR TFRGQRRVVR RRRQRMNEVR RILHSHGLLP SSDRDALKQP ID OB3b GLDPWRIRAE ALDRLLGPVE LAVALGHIAR HRGFKSNSKG AKTNDPADDT SKMKRAVNET REKLARFGSA AKMLVEDESF VLRQTPTKNG ASEIVRRFRN NO: REGDYSRSLL RDDLAAEMRA LFTAQARFQS AIATADLQTA FTKAAFFQRP 111) WP_00361103 LQDSEKLVGP CPFEVDEKRA PKRGYSFELF RFLSRLNHVT LRDGKQERTL 4.1 TRDELALAAA DFGAAAKVSF TALRKKLKLP ETTVFVGVKA DEESKLDVVA RSGKAAEGTA RLRSVIVDAL GELAWGALLC SPEKLDKIAE VISFRSDIGR ISEGLAQAGC NAPLVDALTA AASDGRFDPF TGAGHISSKA ARNILSGLRQ GMTYDKACCA ADYDHTASRE RGAFDVGGHG REALKRILQE ERISRELVGS PTARKALIES IKQVKAIVER YGVPDRIHVE LARDVGKSIE EREEITRGIE KRNRQKDKLR GLFEKEVGRP PQDGARGKEE LLRFELWSEQ MGRCLYTDDY ISPSQLVATD DAVQVDHILP WSRFADDSYA NKTLCMAKAN QDKKGRTPYE WFKAEKTDTE WDAFIVRVEA LADMKGFKKR NYKLRNAEEA AAKFRNRNLN DTRWACRLLA EALKQLYPKG EKDKDGKERR RVFSRPGALT DRLRRAWGLQ WMKKSTKGDR IPDDRHHALD AIVIAATTES LLQRATREVQ EIEDKGLHYD LVKNVTPPWP GFREQAVEAV EKVFVARAER RRARGKAHDA TIRHIAVREG EQRVYERRKV AELKLADLDR VKDAERNARL IEKLRNWIEA GSPKDDPPLS PKGDPIFKVR LVTKSKVNIA LDTGNPKRPG TVDRGEMARV DVFRKASKKG KYEYYLVPIY PHDIATMKTP PIRAVQAYKP EDEWPEMDSS YEFCWSLVPM TYLQVISSKG EIFEGYYRGM NRSVGAIQLS AHSNSSDVVQ GIGARTLTEF KKFNVDRFGR KHEVERELRT WRGETWRGKA YI Actinomyces MDNKNYRIGI DVGLNSIGFC AVEVDQHDTP LGFLNLSVYR HDAGIDPNGK (SEQ coleocanis KTNTTRLAMS GVARRTRRLF RKRKRRLAAL DRFIEAQGWT LPDHADYKDP ID DSM 15436 YTPWLVRAEL AQTPIRDEND LHEKLAIAVR HIARHRGWRS PWVPVRSLHV EQPPSDQYLA LKERVEAKTL LQMPEGATPA EMVVALDLSV DVNLRPKNRE NO: KTDTRPENKK PGFLGGKLMQ SDNANELRKI AKIQGLDDAL LRELIELVFA 112) WP_00654647 ADSPKGASGE LVGYDVLPGQ HGKRRAEKAH PAFQRYRIAS IVSNLRIRHL 9.1 GSGADERLDV ETQKRVFEYL LNAKPTADIT WSDVAEEIGV ERNLLMGTAT QTADGERASA KPPVDVTNVA FATCKIKPLK EWWLNADYEA RCVMVSALSH AEKLTEGTAA EVEVAEFLQN LSDEDNEKLD SFSLPIGRAA YSVDSLERLT KRMIENGEDL FEARVNEFGV SEDWRPPAEP IGARVGNPAV DRVLKAVNRY LMAAEAEWGA PLSVNIEHVR EGFISKRQAV EIDRENQKRY QRNQAVRSQI ADHINATSGV RGSDVTRYLA IQRQNGECLY CGTAITFVNS EMDHIVPRAG LGSTNTRDNL VATCERCNKS KSNKPFAVWA AECGIPGVSV AEALKRVDFW IADGFASSKE HRELQKGVKD RLKRKVSDPE IDNRSMESVA WMARELAHRV QYYFDEKHTG TKVRVFRGSL TSAARKASGF ESRVNFIGGN GKTRLDRRHH AMDAATVAML RNSVAKTLVL RGNIRASERA IGAAETWKSF RGENVADRQI FESWSENMRV LVEKFNLALY NDEVSIFSSL RLQLGNGKAH DDTITKLQMH KVGDAWSLTE IDRASTPALW CALTRQPDFT WKDGLPANED RTIIVNGTHY GPLDKVGIFG KAAASLLVRG GSVDIGSAIH HARIYRIAGK KPTYGMVRVF APDLLRYRNE DLFNVELPPQ SVSMRYAEPK VREAIREGKA EYLGWLVVGD ELLLDLSSET SGQIAELQQD FPGTTHWTVA GFFSPSRLRL RPVYLAQEGL GEDVSEGSKS IIAGQGWRPA VNKVFGSAMP EVIRRDGLGR KRRFSYSGLP VSWQG Caenispirillum MPVLSPLSPN AAQGRRRWSL ALDIGEGSIG WAVAEVDAEG RVLQLTGTGV (SEQ salinarum AK4 TLFPSAWSNE NGTYVAHGAA DRAVRGQQQR HDSRRRRLAG LARLCAPVLE ID RSPEDLKDLT RTPPKADPRA IFFLRADAAR RPLDGPELFR VLHHMAAHRG NO: WP_00954133 IRLAELQEVD PPPESDADDA APAATEDEDG TRRAAADERA FRRLMAEHMH RHGTQPTCGE IMAGRLRETP AGAQPVTRAR DGLRVGGGVA VPTRALIEQE 113) 0.1 FDAIRAIQAP RHPDLPWDSL RRLVLDQAPI AVPPATPCLF LEELRRRGETTable 4- Cas9 orthologsFQGRTITREA IDRGLTVDPL IQALRIRETV GNLRLHERIT EPDGRQRYVP RAMPELGLSH GELTAPERDT LVRALMHDPD GLAAKDGRIP YTRLRKLIGY DNSPVCFAQE RDTSGGGITV NPTDPLMARW IDGWVDLPLK ARSLYVRDVV ARGADSAALA RLLAEGAHGV PPVAAAAVPA ATAAILESDI MQPGRYSVCP WAAEAILDAW ANAPTEGFYD VTRGLFGFAP GEIVLEDLRR ARGALLAHLP RTMAAARTPN RAAQQRGPLP AYESVIPSQL ITSLRRAHKG RAADWSAADP EERNPFLRTW TGNAATDHIL NQVRKTANEV ITKYGNRRGW DPLPSRITVE LAREAKHGVI RRNEIAKENR ENEGRRKKES AALDTFCQDN TVSWQAGGLP KERAALRLRL AQRQEFFCPY CAERPKLRAT DLFSPAETEI DHVIERRMGG DGPDNLVLAH KDCNNAKGKK TPHEHAGDLL DSPALAALWQ GWRKENADRL KGKGHKARTP REDKDFMDRV GWRFEEDARA KAEENQERRG RRMLHDTARA TRLARLYLAA AVMPEDPAEI GAPPVETPPS PEDPTGYTAI YRTISRVQPV NGSVTHMLRQ RLLQRDKNRD YQTHHAEDAC LLLLAGPAVV QAFNTEAAQH GADAPDDRPV DLMPTSDAYH QQRRARALGR VPLATVDAAL ADIVMPESDR QDPETGRVHW RLTRAGRGLK RRIDDLTRNC VILSRPRRPS ETGTPGALHN ATHYGRREIT VDGRTDTVVT QRMNARDLVA LLDNAKIVPA ARLDAAAPGD TILKEICTEI ADRHDRVVDP EGTHARRWIS ARLAALVPAH AEAVARDIAE LADLDALADA DRTPEQEARR SALRQSPYLG RAISAKKADG RARAREQEIL TRALLDPHWG PRGLRHLIMR EARAPSLVRI RANKTDAFGR PVPDAAVWVK TDGNAVSQLW RLTSVVTDDG RRIPLPKPIE KRIEISNLEY ARLNGLDEGA GVTGNNAPPR PLRQDIDRLT PLWRDHGTAP GGYLGTAVGE LEDKARSALR GKAMRQTLTD AGITAEAGWR LDSEGAVCDL EVAKGDTVKK DGKTYKVGVI TQGIFGMPVD AAGSAPRTPE DCEKFEEQYG IKPWKAKGIP LA Coriobacteriu MKLRGIEDDY SIGLDMGTSS VGWAVTDERG TLAHFKRKPT WGSRLFREAQ (SEQ m glomerans TAAVARMPRG QRRRYVRRRW RLDLLQKLFE QQMEQADPDF FIRLRQSRLL ID PW2 RDDRAEEHAD YRWPLFNDCK FTERDYYQRF PTIYHVRSWL METDEQADIR LIYLALHNIV KHRGNFLREG QSLSAKSARP DEALNHLRET LRVWSSERGF NO: ECSIADNGSI LAMLTHPDLS PSDRRKKIAP LFDVKSDDAA ADKKLGIALA 114) WP_01370957 GAVIGLKTEF KNIFGDFPCE DSSIYLSNDE AVDAVRSACP DDCAELFDRL 5.1 CEVYSAYVLQ GLLSYAPGQT ISANMVEKYR RYGEDLALLK KLVKIYAPDQ YRMFFSGATY PGTGIYDAAQ ARGYTKYNLG PKKSEYKPSE SMQYDDFRKA VEKLFAKTDA RADERYRMMM DRFDKQQFLR RLKTSDNGSI YHQLHLEELK AIVENQGRFY PFLKRDADKL VSLVSFRIPY YVGPLSTRNA RTDQHGENRF AWSERKPGMQ DEPIFPWNWE SIIDRSKSAE KFILRMTGMC TYLQQEPVLP KSSLLYEEFC VLNELNGAHW SIDGDDEHRF DAADREGIIE ELFRRKRTVS YGDVAGWMER ERNQIGAHVC GGQGEKGFES KLGSYIFFCK DVFKVERLEQ SDYPMIERII LWNTLFEDRK ILSQRLKEEY GSRLSAEQIK TICKKRFTGW GRLSEKFLTG ITVQVDEDSV SIMDVLREGC PVSGKRGRAM VMMEILRDEE LGFQKKVDDF NRAFFAENAQ ALGVNELPGS PAVRRSLNQS IRIVDEIASI AGKAPANIFI EVTRDEDPKK KGRRTKRRYN DLKDALEAFK KEDPELWREL CETAPNDMDE RLSLYFMQRG KCLYSGRAID IHQLSNAGIY EVDHIIPRTY VKDDSLENKA LVYREENQRK TDMLLIDPEI RRRMSGYWRM LHEAKLIGDK KFRNLLRSRI DDKALKGFIA RQLVETGQMV KLVRSLLEAR YPETNIISVK ASISHDLRTA AELVKCREAN DFHHAHDAFL ACRVGLFIQK RHPCVYENPI GLSQVVRNYV RQQADIFKRC RTIPGSSGFI VNSFMTSGFD KETGEIFKDD WDAEAEVEGI RRSLNFRQCF ISRMPFEDHG VFWDATIYSP RAKKTAALPL KQGLNPSRYG SFSREQFAYF FIYKARNPRK EQTLFEFAQV PVRLSAQIRQ DENALERYAR ELAKDQGLEF IRIERSKILK NQLIEIDGDR LCITGKEEVR NACELAFAQD EMRVIRMLVS EKPVSRECVI SLFNRILLHG DQASRRLSKQ LKLALLSEAF SEASDNVQRN VVLGLIAIFN GSTNMVNLSD IGGSKFAGNV RIKYKKELAS PKVNVHLIDQ SVTGMFERRT KIGL

[0097] In some embodiments, prime editors utilized herein comprise CRISPR-Cas systemenzymes other than type II enzymes. In certain embodiments, prime editors comprise type V or type VI CRISPR-Cas system enzymes. It will be appreciated that certain CRISPR enzymes exhibit promiscuous ssDNA cleavage activity and appropriate precautions should be considered. In certain embodiments, prime editors comprise a nickase or a dead CRISPR with nuclease function comprised in a different component.

[0098] In various embodiments, the nucleic acid programmable DNA binding proteins utilizedherein include, without limitation, Cas9 (e.g., dCas9 and nCas9), Cas12a (Cpf1), Cas12b1 (C2c1),Cas12b2, Cas12c (C2c3), Cas12d (CasY), Cas12e (CasX), C2c4, C2c5, C2c8, C2c9, C2c10, Cas13a (C2c2), Cas13b (C2c6), Cas13c (C2c7), Cas13d, and Argonaute. Cas-equivalents further include those described in Makarova et al., “C2c2 is a single-component programmable RNA- guided RNA-targeting CRISPR effector,” Science 2016; 353(6299) and Makarova et al., “Classification and Nomenclature of CRISPR-Cas Systems: Where from Here?,” The CRISPR Journal, Vol.1. No.5, 2018, the contents of which are incorporated herein by reference. Oneexample of a nucleic acid programmable DNA-binding protein that has different PAM specificitythan Cas9 is Clustered Regularly Interspaced Short Palindromic Repeats from Prevotella and Francisella 1 (i.e, Cas12a (Cpf1)). Similar to Cas9, Cas12a (Cpf1) is also a Class 2 CRISPR effector, but it is a member of type V subgroup of enzymes, rather than the type II subgroup. It has been shown that Cas12a (Cpf1) mediates robust DNA interference with features distinct from Cas9. Cas12a (Cpf1) is a single RNA-guided endonuclease lacking tracrRNA, and it utilizes a T- rich protospacer-adjacent motif (TTN, TTTN, or YTN). Moreover, Cpf1 cleaves DNA via a staggered DNA double-stranded break. Out of 16 Cpf1-family proteins, two enzymes from Acidaminococcus and Lachnospiraceae are shown to have efficient genome-editing activity in human cells. Cpf1 proteins are known in the art and have been described previously, for example Yamano et al., “Crystal structure of Cpf1 in complex with guide RNA and target DNA.” Cell (165) 2016, p.949-962; the entire contents of which is hereby incorporated by reference. 6.3. Type V CRISPR proteins

[0099] In some embodiments, prime editors used herein comprise the type V CRISPR familyincludes Francisella novicida U112 Cpf1 (FnCpf1) also known as FnCas12a. FnCpf1 adopts abilobed architecture with the two lobes connected by the wedge (WED) domain. The N-terminalREC lobe consists of two a-helical domains (REC1 and REC2) that have been shown to coordinate the crRNA-target DNA heteroduplex. The C-terminal NUC lobe consists of the C-terminal RuvC and Nuc domains involved in target cleavage, the arginine-rich bridge helix (BH), and the PAM- interacting (PI) domain. The repeat-derived segment of the crRNA forms a pseudoknot stabilized by intra-molecular base-pairing and hydrogen-bonding interactions. The pseudoknot is coordinated by residues from the WED, RuvC, and REC2 domains, as well as by two hydrated magnesium cations. Notably, nucleotides 1–5 of the crRNA are ordered in the central cavity of FnCas12a and adopt an A-form-like helical conformation. Conformational ordering of the seed sequence is facilitated by multiple interactions between the ribose and phosphate moieties of the crRNA backbone and FnCpf1 residues in the WED and REC1 domains. These include residues Thr16, Lys595, His804, and His881 from the WED domain and residues Tyr47, Lys51, Phe182, and Arg186 from the REC1 domain. The structure of the FnCas12a-crRNA complex further reveals that the bases of the seed sequence are solvent exposed and poised for hybridization with target DNA. Structural aspects of FnCpf1 are described by Swarts et al., Structural Basis for Guide RNA Processing and Seed-Dependent DNA Targeting by CRISPR-Cas12a, Molecular Cell 66, 221-233, April 20, 2017.

[0100] Pre-crRNA processing: Essential residues for crRNA processing include His843,Lys852, and Lys869. Structural observations are consistent with an acid-base catalytic mechanism in which Lys869 acts as the general base catalyst to deprotonate the attacking 2’-hydroxyl group of U(-19), while His843 acts as a general acid to protonate the 5’-oxygen leaving group of A(-18). In turn, the side chain of Lys852 is involved in charge stabilization of the transition state. Collectively, these interactions facilitate the intra-molecular attack of the 20-hydroxyl group of U(-19) on the scissile phosphate and promote the formation of the 2’,3’-cyclic phosphate product.

[0101] R-loop formation: The crRNA-target DNA strand heteroduplex is enclosed in thecentral cavity formed by the REC and NUC lobes and interacts extensively with the REC1 and REC2 domains. The PAM-containing DNA duplex comprises target strand nucleotides dT0–dT8 and non-target strand nucleotides dA(8)*–dA0* and is contacted by the PI, WED, and REC1 domains. The 5’-TTN-3’ PAM is recognized in FnCas12a by a mechanism combining the shape-specific recognition of a narrowed minor groove, with base-specific recognition of the PAM basesby two invariant residues, Lys671 and Lys613. Directly downstream of the PAM, the duplex ofthe target DNA is disrupted by the side chain of residue Lys667, which is inserted between the DNA strands and forms a cation-π stacking interaction with the dA0–dT0* base pair. The phosphate group linking target strand residues dT(-1) and dT0 is coordinated by hydrogen-bonding interactions with the side chain of Lys823 and the backbone amide of Gly826. Target strand residue dT(-1) bends away from residue T0, allowing the target strand to interact with the seed sequence of the crRNA. The non-target strand nucleotides dT1*–dT5* interact with the Arg692- Ser702 loop in FnCas12a through hydrogen-bonding and ionic interactions between backbone phosphate groups and side chains of Arg692, Asn700, Ser702, and Gln704, as well as main-chain amide groups of Lys699, Asn700, and Ser702. Alanine substitution of Q704 or replacement ofresidues Thr698–Ser702 in FnCas12a with the sequence Ala-Gly3 (SEQ ID NO: 115) substantiallyreduced DNA cleavage activity, suggesting that these residues contribute to R-loop formation by stabilizing the displaced conformation of the nontarget DNA strand.

[0102] In the FnCas12a R-loop complex, the crRNA-target strand heteroduplex is terminatedby a stacking interaction with a conserved aromatic residue (Tyr410). This prevents base pairing between the crRNA and the target strand beyond nucleotides U20 and dA(-20), respectively. Beyond this point, the target DNA strand nucleotides re-engage the non-target DNA strand, forming a PAM-distal DNA duplex comprising nucleotides dC(-21)–dA(-27) and dG21*–dT27*, respectively. The duplex is confined between the REC2 and Nuc domains at the end of the central channel formed by the REC and NUC lobes.

[0103] Target DNA cleavage: FnCpf1 can independently accommodate both the target andnon-target DNA strands in the catalytic pocket of the RuvC domain. The RuvC active site contains three catalytic residues (D917, E1006, and D1255). Structural observations suggest that both the target and non-target DNA strands are cleaved by the same catalytic mechanism in a single active site in Cpf1 / Cas12a enzymes.

[0104] Another type V CRISPR is AsCpf1 from Acidaminococcus sp BV3L6 (Yamano et al.,Crystal structure of Cpf1 in complex with guide RNA and target DNA, Cell 165, 949-962, May 5, 2016)

[0105] In certain embodiments, the nuclease comprises a Cas12f effector. Small CRISPR-associated effector proteins belonging to the type V-F subtype have been identified through themining of sequence databases and members classified into Cas12f1 (Cas14a and type V-U3), Cas12f2 (Cas14b) and Cas12f3 (Cas14c, type V-U2 and U4). (See, e.g., Karvelis et al., PAM recognition by miniature CRISPR–Cas12f nucleases triggers programmable double-stranded DNA target cleavage. Nucleic Acids Research, 21 May 2020, 48(9), 5016–23 doi.org / 10.1093 / nar / gkaa208). Xu et al. described development of a 529 amino acid Cas12f-based system for mammalian genome engineering through multiple rounds of iterative protein engineering and screening. (Xu, X. et al., Engineered Miniature CRISPR-Cas System forMammalian Genome Regulation and Editing. Molecular Cell, October 21, 2021, 81(20): 4333-45,doi.org / 10.1016 / j.molcel.2021.08.008).

[0106] Exemplary CRISPR-Cas proteins and enzymes used in the Prime Editors herein includethe following without limitation. Table 5. Table 5 - Cas12a orthologsKKP36646_(modifi MSNFFKNFTN LYELSKTLRF ELKPVGDTLT NMKDHLEYDE KLQTFLKDQN(SEQ IDed) hypothetical IDDAYQALKP QFDEIHEEFI TDSLESKKAK EIDFSEYLDL FQEKKELNDS NO: 116) protein EKKLRNKIGE TFNKAGEKWK KEKYPQYEWK KGSKIANGAD ILSCQDMLQF UR27_C0015G0004 IKYKNPEDEK IKNYIDDTLK GFFTYFGGFN QNRANYYETK KEASTAVATR [Candidatus IVHENLPKFC DNVIQFKHII KRKKDGTVEK TERKTEYLNA YQYLKNNNKI Peregrinibacteria TQIKDAETEK MIESTPIAEK IFDVYYFSSC LSQKQIEEYN RIIGHYNLLI bacterium NLYNQAKRSE GKHLSANEKK YKDLPKFKTL YKQIGCGKKK DLFYTIKCDT GW2011_GWA2_3 EEEANKSRNE GKESHSVEEI INKAQEAINK YFKSNNDCEN INTVPDFINY 3_10] ILTKENYEGV YWSKAAMNTI SDKYFANYHD LQDRLKEAKV FQKADKKSED DIKIPEAIEL SGLFGVLDSL ADWQTTLFKS SILSNEDKLK IITDSQTPSE ALLKMIFNDI EKNMESFLKE TNDIITLKKY KGNKEGTEKI KQWFDYTLAI NRMLKYFLVK ENKIKGNSLD TNISEALKTL IYSDDAEWFK WYDALRNYLT QKPQDEAKEN KLKLNFDNPS LAGGWDVNKE CSNFCVILKD KNEKKYLAIM KKGENTLFQK EWTEGRGKNL TKKSNPLFEI NNCEILSKME YDFWADVSKM IPKCSTQLKA VVNHFKQSDN EFIFPIGYKV TSGEKFREEC KISKQDFELN NKVFNKNELS VTAMRYDLSS TQEKQYIKAF QKEYWELLFK QEKRDTKLTN NEIFNEWINF CNKKYSELLS WERKYKDALT NWINFCKYFL SKYPKTTLFN YSFKESENYN SLDEFYRDVD ICSYKLNINT TINKSILDRL VEEGKLYLFE IKNQDSNDGK SIGHKNNLHT IYWNAIFENF DNRPKLNGEA EIFYRKAISK DKLGIVKGKK TKNGTEIIKN YRFSKEKFIL HVPITLNFCS NNEYVNDIVN TKFYNFSNLH FLGIDRGEKH LAYYSLVNKN GEIVDQGTLN LPFTDKDGNQ RSIKKEKYFY NKQEDKWEAK EVDCWNYNDL LDAMASNRDM ARKNWQRIGT IKEAKNGYVS LVIRKIADLA VNNERPAFIV LEDLNTGFKR SRQKIDKSVY QKFELALAKK LNFLVDKNAK RDEIGSPTKA LQLTPPVNNY GDIENKKQAG IMLYTRANYT SQTDPATGWR KTIYLKAGPE ETTYKKDGKI KNKSVKDQII ETFTDIGFDG KDYYFEYDKG EFVDEKTGEI KPKKWRLYSG ENGKSLDRFR GEREKDKYEW KIDKIDIVKI LDDLFVNFDK NISLLKQLKE GVELTRNNEH GTGESLRFAI NLIQQIRNTG NNERDNDFIL SPVRDENGKH FDSREYWDKE TKGEKISMPS SGDANGAFNI ARKGIIMNAH ILANSDSKDL SLFVSDEEWD LHLNNKTEWK KQLNIFSSRK AMAKRKKTable 5 - Cas12a orthologsKKR91555_(modifi MLFFMSTDIT NKPREKGVFD NFTNLYEFSK TLTFGLIPLK WDDNKKMIVE(SEQ IDed) hypothetical DEDFSVLRKY GVIEEDKRIA ESIKIAKFYL NILHRELIGK VLGSLKFEKK NO: 117) protein NLENYDRLLG EIEKNNKNEN ISEDKKKEIR KNFKKELSIA QDILLKKVGE UU43_C0004G0003 VFESNGSGIL SSKNCLDELT KRFTRQEVDK LRRENKDIGV EYPDVAYREK [Parcubacteria DGKEETKSFF AMDVGYLDDF HKNRKQLYSV KGKKNSLGRR ILDNFEIFCK (Falkowbacteria) NKKLYEKYKN LDIDFSEIER NFNLTLEKVF DFDNYNERLT QEGLDEYAKI bacterium LGGESNKQER TANIHGLNQI INLYIQKKQS EQKAEQKETG KKKIKFNKKD GW2011_GWA2_4 YPTFTCLQKQ ILSQVFRKEI IIESDRDLIR ELKFFVEESK EKVDKARGII 1_14] EFLLNHEEND IDLAMVYLPK SKINSFVYKV FKEPQDFLSV FQDGASNLDF VSFDKIKTHL ENNKLTYKIF FKTLIKENHD FESFLILLQQ EIDLLIDGGE TVTLGGKKES ITSLDEKKNR LKEKLGWFEG KVRENEKMKD EEEGEFCSTV LAYSQAVLNI TKRAEIFWLN EKQDAKVGED NKDMIFYKKF DEFADDGFAP FFYFDKFGNY LKRRSRNTTK EIKLHFGNDD LLEGWDMNKE PEYWSFILRD RNQYYLGIGK KDGEIFHKKL GNSVEAVKEA YELENEADFY EKIDYKQLNI DRFEGIAFPK KTKTEEAFRQ VCKKRADEFL GGDTYEFKIL LAIKKEYDDF KARRQKEKDW DSKFSKEKMS KLIEYYITCL GKRDDWKRFN LNFRQPKEYE DRSDFVRHIQ RQAYWIDPRK VSKDYVDKKV AEGEMFLFKV HNKDFYDFER KSEDKKNHTA NLFTQYLLEL FSCENIKNIK SKDLIESIFE LDGKAEIRFR PKTDDVKLKI YQKKGKDVTY ADKRDGNKEK EVIQHRRFAK DALTLHLKIR LNFGKHVNLF DFNKLVNTEL FAKVPVKILG MDRGENNLIY YCFLDEHGEI ENGKCGSLNR VGEQIITLED DKKVKEPVDY FQLLVDREGQ RDWEQKNWQK MTRIKDLKKA YLGNVVSWIS KEMLSGIKEG VVTIGVLEDL NSNFKRTRFF RERQVYQGFE KALVNKLGYL VDKKYDNYRN VYQFAPIVDS VEEMEKNKQI GTLVYVPASY TSKICPHPKC GWRERLYMKN SASKEKIVGL LKSDGIKISY DQKNDRFYFE YQWEQEHKSD GKKKKYSGVD KVFSNVSRMR WDVEQKKSID FVDGTDGSIT NKLKSLLKGK GIELDNINQQ IVNQQKELGV EFFQSIIFYF NLIMQIRNYD KEKSGSEADY IQCPSCLFDS RKPEMNGKLS AITNGDANGA YNIARKGFMQ LCRIRENPQE PMKLITNREW DEAVREWDIY SAAQKIPVLS EEN KDN25524_(modifi MLFQDFTHLY PLSKTVRFEL KPIDRTLEHI HAKNFLSQDE TMADMHQKVK(SEQ IDed) hypothetical VILDDYHRDF IADMMGEVKL TKLAEFYDVY LKFRKNPKDD ELQKQLKDLQ NO: 118) protein AVLRKEIVKP IGNGGKYKAG YDRLFGAKLF KDGKELGDLA KFVIAQEGES MBO_03467 SPKLAHLAHF EKFSTYFTGF HDNRKNMYSD EDKHTAIAYR LIHENLPRFI [Moraxella bovoculi DNLQILTTIK QKHSALYDQI INELTASGLD VSLASHLDGY HKLLTQEGIT 237] AYNTLLGGIS GEAGSPKIQG INELINSHHN QHCHKSERIA KLRPLHKQIL SDGMSVSFLP SKFADDSEMC QAVNEFYRHY ADVFAKVQSL FDGFDDHQKD > WP_052585281.1 GIYVEHKNLN ELSKQAFGDF ALLGRVLDGY YVDVVNPEFN ERFAKAKTDN type V CRISPR- AKAKLTKEKD KFIKGVHSLA SLEQAIEHYT ARHDDESVQA GKLGQYFKHG associated protein LAGVDNPIQK IHNNHSTIKG FLERERPAGE RALPKIKSGK NPEMTQLRQL Cpf1 [Moraxella KELLDNALNV AHFAKLLTTK TTLDNQDGNF YGEFGVLYDE LAKIPTLYNK bovoculi] VRDYLSQKPF STEKYKLNFG NPTLLNGWDL NKEKDNFGVI LQKDGCYYLA LLDKAHKKVF DNAPNTGKSI YQKMIYKYLE VRKQFPKVFF SKEAIAINYH PSKELVEIKD KGRQRSDDER LKLYRFILEC LKIHPKYDKK FEGAIGDIQL FKKDKKGREV PISEKDLFDK INGIFSSKPK LEMEDFFIGE FKRYNPSQDL VDQYNIYKKI DSNDNRKKEN FYNNHPKFKK DLVRYYYESM CKHEEWEESF EFSKKLQDIG CYVDVNELFT EIETRRLNYK ISFCNINADY IDELVEQGQL YLFQIYNKDF SPKAHGKPNL HTLYFKALFS EDNLADPIYK LNGEAQIFYR KASLDMNETT IHRAGEVLEN KNPDNPKKRQ FVYDIIKDKR YTQDKFMLHV PITMNFGVQG MTIKEFNKKV NQSIQQYDEV NVIGIDRGER HLLYLTVINS KGEILEQCSL NDITTASANG TQMTTPYHKI LDKREIERLN ARVGWGEIET IKELKSGYLS HVVHQISQLM LKYNAIVVLE DLNFGFKRGR FKVEKQIYQN FENALIKKLN HLVLKDKADD EIGSYKNALQ LTNNFTDLKS IGKQTGFLFY VPAWNTSKID PETGFVDLLK PRYENIAQSQ AFFGKFDKIC YNADKDYFEF HIDYAKFTDK AKNSRQIWTI CSHGDKRYVY DKTANQNKGA AKGINVNDELTable 5 - Cas12a orthologsKSLFARHHIN EKQPNLVMDI CQNNDKEFHK SLMYLLKTLL ALRYSNASSD EDFILSPVAN DEGVFFNSAL ADDTQPQNAD ANGAYHIALK GLWLLNELKN SDDLNKVKLA IDNQTWLNFA QNR KKT48220_(modifi MENIFDQFIG KYSLSKTLRF ELKPVGKTED FLKINKVFEK DQTIDDSYNQ(SEQ IDed) hypothetical AKFYFDSLHQ KFIDAALASD KTSELSFQNF ADVLEKQNKI ILDKKREMGA NO: 119) protein LRKRDKNAVG IDRLQKEIND AEDIIQKEKE KIYKDVRTLF DNEAESWKTY UW39_C0001G004 YQEREVDGKK ITFSKADLKQ KGADFLTAAG ILKVLKYEFP EEKEKEFQAK 4 [Parcubacteria NQPSLFVEEK ENPGQKRYIF DSFDKFAGYL TKFQQTKKNL YAADGTSTAV bacterium ATRIADNFII FHQNTKVFRD KYKNNHTDLG FDEENIFEIE RYKNCLLQRE GW2011_GWC2_4 IEHIKNENSY NKIIGRINKK IKEYRDQKAK DTKLTKSDFP FFKNLDKQIL 4_17] GEVEKEKQLI EKTREKTEED VLIERFKEFI ENNEERFTAA KKLMNAFCNG EFESEYEGIY LKNKAINTIS RRWFVSDRDF ELKLPQQKSK NKSEKNEPKV KKFISIAEIK NAVEELDGDI FKAVFYDKKI IAQGGSKLEQ FLVIWKYEFE YLFRDIEREN GEKLLGYDSC LKIAKQLGIF PQEKEAREKA TAVIKNYADA GLGIFQMMKY FSLDDKDRKN TPGQLSTNFY AEYDGYYKDF EFIKYYNEFR NFITKKPFDE DKIKLNFENG ALLKGWDENK EYDFMGVILK KEGRLYLGIM HKNHRKLFQS MGNAKGDNAN RYQKMIYKQI ADASKDVPRL LLTSKKAMEK FKPSQEILRI KKEKTFKRES KNFSLRDLHA LIEYYRNCIP QYSNWSFYDF QFQDTGKYQN IKEFTDDVQK YGYKISFRDI DDEYINQALN EGKMYLFEVV NKDIYNTKNG SKNLHTLYFE HILSAENLND PVFKLSGMAE IFQRQPSVNE REKITTQKNQ CILDKGDRAY KYRRYTEKKI MFHMSLVLNT GKGEIKQVQF NKIINQRISS SDNEMRVNVI GIDRGEKNLL YYSVVKQNGE IIEQASLNEI NGVNYRDKLI EREKERLKNR QSWKPVVKIK DLKKGYISHV IHKICQLIEK YSAIVVLEDL NMRFKQIRGG IERSVYQQFE KALIDKLGYL VFKDNRDLRA PGGVLNGYQL SAPFVSFEKM RKQTGILFYT QAEYTSKTDP ITGFRKNVYI SNSASLDKIK EAVKKFDAIG WDGKEQSYFF KYNPYNLADE KYKNSTVSKE WAIFASAPRI RRQKGEDGYW KYDRVKVNEE FEKLLKVWNF VNPKATDIKQ EIIKKEKAGD LQGEKELDGR LRNFWHSFIY LFNLVLELRN SFSLQIKIKA GEVIAVDEGV DFIASPVKPF FTTPNPYIPS NLCWLAVENA DANGAYNIAR KGVMILKKIR EHAKKDPEFK KLPNLFISNA EWDEAARDWG KYAGTTALNL DH WP_031492824_(m MSSLTKFTNK YSKQLTIKNE LIPVGKTLEN IKENGLIDGD EQLNENYQKA(SEQ IDodified) KIIVDDFLRD FINKALNNTQ IGNWRELADA LNKEDEDNIE KLQDKIRGII NO: 120) hypothetical protein VSKFETFDLF SSYSIKKDEK IIDDDNDVEE EELDLGKKTS SFKYIFKKNL [Succinivibrio FKLVLPSYLK TTNQDKLKII SSFDNFSTYF RGFFENRKNI FTKKPISTSI dextrinosolvens] AYRIVHDNFP KFLDNIRCFN VWQTECPQLI VKADNYLKSK NVIAKDKSLA NYFTVGAYDY FLSQNGIDFY NNIIGGLPAF AGHEKIQGLN EFINQECQKD SELKSKLKNR HAFKMAVLFK QILSDREKSF VIDEFESDAQ VIDAVKNFYA EQCKDNNVIF NLLNLIKNIA FLSDDELDGI FIEGKYLSSV SQKLYSDWSK LRNDIEDSAN SKQGNKELAK KIKTNKGDVE KAISKYEFSL SELNSIVHDN TKFSDLLSCT LHKVASEKLV KVNEGDWPKH LKNNEEKQKI KEPLDALLEI YNTLLIFNCK SFNKNGNFYV DYDRCINELS SVVYLYNKTR NYCTKKPYNT DKFKLNFNSP QLGEGFSKSK ENDCLTLLFK KDDNYYVGII RKGAKINFDD TQAIADNTDN CIFKMNYFLL KDAKKFIPKC SIQLKEVKAH FKKSEDDYIL SDKEKFASPL VIKKSTFLLA TAHVKGKKGN IKKFQKEYSK ENPTEYRNSL NEWIAFCKEF LKTYKAATIF DITTLKKAEE YADIVEFYKD VDNLCYKLEF CPIKTSFIEN LIDNGDLYLF RINNKDFSSK STGTKNLHTL YLQAIFDERN LNNPTIMLNG GAELFYRKES IEQKNRITHK AGSILVNKVC KDGTSLDDKI RNEIYQYENK FIDTLSDEAK KVLPNVIKKE ATHDITKDKR FTSDKFFFHC PLTINYKEGD TKQFNNEVLS FLRGNPDINI IGIDRGERNL IYVTVINQKG EILDSVSFNT VTNKSSKIEQ TVDYEEKLAV REKERIEAKR SWDSISKIAT LKEGYLSAIV HEICLLMIKH NAIVVLENLN AGFKRIRGGL SEKSVYQKFE KMLINKLNYF VSKKESDWNK PSGLLNGLQL SDQFESFEKL GIQSGFIFYV PAAYTSKIDP TTGFANVLNL SKVRNVDAIK SFFSNFNEIS YSKKEALFKFTable 5 - Cas12a orthologsSFDLDSLSKK GFSSFVKFSK SKWNVYTFGE RIIKPKNKQG YREDKRINLT FEMKKLLNEY KVSFDLENNL IPNLTSANLK DTFWKELFFI FKTTLQLRNS VTNGKEDVLI SPVKNAKGEF FVSGTHNKTL PQDCDANGAY HIALKGLMIL ERNNLVREEK DTKKIMAISN VDWFEYVQKR RGVL KKT50231_(modifi MKPVGKTEDF LKINKVFEKD QTIDDSYNQA KFYFDSLHQK FIDAALASDK(SEQ IDed) hypothetical TSELSFQNFA DVLEKQNKII LDKKREMGAL RKRDKNAVGI DRLQKEINDA NO: 121) protein EDIIQKEKEK IYKDVRTLFD NEAESWKTYY QEREVDGKKI TFSKADLKQK UW40_C0007G000 GADFLTAAGI LKVLKYEFPE EKEKEFQAKN QPSLFVEEKE NPGQKRYIFD 6 [Parcubacteria SFDKFAGYLT KFQQTKKNLY AADGTSTAVA TRIADNFIIF HQNTKVFRDK bacterium YKNNHTDLGF DEENIFEIER YKNCLLQREI EHIKNENSYN KIIGRINKKI GW2011_GWF2_4 KEYRDQKAKD TKLTKSDFPF FKNLDKQILG EVEKEKQLIE KTREKTEEDV 4_17] LIERFKEFIE NNEERFTAAK KLMNAFCNGE FESEYEGIYL KNKAINTISR RWFVSDRDFE LKLPQQKSKN KSEKNEPKVK KFISIAEIKN AVEELDGDIF KAVFYDKKII AQGGSKLEQF LVIWKYEFEY LFRDIERENG EKLLGYDSCL KIAKQLGIFP QEKEAREKAT AVIKNYADAG LGIFQMMKYF SLDDKDRKNT PGQLSTNFYA EYDGYYKDFE FIKYYNEFRN FITKKPFDED KIKLNFENGA LLKGWDENKE YDFMGVILKK EGRLYLGIMH KNHRKLFQSM GNAKGDNANR YQKMIYKQIA DASKDVPRLL LTSKKAMEKF KPSQEILRIK KEKTFKRESK NFSLRDLHAL IEYYRNCIPQ YSNWSFYDFQ FQDTGKYQNI KEFTDDVQKY GYKISFRDID DEYINQALNE GKMYLFEVVN KDIYNTKNGS KNLHTLYFEH ILSAENLNDP VFKLSGMAEI FQRQPSVNER EKITTQKNQC ILDKGDRAYK YRRYTEKKIM FHMSLVLNTG KGEIKQVQFN KIINQRISSS DNEMRVNVIG IDRGEKNLLY YSVVKQNGEI IEQASLNEIN GVNYRDKLIE REKERLKNRQ SWKPVVKIKD LKKGYISHVI HKICQLIEKY SAIVVLEDLN MRFKQIRGGI ERSVYQQFEK ALIDKLGYLV FKDNRDLRAP GGVLNGYQLS APFVSFEKMR KQTGILFYTQ AEYTSKTDPI TGFRKNVYIS NSASLDKIKE AVKKFDAIGW DGKEQSYFFK YNPYNLADEK YKNSTVSKEW AIFASAPRIR RQKGEDGYWK YDRVKVNEEF EKLLKVWNFV NPKATDIKQE IIKKEKAGDL QGEKELDGRL RNFWHSFIYL FNLVLELRNS FSLQIKIKAG EVIAVDEGVD FIASPVKPFF TTPNPYIPSN LCWLAVENAD ANGAYNIARK GVMILKKIRE HAKKDPEFKK LPNLFISNAE WDEAARDWGK YAGTTALNLD H WP_004356401_(m MKVMENYQEF TNLFQLNKTL RFELKPIGKT CELLEEGKIF ASGSFLEKDK(SEQ IDodified) VRADNVSYVK KEIDKKHKIF IEETLSSFSI SNDLLKQYFD CYNELKAFKK NO: 122) hypothetical protein DCKSDEEEVK KTALRNKCTS IQRAMREAIS QAFLKSPQKK LLAIKNLIEN [Prevotella disiens] VFKADENVQH FSEFTSYFSG FETNRENFYS DEEKSTSIAY RLVHDNLPIF IKNIYIFEKL KEQFDAKTLS EIFENYKLYV AGSSLDEVFS LEYFNNTLTQ KGIDNYNAVI GKIVKEDKQE IQGLNEHINL YNQKHKDRRL PFFISLKKQI LSDREALSWL PDMFKNDSEV IKALKGFYIE DGFENNVLTP LATLLSSLDK YNLNGIFIRN NEALSSLSQN VYRNFSIDEA IDANAELQTF NNYELIANAL RAKIKKETKQ GRKSFEKYEE YIDKKVKAID SLSIQEINEL VENYVSEFNS NSGNMPRKVE DYFSLMRKGD FGSNDLIENI KTKLSAAEKL LGTKYQETAK DIFKKDENSK LIKELLDATK QFQHFIKPLL GTGEEADRDL VFYGDFLPLY EKFEELTLLY NKVRNRLTQK PYSKDKIRLC FNKPKLMTGW VDSKTEKSDN GTQYGGYLFR KKNEIGEYDY FLGISSKAQL FRKNEAVIGD YERLDYYQPK ANTIYGSAYE GENSYKEDKK RLNKVIIAYI EQIKQTNIKK SIIESISKYP NISDDDKVTP SSLLEKIKKV SIDSYNGILS FKSFQSVNKE VIDNLLKTIS PLKNKAEFLD LINKDYQIFT EVQAVIDEIC KQKTFIYFPI SNVELEKEMG DKDKPLCLFQ ISNKDLSFAK TFSANLRKKR GAENLHTMLF KALMEGNQDN LDLGSGAIFY RAKSLDGNKP THPANEAIKC RNVANKDKVS LFTYDIYKNR RYMENKFLFH LSIVQNYKAA NDSAQLNSSA TEYIRKADDL HIIGIDRGER NLLYYSVIDM KGNIVEQDSL NIIRNNDLET DYHDLLDKRE KERKANRQNW EAVEGIKDLK KGYLSQAVHQ IAQLMLKYNA IIALEDLGQM FVTRGQKIEK AVYQQFEKSL VDKLSYLVDK KRPYNELGGI LKAYQLASSI TKNNSDKQNG FLFYVPAWNT SKIDPVTGFT DLLRPKAMTI KEAQDFFGAF DNISYNDKGYTable 5 - Cas12a orthologsFEFETNYDKF KIRMKSAQTR WTICTFGNRI KRKKDKNYWN YEEVELTEEF KKLFKDSNID YENCNLKEEI QNKDNRKFFD DLIKLLQLTL QMRNSDDKGN DYIISPVANA EGQFFDSRNG DKKLPLDADA NGAYNIARKG LWNIRQIKQT KNDKKLNLSI SSTEWLDFVR EKPYLK CCB70584_(modifi MTNKFTNQYS LSKTLRFELI PQGKTLEFIQ EKGLLSQDKQ RAESYQEMKK(SEQ IDed) Protein of TIDKFHKYFI DLALSNAKLT HLETYLELYN KSAETKKEQK FKDDLKKVQD NO: 123) unknown function NLRKEIVKSF SDGDAKSIFA ILDKKELITV ELEKWFENNE QKDIYFDEKF [Flavobacterium KTFTTYFTGF HQNRKNMYSV EPNSTAIAYR LIHENLPKFL ENAKAFEKIK branchiophilum FL- QVESLQVNFR ELMGEFGDEG LIFVNELEEM FQINYYNDVL SQNGITIYNS 15] IISGFTKNDI KYKGLNEYIN NYNQTKDKKD RLPKLKQLYK QILSDRISLS FLPDAFTDGK QVLKAIFDFY KINLLSYTIE GQEESQNLLL LIRQTIENLS SFDTQKIYLK NDTHLTTISQ QVFGDFSVFS TALNYWYETK VNPKFETEYS KANEKKREIL DKAKAVFTKQ DYFSIAFLQE VLSEYILTLD HTSDIVKKHS SNCIADYFKN HFVAKKENET DKTFDFIANI TAKYQCIQGI LENADQYEDE LKQDQKLIDN LKFFLDAILE LLHFIKPLHL KSESITEKDT AFYDVFENYY EALSLLTPLY NMVRNYVTQK PYSTEKIKLN FENAQLLNGW DANKEGDYLT TILKKDGNYF LAIMDKKHNK AFQKFPEGKE NYEKMVYKLL PGVNKMLPKV FFSNKNIAYF NPSKELLENY KKETHKKGDT FNLEHCHTLI DFFKDSLNKH EDWKYFDFQF SETKSYQDLS GFYREVEHQG YKINFKNIDS EYIDGLVNEG KLFLFQIYSK DFSPFSKGKP NMHTLYWKAL FEEQNLQNVI YKLNGQAEIF FRKASIKPKN IILHKKKIKI AKKHFIDKKT KTSEIVPVQT IKNLNMYYQG KISEKELTQD DLRYIDNFSI FNEKNKTIDI IKDKRFTVDK FQFHVPITMN FKATGGSYIN QTVLEYLQNN PEVKIIGLDR GERHLVYLTL IDQQGNILKQ ESLNTITDSK ISTPYHKLLD NKENERDLAR KNWGTVENIK ELKEGYISQV VHKIATLMLE ENAIVVMEDL NFGFKRGRFK VEKQIYQKLE KMLIDKLNYL VLKDKQPQEL GGLYNALQLT NKFESFQKMG KQSGFLFYVP AWNTSKIDPT TGFVNYFYTK YENVDKAKAF FEKFEAIRFN AEKKYFEFEV KKYSDFNPKA EGTQQAWTIC TYGERIETKR QKDQNNKFVS TPINLTEKIE DFLGKNQIVY GDGNCIKSQI ASKDDKAFFE TLLYWFKMTL QMRNSETRTD IDYLISPVMN DNGTFYNSRD YEKLENPTLP KDADANGAYH IAKKGLMLLN KIDQADLTKK VDLSISNRDW LQFVQKNK WP_005398606_(m MFEKLSNIVS ISKTIRFKLI PVGKTLENIE KLGKLEKDFE RSDFYPILKN(SEQ IDodified) ISDDYYRQYI KEKLSDLNLD WQKLYDAHEL LDSSKKESQK NLEMIQAQYR NO: 124) hypothetical protein KVLFNILSGE LDKSGEKNSK DLIKNNKALY GKLFKKQFIL EVLPDFVNNN [Helcococcus DSYSEEDLEG LNLYSKFTTR LKNFWETRKN VFTDKDIVTA IPFRAVNENF kunzii] GFYYDNIKIF NKNIEYLENK IPNLENELKE ADILDDNRSV KDYFTPNGFN YVITQDGIDV YQAIRGGFTK ENGEKVQGIN EILNLTQQQL RRKPETKNVK LGVLTKLRKQ ILEYSESTSF LIDQIEDDND LVDRINKFNV SFFESTEVSP SLFEQIERLY NALKSIKKEE VYIDARNTQK FSQMLFGQWD VIRRGYTVKI TEGSKEEKKK YKEYLELDET SKAKRYLNIR EIEELVNLVE GFEEVDVFSV LLEKFKMNNI ERSEFEAPIY GSPIKLEAIK EYLEKHLEEY HKWKLLLIGN DDLDTDETFY PLLNEVISDY YIIPLYNLTR NYLTRKHSDK DKIKVNFDFP TLADGWSESK ISDNRSIILR KGGYYYLGIL IDNKLLINKK NKSKKIYEIL IYNQIPEFSK SIPNYPFTKK VKEHFKNNVS DFQLIDGYVS PLIITKEIYD IKKEKKYKKD FYKDNNTNKN YLYTIYKWIE FCKQFLYKYK GPNKESYKEM YDFSTLKDTS LYVNLNDFYA DVNSCAYRVL FNKIDENTID NAVEDGKLLL FQIYNKDFSP ESKGKKNLHT LYWLSMFSEE NLRTRKLKLN GQAEIFYRKK LEKKPIIHKE GSILLNKIDK EGNTIPENIY HECYRYLNKK IGREDLSDEA IALFNKDVLK YKEARFDIIK DRRYSESQFF FHVPITFNWD IKTNKNVNQI VQGMIKDGEI KHIIGIDRGE RHLLYYSVID LEGNIVEQGS LNTLEQNRFD NSTVKVDYQN KLRTREEDRD RARKNWTNIN KIKELKDGYL SHVVHKLSRL IIKYEAIVIM ENLNQGFKRG RFKVERQVYQ KFELALMNKL SALSFKEKYD ERKNLEPSGI LNPIQACYPV DAYQELQGQN GIVFYLPAAY TSVIDPVTGF TNLFRLKSIN SSKYEEFIKK FKNIYFDNEE EDFKFIFNYK DFAKANLVILTable 5 - Cas12a orthologsNNIKSKDWKI STRGERISYN SKKKEYFYVQ PTEFLINKLK ELNIDYENID IIPLIDNLEE KAKRKILKAL FDTFKYSVQL RNYDFENDYI ISPTADDNGN YYNSNEIDID KTNLPNNGDA NGAFNIARKG LLLKDRIVNS NESKVDLKIK NEDWINFIIS WP_021736722_(m MTQFEGFTNL YQVSKTLRFE LIPQGKTLKH IQEQGFIEED KARNDHYKEL(SEQ IDodified) CRISPR- KPIIDRIYKT YADQCLQLVQ LDWENLSAAI DSYRKEKTEE TRNALIEEQA NO: 125) associated protein TYRNAIHDYF IGRTDNLTDA INKRHAEIYK GLFKAELFNG KVLKQLGTVT Cpf1, subtype TTEHENALLR SFDKFTTYFS GFYENRKNVF SAEDISTAIP HRIVQDNFPK PREFRAN FKENCHIFTR LITAVPSLRE HFENVKKAIG IFVSTSIEEV FSFPFYNQLL [Acidaminococcus TQTQIDLYNQ LLGGISREAG TEKIKGLNEV LNLAIQKNDE TAHIIASLPH sp. BV3L6] RFIPLFKQIL SDRNTLSFIL EEFKSDEEVI QSFCKYKTLL RNENVLETAE ALFNELNSID LTHIFISHKK LETISSALCD HWDTLRNALY ERRISELTGK ITKSAKEKVQ RSLKHEDINL QEIISAAGKE LSEAFKQKTS EILSHAHAAL DQPLPTTLKK QEEKEILKSQ LDSLLGLYHL LDWFAVDESN EVDPEFSARL TGIKLEMEPS LSFYNKARNY ATKKPYSVEK FKLNFQMPTL ASGWDVNKEK NNGAILFVKN GLYYLGIMPK QKGRYKALSF EPTEKTSEGF DKMYYDYFPD AAKMIPKCST QLKAVTAHFQ THTTPILLSN NFIEPLEITK EIYDLNNPEK EPKKFQTAYA KKTGDQKGYR EALCKWIDFT RDFLSKYTKT TSIDLSSLRP SSQYKDLGEY YAELNPLLYH ISFQRIAEKE IMDAVETGKL YLFQIYNKDF AKGHHGKPNL HTLYWTGLFS PENLAKTSIK LNGQAELFYR PKSRMKRMAH RLGEKMLNKK LKDQKTPIPD TLYQELYDYV NHRLSHDLSD EARALLPNVI TKEVSHEIIK DRRFTSDKFF FHVPITLNYQ AANSPSKFNQ RVNAYLKEHP ETPIIGIDRG ERNLIYITVI DSTGKILEQR SLNTIQQFDY QKKLDNREKE RVAARQAWSV VGTIKDLKQG YLSQVIHEIV DLMIHYQAVV VLENLNFGFK SKRTGIAEKA VYQQFEKMLI DKLNCLVLKD YPAEKVGGVL NPYQLTDQFT SFAKMGTQSG FLFYVPAPYT SKIDPLTGFV DPFVWKTIKN HESRKHFLEG FDFLHYDVKT GDFILHFKMN RNLSFQRGLP GFMPAWDIVF EKNETQFDAK GTPFIAGKRI VPVIENHRFT GRYRDLYPAN ELIALLEEKG IVFRDGSNIL PKLLENDDSH AIDTMVALIR SVLQMRNSNA ATGEDYINSP VRDLNGVCFD SRFQNPEWPM DADANGAYHI ALKGQLLLNH LKESKDLKLQ NGISNQDWLA YIQELRN WP_004339290_(m MSIYQEFVNK YSLSKTLRFE LIPQGKTLEN IKARGLILDD EKRAKDYKKA(SEQ IDodified) KQIIDKYHQF FIEEILSSVC ISEDLLQNYS DVYFKLKKSD DDNLQKDFKS NO: 126) hypothetical protein AKDTIKKQIS KYINDSEKFK NLFNQNLIDA KKGQESDLIL WLKQSKDNGI [Francisella ELFKANSDIT DIDEALEIIK SFKGWTTYFK GFHENRKNVY SSNDIPTSII tularensis] YRIVDDNLPK FLENKAKYES LKDKAPEAIN YEQIKKDLAE ELTFDIDYKT SEVNQRVFSL DEVFEIANFN NYLNQSGITK FNTIIGGKFV NGENTKRKGI NEYINLYSQQ INDKTLKKYK MSVLFKQILS DTESKSFVID KLEDDSDVVT TMQSFYEQIA AFKTVEEKSI KETLSLLFDD LKAQKLDLSK IYFKNDKSLT DLSQQVFDDY SVIGTAVLEY ITQQVAPKNL DNPSKKEQDL IAKKTEKAKY LSLETIKLAL EEFNKHRDID KQCRFEEILS NFAAIPMIFD EIAQNKDNLA QISIKYQNQG KKDLLQASAE EDVKAIKDLL DQTNNLLHRL KIFHISQSED KANILDKDEH FYLVFEECYF ELANIVPLYN KIRNYITQKP YSDEKFKLNF ENSTLASGWD KNKESANTAI LFIKDDKYYL GIMDKKHNKI FSDKAIEENK GEGYKKIVYK QIADASKDIQ NLMIIDGKTV CKKGRKDRNG VNRQLLSLKR KHLPENIYRI KETKSYLKNE ARFSRKDLYD FIDYYKDRLD YYDFEFELKP SNEYSDFNDF TNHIGSQGYK LTFENISQDY INSLVNEGKL YLFQIYSKDF SAYSKGRPNL HTLYWKALFD ERNLQDVVYK LNGEAELFYR KQSIPKKITH PAKETIANKN KDNPKKESVF EYDLIKDKRF TEDKFFFHCP ITINFKSSGA NKFNDEINLL LKEKANDVHI LSIDRGERHL AYYTLVDGKG NIIKQDNFNI IGNDRMKTNY HDKLAAIEKD RDSARKDWKK INNIKEMKEG YLSQVVHEIA KLVIEYNAIV VFEDLNFGFK RGRFKVEKQV YQKLEKMLIE KLNYLVFKDN EFDKTGGVLR AYQLTAPFET FKKMGKQTGI IYYVPAGFTS KICPVTGFVN QLYPKYESVS KSQEFFSKFD KICYNLDKGY FEFSFDYKNF GDKAAKGKWTTable 5 - Cas12a orthologsIASFGSRLIN FRNSDKNHNW DTREVYPTKE LEKLLKDYSI EYGHGECIKA AICGESDKKF FAKLTSVLNT ILQMRNSKTG TELDYLISPV ADVNGNFFDS RQAPKNMPQD ADANGAYHIG LKGLMLLDRI KNNQEGKKLN LVIKNEEYFE FVQNRNN WP_022501477 MNKAADNYTG GNYDEFIALS KVQKTLRNEL KPTPFTAEHI KQRGIISEDE(SEQ IDYRAQQSLELK KIADEYYRNY ITHKLNDINN LDFYNLFDAI EEKYKKNDKD NO: 127) type V CRISPR- NRDKLDLVEK SKRGEIAKML SADDNFKSMF EAKLITKLLP DYVERNYTGE associated protein DKEKALETLA LFKGFTTYFK GYFKTRKNMF SGEGGASSIC HRIVNVNASI Cpf1 [Eubacterium FYDNLKTFMR IQEKAGDEIA LIEEELTEKL DGWRLEHIFS RDYYNEVLAQ sp. CAG:76] KGIDYYNQIC GDINKHMNLY CQQNKFKANI FKMMKIQKQI MGISEKAFEI PPMYQNDEEV YASFNEFISR LEEVKLTDRL INILQNINIY NTAKIYINAR YYTNVSSYVY GGWGVIDSAI ERYLYNTIAG KGQSKVKKIE NAKKDNKFMS VKELDSIVAE YEPDYFNAPY IDDDDNAVKA FGGQGVLGYF NKMSELLADV SLYTIDYNSD DSLIENKESA LRIKKQLDDI MSLYHWLQTF IIDEVVEKDN AFYAELEDIC CELENVVTLY DRIRNYVTKK PYSTQKFKLN FASPTLAAGW SRSKEFDNNA IILLRNNKYY IAIFNVNNKP DKQIIKGSEE QRLSTDYKKM VYNLLPGPNK MLPKVFIKSD TGKRDYNPSS YILEGYEKNR HIKSSGNFDI NYCHDLIDYY KACINKHPEW KNYGFKFKET NQYNDIGQFY KDVEKQGYSI SWAYISEEDI NKLDEEGKIY LFEIYNKDLS AHSTGRDNLH TMYLKNIFSE DNLKNICIEL NGEAELFYRK SSMKSNITHK KDTILVNKTY INETGVRVSL SDEDYMKVYN YYNNNYVIDT ENDKNLIDII EKIGHRKSKI DIVKDKRYTE DKYFLYLPIT INYGIEDENV NSKIIEYIAK QDNMNVIGID RGERNLIYIS VIDNKGNIIE QKSFNLVNNY DYKNKLKNME KTRDNARKNW QEIGKIKDVK SGYLSGVISK IARMVIDYNA IIVMEDLNKG FKRGRFKVER QVYQKFENML ISKLNYLVFK ERKADENGGI LRGYQLTYIP KSIKNVGKQC GCIFYVPAAY TSKIDPATGF INIFDFKKYS GSGINAKVKD KKEFLMSMNS IRYINECSEE YEKIGHRELF AFSFDYNNFK TYNVSSPVNE WTAYTYGERI KKLYKDGRWL RSEVLNLTEN LIKLMEQYNI EYKDGHDIRE DISHMDETRN ADFICSLFEE LKYTVQLRNS KSEAEDENYD RLVSPILNSS NGFYDSSDYM ENENNTTHTM PKDADANGAY CIALKGLYEI NKIKQNWSDD KKFKENELYI NVTEWLDYIQ NRRFE WP_014550095 MSIYQEFVNK YSLSKTLRFE LIPQGKTLEN IKARGLILDD EKRAKDYKKA(SEQ IDKQIIDKYHQF FIEEILSSVC ISEDLLQNYS DVYFKLKKSD DDNLQKDFKS NO: 128) type V CRISPR- AKDTIKKQIS EYIKDSEKFK NLFNQNLIDA KKGQESDLIL WLKQSKDNGI associated protein ELFKANSDIT DIDEALEIIK SFKGWTTYFK GFHENRKNVY SSNDIPTSII Cpf1 [Francisella YRIVDDNLPK FLENKAKYES LKDKAPEAIN YEQIKKDLAE ELTFDIDYKT tularensis] SEVNQRVFSL DEVFEIANFN NYLNQSGITK FNTIIGGKFV NGENTKRKGI NEYINLYSQQ INDKTLKKYK MSVLFKQILS DTESKSFVID KLEDDSDVVT TMQSFYEQIA AFKTVEEKSI KETLSLLFDD LKAQKLDLSK IYFKNDKSLT DLSQQVFDDY SVIGTAVLEY ITQQVAPKNL DNPSKKEQDL IAKKTEKAKY LSLETIKLAL EEFNKHRDID KQCRFEEILA NFAAIPMIFD EIAQNKDNLA QISIKYQNQG KKDLLQASAE DDVKAIKDLL DQTNNLLHRL KIFHISQSED KANILDKDEH FYLVFEECYF ELANIVPLYN KIRNYITQKP YSDEKFKLNF ENSTLANGWD KNKEPDNTAI LFIKDDKYYL GVMNKKNNKI FDDKAIKENK GEGYKKIVYK LLPGANKMLP KVFFSAKSIK FYNPSEDILR IRNHSTHTKN GNPQKGYEKF EFNIEDCRKF IDFYKESISK HPEWKDFGFR FSDTQRYNSI DEFYREVENQ GYKLTFENIS ESYIDSVVNQ GKLYLFQIYN KDFSAYSKGR PNLHTLYWKA LFDERNLQDV VYKLNGEAEL FYRKKSIPKK ITHPAKEAIA NKNKDNPKKE SFFEYDLIKD KRFTEDKFFF HCPITINFKS SGANKFNDEI NLLLKEKAND VHILSIDRGE RHLAYYTLVD GKGNIIKQDT FNIIGNDRMK TNYHDKLAAI EKDRDSARKD WKKINNIKEM KEGYLSQVVH EIAKLVIEHN AIVVFEDLNF GFKRGRFKVE KQVYQKLEKM LIEKLNYLVF KDNEFDKTGG VLRAYQLTAP FETFKKMGKQ TGIIYYVPAG FTSKICPVTG FVNQLYPKYE SVSKSQEFFS KFDKICYNLD KGYFEFSFDY KNFGDKAAKG KWTIASFGSRTable 5 - Cas12a orthologsLINFRNSDKN HNWDTREVYP TKELEKLLKD YSIEYGHGEC IKAAICGESD KKFFAKLTSI LNTILQMRNS KTGTELDYLI SPVADVNGNF FDSRQAPKNM PQDADANGAY HIGLKGLMLL DRIKNNQEGK KLNLVIKNEE YFEFVQNRNN WP_003034647 MSIYQEFVNK YSLSKTLRFE LIPQGKTLEN IKARGLILDD EKRAKDYKKA(SEQ IDKQIIDKYHQF FIEEILSSVC ISEDLLQNYS DVYFKLKKSD DDNLQKDFKS NO: 129) type V CRISPR- AKDTIKKQIS EYIKDSEKFK NLFNQNLIDA KKGQESDLIL WLKQSKDNGI associated protein ELFKANSDIT DIDEALEIIK SFKGWTTYFK GFHENRKNVY SSDDIPTSII Cpf1 [Francisella YRIVDDNLPK FLENKAKYES LKDKAPEAIN YEQIKKDLAE ELTFDIDYKT tularensis] SEVNQRVFSL DEVFEIANFN NYLNQSGITK FNTIIGGKFV NGENTKRKGI NEYINLYSQQ INDKTLKKYK MSVLFKQILS DTESKSFVID KLEDDSDVVT TMQSFYEQIA AFKTVEEKSI KETLSLLFDD LKAQKLDLSK IYFKNDKSLT DLSQQVFDDY SVIGTAVLEY ITQQVAPKNL DNPSKKEQDL IAKKTEKAKY LSLETIKLAL EEFNKHRDID KQCRFEEILA NFAAIPMIFD EIAQNKDNLA QISLKYQNQG KKDLLQASAE EDVKAIKDLL DQTNNLLHRL KIFHISQSED KANILDKDEH FYLVFEECYF ELANIVPLYN KIRNYITQKP YSDEKFKLNF ENSTLANGWD KNKEPDNTAI LFIKDDKYYL GVMNKKNNKI FDDKAIKENK GEGYKKIVYK LLPGANKMLP KVFFSAKSIK FYNPSEDILR IRNHSTHTKN GNPQKGYEKF EFNIEDCRKF IDFYKESISK HPEWKDFGFR FSDTQRYNSI DEFYREVENQ GYKLTFENIS ESYIDSVVNQ GKLYLFQIYN KDFSAYSKGR PNLHTLYWKA LFDERNLQDV VYKLNGEAEL FYRKQSIPKK ITHPAKEAIA NKNKDNPKKE SVFEYDLIKD KRFTEDKFFF HCPITINFKS SGANKFNDEI NLLLKEKAND VHILSIDRGE RHLAYYTLVD GKGNIIKQDT FNIIGNDRMK TNYHDKLAAI EKDRDSARKD WKKINNIKEM KEGYLSQVVH EIAKLVIEHN AIVVFEDLNF GFKRGRFKVE KQVYQKLEKM LIEKLNYLVF KDNEFDKTGG VLRAYQLTAP FETFKKMGKQ TGIIYYVPAG FTSKICPVTG FVNQLYPKYE SVSKSQEFFS KFDKICYNLD KGYFEFSFDY KNFGDKAAKG KWTIASFGSR LINFRNSDKN HNWDTREVYP TKELEKLLKD YSIEYGHGEC IKAAICGESD KKFFAKLTSV LNTILQMRNS KTGTELDYLI SPVADVNGNF FDSRQAPKNM PQDADANGAY HIGLKGLMLL DRIKNNQEGK KLNLVIKNEE YFEFVQNRNN WP_003040289.1 MSIYQEFVNK YSLSKTLRFE LIPQGKTLEN IKARGLILDD EKRAKDYKKA(SEQ IDKQIIDKYHQF FIEEILSSVC ISEDLLQNYS DVYFKLKKSD DDNLQKDFKS NO: 130) type V CRISPR- AKDTIKKQIS EYIKDSEKFK NLFNQNLIDA KKGQESDLIL WLKQSKDNGI associated protein ELFKANSDIT DIDEALEIIK SFKGWTTYFK GFHENRKNVY SSNDIPTSII Cpf1 [Francisella YRIVDDNLPK FLENKAKYES LKDKAPEAIN YEQIKKDLAE ELTFDIDYKT tularensis subsp. SEVNQRVFSL DEVFEIANFN NYLNQSGITK FNTIIGGKFV NGENTKRKGI novicida U112] NEYINLYSQQ INDKTLKKYK MSVLFKQILS DTESKSFVID KLEDDSDVVT TMQSFYEQIA AFKTVEEKSI KETLSLLFDD LKAQKLDLSK IYFKNDKSLT DLSQQVFDDY SVIGTAVLEY ITQQIAPKNL DNPSKKEQEL IAKKTEKAKY LSLETIKLAL EEFNKHRDID KQCRFEEILA NFAAIPMIFD EIAQNKDNLA QISIKYQNQG KKDLLQASAE DDVKAIKDLL DQTNNLLHKL KIFHISQSED KANILDKDEH FYLVFEECYF ELANIVPLYN KIRNYITQKP YSDEKFKLNF ENSTLANGWD KNKEPDNTAI LFIKDDKYYL GVMNKKNNKI FDDKAIKENK GEGYKKIVYK LLPGANKMLP KVFFSAKSIK FYNPSEDILR IRNHSTHTKN GSPQKGYEKF EFNIEDCRKF IDFYKQSISK HPEWKDFGFR FSDTQRYNSI DEFYREVENQ GYKLTFENIS ESYIDSVVNQ GKLYLFQIYN KDFSAYSKGR PNLHTLYWKA LFDERNLQDV VYKLNGEAEL FYRKQSIPKK ITHPAKEAIA NKNKDNPKKE SVFEYDLIKD KRFTEDKFFF HCPITINFKS SGANKFNDEI NLLLKEKAND VHILSIDRGE RHLAYYTLVD GKGNIIKQDT FNIIGNDRMK TNYHDKLAAI EKDRDSARKD WKKINNIKEM KEGYLSQVVH EIAKLVIEYN AIVVFEDLNF GFKRGRFKVE KQVYQKLEKM LIEKLNYLVF KDNEFDKTGG VLRAYQLTAP FETFKKMGKQ TGIIYYVPAG FTSKICPVTG FVNQLYPKYE SVSKSQEFFS KFDKICYNLD KGYFEFSFDY KNFGDKAAKG KWTIASFGSR LINFRNSDKN HNWDTREVYP TKELEKLLKD YSIEYGHGEC IKAAICGESD KKFFAKLTSV LNTILQMRNS KTGTELDYLI SPVADVNGNF FDSRQAPKNMTable 5 - Cas12a orthologsPQDADANGAY HIGLKGLMLL GRIKNNQEGK KLNLVIKNEE YFEFVQNRNN KKQ38174 MKSFDSFTNL YSLSKTLKFE MRPVGNTQKM LDNAGVFEKD KLIQKKYGKT(SEQ IDKPYFDRLHRE FIEEALTGVE LIGLDENFRT LVDWQKDKKN NVAMKAYENS NO: 131) hypothetical protein LQRLRTEIGK IFNLKAEDWV KNKYPILGLK NKNTDILFEE AVFGILKARY US54_C0016G0015 GEEKDTFIEV EEIDKTGKSK INQISIFDSW KGFTGYFKKF FETRKNFYKN [Candidatus DGTSTAIATR IIDQNLKRFI DNLSIVESVR QKVDLAETEK SFSISLSQFF Roizmanbacteria SIDFYNKCLL QDGIDYYNKI IGGETLKNGE KLIGLNELIN QYRQNNKDQK bacterium IPFFKLLDKQ ILSEKILFLD EIKNDTELIE ALSQFAKTAE EKTKIVKKLF GW2011_GWA2_3 ADFVENNSKY DLAQIYISQE AFNTISNKWT SETETFAKYL FEAMKSGKLA 7_7] KYEKKDNSYK FPDFIALSQM KSALLSISLE GHFWKEKYYK ISKFQEKTNW EQFLAIFLYE FNSLFSDKIN TKDGETKQVG YYLFAKDLHN LILSEQIDIP KDSKVTIKDF ADSVLTIYQM AKYFAVEKKR AWLAEYELDS FYTQPDTGYL QFYDNAYEDI VQVYNKLRNY LTKKPYSEEK WKLNFENSTL ANGWDKNKES DNSAVILQKG GKYYLGLITK GHNKIFDDRF QEKFIVGIEG GKYEKIVYKF FPDQAKMFPK VCFSAKGLEF FRPSEEILRI YNNAEFKKGE TYSIDSMQKL IDFYKDCLTK YEGWACYTFR HLKPTEEYQN NIGEFFRDVA EDGYRIDFQG ISDQYIHEKN EKGELHLFEI HNKDWNLDKA RDGKSKTTQK NLHTLYFESL FSNDNVVQNF PIKLNGQAEI FYRPKTEKDK LESKKDKKGN KVIDHKRYSE NKIFFHVPLT LNRTKNDSYR FNAQINNFLA NNKDINIIGV DRGEKHLVYY SVITQASDIL ESGSLNELNG VNYAEKLGKK AENREQARRD WQDVQGIKDL KKGYISQVVR KLADLAIKHN AIIILEDLNM RFKQVRGGIE KSIYQQLEKA LIDKLSFLVD KGEKNPEQAG HLLKAYQLSA PFETFQKMGK QTGIIFYTQA SYTSKSDPVT GWRPHLYLKY FSAKKAKDDI AKFTKIEFVN DRFELTYDIK DFQQAKEYPN KTVWKVCSNV ERFRWDKNLN QNKGGYTHYT NITENIQELF TKYGIDITKD LLTQISTIDE KQNTSFFRDF IFYFNLICQI RNTDDSEIAK KNGKDDFILS PVEPFFDSRK DNGNKLPENG DDNGAYNIAR KGIVILNKIS QYSEKNENCE KMKWGDLYVS NIDWDNFVTQ ANARH WP_022097749 MNGNRSIVYR EFVGVTPVAK TLRNELRPVG HTQEHIIQNG LIQEDELRQE(SEQ IDKSTELKNIMD DYYREYIDKS LSGLTDLDFT LLFELMNSVQ SSLSKDNKKA NO: 132) type V CRISPR- LEKEHNKMRE QICTHLQSDS DYKNMFNAKL FKEILPDFIK NYNQYDVKDK associated protein AGKLETLALF NGFSTYFTDF FEKRKNVFTK EAVSTSIAYR IVHENSLIFL Cpf1 [Eubacterium ANMTSYKKIS EKALDEIEVI EKNNQDKMGD WELNQIFNPD FYNMVLIQSG eligens CAG:72] IDFYNEICGV VNAHMNLYCQ QTKNNYNLFK MRKLHKQILA YTSTSFEVPK MFEDDMSVYN AVNAFIDETE KGNIIGKLKD IVNKYDELDE KRIYISKDFY ETLSCFMSGN WNLITGCVEN FYDENIHAKG KSKEEKVKKA VKEDKYKSIN DVNDLVEKYI DEKERNEFKN SNAKQYIREI SNIITDTETA HLEYDEHISL IESEEKADEI KKRLDMYMNM YHWVKAFIVD EVLDRDEMFY SDIDDIYNIL ENIVPLYNRV RNYVTQKPYT SKKIKLNFQS PTLANGWSQS KEFDNNAIIL IRDNKYYLAI FNAKNKPDKK IIQGNSDKKN DNDYKKMVYN LLPGANKMLP KVFLSKKGIE TFKPSDYIIS GYNAHKHIKT SENFDISFCR DLIDYFKNSI EKHAEWRKYE FKFSATDSYN DISEFYREVE MQGYRIDWTY ISEADINKLD EEGKIYLFQI YNKDFAENST GKENLHTMYF KNIFSEENLK NIVIKLNGQA ELFYRKASVK NPVKHKKDSV LVNKTYKNQL DNGDVVRIPI PDDIYNEIYK MYNGYIKESD LSEAAKEYLD KVEVRTAQKD IVKDYRYTVD KYFIHTPITI NYKVTARNNV NDMAVKYIAQ NDDIHVIGID RGERNLIYIS VIDSHGNIVK QKSYNILNNY DYKKKLVEKE KTREYARKNW KSIGNIKELK EGYISGVVHE IAMLMVEYNA IIAMEDLNYG FKRGRFKVER QVYQKFESML INKLNYFASK GKSVDEPGGL LKGYQLTYVP DNIKNLGKQC GVIFYVPAAF TSKIDPSTGF ISAFNFKSIS TNASRKQFFM QFDEIRYCAE KDMFSFGFDY NNFDTYNITM GKTQWTVYTN GERLQSEFNN ARRTGKTKSI NLTETIKLLL EDNEINYADG HDVRIDMEKM YEDKNSEFFA QLLSLYKLTV QMRNSYTEAE EQEKGISYDK IISPVINDEG EFFDSDNYKE SDDKECKMPK DADANGAYCI ALKGLYEVLK IKSEWTEDGF DRNCLKLPHA EWLDFIQNKR YETable 5 - Cas12a orthologsWP_021739647 MIKKTIDTVL NVRPIFVGIQ HLYFYEGPCR FGEGDELMPE YDAMMNQEMN(SEQ IDAAYVNEVVQH ETEGVHIMDP IYVERDDWFR SPEAMYEKMA EDIDKVDFYL NO: 133) hypothetical protein FHFGIGRGDI YLEFAERYKK PVGAAPGLCC DGIGNTAAVK NRGLEAYAFM [Eubacterium SWDEFDTWMR VLRVRKCLKN TRVLLAVRWD SNRSYSSYDN FINQSDVTNK ramulus] WGIQFRHVNV HELLDQTHPV DPTTNPSTPG RKALNINDED MKEIEKITDE LIANAEACTM EPDMVKKTIQ AYYTVQKLLD AYDCNAFTAP CPDLCSTRRF SEEKFTLCMT HSLNDENGIS SACEYDINSV IGKVIMTNLS GKAPYMGNTN AIVFDKEGHM IPFHKFNDNT IEDIADKTNL YMTFHSTPNR NLKGLKAEKE RYRLAPFAYS GFGATIRYDF AQDIGQVITM IRISPDATKI FIAKGTISGG AGYEMKNCDQ GVFFNVADKV DFYHKQQYFG NHTVLAYGDY VEELKMLAEA LGIEAVIA gi|800943167 MKNFSNLYQV SKTVRFELKP IGNTLENIKN KSLLKNDSIR AESYQKMKKT(SEQ IDIDEFHKYFID LALNNKKLSY LNEYIALYTQ SAEAKKEDKF KADFKKVQDN NO: 134) WP_045971446.1 LRKEIVSSFT EGEAKAIFSV LDKKELITIE LEKWKNENNL AVYLDESFKS type V CRISPR- FTTYFTGFHQ NRKNMYSAEA NSTAIAYRLI HENLPKFIEN SKAFEKSSQI associated protein AELQPKIEKL YKEFEAYLNV NSISELFEID YFNEVLTQKG ITVYNNIIGG Cpf1 RTATEGKQKI QGLNEIINLY NQTKPKNERL PKLKQLYKQI LSDRISLSFL [Flavobacterium sp. PDAFTEGKQV LKAVFEFYKI NLLSYKQDGV EESQNLLELI QQVVKNLGNQ 316] DVNKIYLKND TSLTTIAQQL FGDFSVFSAA LQYRYETVVN PKYTAEYQKA NEAKQEKLDK EKIKFVKQDY FSIAFLQEVV ADYVKTLDEN LDWKQKYTPS CIADYFTTHF IAKKENEADK TFNFIANIKA KYQCIQGILE QADDYEDELK QDQKLIDNIK FFLDAILEVV HFIKPLHLKS ESITEKDNAF YDVFENYYEA LNVVTPLYNM VRNYVTQKPY STEKIKLNFE NAQLLNGWDA NKEKDYLTTI LKRDGNYFLA IMDKKHNKTF QQFTEDDENY EKIVYKLLPG VNKMLPKVFF SNKNIAFFNP SKEILDNYKN NTHKKGATFN LKDCHALIDF FKDSLNKHED WKYFDFQFSE TKTYQDLSGF YKEVEHQGYK INFKKVSVSQ IDTLIEEGKM YLFQIYNKDF SPYAKGKPNM HTLYWKALFE TQNLENVIYK LNGQAEIFFR KASIKKKNII THKAHQPIAA KNPLTPTAKN TFAYDLIKDK RYTVDKFQFH VPITMNFKAT GNSYINQDVL AYLKDNPEVN IIGLDRGERH LVYLTLIDQK GTILLQESLN VIQDEKTHTP YHTLLDNKEI ARDKARKNWG SIESIKELKE GYISQVVHKI TKMMIEHNAI VVMEDLNFGF KRGRFKVEKQ IYQKLEKMLI DKLNYLVLKD KQPHELGGLY NALQLTNKFE SFQKMGKQSG FLFYVPAWNT SKIDPTTGFV NYFYTKYENV EKAKTFFSKF DSILYNKTKG YFEFVVKNYS DFNPKAADTR QEWTICTHGE RIETKRQKEQ NNNFVSTTIQ LTEQFVNFFE KVGLDLSKEL KTQLIAQNEK SFFEELFHLL KLTLQMRNSE SHTEIDYLIS PVANEKGIFY DSRKATASLP IDADANGAYH IAKKGLWIME QINKTNSEDD LKKVKLAISN REWLQYVQQV QKK WP_044110123.1 MKQFTNLYQL SKTLRFELKP IGKTLEHINA NGFIDNDAHR AESYKKVKKL(SEQ IDIDDYHKDYIE NVLNNFKLNG EYLQAYFDLY SQDTKDKQFK DIQDKLRKSI NO: 135) type V CRISPR- ASALKGDDRY KTIDKKELIR QDMKTFLKKD TDKALLDEFY EFTTYFTGYH associated protein ENRKNMYSDE AKSTAIAYRL IHDNLPKFID NIAVFKKIAN TSVADNFSTI Cpf1 [Prevotella YKNFEEYLNV NSIDEIFSLD YYNIVLTQTQ IEVYNSIIGG RTLEDDTKIQ brevis] GINEFVNLYN QQLANKKDRL PKLKPLFKQI LSDRVQLSWL QEEFNTGADV LNAVKEYCTS YFDNVEESVK VLLTGISDYD LSKIYITNDL ALTDVSQRMF GEWSIIPNAI EQRLRSDNPK KTNEKEEKYS DRISKLKKLP KSYSLGYINE CISELNGIDI ADYYATLGAI NTESKQEPSI PTSIQVHYNA LKPILDTDYP REKNLSQDKL TVMQLKDLLD DFKALQHFIK PLLGNGDEAE KDEKFYGELM QLWEVIDSIT PLYNKVRNYC TRKPFSTEKI KVNFENAQLL DGWDENKEST NASIILRKNG MYYLGIMKKE YRNILTKPMP SDGDCYDKVV YKFFKDITTM VPKCTTQMKS VKEHFSNSND DYTLFEKDKF IAPVVITKEI FDLNNVLYNG VKKFQIGYLN NTGDSFGYNH AVEIWKSFCL KFLKAYKSTS IYDFSSIEKN IGCYNDLNSF YGAVNLLLYN LTYRKVSVDY IHQLVDEDKM YLFMIYNKDF STYSKGTPNM HTLYWKMLFD ESNLNDVVYK LNGQAEVFYR KKSITYQHPT HPANKPIDNK NVNNPKKQSN FEYDLIKDKR YTVDKFMFHV PITLNFKGMGTable 5 - Cas12a orthologsNGDINMQVRE YIKTTDDLHF IGIDRGERHL LYICVINGKG EIVEQYSLNE IVNNYKGTEY KTDYHTLLSE RDKKRKEERS SWQTIEGIKE LKSGYLSQVI HKITQLMIKY NAIVLLEDLN MGFKRGRQKV ESSVYQQFEK ALIDKLNYLV DKNKDANEIG GLLHAYQLTN DPKLPNKNSK QSGFLFYVPA WNTSKIDPVT GFVNLLDTRY ENVAKAQAFF KKFDSIRYNK EYDRFEFKFD YSNFTAKAED TRTQWTLCTY GTRIETFRNA EKNSNWDSRE IDLTTEWKTL FTQHNIPLNA NLKEAILLQA NKNFYTDILH LMKLTLQMRN SVTGTDIDYM VSPVANECGE FFDSRKVKEG LPVNADANGA YNIARKGLWL AQQIKNANDL SDVKLAITNK EWLQFAQKKQ YLKD WP_036388671.1 MLFQDFTHLY PLSKTMRFEL KPIGKTLEHI HAKNFLSQDE TMADMYQKVK(SEQ IDAILDDYHRDF IADMMGEVKL TKLAEFYDVY LKFRKNPKDD GLQKQLKDLQ NO: 136) type V CRISPR- AVLRKEIVKP IGNGGKYKAG YDRLFGAKLF KDGKELGDLA KFVIAQEGES associated protein SPKLAHLAHF EKFSTYFTGF HDNRKNMYSD EDKHTAITYR LIHENLPRFI Cpf1 [Moraxella DNLQILATIK QKHSALYDQI INELTASGLD VSLASHLDGY HKLLTQEGIT caprae] AYNTLLGGIS GEAGSRKIQG INELINSHHN QHCHKSERIA KLRPLHKQIL SDGMGVSFLP SKFADDSEMC QAVNEFYRHY ADVFAKVQSL FDGFDDHQKD GIYVEHKNLN ELSKQAFGDF ALLGRVLDGY YVDVVNPEFN ERFAKAKTDN AKAKLTKEKD KFIKGVHSLA SLEQAIEHYT ARHDDESVQA GKLGQYFKHG LAGVDNPIQK IHNNHSTIKG FLERERPAGE RALPKIKSGK NPEMTQLRQL KELLDNALNV AHFAKLLTTK TTLDNQDGNF YGEFGALYDE LAKIPTLYNK VRDYLSQKPF STEKYKLNFG NPTLLNGWDL NKEKDNFGII LQKDGCYYLA LLDKAHKKVF DNAPNTGKNV YQKMIYKLLP GPNKMLPKVF FAKSNLDYYN PSAELLDKYA QGTHKKGNNF NLKDCHALID FFKAGINKHP EWQHFGFKFS PTSSYQDLSD FYREVEPQGY QVKFVDINAD YINELVEQGQ LYLFQIYNKD FSPKAHGKPN LHTLYFKALF SKDNLANPIY KLNGEAQIFY RKASLDMNET TIHRAGEVLE NKNPDNPKKR QFVYDIIKDK RYTQDKFMLH VPITMNFGVQ GMTIKEFNKK VNQSIQQYDE VNVIGIDRGE RHLLYLTVIN SKGEILEQRS LNDITTASAN GTQMTTPYHK ILDKREIERL NARVGWGEIE TIKELKSGYL SHVVHQISQL MLKYNAIVVL EDLNFGFKRG RFKVEKQIYQ NFENALIKKL NHLVLKDEAD DEIGSYKNAL QLTNNFTDLK SIGKQTGFLF YVPAWNTSKI DPETGFVDLL KPRYENIAQS QAFFGKFDKI CYNADKDYFE FHIDYAKFTD KAKNSRQIWK ICSHGDKRYV YDKTANQNKG ATKGINVNDE LKSLFARHHI NDKQPNLVMD ICQNNDKEFH KSLIYLLKTL LALRYSNASS DEDFILSPVA NDEGMFFNSA LADDTQPQNA DANGAYHIAL KGLWVLEQIK NSDDLNKVKL AIDNQTWLNF AQNR WP_020988726.1 MEDYSGFVNI YSIQKTLRFE LKPVGKTLEH IEKKGFLKKD KIRAEDYKAV(SEQ IDKKIIDKYHRA YIEEVFDSVL HQKKKKDKTR FSTQFIKEIK EFSELYYKTE NO: 137) type V CRISPR- KNIPDKERLE ALSEKLRKML VGAFKGEFSE EVAEKYKNLF SKELIRNEIE associated protein KFCETDEERK QVSNFKSFTT YFTGFHSNRQ NIYSDEKKST AIGYRIIHQN Cpf1 [Leptospira LPKFLDNLKI IESIQRRFKD FPWSDLKKNL KKIDKNIKLT EYFSIDGFVN inadai] VLNQKGIDAY NTILGGKSEE SGEKIQGLNE YINLYRQKNN IDRKNLPNVK ILFKQILGDR ETKSFIPEAF PDDQSVLNSI TEFAKYLKLD KKKKSIIAEL KKFLSSFNRY ELDGIYLAND NSLASISTFL FDDWSFIKKS VSFKYDESVG DPKKKIKSPL KYEKEKEKWL KQKYYTISFL NDAIESYSKS QDEKRVKIRL EAYFAEFKSK DDAKKQFDLL ERIEEAYAIV EPLLGAEYPR DRNLKADKKE VGKIKDFLDS IKSLQFFLKP LLSAEIFDEK DLGFYNQLEG YYEEIDSIGH LYNKVRNYLT GKIYSKEKFK LNFENSTLLK GWDENREVAN LCVIFREDQK YYLGVMDKEN NTILSDIPKV KPNELFYEKM VYKLIPTPHM QLPRIIFSSD NLSIYNPSKS ILKIREAKSF KEGKNFKLKD CHKFIDFYKE SISKNEDWSR FDFKFSKTSS YENISEFYRE VERQGYNLDF KKVSKFYIDS LVEDGKLYLF QIYNKDFSIF SKGKPNLHTI YFRSLFSKEN LKDVCLKLNG EAEMFFRKKS INYDEKKKRE GHHPELFEKL KYPILKDKRY SEDKFQFHLP ISLNFKSKER LNFNLKVNEF LKRNKDINII GIDRGERNLL YLVMINQKGE ILKQTLLDSM QSGKGRPEIN YKEKLQEKEI ERDKARKSWG TVENIKELKE GYLSIVIHQITable 5 - Cas12a orthologsSKLMVENNAI VVLEDLNIGF KRGRQKVERQ VYQKFEKMLI DKLNFLVFKE NKPTEPGGVL KAYQLTDEFQ SFEKLSKQTG FLFYVPSWNT SKIDPRTGFI DFLHPAYENI EKAKQWINKF DSIRFNSKMD WFEFTADTRK FSENLMLGKN RVWVICTTNV ERYFTSKTAN SSIQYNSIQI TEKLKELFVD IPFSNGQDLK PEILRKNDAV FFKSLLFYIK TTLSLRQNNG KKGEEEKDFI LSPVVDSKGR FFNSLEASDD EPKDADANGA YHIALKGLMN LLVLNETKEE NLSRPKWKIK NKDWLEFVWE RNR WP_023936172.1 MPWIDLKDFT NLYPVSKTLR FELKPVGKTL ENIEKAGILK EDEHRAESYR(SEQ IDRVKKIIDTYH KVFIDSSLEN MAKMGIENEI KAMLQSFCEL YKKDHRTEGE NO: 138) type V CRISPR- DKALDKIRAV LRGLIVGAFT GVCGRRENTV QNEKYESLFK EKLIKEILPD associated protein FVLSTEAESL PFSVEEATRS LKEFDSFTSY FAGFYENRKN IYSTKPQSTA Cpf1 IAYRLIHENL PKFIDNILVF QKIKEPIAKE LEHIRADFSA GGYIKKDERL [Porphyromonas EDIFSLNYYI HVLSQAGIEK YNALIGKIVT EGDGEMKGLN EHINLYNQQR crevioricanis] GREDRLPLFR PLYKQILSDR EQLSYLPESF EKDEELLRAL KEFYDHIAED ILGRTQQLMT SISEYDLSRI YVRNDSQLTD ISKKMLGDWN AIYMARERAY DHEQAPKRIT AKYERDRIKA LKGEESISLA NLNSCIAFLD NVRDCRVDTY LSTLGQKEGP HGLSNLVENV FASYHEAEQL LSFPYPEENN LIQDKDNVVL IKNLLDNISD LQRFLKPLWG MGDEPDKDER FYGEYNYIRG ALDQVIPLYN KVRNYLTRKP YSTRKVKLNF GNSQLLSGWD RNKEKDNSCV ILRKGQNFYL AIMNNRHKRS FENKVLPEYK EGEPYFEKMD YKFLPDPNKM LPKVFLSKKG IEIYEPSPKL LEQYGHGTHK KGDTFSMDDL HELIDFFKHS IEAHEDWKQF GFKFSDTATY ENVSSFYREV EDQGYKLSFR KVSESYVYSL IDQGKLYLFQ IYNKDFSPCS KGTPNLHTLY WRMLFDERNL ADVIYKLDGK AEIFFREKSL KNDHPTHPAG KPIKKKSRQK KGEESLFEYD LVKDRRYTMD KFQFHVPITM NFKCSAGSKV NDMVNAHIRE AKDMHVIGID RGERNLLYIC VIDSRGTILD QISLNTINDI DYHDLLESRD KDRQQERRNW QTIEGIKELK QGYLSQAVHR IAELMVAYKA VVALEDLNMG FKRGRQKVES SVYQQFEKQL IDKLNYLVDK KKRPEDIGGL LRAYQFTAPF KSFKEMGKQN GFLFYIPAWN TSNIDPTTGF VNLFHAQYEN VDKAKSFFQK FDSISYNPKK DWFEFAFDYK NFTKKAEGSR SMWILCTHGS RIKNFRNSQK NGQWDSEEFA LTEAFKSLFV RYEIDYTADL KTAIVDEKQK DFFVDLLKLF KLTVQMRNSW KEKDLDYLIS PVAGADGRFF DTREGNKSLP KDADANGAYN IALKGLWALR QIRQTSEGGK LKLAISNKEW LQFVQERSYE KD WP_009217842.1 MRKFNEFVGL YPISKTLRFE LKPIGKTLEH IQRNKLLEHD AVRADDYVKV(SEQ IDKKIIDKYHKC LIDEALSGFT FDTEADGRSN NSLSEYYLYY NLKKRNEQEQ NO: 139) type V CRISPR- KTFKTIQNNL RKQIVNKLTQ SEKYKRIDKK ELITTDLPDF LTNESEKELV associated protein EKFKNFTTYF TEFHKNRKNM YSKEEKSTAI AFRLINENLP KFVDNIAAFE Cpf1 [Bacteroidetes KVVSSPLAEK INALYEDFKE YLNVEEISRV FRLDYYDELL TQKQIDLYNA oral taxon 274] IVGGRTEEDN KIQIKGLNQY INEYNQQQTD RSNRLPKLKP LYKQILSDRE SVSWLPPKFD SDKNLLIKIK ECYDALSEKE KVFDKLESIL KSLSTYDLSK IYISNDSQLS YISQKMFGRW DIISKAIRED CAKRNPQKSR ESLEKFAERI DKKLKTIDSI SIGDVDECLA QLGETYVKRV EDYFVAMGES EIDDEQTDTT SFKKNIEGAY ESVKELLNNA DNITDNNLMQ DKGNVEKIKT LLDAIKDLQR FIKPLLGKGD EADKDGVFYG EFTSLWTKLD QVTPLYNMVR NYLTSKPYST KKIKLNFENS TLMDGWDLNK EPDNTTVIFC KDGLYYLGIM GKKYNRVFVD REDLPHDGEC YDKMEYKLLP GANKMLPKVF FSETGIQRFL PSEELLGKYE RGTHKKGAGF DLGDCRALID FFKKSIERHD DWKKFDFKFS DTSTYQDISE FYREVEQQGY KMSFRKVSVD YIKSLVEEGK LYLFQIYNKD FSAHSKGTPN MHTLYWKMLF DEENLKDVVY KLNGEAEVFF RKSSITVQSP THPANSPIKN KNKDNQKKES KFEYDLIKDR RYTVDKFLFH VPITMNFKSV GGSNINQLVK RHIRSATDLH IIGIDRGERH LLYLTVIDSR GNIKEQFSLN EIVNEYNGNT YRTDYHELLD TREGERTEAR RNWQTIQNIR ELKEGYLSQV IHKISELAIK YNAVIVLEDL NFGFMRSRQK VEKQVYQKFE KMLIDKLNYL VDKKKPVAET GGLLRAYQLT GEFESFKTLG KQSGILFYVP AWNTSKIDPV TGFVNLFDTHTable 5 - Cas12a orthologsYENIEKAKVF FDKFKSIRYN SDKDWFEFVV DDYTRFSPKA EGTRRDWTIC TQGKRIQICR NHQRNNEWEG QEIDLTKAFK EHFEAYGVDI SKDLREQINT QNKKEFFEEL LRLLRLTLQM RNSMPSSDID YLISPVANDT GCFFDSRKQA ELKENAVLPM NADANGAYNI ARKGLLAIRK MKQEENDSAK ISLAISNKEW LKFAQTKPYL ED WP_036890108.1 MDSLKDFTNL YPVSKTLRFE LKPVGKTLEN IEKAGILKED EHRAESYRRV(SEQ IDKKIIDTYHKV FIDSSLENMA KMGIENEIKA MLQSFCELYK KDHRTEGEDK NO: 140) type V CRISPR- ALDKIRAVLR GLIVGAFTGV CGRRENTVQN EKYESLFKEK LIKEILPDFV associated protein LSTEAESLPF SVEEATRSLK EFDSFTSYFA GFYENRKNIY STKPQSTAIA Cpf1 YRLIHENLPK FIDNILVFQK IKEPIAKELE HIRADFSAGG YIKKDERLED [Porphyromonas IFSLNYYIHV LSQAGIEKYN ALIGKIVTEG DGEMKGLNEH INLYNQQRGR crevioricanis] EDRLPLFRPL YKQILSDREQ LSYLPESFEK DEELLRALKE FYDHIAEDIL GRTQQLMTSI SEYDLSRIYV RNDSQLTDIS KKMLGDWNAI YMARERAYDH EQAPKRITAK YERDRIKALK GEESISLANL NSCIAFLDNV RDCRVDTYLS TLGQKEGPHG LSNLVENVFA SYHEAEQLLS FPYPEENNLI QDKDNVVLIK NLLDNISDLQ RFLKPLWGMG DEPDKDERFY GEYNYIRGAL DQVIPLYNKV RNYLTRKPYS TRKVKLNFGN SQLLSGWDRN KEKDNSCVIL RKGQNFYLAI MNNRHKRSFE NKMLPEYKEG EPYFEKMDYK FLPDPNKMLP KVFLSKKGIE IYKPSPKLLE QYGHGTHKKG DTFSMDDLHE LIDFFKHSIE AHEDWKQFGF KFSDTATYEN VSSFYREVED QGYKLSFRKV SESYVYSLID QGKLYLFQIY NKDFSPCSKG TPNLHTLYWR MLFDERNLAD VIYKLDGKAE IFFREKSLKN DHPTHPAGKP IKKKSRQKKG EESLFEYDLV KDRRYTMDKF QFHVPITMNF KCSAGSKVND MVNAHIREAK DMHVIGIDRG ERNLLYICVI DSRGTILDQI SLNTINDIDY HDLLESRDKD RQQEHRNWQT IEGIKELKQG YLSQAVHRIA ELMVAYKAVV ALEDLNMGFK RGRQKVESSV YQQFEKQLID KLNYLVDKKK RPEDIGGLLR AYQFTAPFKS FKEMGKQNGF LFYIPAWNTS NIDPTTGFVN LFHVQYENVD KAKSFFQKFD SISYNPKKDW FEFAFDYKNF TKKAEGSRSM WILCTHGSRI KNFRNSQKNG QWDSEEFALT EAFKSLFVRY EIDYTADLKT AIVDEKQKDF FVDLLKLFKL TVQMRNSWKE KDLDYLISPV AGADGRFFDT REGNKSLPKD ADANGAYNIA LKGLWALRQI RQTSEGGKLK LAISNKEWLQ FVQERSYEKD WP_036887416.1 MDSLKDFTNL YPVSKTLRFE LKPVGKTLEN IEKAGILKED EHRAESYRRV(SEQ IDKKIIDTYHKV FIDSSLENMA KMGIENEIKA MLQSFCELYK KDHRTEGEDK NO: 141) type V CRISPR- ALDKIRAVLR GLIVGAFTGV CGRRENTVQN EKYESLFKEK LIKEILPDFV associated protein LSTEAESLPF SVEEATRSLK EFDSFTSYFA GFYENRKNIY STKPQSTAIA Cpf1 YRLIHENLPK FIDNILVFQK IKEPIAKELE HIRADFSAGG YIKKDERLED [Porphyromonas IFSLNYYIHV LSQAGIEKYN ALIGKIVTEG DGEMKGLNEH INLYNQQRGR crevioricanis] EDRLPLFRPL YKQILSDREQ LSYLPESFEK DEELLRALKE FYDHIAEDIL GRTQQLMTSI SEYDLSRIYV RNDSQLTDIS KKMLGDWNAI YMARERAYDH EQAPKRITAK YERDRIKALK GEESISLANL NSCIAFLDNV RDCRVDTYLS TLGQKEGPHG LSNLVENVFA SYHEAEQLLS FPYPEENNLI QDKDNVVLIK NLLDNISDLQ RFLKPLWGMG DEPDKDERFY GEYNYIRGAL DQVIPLYNKV RNYLTRKPYS TRKVKLNFGN SQLLSGWDRN KEKDNSCVIL RKGQNFYLAI MNNRHKRSFE NKVLPEYKEG EPYFEKMDYK FLPDPNKMLP KVFLSKKGIE IYKPSPKLLE QYGHGTHKKG DTFSMDDLHE LIDFFKHSIE AHEDWKQFGF KFSDTATYEN VSSFYREVED QGYKLSFRKV SESYVYSLID QGKLYLFQIY NKDFSPCSKG TPNLHTLYWR MLFDERNLAD VIYKLDGKAE IFFREKSLKN DHPTHPAGKP IKKKSRQKKG EESLFEYDLV KDRHYTMDKF QFHVPITMNF KCSAGSKVND MVNAHIREAK DMHVIGIDRG ERNLLYICVI DSRGTILDQI SLNTINDIDY HDLLESRDKD RQQERRNWQT IEGIKELKQG YLSQAVHRIA ELMVAYKAVV ALEDLNMGFK RGRQKVESSV YQQFEKQLID KLNYLVDKKK RPEDIGGLLR AYQFTAPFKS FKEMGKQNGF LFYIPAWNTS NIDPTTGFVN LFHAQYENVD KAKSFFQKFD SISYNPKKDW FEFAFDYKNF TKKAEGSRSM WILCTHGSRI KNFRNSQKNG QWDSEEFALT EAFKSLFVRY EIDYTADLKTTable 5 - Cas12a orthologsAIVDEKQKDF FVDLLKLFKL TVQMRNSWKE KDLDYLISPV AGADGRFFDT REGNKSLPKD ADANGAYNIA LKGLWALRQI RQTSEGGKLK LAISNKEWLQ FVQERSYEKD WP_023941260.1 MDSLKDFTNL YPVSKTLRFE LKPVGKTLEN IEKAGILKED EHRAESYRRV(SEQ IDKKIIDTYHKV FIDSSLENMA KMGIENEIKA MLQSFCELYK KDHRTEGEDK NO: 142) type V CRISPR- ALDKIRAVLR GLIVGAFTGV CGRRENTVQN EKYESLFKEK LIKEILPDFV associated protein LSTEAESLPF SVEEATRSLK EFDSFTSYFA GFYENRKNIY STKPQSTAIA Cpf1 YRLIHENLPK FIDNILVFQK IKEPIAKELE HIRADFSAGG YIKKDERLED [Porphyromonas IFSLNYYIHV LSQAGIEKYN ALIGKIVTEG DGEMKGLNEH INLYNQQRGR crevioricanis] EDRLPLFRPL YKQILSDREQ LSYLPESFEK DEELLRALKE FYDHIAEDIL GRTQQLMTSI SEYDLSRIYV RNDSQLTDIS KKMLGDWNAI YMARERAYDH EQAPKRITAK YERDRIKALK GEESISLANL NSCIAFLDNV RDCRVDTYLS TLGQKEGPHG LSNLVENVFA SYHEAEQLLS FPYPEENNLI QDKDNVVLIK NLLDNISDLQ RFLKPLWGMG DEPDKDERFY GEYNYIRGAL DQVIPLYNKV RNYLTRKPYS TRKVKLNFGN SQLLSGWDRN KEKDNSCVIL RKGQNFYLAI MNNRHKRSFE NKVLPEYKEG EPYFEKMDYK FLPDPNKMLP KVFLSKKGIE IYKPSPKLLE QYGHGTHKKG DTFSMDDLHE LIDFFKHSIE AHEDWKQFGF KFSDTATYEN VSSFYREVED QGYKLSFRKV SESYVYSLID QGKLYLFQIY NKDFSPCSKG TPNLHTLYWR MLFDERNLAD VIYKLDGKAE IFFREKSLKN DHPTHPAGKP IKKKSRQKKG EESLFEYDLV KDRRYTMDKF QFHVPITMNF KCSAGSKVND MVNAHIREAK DMHVIGIDRG ERNLLYICVI DSRGTILDQI SLNTINDIDY HDLLESRDKD RQQERRNWQT IEGIKELKQG YLSQAVHRIA ELMVAYKAVV ALEDLNMGFK RGRQKVESSV YQQFEKQLID KLNYLVDKKK RPEDIGGLLR AYQFTAPFKS FKEMGKQNGF LFYIPAWNTS NIDPTTGFVN LFHAQYENVD KAKSFFQKFD SISYNPKKDW FEFAFDYKNF TKKAEGSRSM WILCTHGSRI KNFRNSQKNG QWDSEEFALT EAFKSLFVRY EIDYTADLKT AIVDEKQKDF FVDLLKLFKL TVQMRNSWKE KDLDYLISPV AGADGRFFDT REGNKSLPKD ADANGAYNIA LKGLWALRQI RQTSEGGKLK LAISNKEWLQ FVQERSYEKD WP_037975888.1 MANSLKDFTN IYQLSKTLRF ELKPIGKTEE HINRKLIIMH DEKRGEDYKS(SEQ IDVTKLIDDYHR KFIHETLDPA HFDWNPLAEA LIQSGSKNNK ALPAEQKEMR NO: 143) type V CRISPR- EKIISMFTSQ AVYKKLFKKE LFSELLPEMI KSELVSDLEK QAQLDAVKSF associated protein DKFSTYFTGF HENRKNIYSK KDTSTSIAFR IVHQNFPKFL ANVRAYTLIK Cpf1 [Synergistes ERAPEVIDKA QKELSGILGG KTLDDIFSIE SFNNVLTQDK IDYYNQIIGG jonesii] VSGKAGDKKL RGVNEFSNLY RQQHPEVASL RIKMVPLYKQ ILSDRTTLSF VPEALKDDEQ AINAVDGLRS ELERNDIFNR IKRLFGKNNL YSLDKIWIKN SSISAFSNEL FKNWSFIEDA LKEFKENEFN GARSAGKKAE KWLKSKYFSF ADIDAAVKSY SEQVSADISS APSASYFAKF TNLIETAAEN GRKFSYFAAE SKAFRGDDGK TEIIKAYLDS LNDILHCLKP FETEDISDID TEFYSAFAEI YDSVKDVIPV YNAVRNYTTQ KPFSTEKFKL NFENPALAKG WDKNKEQNNT AIILMKDGKY YLGVIDKNNK LRADDLADDG SAYGYMKMNY KFIPTPHMEL PKVFLPKRAP KRYNPSREIL LIKENKTFIK DKNFNRTDCH KLIDFFKDSI NKHKDWRTFG FDFSDTDSYE DISDFYMEVQ DQGYKLTFTR LSAEKIDKWV EEGRLFLFQI YNKDFADGAQ GSPNLHTLYW KAIFSEENLK DVVLKLNGEA ELFFRRKSID KPAVHAKGSM KVNRRDIDGN PIDEGTYVEI CGYANGKRDM ASLNAGARGL IESGLVRITE VKHELVKDKR YTIDKYFFHV PFTINFKAQG QGNINSDVNL FLRNNKDVNI IGIDRGERNL VYVSLIDRDG HIKLQKDFNI IGGMDYHAKL NQKEKERDTA RKSWKTIGTI KELKEGYLSQ VVHEIVRLAV DNNAVIVMED LNIGFKRGRF KVEKQVYQKF EKMLIDKLNY LVFKDAGYDA PCGILKGLQL TEKFESFTKL GKQCGIIFYI PAGYTSKIDP TTGFVNLFNI NDVSSKEKQK DFIGKLDSIR FDAKRDMFTF EFDYDKFRTY QTSYRKKWAV WTNGKRIVRE KDKDGKFRMN DRLLTEDMKN ILNKYALAYK AGEDILPDVI SRDKSLASEI FYVFKNTLQM RNSKRDTGED FIISPVLNAK GRFFDSRKTD AALPIDADAN GAYHIALKGS LVLDAIDEKL KEDGRIDYKD MAVSNPKWFETable 5 - Cas12a orthologsFMQTRKFDF WP_081839471.1 MENMANSLKD FTNIYQLSKT LRFELKPIGK TEEHINRKLI IMHDEKRGED(SEQ IDYKSVTKLIDD YHRKFIHETL DPAHFDWNPL AEALIQSGSK NNKALPAEQK NO: 144) type V CRISPR- EMREKIISMF TSQAVYKKLF KKELFSELLP EMIKSELVSD LEKQAQLDAV associated protein KSFDKFSTYF TGFHENRKNI YSKKDTSTSI AFRIVHQNFP KFLANVRAYT Cpf1 [Synergistes LIKERAPEVI DKAQKELSGI LGGKTLDDIF SIESFNNVLT QDKIDYYNQI jonesii] IGGVSGKAGD KKLRGVNEFS NLYRQQHPEV ASLRIKMVPL YKQILSDRTT LSFVPEALKD DEQAINAVDG LRSELERNDI FNRIKRLFGK NNLYSLDKIW IKNSSISAFS NELFKNWSFI EDALKEFKEN EFNGARSAGK KAEKWLKSKY FSFADIDAAV KSYSEQVSAD ISSAPSASYF AKFTNLIETA AENGRKFSYF AAESKAFRGD DGKTEIIKAY LDSLNDILHC LKPFETEDIS DIDTEFYSAF AEIYDSVKDV IPVYNAVRNY TTQKPFSTEK FKLNFENPAL AKGWDKNKEQ NNTAIILMKD GKYYLGVIDK NNKLRADDLA DDGSAYGYMK MNYKFIPTPH MELPKVFLPK RAPKRYNPSR EILLIKENKT FIKDKNFNRT DCHKLIDFFK DSINKHKDWR TFGFDFSDTD SYEDISDFYM EVQDQGYKLT FTRLSAEKID KWVEEGRLFL FQIYNKDFAD GAQGSPNLHT LYWKAIFSEE NLKDVVLKLN GEAELFFRRK SIDKPAVHAK GSMKVNRRDI DGNPIDEGTY VEICGYANGK RDMASLNAGA RGLIESGLVR ITEVKHELVK DKRYTIDKYF FHVPFTINFK AQGQGNINSD VNLFLRNNKD VNIIGIDRGE RNLVYVSLID RDGHIKLQKD FNIIGGMDYH AKLNQKEKER DTARKSWKTI GTIKELKEGY LSQVVHEIVR LAVDNNAVIV MEDLNIGFKR GRFKVEKQVY QKFEKMLIDK LNYLVFKDAG YDAPCGILKG LQLTEKFESF TKLGKQCGII FYIPAGYTSK IDPTTGFVNL FNINDVSSKE KQKDFIGKLD SIRFDAKRDM FTFEFDYDKF RTYQTSYRKK WAVWTNGKRI VREKDKDGKF RMNDRLLTED MKNILNKYAL AYKAGEDILP DVISRDKSLA SEIFYVFKNT LQMRNSKRDT GEDFIISPVL NAKGRFFDSR KTDAALPIDA DANGAYHIAL KGSLVLDAID EKLKEDGRID YKDMAVSNPK WFEFMQTRKF DF WP_006283774.1 MQINNLKIIY MKFTDFTGLY SLSKTLRFEL KPIGKTLENI KKAGLLEQDQ(SEQ IDHRADSYKKVK KIIDEYHKAF IEKSLSNFEL KYQSEDKLDS LEEYLMYYSM NO: 145) type V CRISPR- KRIEKTEKDK FAKIQDNLRK QIADHLKGDE SYKTIFSKDL IRKNLPDFVK associated protein SDEERTLIKE FKDFTTYFKG FYENRENMYS AEDKSTAISH RIIHENLPKF Cpf1 [Prevotella VDNINAFSKI ILIPELREKL NQIYQDFEEY LNVESIDEIF HLDYFSMVMT bryantii B14] QKQIEVYNAI IGGKSTNDKK IQGLNEYINL YNQKHKDCKL PKLKLLFKQI LSDRIAISWL PDNFKDDQEA LDSIDTCYKN LLNDGNVLGE GNLKLLLENI DTYNLKGIFI RNDLQLTDIS QKMYASWNVI QDAVILDLKK QVSRKKKESA EDYNDRLKKL YTSQESFSIQ YLNDCLRAYG KTENIQDYFA KLGAVNNEHE QTINLFAQVR NAYTSVQAIL TTPYPENANL AQDKETVALI KNLLDSLKRL QRFIKPLLGK GDESDKDERF YGDFTPLWET LNQITPLYNM VRNYMTRKPY SQEKIKLNFE NSTLLGGWDL NKEHDNTAII LRKNGLYYLA IMKKSANKIF DKDKLDNSGD CYEKMVYKLL PGANKMLPKV FFSKSRIDEF KPSENIIENY KKGTHKKGAN FNLADCHNLI DFFKSSISKH EDWSKFNFHF SDTSSYEDLS DFYREVEQQG YSISFCDVSV EYINKMVEKG DLYLFQIYNK DFSEFSKGTP NMHTLYWNSL FSKENLNNII YKLNGQAEIF FRKKSLNYKR PTHPAHQAIK NKNKCNEKKE SIFDYDLVKD KRYTVDKFQF HVPITMNFKS TGNTNINQQV IDYLRTEDDT HIIGIDRGER HLLYLVVIDS HGKIVEQFTL NEIVNEYGGN IYRTNYHDLL DTREQNREKA RESWQTIENI KELKEGYISQ VIHKITDLMQ KYHAVVVLED LNMGFMRGRQ KVEKQVYQKF EEMLINKLNY LVNKKADQNS AGGLLHAYQL TSKFESFQKL GKQSGFLFYI PAWNTSKIDP VTGFVNLFDT RYESIDKAKA FFGKFDSIRY NADKDWFEFA FDYNNFTTKA EGTRTNWTIC TYGSRIRTFR NQAKNSQWDN EEIDLTKAYK AFFAKHGINI YDNIKEAIAM ETEKSFFEDL LHLLKLTLQM RNSITGTTTD YLISPVHDSK GNFYDSRICD NSLPANADAN GAYNIARKGL MLIQQIKDST SSNRFKFSPI TNKDWLIFAQ EKPYLNDTable 5 - Cas12a orthologsWP_024988992 MNIKNFTGLY PLSKTLRFEL KPIGKTKENI EKNGILTKDE QRAKDYLIVK(SEQ IDGFIDEYHKQF IKDRLWDFKL PLESEGEKNS LEEYQELYEL TKRNDAQEAD NO: 146) type V CRISPR- FTEIKDNLRS SITEQLTKSG SAYDRIFKKE FIREDLVNFL EDEKDKNIVK associated protein QFEDFTTYFT GFYENRKNMY SSEEKSTAIA YRLIHQNLPK FMDNMRSFAK Cpf1 [Prevotella IANSSVSEHF SDIYESWKEY LNVNSIEEIF QLDYFSETLT QPHIEVYNYI albensis] IGKKVLEDGT EIKGINEYVN LYNQQQKDKS KRLPFLVPLY KQILSDREKL SWIAEEFDSD KKMLSAITES YNHLHNVLMG NENESLRNLL LNIKDYNLEK INITNDLSLT EISQNLFGRY DVFTNGIKNK LRVLTPRKKK ETDENFEDRI NKIFKTQKSF SIAFLNKLPQ PEMEDGKPRN IEDYFITQGA INTKSIQKED IFAQIENAYE DAQVFLQIKD TDNKLSQNKT AVEKIKTLLD ALKELQHFIK PLLGSGEENE KDELFYGSFL AIWDELDTIT PLYNKVRNWL TRKPYSTEKI KLNFDNAQLL GGWDVNKEHD CAGILLRKND SYYLGIINKK TNHIFDTDIT PSDGECYDKI DYKLLPGANK MLPKVFFSKS RIKEFEPSEA IINCYKKGTH KKGKNFNLTD CHRLINFFKT SIEKHEDWSK FGFKFSDTET YEDISGFYRE VEQQGYRLTS HPVSASYIHS LVKEGKLYLF QIWNKDFSQF SKGTPNLHTL YWKMLFDKRN LSDVVYKLNG QAEVFYRKSS IEHQNRIIHP AQHPITNKNE LNKKHTSTFK YDIIKDRRYT VDKFQFHVPI TINFKATGQN NINPIVQEVI RQNGITHIIG IDRGERHLLY LSLIDLKGNI IKQMTLNEII NEYKGVTYKT NYHNLLEKRE KERTEARHSW SSIESIKELK DGYMSQVIHK ITDMMVKYNA IVVLEDLNGG FMRGRQKVEK QVYQKFEKKL IDKLNYLVDK KLDANEVGGV LNAYQLTNKF ESFKKIGKQS GFLFYIPAWN TSKIDPITGF VNLFNTRYES IKETKVFWSK FDIIRYNKEK NWFEFVFDYN TFTTKAEGTR TKWTLCTHGT RIQTFRNPEK NAQWDNKEIN LTESFKALFE KYKIDITSNL KESIMQETEK KFFQELHNLL HLTLQMRNSV TGTDIDYLIS PVADEDGNFY DSRINGKNFP ENADANGAYN IARKGLMLIR QIKQADPQKK FKFETITNKD WLKFAQDKPY LKD WP_039658684.1 MQTLFENFTN QYPVSKTLRF ELIPQGKTKD FIEQKGLLKK DEDRAEKYKK(SEQ IDVKNIIDEYHK DFIEKSLNGL KLDGLEKYKT LYLKQEKDDK DKKAFDKEKE NO: 147) type V CRISPR- NLRKQIANAF RNNEKFKTLF AKELIKNDLM SFACEEDKKN VKEFEAFTTY associated protein FTGFHQNRAN MYVADEKRTA IASRLIHENL PKFIDNIKIF EKMKKEAPEL Cpf1 [Smithella sp. LSPFNQTLKD MKDVIKGTTL EEIFSLDYFN KTLTQSGIDI YNSVIGGRTP SC_K08D17] EEGKTKIKGL NEYINTDFNQ KQTDKKKRQP KFKQLYKQIL SDRQSLSFIA EAFKNDTEIL EAIEKFYVNE LLHFSNEGKS TNVLDAIKNA VSNLESFNLT KMYFRSGASL TDVSRKVFGE WSIINRALDN YYATTYPIKP REKSEKYEER KEKWLKQDFN VSLIQTAIDE YDNETVKGKN SGKVIADYFA KFCDDKETDL IQKVNEGYIA VKDLLNTPCP ENEKLGSNKD QVKQIKAFMD SIMDIMHFVR PLSLKDTDKE KDETFYSLFT PLYDHLTQTI ALYNKVRNYL TQKPYSTEKI KLNFENSTLL GGWDLNKETD NTAIILRKDN LYYLGIMDKR HNRIFRNVPK ADKKDFCYEK MVYKLLPGAN KMLPKVFFSQ SRIQEFTPSA KLLENYANET HKKGDNFNLN HCHKLIDFFK DSINKHEDWK NFDFRFSATS TYADLSGFYH EVEHQGYKIS FQSVADSFID DLVNEGKLYL FQIYNKDFSP FSKGKPNLHT LYWKMLFDEN NLKDVVYKLN GEAEVFYRKK SIAEKNTTIH KANESIINKN PDNPKATSTF NYDIVKDKRY TIDKFQFHIP ITMNFKAEGI FNMNQRVNQF LKANPDINII GIDRGERHLL YYALINQKGK ILKQDTLNVI ANEKQKVDYH NLLDKKEGDR ATARQEWGVI ETIKELKEGY LSQVIHKLTD LMIENNAIIV MEDLNFGFKR GRQKVEKQVY QKFEKMLIDK LNYLVDKNKK ANELGGLLNA FQLANKFESF QKMGKQNGFI FYVPAWNTSK TDPATGFIDF LKPRYENLNQ AKDFFEKFDS IRLNSKADYF EFAFDFKNFT EKADGGRTKW TVCTTNEDRY AWNRALNNNR GSQEKYDITA ELKSLFDGKV DYKSGKDLKQ QIASQESADF FKALMKNLSI TLSLRHNNGE KGDNEQDYIL SPVADSKGRF FDSRKADDDM PKNADANGAY HIALKGLWCL EQISKTDDLK KVKLAISNKE WLEFVQTLKG WP_037385181 MQTLFENFTN QYPVSKTLRF ELIPQGKTKD FIEQKGLLKK DEDRAEKYKK(SEQ IDVKNIIDEYHK DFIEKSLNGL KLDGLEEYKT LYLKQEKDDK DKKAFDKEKE NO: 148) type V CRISPR- NLRKQIANAF RNNEKFKTLF AKELIKNDLM SFACEEDKKN VKEFEAFTTY associated proteinTable 5 - Cas12a orthologsCpf1 [Smithella sp. FTGFHQNRAN MYVADEKRTA IASRLIHENL PKFIDNIKIF EKMKKEAPEL SCADC] LSPFNQTLKD MKDVIKGTTL EEIFSLDYFN KTLTQSGIDI YNSVIGGRTP EEGKTKIKGL NEYINTDFNQ KQTDKKKRQP KFKQLYKQIL SDRQSLSFIA EAFKNDTEIL EAIEKFYVNE LLHFSNEGKS TNVLDAIKNA VSNLESFNLT KIYFRSGTSL TDVSRKVFGE WSIINRALDN YYATTYPIKP REKSEKYEER KEKWLKQDFN VSLIQTAIDE YDNETVKGKN SGKVIVDYFA KFCDDKETDL IQKVNEGYIA VKDLLNTPYP ENEKLGSNKD QVKQIKAFMD SIMDIMHFVR PLSLKDTDKE KDETFYSLFT PLYDHLTQTI ALYNKVRNYL TQKPYSTEKI KLNFENSTLL GGWDLNKETD NTAIILRKEN LYYLGIMDKR HNRIFRNVPK ADKKDSCYEK MVYKLLPGAN KMLPKVFFSQ SRIQEFTPSA KLLENYENET HKKGDNFNLN HCHQLIDFFK DSINKHEDWK NFDFRFSATS TYADLSGFYH EVEHQGYKIS FQSIADSFID DLVNEGKLYL FQIYNKDFSP FSKGKPNLHT LYWKMLFDEN NLKDVVYKLN GEAEVFYRKK SIAEKNTTIH KANESIINKN PDNPKATSTF NYDIVKDKRY TIDKFQFHVP ITMNFKAEGI FNMNQRVNQF LKANPDINII GIDRGERHLL YYTLINQKGK ILKQDTLNVI ANEKQKVDYH NLLDKKEGDR ATARQEWGVI ETIKELKEGY LSQVIHKLTD LMIENNAIIV MEDLNFGFKR GRQKVEKQVY QKFEKMLIDK LNYLVDKNKK ANELGGLLNA FQLANKFESF QKMGKQNGFI FYVPAWNTSK TDPATGFIDF LKPRYENLKQ AKDFFEKFDS IRLNSKADYF EFAFDFKNFT GKADGGRTKW TVCTTNEDRY AWNRALNNNR GSQEKYDITA ELKSLFDGKV DYKSGKDLKQ QIASQELADF FRTLMKYLSV TLSLRHNNGE KGETEQDYIL SPVADSMGKF FDSRKAGDDM PKNADANGAY HIALKGLWCL EQISKTDDLK KVKLAISNKE WLEFMQTLKG WP_039871282.1 MKFTDFTGLY SLSKTLRFEL KPIGKTLENI KKAGLLEQDQ HRADSYKKVK(SEQ IDKIIDEYHKAF IEKSLSNFEL KYQSEDKLDS LEEYLMYYSM KRIEKTEKDK NO: 149) type V CRISPR- FAKIQDNLRK QIADHLKGDE SYKTIFSKDL IRKNLPDFVK SDEERTLIKE associated protein FKDFTTYFKG FYENRENMYS AEDKSTAISH RIIHENLPKF VDNINAFSKI Cpf1 [Prevotella ILIPELREKL NQIYQDFEEY LNVESIDEIF HLDYFSMVMT QKQIEVYNAI bryantii B14] IGGKSTNDKK IQGLNEYINL YNQKHKDCKL PKLKLLFKQI LSDRIAISWL PDNFKDDQEA LDSIDTCYKN LLNDGNVLGE GNLKLLLENI DTYNLKGIFI RNDLQLTDIS QKMYASWNVI QDAVILDLKK QVSRKKKESA EDYNDRLKKL YTSQESFSIQ YLNDCLRAYG KTENIQDYFA KLGAVNNEHE QTINLFAQVR NAYTSVQAIL TTPYPENANL AQDKETVALI KNLLDSLKRL QRFIKPLLGK GDESDKDERF YGDFTPLWET LNQITPLYNM VRNYMTRKPY SQEKIKLNFE NSTLLGGWDL NKEHDNTAII LRKNGLYYLA IMKKSANKIF DKDKLDNSGD CYEKMVYKLL PGANKMLPKV FFSKSRIDEF KPSENIIENY KKGTHKKGAN FNLADCHNLI DFFKSSISKH EDWSKFNFHF SDTSSYEDLS DFYREVEQQG YSISFCDVSV EYINKMVEKG DLYLFQIYNK DFSEFSKGTP NMHTLYWNSL FSKENLNNII YKLNGQAEIF FRKKSLNYKR PTHPAHQAIK NKNKCNEKKE SIFDYDLVKD KRYTVDKFQF HVPITMNFKS TGNTNINQQV IDYLRTEDDT HIIGIDRGER HLLYLVVIDS HGKIVEQFTL NEIVNEYGGN IYRTNYHDLL DTREQNREKA RESWQTIENI KELKEGYISQ VIHKITDLMQ KYHAVVVLED LNMGFMRGRQ KVEKQVYQKF EEMLINKLNY LVNKKADQNS AGGLLHAYQL TSKFESFQKL GKQSGFLFYI PAWNTSKIDP VTGFVNLFDT RYESIDKAKA FFGKFDSIRY NADKDWFEFA FDYNNFTTKA EGTRTNWTIC TYGSRIRTFR NQAKNSQWDN EEIDLTKAYK AFFAKHGINI YDNIKEAIAM ETEKSFFEDL LHLLKLTLQM RNSITGTTTD YLISPVHDSK GNFYDSRICD NSLPANADAN GAYNIARKGL MLIQQIKDST SSNRFKFSPI TNKDWLIFAQ EKPYLND EKE28449.1 MFKGDAFTGL YEVQKTLRFE LVPIGLTQSY LENDWVIQKD KEVEENYGKI(SEQ IDKAYFDLIHKE FVRQSLENAW LCQLDDFYEK YIELHNSLET RKDKNLAKQF NO: 150) hypothetical protein EKVMKSLKKE FVSFFDAKWN EWKQKFSFLK KWWIDVLNEK EVLDLMAEFY ACD_3C00058G00 PDEKELFDKF DKFFTYFSNF KESRKNFYAD DGRAWAIATR AIDENLITFI 15 [uncultured KNIEDFKKLN SSFREFVNDN FSEEDKQIFE IDFYNNCLLQ PWIDKYNKIV bacterium (gcode WWYSLENWEK VQWLNEKINN FKQNQNKSNS KDLKFPRMKL LYKQILGDKE 4)] KKVYIDEIRD DKNLIDLIDN SKRRNQIKID NANDIINDFI NNNAKFELDKTable 5 - Cas12a orthologsIYLTRQSINT ISSKYFSSWD YIRWYFWTGE LQEFVSFYDL KETFWKIEYE TLENIFKDCY VKGINTESQN NIVFETQGIY ENFLNIFKFE FNQNISQISL LEWELDKIQN EDIKKNEKQV EVIKNYFDSV MSVYKMTKYF SLEKWKKRVE LDTDNNFYND FNEYLEGFEI WKDYNLVRNY ITKKQVNTDK IKLNFDNSQF LTWWDKDKEN ERLGIILRRE WKYYLWILKK WNTLNFGDYL QKEWEIFYEK MNYKQLNNVY RQLPRLLFPL TKKLNELKWD ELKKYLSKYI QNFWYNEEIA QIKIEFDIFQ ESKEKWEKFD IDKLRKLIEY YKKWVLALYS DLYDLEFIKY KNYDDLSIFY SDVEKKMYNL NFTKIDKSLI DGKVKSWELY LFQIYNKDFS ESKKEWSTEN IHTKYFKLLF NEKNLQNLVV KLSWWADIFF RDKTENLKFK KDKNGQEILD HRRFSQDKIM FHISITLNAN CWDKYWFNQY VNEYMNKERD IKIIWIDRWE KHLAYYCVID KSWKIFNNEI WTLNELNWVN YLEKLEKIES SRKDSRISWW EIENIKELKN GYISQVINKL TELIVKYNAI IVFEDLNIWF KRWRQKIEKQ IYQKLELALA KKLNYLTQKD KKDDEILWNL KALQLVPKVN DYQDIWNYKQ SWIMFYVRAN YTSVTCPNCW LRKNLYISNS ATKENQKKSL NSIAIKYNDW KFSFSYEIDD KSWKQKQSLN KKKFIVYSDI ERFVYSPLEK LTKVIDVNKK LLELFRDFNL SLDINKQIQE KDLDSVFFKS LTHLFNLILQ LRNSDSKDNK DYISCPSCYY HSNNWLQWFE FNWDANWAYN IARKGIILLD RIRKNQEKPD LYVSDIDWDN FVQSNQFPNT IIPIQNIEKQ VPLNIKI WP_018359861.1 MKTQHFFEDF TSLYSLSKTI RFELKPIGKT LENIKKNGLI RRDEQRLDDY(SEQ IDEKLKKVIDEY HEDFIANILS SFSFSEEILQ SYIQNLSESE ARAKIEKTMR NO: 151) type V CRISPR- DTLAKAFSED ERYKSIFKKE LVKKDIPVWC PAYKSLCKKF DNFTTSLVPF associated protein HENRKNLYTS NEITASIPYR IVHVNLPKFI QNIEALCELQ KKMGADLYLE Cpf1 MMENLRNVWP SFVKTPDDLC NLKTYNHLMV QSSISEYNRF VGGYSTEDGT [Porphyromonas KHQGINEWIN IYRQRNKEMR LPGLVFLHKQ ILAKVDSSSF ISDTLENDDQ macacae] VFCVLRQFRK LFWNTVSSKE DDAASLKDLF CGLSGYDPEA IYVSDAHLAT ISKNIFDRWN YISDAIRRKT EVLMPRKKES VERYAEKISK QIKKRQSYSL AELDDLLAHY SEESLPAGFS LLSYFTSLGG QKYLVSDGEV ILYEEGSNIW DEVLIAFRDL QVILDKDFTE KKLGKDEEAV SVIKKALDSA LRLRKFFDLL SGTGAEIRRD SSFYALYTDR MDKLKGLLKM YDKVRNYLTK KPYSIEKFKL HFDNPSLLSG WDKNKELNNL SVIFRQNGYY YLGIMTPKGK NLFKTLPKLG AEEMFYEKME YKQIAEPMLM LPKVFFPKKT KPAFAPDQSV VDIYNKKTFK TGQKGFNKKD LYRLIDFYKE ALTVHEWKLF NFSFSPTEQY RNIGEFFDEV REQAYKVSMV NVPASYIDEA VENGKLYLFQ IYNKDFSPYS KGIPNLHTLY WKALFSEQNQ SRVYKLCGGG ELFYRKASLH MQDTTVHPKG ISIHKKNLNK KGETSLFNYD LVKDKRFTED KFFFHVPISI NYKNKKITNV NQMVRDYIAQ NDDLQIIGID RGERNLLYIS RIDTRGNLLE QFSLNVIESD KGDLRTDYQK ILGDREQERL RRRQEWKSIE SIKDLKDGYM SQVVHKICNM VVEHKAIVVL ENLNLSFMKG RKKVEKSVYE KFERMLVDKL NYLVVDKKNL SNEPGGLYAA YQLTNPLFSF EELHRYPQSG ILFFVDPWNT SLTDPSTGFV NLLGRINYTN VGDARKFFDR FNAIRYDGKG NILFDLDLSR FDVRVETQRK LWTLTTFGSR IAKSKKSGKW MVERIENLSL CFLELFEQFN IGYRVEKDLK KAILSQDRKE FYVRLIYLFN LMMQIRNSDG EEDYILSPAL NEKNLQFDSR LIEAKDLPVD ADANGAYNVA RKGLMVVQRI KRGDHESIHR IGRAQWLRYV QEGIVE WP_013282991 MLLYENYTKR NQITKSLRLE LRPQGKTLRN IKELNLLEQD KAIYALLERL(SEQ IDKPVIDEGIKD IARDTLKNCE LSFEKLYEHF LSGDKKAYAK ESERLKKEIV NO: 152) type V CRISPR- KTLIKNLPEG IGKISEINSA KYLNGVLYDF IDKTHKDSEE KQNILSDILE associated protein TKGYLALFSK FLTSRITTLE QSMPKRVIEN FEIYAANIPK MQDALERGAV Cpf1 [Butyrivibrio SFAIEYESIC SVDYYNQILS QEDIDSYNRL ISGIMDEDGA KEKGINQTIS proteoclasticus] EKNIKIKSEH LEEKPFRILK QLHKQILEER EKAFTIDHID SDEEVVQVTK EAFEQTKEQW ENIKKINGFY AKDPGDITLF IVVGPNQTHV LSQLIYGEHD RIRLLLEEYE KNTLEVLPRR TKSEKARYDK FVNAVPKKVA KESHTFDGLQ KMTGDDRLFI LYRDELARNY MRIKEAYGTF ERDILKSRRG IKGNRDVQES LVSFYDELTK FRSALRIINS GNDEKADPIF YNTFDGIFEK ANRTYKAENL CRNYVTKSPA DDARIMASCL GTPARLRTHW WNGEENFAIN DVAMIRRGDETable 5 - Cas12a orthologsYYYFVLTPDV KPVDLKTKDE TDAQIFVQRK GAKSFLGLPK ALFKCILEPY FESPEHKNDK NCVIEEYVSK PLTIDRRAYD IFKNGTFKKT NIGIDGLTEE KFKDDCRYLI DVYKEFIAVY TRYSCFNMSG LKRADEYNDI GEFFSDVDTR LCTMEWIPVS FERINDMVDK KEGLLFLVRS MFLYNRPRKP YERTFIQLFS DSNMEHTSML LNSRAMIQYR AASLPRRVTH KKGSILVALR DSNGEHIPMH IREAIYKMKN NFDISSEDFI MAKAYLAEHD VAIKKANEDI IRNRRYTEDK FFLSLSYTKN ADISARTLDY INDKVEEDTQ DSRMAVIVTR NLKDLTYVAV VDEKNNVLEE KSLNEIDGVN YRELLKERTK IKYHDKTRLW QYDVSSKGLK EAYVELAVTQ ISKLATKYNA VVVVESMSST FKDKFSFLDE QIFKAFEARL CARMSDLSFN TIKEGEAGSI SNPIQVSNNN GNSYQDGVIY FLNNAYTRTL CPDTGFVDVF DKTRLITMQS KRQFFAKMKD IRIDDGEMLF TFNLEEYPTK RLLDRKEWTV KIAGDGSYFD KDKGEYVYVN DIVREQIIPA LLEDKAVFDG NMAEKFLDKT AISGKSVELI YKWFANALYG IITKKDGEKI YRSPITGTEI DVSKNTTYNF GKKFMFKQEY RGDGDFLDAF LNYMQAQDIA V WP_048112740.1 MNNYDEFTKL YPIQKTIRFE LKPQGRTMEH LETFNFFEED RDRAEKYKIL(SEQ IDKEAIDEYHKK FIDEHLTNMS LDWNSLKQIS EKYYKSREEK DKKVFLSEQK NO: 153) type V CRISPR- RMRQEIVSEF KKDDRFKDLF SKKLFSELLK EEIYKKGNHQ EIDALKSFDK associated protein FSGYFIGLHE NRKNMYSDGD EITAISNRIV NENFPKFLDN LQKYQEARKK Cpf1 [Candidatus YPEWIIKAES ALVAHNIKMD EVFSLEYFNK VLNQEGIQRY NLALGGYVTK Methanoplasma SGEKMMGLND ALNLAHQSEK SSKGRIHMTP LFKQILSEKE SFSYIPDVFT termitum] EDSQLLPSIG GFFAQIENDK DGNIFDRALE LISSYAEYDT ERIYIRQADI NRVSNVIFGE WGTLGGLMRE YKADSINDIN LERTCKKVDK WLDSKEFALS DVLEAIKRTG NNDAFNEYIS KMRTAREKID AARKEMKFIS EKISGDEESI HIIKTLLDSV QQFLHFFNLF KARQDIPLDG AFYAEFDEVH SKLFAIVPLY NKVRNYLTKN NLNTKKIKLN FKNPTLANGW DQNKVYDYAS LIFLRDGNYY LGIINPKRKK NIKFEQGSGN GPFYRKMVYK QIPGPNKNLP RVFLTSTKGK KEYKPSKEII EGYEADKHIR GDKFDLDFCH KLIDFFKESI EKHKDWSKFN FYFSPTESYG DISEFYLDVE KQGYRMHFEN ISAETIDEYV EKGDLFLFQI YNKDFVKAAT GKKDMHTIYW NAAFSPENLQ DVVVKLNGEA ELFYRDKSDI KEIVHREGEI LVNRTYNGRT PVPDKIHKKL TDYHNGRTKD LGEAKEYLDK VRYFKAHYDI TKDRRYLNDK IYFHVPLTLN FKANGKKNLN KMVIEKFLSD EKAHIIGIDR GERNLLYYSI IDRSGKIIDQ QSLNVIDGFD YREKLNQREI EMKDARQSWN AIGKIKDLKE GYLSKAVHEI TKMAIQYNAI VVMEELNYGF KRGRFKVEKQ IYQKFENMLI DKMNYLVFKD APDESPGGVL NAYQLTNPLE SFAKLGKQTG ILFYVPAAYT SKIDPTTGFV NLFNTSSKTN AQERKEFLQK FESISYSAKD GGIFAFAFDY RKFGTSKTDH KNVWTAYTNG ERMRYIKEKK RNELFDPSKE IKEALTSSGI KYDGGQNILP DILRSNNNGL IYTMYSSFIA AIQMRVYDGK EDYIISPIKN SKGEFFRTDP KRRELPIDAD ANGAYNIALR GELTMRAIAE KFDPDSEKMA KLELKHKDWF EFMQTRGD WP_027407524.1 MVAFIDEFVG QYPVSKTLRF EARPVPETKK WLESDQCSVL FNDQKRNEYY(SEQ IDGVLKELLDDY YRAYIEDALT SFTLDKALLE NAYDLYCNRD TNAFSSCCEK NO: 154) type V CRISPR- LRKDLVKAFG NLKDYLLGSD QLKDLVKLKA KVDAPAGKGK KKIEVDSRLI associated protein NWLNNNAKYS AEDREKYIKA IESFEGFVTY LTNYKQAREN MFSSEDKSTA Cpf1 [Anaerovibrio IAFRVIDQNM VTYFGNIRIY EKIKAKYPEL YSALKGFEKF FSPTAYSEIL sp. RM50] SQSKIDEYNY QCIGRPIDDA DFKGVNSLIN EYRQKNGIKA RELPVMSMLY KQILSDRDNS FMSEVINRNE EAIECAKNGY KVSYALFNEL LQLYKKIFTE DNYGNIYVKT QPLTELSQAL FGDWSILRNA LDNGKYDKDI INLAELEKYF SEYCKVLDAD DAAKIQDKFN LKDYFIQKNA LDATLPDLDK ITQYKPHLDA MLQAIRKYKL FSMYNGRKKM DVPENGIDFS NEFNAIYDKL SEFSILYDRI RNFATKKPYS DEKMKLSFNM PTMLAGWDYN NETANGCFLF IKDGKYFLGV ADSKSKNIFD FKKNPHLLDK YSSKDIYYKV KYKQVSGSAK MLPKVVFAGS NEKIFGHLIS KRILEIREKK LYTAAAGDRK AVAEWIDFMK SAIAIHPEWN EYFKFKFKNT AEYDNANKFY EDIDKQTYSL EKVEIPTEYI DEMVSQHKLY LFQLYTKDFS DKKKKKGTDN LHTMYWHGVF SDENLKAVTE GTQPIIKLNGTable 5 - Cas12a orthologsEAEMFMRNPS IEFQVTHEHN KPIANKNPLN TKKESVFNYD LIKDKRYTER KFYFHCPITL NFRADKPIKY NEKINRFVEN NPDVCIIGID RGERHLLYYT VINQTGDILE QGSLNKISGS YTNDKGEKVN KETDYHDLLD RKEKGKHVAQ QAWETIENIK ELKAGYLSQV VYKLTQLMLQ YNAVIVLENL NVGFKRGRTK VEKQVYQKFE KAMIDKLNYL VFKDRGYEMN GSYAKGLQLT DKFESFDKIG KQTGCIYYVI PSYTSHIDPK TGFVNLLNAK LRYENITKAQ DTIRKFDSIS YNAKADYFEF AFDYRSFGVD MARNEWVVCT CGDLRWEYSA KTRETKAYSV TDRLKELFKA HGIDYVGGEN LVSHITEVAD KHFLSTLLFY LRLVLKMRYT VSGTENENDF ILSPVEYAPG KFFDSREATS TEPMNADANG AYHIALKGLM TIRGIEDGKL HNYGKGGENA AWFKFMQNQE YKNNG WP_044910712.1 MDYGNGQFER RAPLTKTITL RLKPIGETRE TIREQKLLEQ DAAFRKLVET(SEQ IDVTPIVDDCIR KIADNALCHF GTEYDFSCLG NAISKNDSKA IKKETEKVEK NO: 155) type V CRISPR- LLAKVLTENL PDGLRKVNDI NSAAFIQDTL TSFVQDDADK RVLIQELKGK associated protein TVLMQRFLTT RITALTVWLP DRVFENFNIF IENAEKMRIL LDSPLNEKIM Cpf1 KFDPDAEQYA SLEFYGQCLS QKDIDSYNLI ISGIYADDEV KNPGINEIVK [Lachnospiraceae EYNQQIRGDK DESPLPKLKK LHKQILMPVE KAFFVRVLSN DSDARSILEK bacterium MC2017] ILKDTEMLPS KIIEAMKEAD AGDIAVYGSR LHELSHVIYG DHGKLSQIIY DKESKRISEL METLSPKERK ESKKRLEGLE EHIRKSTYTF DELNRYAEKN VMAAYIAAVE ESCAEIMRKE KDLRTLLSKE DVKIRGNRHN TLIVKNYFNA WTVFRNLIRI LRRKSEAEID SDFYDVLDDS VEVLSLTYKG ENLCRSYITK KIGSDLKPEI ATYGSALRPN SRWWSPGEKF NVKFHTIVRR DGRLYYFILP KGAKPVELED MDGDIECLQM RKIPNPTIFL PKLVFKDPEA FFRDNPEADE FVFLSGMKAP VTITRETYEA YRYKLYTVGK LRDGEVSEEE YKRALLQVLT AYKEFLENRM IYADLNFGFK DLEEYKDSSE FIKQVETHNT FMCWAKVSSS QLDDLVKSGN GLLFEIWSER LESYYKYGNE KVLRGYEGVL LSILKDENLV SMRTLLNSRP MLVYRPKESS KPMVVHRDGS RVVDRFDKDG KYIPPEVHDE LYRFFNNLLI KEKLGEKARK ILDNKKVKVK VLESERVKWS KFYDEQFAVT FSVKKNADCL DTTKDLNAEV MEQYSESNRL ILIRNTTDIL YYLVLDKNGK VLKQRSLNII NDGARDVDWK ERFRQVTKDR NEGYNEWDYS RTSNDLKEVY LNYALKEIAE AVIEYNAILI IEKMSNAFKD KYSFLDDVTF KGFETKLLAK LSDLHFRGIK DGEPCSFTNP LQLCQNDSNK ILQDGVIFMV PNSMTRSLDP DTGFIFAIND HNIRTKKAKL NFLSKFDQLK VSSEGCLIMK YSGDSLPTHN TDNRVWNCCC NHPITNYDRE TKKVEFIEEP VEELSRVLEE NGIETDTELN KLNERENVPG KVVDAIYSLV LNYLRGTVSG VAGQRAVYYS PVTGKKYDIS FIQAMNLNRK CDYYRIGSKE RGEWTDFVAQ LIN WP_081834226 MTMDYGNGQF ERRAPLTKTI TLRLKPIGET RETIREQKLL EQDAAFRKLV(SEQ IDETVTPIVDDC IRKIADNALC HFGTEYDFSC LGNAISKNDS KAIKKETEKV NO: 156) type V CRISPR- EKLLAKVLTE NLPDGLRKVN DINSAAFIQD TLTSFVQDDA DKRVLIQELK associated protein GKTVLMQRFL TTRITALTVW LPDRVFENFN IFIENAEKMR ILLDSPLNEK Cpf1 IMKFDPDAEQ YASLEFYGQC LSQKDIDSYN LIISGIYADD EVKNPGINEI [Lachnospiraceae VKEYNQQIRG DKDESPLPKL KKLHKQILMP VEKAFFVRVL SNDSDARSIL bacterium EKILKDTEML PSKIIEAMKE ADAGDIAVYG SRLHELSHVI YGDHGKLSQI MC2017]. IYDKESKRIS ELMETLSPKE RKESKKRLEG LEEHIRKSTY TFDELNRYAE KNVMAAYIAA VEESCAEIMR KEKDLRTLLS KEDVKIRGNR HNTLIVKNYF NAWTVFRNLI RILRRKSEAE IDSDFYDVLD DSVEVLSLTY KGENLCRSYI TKKIGSDLKP EIATYGSALR PNSRWWSPGE KFNVKFHTIV RRDGRLYYFI LPKGAKPVEL EDMDGDIECL QMRKIPNPTI FLPKLVFKDP EAFFRDNPEA DEFVFLSGMK APVTITRETY EAYRYKLYTV GKLRDGEVSE EEYKRALLQV LTAYKEFLEN RMIYADLNFG FKDLEEYKDS SEFIKQVETH NTFMCWAKVS SSQLDDLVKS GNGLLFEIWS ERLESYYKYG NEKVLRGYEG VLLSILKDEN LVSMRTLLNS RPMLVYRPKE SSKPMVVHRD GSRVVDRFDK DGKYIPPEVH DELYRFFNNL LIKEKLGEKA RKILDNKKVK VKVLESERVK WSKFYDEQFA VTFSVKKNAD CLDTTKDLNA EVMEQYSESN RLILIRNTTD ILYYLVLDKN GKVLKQRSLN IINDGARDVD WKERFRQVTK DRNEGYNEWD YSRTSNDLKETable 5 - Cas12a orthologsVYLNYALKEI AEAVIEYNAI LIIEKMSNAF KDKYSFLDDV TFKGFETKLL AKLSDLHFRG IKDGEPCSFT NPLQLCQNDS NKILQDGVIF MVPNSMTRSL DPDTGFIFAI NDHNIRTKKA KLNFLSKFDQ LKVSSEGCLI MKYSGDSLPT HNTDNRVWNC CCNHPITNYD RETKKVEFIE EPVEELSRVL EENGIETDTE LNKLNERENV PGKVVDAIYS LVLNYLRGTV SGVAGQRAVY YSPVTGKKYD ISFIQAMNLN RKCDYYRIGS KERGEWTDFV AQLIN WP_027216152.1 MYYESLTKLY PIKKTIRNEL VPIGKTLENI KKNNILEADE DRKIAYIRVK(SEQ IDAIMDDYHKRL INEALSGFAL IDLDKAANLY LSRSKSADDI ESFSRFQDKL NO: 157) type V CRISPR- RKAIAKRLRE HENFGKIGNK DIIPLLQKLS ENEDDYNALE SFKNFYTYFE associated protein SYNDVRLNLY SDKEKSSTVA YRLINENLPR FLDNIRAYDA VQKAGITSEE Cpf1 [Butyrivibrio LSSEAQDGLF LVNTFNNVLI QDGINTYNED IGKLNVAINL YNQKNASVQG fibrisolvens] FRKVPKMKVL YKQILSDREE SFIDEFESDT ELLDSLESHY ANLAKYFGSN KVQLLFTALR ESKGVNVYVK NDIAKTSFSN VVFGSWSRID ELINGEYDDN NNRKKDEKYY DKRQKELKKN KSYTIEKIIT LSTEDVDVIG KYIEKLESDI DDIRFKGKNF YEAVLCGHDR SKKLSKNKGA VEAIKGYLDS VKDFERDLKL INGSGQELEK NLVVYGEQEA VLSELSGIDS LYNMTRNYLT KKPFSTEKIK LNFNKPTFLD GWDYGNEEAY LGFFMIKEGN YFLAVMDANW NKEFRNIPSV DKSDCYKKVI YKQISSPEKS IQNLMVIDGK TVKKNGRKEK EGIHSGENLI LEELKNTYLP KKINDIRKRR SYLNGDTFSK KDLTEFIGYY KQRVIEYYNG YSFYFKSDDD YASFKEFQED VGRQAYQISY VDVPVSFVDD LINSGKLYLF RVYNKDFSEY SKGRLNLHTL YFKMLFDERN LKNVVYKLNG QAEVFYRPSS IKKEELIVHR AGEEIKNKNP KRAAQKPTRR LDYDIVKDRR YSQDKFMLHT SIIMNFGAEE NVSFNDIVNG VLRNEDKVNV IGIDRGERNL LYVVVIDPEG KILEQRSLNC ITDSNLDIET DYHRLLDEKE SDRKIARRDW TTIENIKELK AGYLSQVVHI VAELVLKYNA IICLEDLNFG FKRGRQKVEK QVYQKFEKML IDKLNYLVMD KSREQLSPEK ISGALNALQL TPDFKSFKVL GKQTGIIYYV PAYLTSKIDP MTGFANLFYV KYENVDKAKE FFSKFDSIKY NKDGKNWNTK GYFEFAFDYK KFTDRAYGRV SEWTVCTVGE RIIKFKNKEK NNSYDDKVID LTNSLKELFD SYKVTYESEV DLKDAILAID DPAFYRDLTR RLQQTLQMRN SSCDGSRDYI ISPVKNSKGE FFCSDNNDDT TPNDADANGA FNIARKGLWV LNEIRNSEEG SKINLAMSNA QWLEYAQDNT I WP_016301126.1 MHENNGKIAD NFIGIYPVSK TLRFELKPVG KTQEYIEKHG ILDEDLKRAG(SEQ IDDYKSVKKIID AYHKYFIDEA LNGIQLDGLK NYYELYEKKR DNNEEKEFQK NO: 158) type V CRISPR- IQMSLRKQIV KRFSEHPQYK YLFKKELIKN VLPEFTKDNA EEQTLVKSFQ associated protein EFTTYFEGFH QNRKNMYSDE EKSTAIAYRV VHQNLPKYID NMRIFSMILN Cpf1 TDIRSDLTEL FNNLKTKMDI TIVEEYFAID GFNKVVNQKG IDVYNTILGA [Lachnospiraceae FSTDDNTKIK GLNEYINLYN QKNKAKLPKL KPLFKQILSD RDKISFIPEQ bacterium COE1] FDSDTEVLEA VDMFYNRLLQ FVIENEGQIT ISKLLTNFSA YDLNKIYVKN DTTISAISND LFDDWSYISK AVRENYDSEN VDKNKRAAAY EEKKEKALSK IKMYSIEELN FFVKKYSCNE CHIEGYFERR ILEILDKMRY AYESCKILHD KGLINNISLC QDRQAISELK DFLDSIKEVQ WLLKPLMIGQ EQADKEEAFY TELLRIWEEL EPITLLYNKV RNYVTKKPYT LEKVKLNFYK STLLDGWDKN KEKDNLGIIL LKDGQYYLGI MNRRNNKIAD DAPLAKTDNV YRKMEYKLLT KVSANLPRIF LKDKYNPSEE MLEKYEKGTH LKGENFCIDD CRELIDFFKK GIKQYEDWGQ FDFKFSDTES YDDISAFYKE VEHQGYKITF RDIDETYIDS LVNEGKLYLF QIYNKDFSPY SKGTKNLHTL YWEMLFSQQN LQNIVYKLNG NAEIFYRKAS INQKDVVVHK ADLPIKNKDP QNSKKESMFD YDIIKDKRFT CDKYQFHVPI TMNFKALGEN HFNRKVNRLI HDAENMHIIG IDRGERNLIY LCMIDMKGNI VKQISLNEII SYDKNKLEHK RNYHQLLKTR EDENKSARQS WQTIHTIKEL KEGYLSQVIH VITDLMVEYN AIVVLEDLNF GFKQGRQKFE RQVYQKFEKM LIDKLNYLVD KSKGMDEDGG LLHAYQLTDE FKSFKQLGKQ SGFLYYIPAW NTSKLDPTTG FVNLFYTKYE SVEKSKEFIN NFTSILYNQE REYFEFLFDY SAFTSKAEGS RLKWTVCSKG ERVETYRNPK KNNEWDTQKI DLTFELKKLF NDYSISLLDG DLREQMGKID KADFYKKFMK LFALIVQMRNTable 5 - Cas12a orthologsSDEREDKLIS PVLNKYGAFF ETGKNERMPL DADANGAYNI ARKGLWIIEK IKNTDVEQLD KVKLTISNKE WLQYAQEHIL WP_035635841.1 MSKLEKFTNC YSLSKTLRFK AIPVGKTQEN IDNKRLLVED EKRAEDYKGV(SEQ IDKKLLDRYYLS FINDVLHSIK LKNLNNYISL FRKKTRTEKE NKELENLEIN NO: 159) type V CRISPR- LRKEIAKAFK GNEGYKSLFK KDIIETILPE FLDDKDEIAL VNSFNGFTTA associated protein FTGFFDNREN MFSEEAKSTS IAFRCINENL TRYISNMDIF EKVDAIFDKH Cpf1 EVQEIKEKIL NSDYDVEDFF EGEFFNFVLT QEGIDVYNAI IGGFVTESGE [Lachnospiraceae KIKGLNEYIN LYNQKTKQKL PKFKPLYKQV LSDRESLSFY GEGYTSDEEV bacterium ND2006] LEVFRNTLNK NSEIFSSIKK LEKLFKNFDE YSSAGIFVKN GPAISTISKD IFGEWNVIRD KWNAEYDDIH LKKKAVVTEK YEDDRRKSFK KIGSFSLEQL QEYADADLSV VEKLKEIIIQ KVDEIYKVYG SSEKLFDADF VLEKSLKKND AVVAIMKDLL DSVKSFENYI KAFFGEGKET NRDESFYGDF VLAYDILLKV DHIYDAIRNY VTQKPYSKDK FKLYFQNPQF MGGWDKDKET DYRATILRYG SKYYLAIMDK KYAKCLQKID KDDVNGNYEK INYKLLPGPN KMLPKVFFSK KWMAYYNPSE DIQKIYKNGT FKKGDMFNLN DCHKLIDFFK DSISRYPKWS NAYDFNFSET EKYKDIAGFY REVEEQGYKV SFESASKKEV DKLVEEGKLY MFQIYNKDFS DKSHGTPNLH TMYFKLLFDE NNHGQIRLSG GAELFMRRAS LKKEELVVHP ANSPIANKNP DNPKKTTTLS YDVYKDKRFS EDQYELHIPI AINKCPKNIF KINTEVRVLL KHDDNPYVIG IDRGERNLLY IVVVDGKGNI VEQYSLNEII NNFNGIRIKT DYHSLLDKKE KERFEARQNW TSIENIKELK AGYISQVVHK ICELVEKYDA VIALEDLNSG FKNSRVKVEK QVYQKFEKML IDKLNYMVDK KSNPCATGGA LKGYQITNKF ESFKSMSTQN GFIFYIPAWL TSKIDPSTGF VNLLKTKYTS IADSKKFISS FDRIMYVPEE DLFEFALDYK NFSRTDADYI KKWKLYSYGN RIRIFRNPKK NNVFDWEEVC LTSAYKELFN KYGINYQQGD IRALLCEQSD KAFYSSFMAL MSLMLQMRNS ITGRTDVDFL ISPVKNSDGI FYDSRNYEAQ ENAILPKNAD ANGAYNIARK VLWAIGQFKK AEDEKLDKVK IAISNKEWLE YAQTSVKH WP_051666128.1 MLKNVGIDRL DVEKGRKNMS KLEKFTNCYS LSKTLRFKAI PVGKTQENID(SEQ IDNKRLLVEDEK RAEDYKGVKK LLDRYYLSFI NDVLHSIKLK NLNNYISLFR NO: 160) type V CRISPR- KKTRTEKENK ELENLEINLR KEIAKAFKGN EGYKSLFKKD IIETILPEFL associated protein DDKDEIALVN SFNGFTTAFT GFFDNRENMF SEEAKSTSIA FRCINENLTR Cpf1 YISNMDIFEK VDAIFDKHEV QEIKEKILNS DYDVEDFFEG EFFNFVLTQE [Lachnospiraceae GIDVYNAIIG GFVTESGEKI KGLNEYINLY NQKTKQKLPK FKPLYKQVLS bacterium ND2006] DRESLSFYGE GYTSDEEVLE VFRNTLNKNS EIFSSIKKLE KLFKNFDEYS SAGIFVKNGP AISTISKDIF GEWNVIRDKW NAEYDDIHLK KKAVVTEKYE DDRRKSFKKI GSFSLEQLQE YADADLSVVE KLKEIIIQKV DEIYKVYGSS EKLFDADFVL EKSLKKNDAV VAIMKDLLDS VKSFENYIKA FFGEGKETNR DESFYGDFVL AYDILLKVDH IYDAIRNYVT QKPYSKDKFK LYFQNPQFMG GWDKDKETDY RATILRYGSK YYLAIMDKKY AKCLQKIDKD DVNGNYEKIN YKLLPGPNKM LPKVFFSKKW MAYYNPSEDI QKIYKNGTFK KGDMFNLNDC HKLIDFFKDS ISRYPKWSNA YDFNFSETEK YKDIAGFYRE VEEQGYKVSF ESASKKEVDK LVEEGKLYMF QIYNKDFSDK SHGTPNLHTM YFKLLFDENN HGQIRLSGGA ELFMRRASLK KEELVVHPAN SPIANKNPDN PKKTTTLSYD VYKDKRFSED QYELHIPIAI NKCPKNIFKI NTEVRVLLKH DDNPYVIGID RGERNLLYIV VVDGKGNIVE QYSLNEIINN FNGIRIKTDY HSLLDKKEKE RFEARQNWTS IENIKELKAG YISQVVHKIC ELVEKYDAVI ALEDLNSGFK NSRVKVEKQV YQKFEKMLID KLNYMVDKKS NPCATGGALK GYQITNKFES FKSMSTQNGF IFYIPAWLTS KIDPSTGFVN LLKTKYTSIA DSKKFISSFD RIMYVPEEDL FEFALDYKNF SRTDADYIKK WKLYSYGNRI RIFRNPKKNN VFDWEEVCLT SAYKELFNKY GINYQQGDIR ALLCEQSDKA FYSSFMALMS LMLQMRNSIT GRTDVDFLIS PVKNSDGIFY DSRNYEAQEN AILPKNADAN GAYNIARKVL WAIGQFKKAE DEKLDKVKIA ISNKEWLEYA QTSVKHWP_015504779.1 MDAKEFTGQY PLSKTLRFEL RPIGRTWDNL EASGYLAEDR HRAECYPRAK (SEQ IDELLDDNHRAF LNRVLPQIDM DWHPIAEAFC KVHKNPGNKE LAQDYNLQLS NO: 161)Table 5 - Cas12a orthologstype V CRISPR- KRRKEISAYL QDADGYKGLF AKPALDEAMK IAKENGNESD IEVLEAFNGF associated protein SVYFTGYHES RENIYSDEDM VSVAYRITED NFPRFVSNAL IFDKLNESHP Cpf1 [Candidatus DIISEVSGNL GVDDIGKYFD VSNYNNFLSQ AGIDDYNHII GGHTTEDGLI Methanomethylophi QAFNVVLNLR HQKDPGFEKI QFKQLYKQIL SVRTSKSYIP KQFDNSKEMV lus alvus] DCICDYVSKI EKSETVERAL KLVRNISSFD LRGIFVNKKN LRILSNKLIG DWDAIETALM HSSSSENDKK SVYDSAEAFT LDDIFSSVKK FSDASAEDIG NRAEDICRVI SETAPFINDL RAVDLDSLND DGYEAAVSKI RESLEPYMDL FHELEIFSVG DEFPKCAAFY SELEEVSEQL IEIIPLFNKA RSFCTRKRYS TDKIKVNLKF PTLADGWDLN KERDNKAAIL RKDGKYYLAI LDMKKDLSSI RTSDEDESSF EKMEYKLLPS PVKMLPKIFV KSKAAKEKYG LTDRMLECYD KGMHKSGSAF DLGFCHELID YYKRCIAEYP GWDVFDFKFR ETSDYGSMKE FNEDVAGAGY YMSLRKIPCS EVYRLLDEKS IYLFQIYNKD YSENAHGNKN MHTMYWEGLF SPQNLESPVF KLSGGAELFF RKSSIPNDAK TVHPKGSVLV PRNDVNGRRI PDSIYRELTR YFNRGDCRIS DEAKSYLDKV KTKKADHDIV KDRRFTVDKM MFHVPIAMNF KAISKPNLNK KVIDGIIDDQ DLKIIGIDRG ERNLIYVTMV DRKGNILYQD SLNILNGYDY RKALDVREYD NKEARRNWTK VEGIRKMKEG YLSLAVSKLA DMIIENNAII VMEDLNHGFK AGRSKIEKQV YQKFESMLIN KLGYMVLKDK SIDQSGGALH GYQLANHVTT LASVGKQCGV IFYIPAAFTS KIDPTTGFAD LFALSNVKNV ASMREFFSKM KSVIYDKAEG KFAFTFDYLD YNVKSECGRT LWTVYTVGER FTYSRVNREY VRKVPTDIIY DALQKAGISV EGDLRDRIAE SDGDTLKSIF YAFKYALDMR VENREEDYIQ SPVKNASGEF FCSKNAGKSL PQDSDANGAY NIALKGILQL RMLSEQYDPN AESIRLPLIT NKAWLTFMQS GMKTWKN WP_044910713.1 MGLYDGFVNR YSVSKTLRFE LIPQGRTREY IETNGILSDD EERAKDYKTI(SEQ IDKRLIDEYHKD YISRCLKNVN ISCLEEYYHL YNSSNRDKRH EELDALSDQM NO: 162) type V CRISPR- RGEIASFLTG NDEYKEQKSR DIIINERIIN FASTDEELAA VKRFRKFTSY associated protein FTGFFTNREN MYSAEKKSTA IAHRIIDVNL PKYVDNIKAF NTAIEAGVFD Cpf1 IAEFESNFKA ITDEHEVSDL LDITKYSRFI RNEDIIIYNT LLGGISMKDE [Lachnospiraceae KIQGLNELIN LHNQKHPGKK VPLLKVLYKQ ILGDSQTHSF VDDQFEDDQQ bacterium MC2017] VINAVKAVTD TFSETLLGSL KIIINNIGHY DLDRIYIKAG QDITTLSKRA LNDWHIITEC LESEYDDKFP KNKKSDTYEE MRNRYVKSFK SFSIGRLNSL VTTYTEQACF LENYLGSFGG DTDKNCLTDF TNSLMEVEHL LNSEYPVTNR LITDYESVRI LKRLLDSEME VIHFLKPLLG NGNESDKDLV FYGEFEAEYE KLLPVIKVYN RVRNYLTRKP FSTEKIKLNF NSPTLLCGWS QSKEKEYMGV ILRKDGQYYL GIMTPSNKKI FSEAPKPDED CYEKMVLRYI PHPYQMLPKV FFSKSNIAFF NPSDEILRIK KQESFKKGKS FNRDDCHKFI DFYKDSINRH EEWRKFNFKF SDTDSYEDIS RFYKEVENQA FSMSFTKIPT VYIDSLVDEG KLYLFKLHNK DFSEHSKGKP NLHTVYWNAL FSEYNLQNTV YQLNGSAEIF FRKASIPENE RVIHKKNVPI TRKVAELNGK KEVSVFPYDI IKNRRYTVDK FQFHVPLKMN FKADEKKRIN DDVIEAIRSN KGIHVIGIDR GERNLLYLSL INEEGRIIEQ RSLNIIDSGE GHTQNYRDLL DSREKDREKA RENWQEIQEI KDLKTGYLSQ AIHTITKWMK EYNAIIVLED LNDRFTNGRK KVEKQVYQKF EKMLIDKLNY YVDKDEEFDR MGGTHRALQL TEKFESFQKL GRQTGFIFYV PAWNTSKLDP TTGFVDLLYP KYKSVDATKD FIKKFDFIRF NSEKNYFEFG LHYSNFTERA IGCRDEWILC SYGNRIVNFR NAAKNNSWDY KEIDITKQLL DLFEKNGIDV KQENLIDSIC EMKDKPFFKS LIANIKLILQ IRNSASGTDI DYMISPAMND RGEFFDTRKG LQQLPLDADA NGAYNIAKKG LWIVDQIRNT TGNNVKMAMS NREWMHFAQE SRLA KKQ36153.1 MKNVFGGFTN LYSLTKTLRF ELKPTSKTQK LMKRNNVIQT DEEIDKLYHD(SEQ IDEMKPILDEIH RRFINDALAQ KIFISASLDN FLKVVKNYKV ESAKKNIKQN NO: 163) hypothetical protein QVKLLQKEIT IKTLGLRREV VSGFITVSKK WKDKYVGLGI KLKGDGYKVL US52_C0007G0008 TEQAVLDILK IEFPNKAKYI DKFRGFWTYF SGFNENRKNY YSEEDKATSI [candidate division ANRIVNENLS RYIDNIIAFE EILQKIPNLK KFKQDLDITS YNYYLNQAGI WS6 bacterium DKYNKIIGGY IVDKDKKIQG INEKVNLYTQ QTKKKLPKLK FLFKQIGSERTable 5 - Cas12a orthologsGW2011_GWA2_3 KGFGIFEIKE GKEWEQLGDL FKLQRTKINS NGREKGLFDS LRTMYREFFD 7_6] EIKRDSNSQA RYSLDKIYFN KASVNTISNS WFTNWNKFAE LLNIKEDKKN GEKKIPEQIS IEDIKDSLSI IPKENLEELF KLTNREKHDR TRFFGSNAWV TFLNIWQNEI EESFNKLEEK EKDFKKNAAI KFQKNNLVQK NYIKEVCDRM LAIERMAKYH LPKDSNLSRE EDFYWIIDNL SEQREIYKYY NAFRNYISKK PYNKSKMKLN FENGNLLGGW SDGQERNKAG VILRNGNKYY LGVLINRGIF RTDKINNEIY RTGSSKWERL ILSNLKFQTL AGKGFLGKHG VSYGNMNPEK SVPSLQKFIR ENYLKKYPQL TEVSNTKFLS KKDFDAAIKE ALKECFTMNF INIAENKLLE AEDKGDLYLF EITNKDFSGK KSGKDNIHTI YWKYLFSESN CKSPIIGLNG GAEIFFREGQ KDKLHTKLDK KGKKVFDAKR YSEDKLFFHV SITINYGKPK NIKFRDIINQ LITSMNVNII GIDRGEKHLL YYSVIDSNGI ILKQGSLNKI RVGDKEVDFN KKLTERANEM KKARQSWEQI GNIKNFKEGY LSQAIHEIYQ LMIKYNAIIV LEDLNTEFKA KRLSKVEKSV YKKFELKLAR KLNHLILKDR NTNEIGGVLK AYQLTPTIGG GDVSKFEKAK QWGMMFYVRA NYTSTTDPVT GWRKHLYISN FSNNSVIKSF FDPTNRDTGI EIFYSGKYRS WGFRYVQKET GKKWELFATK ELERFKYNQT TKLCEKINLY DKFEELFKGI DKSADIYSQL CNVLDFRWKS LVYLWNLLNQ IRNVDKNAEG NKNDFIQSPV YPFFDSRKTD GKTEPINGDA NGALNIARKG LMLVERIKNN PEKYEQLIRD TEWDAWIQNF NKVN WP_044919442.1 MYYESLTKQY PVSKTIRNEL IPIGKTLDNI RQNNILESDV KRKQNYEHVK(SEQ IDGILDEYHKQL INEALDNCTL PSLKIAAEIY LKNQKEVSDR EDFNKTQDLL NO: 164) type V CRISPR- RKEVVEKLKA HENFTKIGKK DILDLLEKLP SISEDDYNAL ESFRNFYTYF associated protein TSYNKVRENL YSDKEKSSTV AYRLINENFP KFLDNVKSYR FVKTAGILAD Cpf1 GLGEEEQDSL FIVETFNKTL TQDGIDTYNS QVGKINSSIN LYNQKNQKAN [Lachnospiraceae GFRKIPKMKM LYKQILSDRE ESFIDEFQSD EVLIDNVESY GSVLIESLKS bacterium MA2020] SKVSAFFDAL RESKGKNVYV KNDLAKTAMS NIVFENWRTF DDLLNQEYDL ANENKKKDDK YFEKRQKELK KNKSYSLEHL CNLSEDSCNL IENYIHQISD DIENIIINNE TFLRIVINEH DRSRKLAKNR KAVKAIKDFL DSIKVLEREL KLINSSGQEL EKDLIVYSAH EELLVELKQV DSLYNMTRNY LTKKPFSTEK VKLNFNRSTL LNGWDRNKET DNLGVLLLKD GKYYLGIMNT SANKAFVNPP VAKTEKVFKK VDYKLLPVPN QMLPKVFFAK SNIDFYNPSS EIYSNYKKGT HKKGNMFSLE DCHNLIDFFK ESISKHEDWS KFGFKFSDTA SYNDISEFYR EVEKQGYKLT YTDIDETYIN DLIERNELYL FQIYNKDFSM YSKGKLNLHT LYFMMLFDQR NIDDVVYKLN GEAEVFYRPA SISEDELIIH KAGEEIKNKN PNRARTKETS TFSYDIVKDK RYSKDKFTLH IPITMNFGVD EVKRFNDAVN SAIRIDENVN VIGIDRGERN LLYVVVIDSK GNILEQISLN SIINKEYDIE TDYHALLDER EGGRDKARKD WNTVENIRDL KAGYLSQVVN VVAKLVLKYN AIICLEDLNF GFKRGRQKVE KQVYQKFEKM LIDKLNYLVI DKSREQTSPK ELGGALNALQ LTSKFKSFKE LGKQSGVIYY VPAYLTSKID PTTGFANLFY MKCENVEKSK RFFDGFDFIR FNALENVFEF GFDYRSFTQR ACGINSKWTV CTNGERIIKY RNPDKNNMFD EKVVVVTDEM KNLFEQYKIP YEDGRNVKDM IISNEEAEFY RRLYRLLQQT LQMRNSTSDG TRDYIISPVK NKREAYFNSE LSDGSVPKDA DANGAYNIAR KGLWVLEQIR QKSEGEKINL AMTNAEWLEY AQTHLL WP_035798880.1 MYYQNLTKKY PVSKTIRNEL IPIGKTLENI RKNNILESDV KRKQDYEHVK(SEQ IDGIMDEYHKQL INEALDNYML PSLNQAAEIY LKKHVDVEDR EEFKKTQDLL NO: 165) type V CRISPR- RREVTGRLKE HENYTKIGKK DILDLLEKLP SISEEDYNAL ESFRNFYTYF associated protein TSYNKVRENL YSDEEKSSTV AYRLINENLP KFLDNIKSYA FVKAAGVLAD Cpf1 [Butyrivibrio CIEEEEQDAL FMVETFNMTL TQEGIDMYNY QIGKVNSAIN LYNQKNHKVE sp. NC3005] EFKKIPKMKV LYKQILSDRE EVFIGEFKDD ETLLSSIGAY GNVLMTYLKS EKINIFFDAL RESEGKNVYV KNDLSKTTMS NIVFGSWSAF DELLNQEYDL ANENKKKDDK YFEKRQKELK KNKSYTLEQM SNLSKEDISP IENYIERISE DIEKICIYNG EFEKIVVNEH DSSRKLSKNI KAVKVIKDYL DSIKELEHDI KLINGSGQEL EKNLVVYVGQ EEALEQLRPV DSLYNLTRNY LTKKPFSTEKTable 5 - Cas12a orthologsVKLNFNKSTL LNGWDKNKET DNLGILFFKD GKYYLGIMNT TANKAFVNPP AAKTENVFKK VDYKLLPGSN KMLPKVFFAK SNIGYYNPST ELYSNYKKGT HKKGPSFSID DCHNLIDFFK ESIKKHEDWS KFGFEFSDTA DYRDISEFYR EVEKQGYKLT FTDIDESYIN DLIEKNELYL FQIYNKDFSE YSKGKLNLHT LYFMMLFDQR NLDNVVYKLN GEAEVFYRPA SIAENELVIH KAGEGIKNKN PNRAKVKETS TFSYDIVKDK RYSKYKFTLH IPITMNFGVD EVRRFNDVIN NALRTDDNVN VIGIDRGERN LLYVVVINSE GKILEQISLN SIINKEYDIE TNYHALLDER EDDRNKARKD WNTIENIKEL KTGYLSQVVN VVAKLVLKYN AIICLEDLNF GFKRGRQKVE KQVYQKFEKM LIEKLNYLVI DKSREQVSPE KMGGALNALQ LTSKFKSFAE LGKQSGIIYY VPAYLTSKID PTTGFVNLFY IKYENIEKAK QFFDGFDFIR FNKKDDMFEF SFDYKSFTQK ACGIRSKWIV YTNGERIIKY PNPEKNNLFD EKVINVTDEI KGLFKQYRIP YENGEDIKEI IISKAEADFY KRLFRLLHQT LQMRNSTSDG TRDYIISPVK NDRGEFFCSE FSEGTMPKDA DANGAYNIAR KGLWVLEQIR QKDEGEKVNL SMTNAEWLKY AQLHLL WP_027109509.1 MENYYDSLTR QYPVTKTIRQ ELKPVGKTLE NIKNAEIIEA DKQKKEAYVK(SEQ IDVKELMDEFHK SIIEKSLVGI KLDGLSEFEK LYKIKTKTDE DKNRISELFY NO: 166) type V CRISPR- YMRKQIADAL KNSRDYGYVD NKDLIEKILP ERVKDENSLN ALSCFKGFTT associated protein YFTDYYKNRK NIYSDEEKHS TVGYRCINEN LLIFMSNIEV YQIYKKANIK Cpf1 NDNYDEETLD KTFMIESFNE CLTQSGVEAY NSVVASIKTA TNLYIQKNNK [Lachnospiraceae EENFVRVPKM KVLFKQILSD RTSLFDGLII ESDDELLDKL CSFSAEVDKF bacterium NC2008] LPINIDRYIK TLMDSNNGTG IYVKNDSSLT TLSNYLTDSW SSIRNAFNEN YDAKYTGKVN DKYEEKREKA YKSNDSFELN YIQNLLGINV IDKYIERINF DIKEICEAYK EMTKNCFEDH DKTKKLQKNI KAVASIKSYL DSLKNIERDI KLLNGTGLES RNEFFYGEQS TVLEEITKVD ELYNITRNYL TKKPFSTEKM KLNFNNPQLL GGWDVNKERD CYGVILIKDN NYYLGIMDKS ANKSFLNIKE SKNENAYKKV NCKLLPGPNK MFPKVFFAKS NIDYYDPTHE IKKLYDKGTF KKGNSFNLED CHKLIDFYKE SIKKNDDWKN FNFNFSDTKD YEDISGFFRE VEAQNYKITY TNVSCDFIES LVDEGKLYLF QIYNKDFSEY ATGNLNLHTL YLKMLFDERN LKDLCIKMNG EAEVFYRPAS ILDEDKVVHK ANQKITNKNT NSKKKESIFS YDIVKDKRYT VDKFFIHLPI TLNYKEQNVS RFNDYIREIL KKSKNIRVIG IDRGERNLLY VVVCDSDGSI LYQRSINEIV SGSHKTDYHK LLDNKEKERL SSRRDWKTIE NIKDLKAGYM SQVVNEIYNL ILKYNAIVVL EDLNIGFKNG RKKVEKQVYQ NFEKALIDKL NYLCIDKTRE QLSPSSPGGV LNAYQLTAKF ESFEKIGKQT GCIFYVPAYL TSQIDPTTGF VNLFYQKDTS KQGLQLFFRK FKKINFDKVA SNFEFVFDYN DFTNKAEGTK TNWTISTQGT RIAKYRSDDA NGKWISRTVH PTDIIKEALN REKINYNDGH DLIDEIVSIE KSAVLKEIYY GFKLTLQLRN STLANEEEQE DYIISPVKNS SGNYFDSRIT SKELPCDADA NGAYNIARKG LWALEQIRNS ENVSKVKLAI SNKEWFEYTQ NNIPSL WP_049895985.1 METEILKYDF FEREGKYMYY DGLTKQYALS KTIRNELVPI GKTLDNIKKN(SEQ IDRILEADIKRK SDYEHVKKLM DMYHKKIINE ALDNFKLSVL EDAADIYFNK NO: 167) type V CRISPR- QNDERDIDAF LKIQDKLRKE IVEQLKGHTD YSKVGNKDFL GLLKAASTEE associated protein DRILIESFDN FYTYFTSYNK VRSNLYSAED KSSTVAYRLI NENLPKFFDN Cpf1 [Oribacterium IKAYRTVRNA GVISGDMSIV EQDELFEVDT FNHTLTQYGI DTYNHMIGQL sp. NK2B42] NSAINLYNQK MHGAGSFKKL PKMKELYKQL LTEREEEFIE EYTDDEVLIT WP_029202018 SVHNYVSYLI DYLNSDKVES FFDTLRKSDG KEVFIKNDVS KTTMSNILFD NWSTIDDLIN HEYDSAPENV KKTKDDKYFE KRQKDLKKNK SYSLSKIAAL CRDTTILEKY IRRLVDDIEK IYTSNNVFSD IVLSKHDRSK KLSKNTNAVQ AIKNMLDSIK DFEHDVMLIN GSGQEIKKNL NVYSEQEALA GILRQVDHIY NLTRNYLTKK PFSTEKIKLN FNRPTFLDGW DKNKEEANLG ILLIKDNRYY LGIMNTSSNK AFVNPPKAIS NDIYKKVDYK LLPGPNKMLP KVFFATKNIA YYAPSEELLS KYRKGTHKKG DSFSIDDCRN LIDFFKSSIN KNTDWSTFGF NFSDTNSYND ISDFYREVEK QGYKLSFTDI DACYIKDLVD NNELYLFQIYTable 5 - Cas12a orthologsNKDFSPYSKG KLNLHTLYFK MLFDQRNLDN VVYKLNGEAE VFYRPASIES DEQIIHKSGQ NIKNKNQKRS NCKKTSTFDY DIVKDRRYCK DKFMLHLPIT VNFGTNESGK FNELVNNAIR ADKDVNVIGI DRGERNLLYV VVVDPCGKII EQISLNTIVD KEYDIETDYH QLLDEKEGSR DKARKDWNTI ENIKELKEGY LSQVVNIIAK LVLKYDAIIC LEDLNFGFKR GRQKVEKQVY QKFEKMLIDK MNYLVLDKSR KQESPQKPGG ALNALQLTSA FKSFKELGKQ TGIIYYVPAY LTSKIDPTTG FANLFYIKYE SVDKARDFFS KFDFIRYNQM DNYFEFGFDY KSFTERASGC KSKWIACTNG ERIVKYRNSD KNNSFDDKTV ILTDEYRSLF DKYLQNYIDE DDLKDQILQI DSADFYKNLI KLFQLTLQMR NSSSDGKRDY IISPVKNYRE EFFCSEFSDD TFPRDADANG AYNIARKGLW VIKQIRETKS GTKINLAMSN SEWLEYAQCN LL WP_028248456.1 MYYQNLTKMY PISKTLRNEL IPVGKTLENI RKNGILEADI QRKADYEHVK(SEQ IDKLMDNYHKQL INEALQGVHL SDLSDAYDLY FNLSKEKNSV DAFSKCQDKL NO: 168) type V CRISPR- RKEIVSLLKN HENFPKIGNK EIIKLLQSLY DNDTDYKALD SFSNFYTYFS associated protein SYNEVRKNLY SDEEKSSTVA YRLINENLPK FLDNIKAYAI AKKAGVRAEG Cpf1 LSEEDQDCLF IIETFERTLT QDGIDNYNAA IGKLNTAINL FNQQNKKQEG [Pseudobutyrivibrio FRKVPQMKCL YKQILSDREE AFIDEFSDDE DLITNIESFA ENMNVFLNSE ruminis] IITDFKIALV ESDGSLVYIK NDVSKTSFSN IVFGSWNAID EKLSDEYDLA NSKKKKDEKY YEKRQKELKK NKSYDLETII GLFDDNSDVI GKYIEKLESD ITAIAEAKND FDEIVLRKHD KNKSLRKNTN AVEAIKSYLD TVKDFERDIK LINGSGQEVE KNLVVYAEQE NILAEIKNVD SLYNMSRNYL TQKPFSTEKF KLNFNRATLL NGWDKNKETD NLGILFEKDG MYYLGIMNTK ANKIFVNIPK ATSNDVYHKV NYKLLPGPNK MLPKVFFAQS NLDYYKPSEE LLAKYKAGTH KKGDNFSLED CHALIDFFKA SIEKHPDWSS FGFEFSETCT YEDLSGFYRE VEKQGYKITY TDVDADYITS LVERDELYLF QIYNKDFSPY SKGNLNLHTI YLQMLFDQRN LNNVVYKLNG EAEVFYRPAS INDEEVIIHK AGEEIKNKNS KRAVDKPTSK FGYDIIKDRR YSKDKFMLHI PVTMNFGVDE TRRFNDVVND ALRNDEKVRV IGIDRGERNL LYVVVVDTDG TILEQISLNS IINNEYSIET DYHKLLDEKE GDRDRARKNW TTIENIKELK EGYLSQVVNV IAKLVLKYNA IICLEDLNFG FKRGRQKVEK QVYQKFEKML IDKLNYLVID KSRKQDKPEE FGGALNALQL TSKFTSFKDM GKQTGIIYYV PAYLTSKIDP TTGFANLFYV KYENVEKAKE FFSRFDSISY NNESGYFEFA FDYKKFTDRA CGARSQWTVC TYGERIIKFR NTEKNNSFDD KTIVLSEEFK ELFSIYGISY EDGAELKNKI MSVDEADFFR SLTRLFQQTM QMRNSSNDVT RDYIISPIMN DRGEFFNSEA CDASKPKDAD ANGAFNIARK GLWVLEQIRN TPSGDKLNLA MSNAEWLEYA QRNQI WP_028830240 MENFKNLYPI NKTLRFELRP YGKTLENFKK SGLLEKDAFK ANSRRSMQAI(SEQ IDIDEKFKETIE ERLKYTEFSE CDLGNMTSKD KKITDKAATN LKKQVILSFD NO: 169) type V CRISPR- DEIFNNYLKP DKNIDALFKN DPSNPVISTF KGFTTYFVNF FEIRKHIFKG associated protein ESSGSMAYRI IDENLTTYLN NIEKIKKLPE ELKSQLEGID QIDKLNNYNE Cpf1 [Proteocatella FITQSGITHY NEIIGGISKS ENVKIQGINE GINLYCQKNK VKLPRLTPLY sphenisci] KMILSDRVSN SFVLDTIEND TELIEMISDL INKTEISQDV IMSDIQNIFI KYKQLGNLPG ISYSSIVNAI CSDYDNNFGD GKRKKSYEND RKKHLETNVY SINYISELLT DTDVSSNIKM RYKELEQNYQ VCKENFNATN WMNIKNIKQS EKTNLIKDLL DILKSIQRFY DLFDIVDEDK NPSAEFYTWL SKNAEKLDFE FNSVYNKSRN YLTRKQYSDK KIKLNFDSPT LAKGWDANKE IDNSTIIMRK FNNDRGDYDY FLGIWNKSTP ANEKIIPLED NGLFEKMQYK LYPDPSKMLP KQFLSKIWKA KHPTTPEFDK KYKEGRHKKG PDFEKEFLHE LIDCFKHGLV NHDEKYQDVF GFNLRNTEDY NSYTEFLEDV ERCNYNLSFN KIADTSNLIN DGKLYVFQIW SKDFSIDSKG TKNLNTIYFE SLFSEENMIE KMFKLSGEAE IFYRPASLNY CEDIIKKGHH HAELKDKFDY PIIKDKRYSQ DKFFFHVPMV INYKSEKLNS KSLNNRTNEN LGQFTHIIGI DRGERHLIYL TVVDVSTGEI VEQKHLDEII NTDTKGVEHK THYLNKLEEK SKTRDNERKS WEAIETIKEL KEGYISHVIN EIQKLQEKYN ALIVMENLNY GFKNSRIKVE KQVYQKFETATable 5 - Cas12a orthologsLIKKFNYIID KKDPETYIHG YQLTNPITTL DKIGNQSGIV LYIPAWNTSK IDPVTGFVNL LYADDLKYKN QEQAKSFIQK IDNIYFENGE FKFDIDFSKW NNRYSISKTK WTLTSYGTRI QTFRNPQKNN KWDSAEYDLT EEFKLILNID GTLKSQDVET YKKFMSLFKL MLQLRNSVTG TDIDYMISPV TDKTGTHFDS RENIKNLPAD ADANGAYNIA RKGIMAIENI MNGISDPLKI SNEDYLKYIQ NQQE WP_084502895.1 MIILYISTSN MNMEGVFMEN FKNLYPINKT LRFELRPYGK TLENFKKSGL(SEQ IDLEKDAFKANS RRSMQAIIDE KFKETIEERL KYTEFSECDL GNMTSKDKKI NO: 170) type V CRISPR- TDKAATNLKK QVILSFDDEI FNNYLKPDKN IDALFKNDPS NPVISTFKGF associated protein TTYFVNFFEI RKHIFKGESS GSMAYRIIDE NLTTYLNNIE KIKKLPEELK Cpf1 [Proteocatella SQLEGIDQID KLNNYNEFIT QSGITHYNEI IGGISKSENV KIQGINEGIN sphenisci] LYCQKNKVKL PRLTPLYKMI LSDRVSNSFV LDTIENDTEL IEMISDLINK TEISQDVIMS DIQNIFIKYK QLGNLPGISY SSIVNAICSD YDNNFGDGKR KKSYENDRKK HLETNVYSIN YISELLTDTD VSSNIKMRYK ELEQNYQVCK ENFNATNWMN IKNIKQSEKT NLIKDLLDIL KSIQRFYDLF DIVDEDKNPS AEFYTWLSKN AEKLDFEFNS VYNKSRNYLT RKQYSDKKIK LNFDSPTLAK GWDANKEIDN STIIMRKFNN DRGDYDYFLG IWNKSTPANE KIIPLEDNGL FEKMQYKLYP DPSKMLPKQF LSKIWKAKHP TTPEFDKKYK EGRHKKGPDF EKEFLHELID CFKHGLVNHD EKYQDVFGFN LRNTEDYNSY TEFLEDVERC NYNLSFNKIA DTSNLINDGK LYVFQIWSKD FSIDSKGTKN LNTIYFESLF SEENMIEKMF KLSGEAEIFY RPASLNYCED IIKKGHHHAE LKDKFDYPII KDKRYSQDKF FFHVPMVINY KSEKLNSKSL NNRTNENLGQ FTHIIGIDRG ERHLIYLTVV DVSTGEIVEQ KHLDEIINTD TKGVEHKTHY LNKLEEKSKT RDNERKSWEA IETIKELKEG YISHVINEIQ KLQEKYNALI VMENLNYGFK NSRIKVEKQV YQKFETALIK KFNYIIDKKD PETYIHGYQL TNPITTLDKI GNQSGIVLYI PAWNTSKIDP VTGFVNLLYA DDLKYKNQEQ AKSFIQKIDN IYFENGEFKF DIDFSKWNNR YSISKTKWTL TSYGTRIQTF RNPQKNNKWD SAEYDLTEEF KLILNIDGTL KSQDVETYKK FMSLFKLMLQ LRNSVTGTDI DYMISPVTDK TGTHFDSREN IKNLPADADA NGAYNIARKG IMAIENIMNG ISDPLKISNE DYLKYIQNQQ E WP_055225123.1 MNNGTNNFQN FIGISSLQKT LRNALIPTET TQQFIVKNGI IKEDELRGEN(SEQ IDEubacterium rectale RQILKDIMDD YYRGFISETL SSIDDIDWTS LFEKMEIQLK NGDNKDTLIK NO: 171) EQTEYRKAIH KKFANDDRFK NMFSAKLISD ILPEFVIHNN NYSASEKEEK TQVIKLFSRF ATSFKDYFKN RANCFSADDI SSSSCHRIVN DNAEIFFSNA LVYRRIVKSL SNDDINKISG DMKDSLKEMS LEEIYSYEKY GEFITQEGIS FYNDICGKVN SFMNLYCQKN KENKNLYKLQ KLHKQILCIA DTSYEVPYKF ESDEEVYQSV NGFLDNISSK HIVERLRKIG DNYNGYNLDK IYIVSKFYES VSQKTYRDWE TINTALEIHY NNILPGNGKS KADKVKKAVK NDLQKSITEI NELVSNYKLC SDDNIKAETY IHEISHILNN FEAQELKYNP EIHLVESELK ASELKNVLDV IMNAFHWCSV FMTEELVDKD NNFYAELEEI YDEIYPVISL YNLVRNYVTQ KPYSTKKIKL NFGIPTLADG WSKSKEYSNN AIILMRDNLY YLGIFNAKNK PDKKIIEGNT SENKGDYKKM IYNLLPGPNK MIPKVFLSSK TGVETYKPSA YILEGYKQNK HIKSSKDFDI TFCHDLIDYF KNCIAIHPEW KNFGFDFSDT STYEDISGFY REVELQGYKI DWTYISEKDI DLLQEKGQLY LFQIYNKDFS KKSTGNDNLH TMYLKNLFSE ENLKDIVLKL NGEAEIFFRK SSIKNPIIHK KGSILVNRTY EAEEKDQFGN IQIVRKNIPE NIYQELYKYF NDKSDKELSD EAAKLKNVVG HHEAATNIVK DYRYTYDKYF LHMPITINFK ANKTGFINDR ILQYIAKEKD LHVIGIDRGE RNLIYVSVID TCGNIVEQKS FNIVNGYDYQ IKLKQQEGAR QIARKEWKEI GKIKEIKEGY LSLVIHEISK MVIKYNAIIA MEDLSYGFKK GRFKVERQVY QKFETMLINK LNYLVFKDIS ITENGGLLKG YQLTYIPDKL KNVGHQCGCI FYVPAAYTSK IDPTTGFVNI FKFKDLTVDA KREFIKKFDS IRYDSEKNLF CFTFDYNNFI TQNTVMSKSS WSVYTYGVRI KRRFVNGRFS NESDTIDITK DMEKTLEMTD INWRDGHDLR QDIIDYEIVQ HIFEIFRLTV QMRNSLSELE DRDYDRLISP VLNENNIFYDTable 5 - Cas12a orthologsSAKAGDALPK DADANGAYCI ALKGLYEIKQ ITENWKEDGK FSRDKLKISN KDWFDFIQNK RYL WP_055237260.1 MNNGTNNFQN FIGISSLQKT LRNALIPTET TQQFIVKNGI IKEDELRGEN(SEQ IDRQILKDIMDD YYRGFISETL SSIDDIDWTS LFEKMEIQLK NGDNKDTLIK NO: 172) Eubacterium rectale EQAEKRKAIY KKFADDDRFK NMFSAKLISD ILPEFVIHNN NYSASEKEEK TQVIKLFSRF ATSFKDYFKN RANCFSADDI SSSSCHRIVN DNAEIFFSNA LVYRRIVKNL SNDDINKISG DMKDSLKEMS LDEIYSYEKY GEFITQEGIS FYNDICGKVN SFMNLYCQKN KENKNLYKLR KLHKQILCIA DTSYEVPYKF ESDEEVYQSV NGFLDNISSK HIVERLRKIG DNYNGYNLDK IYIVSRFYES VSQKTYRDWE TINTALEIHY NNILPGNGKS KADKVKKAVK NDLQKSITEI NELVSNYKLC PDDNIKAETY IHEISHILNN FEAQELKYNP EIHLVESELK ASELKNVLDV IMNAFHWCSV FMTEELVDKD NNFYAELEEI YDEIYPVISL YNLVRNYVTQ KPYSTKKIKL NFGIPTLADG WSKSKEYSNN AIILMRDNLY YLGIFNAKNK PDKKIIEGNT SENKGDYKKM IYNLLPGPNK MIPKVFLSSK TGVETYKPSA YILEGYKQNK HLKSSKDFDI TFCRDLIDYF KNCIAIHPEW KNFGFDFSDT STYEDISGFY REVELQGYKI DWTYISEKDI DLLQEKGQLY LFQIYNKDFS KKSTGNDNLH TMYLKNLFSE ENLKDIVLKL NGEAEIFFRK SSIKNPIIHK KGSILVNRTY EAEEKDQFGN IQIVRKTIPE NIYQELYKYF NDKSDKELSD EAAKLKNVVG HHEAATNIVK DYRYTYDKYF LHMPITINFK ANKTSFINDR ILQYIAKEND LHVIGIDRGE RNLIYVSVID TCGNIVEQKS FNIVNGYDYQ IKLKQQEGAR QIARKEWKEI GKIKEIKEGY LSLVIHEISK MVIKYNAIIA MEDLSYGFKK GRFKVERQVY QKFETMLINK LNYLVFKDIS ITENGGLLKG YQLTYIPEKL KNVGHQCGCI FYVPAAYTSK IDPTTGFANI FKFKDLTVDA KREFIKKFDS IRYDSEKNLF CFTFDYNNFI TQNTVMSKSS WSVYTYGVRI KRRFVNGRFS NESDTIDITK DMEKTLEMTD INWRDGHDLR QDIIDYEIVQ HIFEIFKLTV QMRNSLSELE DRDYDRLISP VLNENNIFYD SAKAGDALPK DADANGAYCI ALKGLYEIKQ ITENWKEDGK FSRDKLKISN KDWFDFIQNK RYL WP_055272206.1 MNNGTNNFQN FIGISSLQKT LRNALTPTET TQQFIVKNGI IKEDELRGEN(SEQ IDRQILKDIMDD YYRGFISETL SSIDDIDWTS LFEKMEIQLK NGDNKDTLIK NO: 173) Eubacterium rectale EQAEKRKAIY KKFADDDRFK NMFSAKLISD ILPEFVIHNN NYSASEKEEK TQVIKLFSRF ATSFKDYFKN RANCFSADDI SSSSCHRIVN DNAEIFFSNA LVYRRIVKNL SNDDINKISG DMKDSLKKMS LEKIYSYEKY GEFITQEGIS FYNDICGKVN SFMNLYCQKN KENKNLYKLR KLHKQILCIA DTSYEVPYKF ESDEEVYQSV NGFLDNISSK HIVERLRKIG DNYNGYNLDK IYIVSKFYES VSQKTYRDWE TINTALEIHY NNILPGNGKS KADKVKKAVK NDLQKSITEI NELVSNYKLC PDDNIKAETY IHEISHILNN FEAQELKYNP EIHLVESELK ASELKNVLDV IMNAFHWCSV FMTEELVDKD NNFYAELEEI YDEIYPVISL YNLVRNYVTQ KPYSTKKIKL NFGIPTLADG WSKSKEYSNN AIILMRDNLY YLGIFNAKNK PEKKIIEGNT SENKGDYKKM IYNLLPGPNK MIPKVFLSSK TGVETYKPSA YILEGYKQNK HLKSSKDFDI TFCRDLIDYF KNCIAIHPEW KNFGFDFSDT STYEDISGFY REVELQGYKI DWTYISEKDI DLLQEKGQLY LFQIYNKDFS KKSTGNDNLH TMYLKNLFSE ENLKDVVLKL NGEAEIFFRK SSIKNPIIHK KGSILVNRTY EAEEKDQFGN IQIVRKTIPE NIYQELYKYF NDKSDKELSD EAAKLKNAVG HHEAATNIVK DYRYTYDKYF LHMPITINFK ANKTSFINDR ILQYIAKEKD LHVIGIDRGE RNLIYVSVID TCGNIVEQKS FNIVNGYDYQ IKLKQQEGAR QIARKEWKEI GKIKEIKEGY LSLVIHEISK MVIKYNAIIA MEDLSYGFKK GRFKVERQVY QKFETMLINK LNYLVFKDIS ITENGGLLKG YQLTYIPEKL KNVGHQCGCI FYVPAAYTSK IDPTTGFVNI FKFKDLTVDA KREFIKKFDS IRYDSDKNLF CFTFDYNNFI TQNTVMSKSS WSVYTYGVRI KRRFVNGRFS NESDTIDITK DMEKTLEMTD INWRDGHDLR QDIIDYEIVQ HIFEIFKLTV QMRNSLSELE DRNYDRLISP VLNENNIFYD SAKAGDALPK DADANGAYCI ALKGLYEIKQ ITENWKEDGK FSRDKLKISN KDWFDFIQNK RYLTable 5 - Cas12a orthologsOLA16049.1 MNNGTNNFQN FIGISSLQKT LRNALIPTET TQQFIVKNGI IKEDELRGKN(SEQ IDRQILKDIMDD YYRGFISETL SSIDDIDWTS LFEKMEIQLK NGDNKDTLIK NO: 174) Eubacterium sp. EQAEKRKAIY KKFADDDRFK NMFSAKLISD ILPEFVIHNN NYSASEKKEK 41_20 TQVIKLFSRF ATSFKDYFKN RANCFSADDI SSSSCHRIVN DNAEIFFSNA LVYRRIVKNL SNDDINKISG DMKDSLKEMS LEEIYSYEKY GEFITQEGIS FYNDICGKVN SFMNLYCQKN KENKNLYKLR KLHKQILCIA DTSYEVPYKF ESDEEVYQSV NGFLDNISSK HIVERLRKIG DNYNDYNLDK IYIVSKFYES VSQKTYRDWE TINTALEIHY NNILPGNGKS KADKVKKAVK NDLQKSITEI NELVSNYKLC SDDNIKAETY IHEISHILNN FEAHELKYNP EIHLVESELK ASELKNVLDI IMNAFHWCSV FMTEELVDKD NNFYAELEEI YDEIYPVISL YNLVRNYVTQ KPYSTKKIKL NFGIPTLADG WSKSKEYSNN AIILMRDNLY YLGIFNAKNK PDKKIIEGNT SENKGDYKKM IYNLLPGPNK MIPKVFLSSK TGVETYKPSA YILEGYKQNK HLKSSKDFDI TFCHDLIDYF KNCIAIHPEW KNFGFDFSDT SAYEDISGFY REVELQGYKI DWTYISEKDI DLLQEKGQLY LFQIYNKDFS KKSTGNDNLH TMYLKNLFSE ENLKDIVLKL NGEAEIFFRK SSIKNPIIHK KGSILVNRTY EAEEKDQFGN IQIVRKTIPE NIYQELYKYF NDKSDKELSD EAAKLKNVVG HHEAATNIVK DYRYTYDKYF LHMPITINFK ANKTSFINDR ILQYIAKEKD LHVIGIDRGE RNLIYVSVID TCGNIVEQKS FNIVNGYDYQ IKLKQQEGAR QIARKEWKEI GKIKEIKEGY LSLVIHEISK MVIKYNAIIA MEDLSYGFKK GRFKVERQVY QKFETMLINK LNYLVFKDIS ITENGGLLKG YQLTYIPDKL KNVGHQCGCI FYVPAAYTSK IDPTTGFVNI FKFKDLTVDA KREFIKKFDS IRYDSEKNLF CFTFDYNNFI TQNTVMSKSS WSVYTYGVRI KRRFVNGRFS NESDTIDITK DMEKTLEMTD INWRDGHDLR QDIIDYEIVQ HIFEIFKLTV QMRNSLSELE DRDYDRLISP VLNENNIFYD SAKAGYALPK DADANGAYCI ALKGLYEIKQ ITENWKEDGK FSRDKLKISN KDWFDFIQNK RYL Table 6. Table 6 - Cas12b (C2c1) orthologsAlicyclobacillus MVAVKSIKVK LMLGHLPEIR EGLWHLHEAV NLGVRYYTEW LALLRQGNLY(SEQ IDmacrosporangiidus RRGKDGAQEC YMTAEQCRQE LLVRLRDRQK RNGHTGDPGT DEELLGVARR NO: 175) strain DSM 17980 LYELLVPQSV GKKGQAQMLA SGFLSPLADP KSEGGKGTSK SGRKPAWMGM KEAGDSRWVE AKARYEANKA KDPTKQVIAS LEMYGLRPLF DVFTETYKTI WP_074948407.1 RWMPLGKHQG VRAWDRDMFQ QSLERLMSWE SWNERVGAEF ARLVDRRDRF REKHFTGQEH LVALAQRLEQ EMKEASPGFE SKSSQAHRIT KRALRGADGI IDDWLKLSEG EPVDRFDEIL RKRQAQNPRR FGSHDLFLKL AEPVFQPLWR EDPSFLSRWA SYNEVLNKLE DAKQFATFTL PSPCSNPVWA RFENAEGTNI FKYDFLFDHF GKGRHGVRFQ RMIVMRDGVP TEVEGIVVPI APSRQLDALA PNDAASPIDV FVGDPAAPGA FRGQFGGAKI QYRRSALVRK GRREEKAYLC GFRLPSQRRT GTPADDAGEV FLNLSLRVES QSEQAGRRNP PYAAVFHISD QTRRVIVRYG EIERYLAEHP DTGIPGSRGL TSGLRVMSVD LGLRTSAAIS VFRVAHRDEL TPDAHGRQPF FFPIHGMDHL VALHERSHLI RLPGETESKK VRSIREQRLD RLNRLRSQMA SLRLLVRTGV LDEQKRDRNW ERLQSSMERG GERMPSDWWD LFQAQVRYLA QHRDASGEAW GRMVQAAVRT LWRQLAKQVR DWRKEVRRNA DKVKIRGIAR DVPGGHSLAQ LDYLERQYRF LRSWSAFSVQ AGQVVRAERD SRFAVALREH IDNGKKDRLK KLADRILMEA LGYVYVTDGR RAGQWQAVYP PCQLVLLEEL SEYRFSNDRP PSENSQLMVW SHRGVLEELI HQAQVHDVLV GTIPAAFSSR FDARTGAPGI RCRRVPSIPL KDAPSIPIWL SHYLKQTERD AAALRPGELI PTGDGEFLVT PAGRGASGVR VVHADINAAH NLQRRLWENF DLSDIRVRCD RREGKDGTVV LIPRLTNQRV KERYSGVIFTTable 6 - Cas12b (C2c1) orthologsSEDGVSFTVG DAKTRRRSSA SQGEGDDLSD EEQELLAEAD DARERSVVLF RDPSGFVNGG RWTAQRAFWG MVHNRIETLL AERFSVSGAA EKVRG Bacillus hisashii MATRSFILKI EPNEEVKKGL WKTHEVLNHG IAYYMNILKL IRQEAIYEHH(SEQ IDstrain C4 EQDPKNPKKV SKAEIQAELW DFVLKMQKCN SFTHEVDKDE VFNILRELYE NO: 176) ELVPSSVEKK GEANQLSNKF LYPLVDPNSQ SGKGTASSGR KPRWYNLKIA WP_095142515.1 GDPSWEEEKK KWEEDKKKDP LAKILGKLAE YGLIPLFIPY TDSNEPIVKE IKWMEKSRNQ SVRRLDKDMF IQALERFLSW ESWNLKVKEE YEKVEKEYKT LEERIKEDIQ ALKALEQYEK ERQEQLLRDT LNTNEYRLSK RGLRGWREII QKWLKMDENE PSEKYLEVFK DYQRKHPREA GDYSVYEFLS KKENHFIWRN HPEYPYLYAT FCEIDKKKKD AKQQATFTLA DPINHPLWVR FEERSGSNLN KYRILTEQLH TEKLKKKLTV QLDRLIYPTE SGGWEEKGKV DIVLLPSRQF YNQIFLDIEE KGKHAFTYKD ESIKFPLKGT LGGARVQFDR DHLRRYPHKV ESGNVGRIYF NMTVNIEPTE SPVSKSLKIH RDDFPKVVNF KPKELTEWIK DSKGKKLKSG IESLEIGLRV MSIDLGQRQA AAASIFEVVD QKPDIEGKLF FPIKGTELYA VHRASFNIKL PGETLVKSRE VLRKAREDNL KLMNQKLNFL RNVLHFQQFE DITEREKRVT KWISRQENSD VPLVYQDELI QIRELMYKPY KDWVAFLKQL HKRLEVEIGK EVKHWRKSLS DGRKGLYGIS LKNIDEIDRT RKFLLRWSLR PTEPGEVRRL EPGQRFAIDQ LNHLNALKED RLKKMANTII MHALGYCYDV RKKKWQAKNP ACQIILFEDL SNYNPYEERS RFENSKLMKW SRREIPRQVA LQGEIYGLQV GEVGAQFSSR FHAKTGSPGI RCSVVTKEKL QDNRFFKNLQ REGRLTLDKI AVLKEGDLYP DKGGEKFISL SKDRKCVTTH ADINAAQNLQ KRFWTRTHGF YKVYCKAYQV DGQTVYIPES KDQKQKIIEE FGEGYFILKD GVYEWVNAGK LKIKKGSSKQ SSSELVDSDI LKDSFDLASE LKGEKLMLYR DPSGNVFPSD KWMAAGVFFG KLERILISKL TNQYSISTIE DDSSKQSM Candidatus MPRDDLDLLT NLNSTAKGIR ERGKTKEGTD KKKSGRKSSW PMDKAAWETA(SEQ IDLindowbacteria KTSDSSAHFL EKLKQHPDLK DAFGNLSSGG SKKLEYYKKL AGSAPWKESQ NO: 177) bacterium SVILEKAARW KEAKQEREEK EQDSSEHGSK AAYRRLFDAG CLPMPEFAKY RIFCSPLOWO2 IDENQIEFGD LKLSDCGAEW KRGMWNQAGQ RVRSHMGWQR RREKENAVYS LRKELFEKGG AIRRKKSEEL TPEDILPGKA APDQNDWQER PAYGNQMWFI OGH55994.1 GLRSYEENEM AKYAEEAGMG SRSAPRIRRG TIKGWSKLRE RWLQILKRNP QATRDDLIGE LNALRSQDPR AYGDARLFDW LSKTDQRFLW DGFDADGKIL CGRDDRDCVS AFVAYNEEFA DEPSSITLTE TDERLHPVWP FFGESSAVPY EIEYDLETAC PTAIRLPLLV GKENGGYAER QGTRLPLAEY ADLASSFQLP TPVRLDVLVE IREVTRAGRK VTCPFSYFKQ NGVWYVREGE IPSGESIQIK QTDRKIENGK IFISSKLRMA YRDDLMVSPA TGDFGSIKIL WERIELASHV DQKKLPETAP ARSRVFVSFS CNVVERAPRK QLTRKPDAVV VTIPSGVDQG LVVVSTDVRT GKSKSSSAPP LPPGSRLWPA DAVHGDPPLR ILSVDLGHRH SAYAVWELGL QQKSWRAGVL KGSTQTPVYA DCTGTGLLCL PGDGEDTPAE EESLRLRSRQ IRRRLNLQNS ILRVSRLLSL DKFEKTIFEQ SDVRDRPNKK GLRIRRRCRT EKTPLSEAEV RKNCDKAAEI LIRWADTDAM AKSLAATGNA DISFWKYMAV KNPPLSAVVD VAPSTIVPDD GPDRETLKKK RQEEEEKFAS SIYENRVKLA GALCSGYDAD HRRPATGGLW HDLDRTLIRE ISYGDRGQKG NPRKLNNEGI LRLLRRPPRA RPDWREFHRT LNDANRIPKG RTLRGGLSMG RLNFLKEVGD FVKKWSCRPR WPGDRRHIPP GQLFDRQDAE HLEHLRDDRI KRLAHLIVAQ ALGFEPDIRR GLWKYVDGST GEILWQHPET RRFFAEGAAG ELREVSRPAE IDDDAAARPH TVSAPAHIVV FENLIRYRFQ SDRPKTENAG LMQWAHRQIV HFTKQVASLY GLKVAMVYAA FSSKFCSRCG SPGARVSRFD PAWRNQEWFK RRTSNPRSKV DHSLKRASED PTADETRPWV LIEGGKEFVC ANAKCSAHDE PLNADENAAA NIGLRFLRGV EDFRTKVNPA GALKGKLRFE TGIHSFRPPV SGSPFWSPMA EPAQKKKIGA AAPGADVDEA GDADESGVVV LFRDPSGAFR NKQYWYEGKI FWSNVMMAVE AKIAGASVGA KPVAASWGQA QPQSGPGLAK PGGDTable 6 - Cas12b (C2c1) orthologsElusimicrobia MNRIYQGRVT KVEVPDGKDE KGNIKWKKLE NWSDILWQHH MLFQDAVNYY(SEQ IDbacterium TLALAAISGS AVGSDEKSII LREWAVQVQN IWEKAKKKAT VFEGPQKRLT NO: 178) RIFOXYA12 SILGLEQNAS FDIAAKHILR TSEAKPEQRA SALIRLLEEI DKKNHNVVCG ERLPFFCPRN IQSKRSPTSK AVSSVQEQKR QEEVRRFHNM QPEEVVKNAV OGS02326.1 TLDISLFKSS PKIVFLEDPK KARAELLKQF DNACKKHKEL VGIKKAFTES IDKHGSSLKV PAPGSKPSGL YPSAIVFKYF PVDITKTVFL KATEKLAMGK DREVTNDPIA DARVNDKPHF DYFTNIALIR EKEKNRAAWF EFDLAAFIEA IMSPHRFYQD TQKRKEAARK LEEKIKAIEG KGGQFKESDS EDDDVDSLPG FEGDTRIDLL RKLVTDTLGW LGESETPDNN EGKKTEYSIS ERTLRIFPDI QKQWSELAEK GETTEGKLLE VLKHEQTEHQ SDFGSATLYQ HLAKPEFHPI WLKSGTEEWH AENPLKAWLN YKELQYELTD KKRPIHFTPA HPVYSPRYFD FPKKSETEEK EVSKNTHSLT TSLASEHIKN SLQFTAGLIR KTNVGKKAIK ARFSYSAPRL RRDCLRSENN ENLYKAPWLQ PMMRALGIDE EKADRQNFAN TRITLMAKGL DDIQLGFPVE ANSQELQKEV SNGISWKGQF NWGGIASLSA LRWPHEKKPK NPPEQPWWGI DSFSCLAVDL GQRYAGAFAR LDVSTIEKKG KSRFIGEACD KKWYAKVSRM GLLRLPGEDV KVWRDASKID KENGFAFRKE LFGEKGRSAT PLEAEETAEL IKLFGANEKD VMPDNWSKEL SFPEQNDKLL IVARRAQAAV SRLHRWAWFF DEAKRSDDAI REILESDDTD LKQKVNKNEI EKVKETIISL LKVKQELLPT LLTRLANRVL PLRGRSWEWK KHHQKNDGFI LDQTGKAMPN VLIRGQRGLS MDRIEQITEL RKRFQALNQS LRRQIGKKAP AKRDDSIPDC CPDLLEKLDH MKEQRVNQTA HMILAEALGL KLAEPPKDKK ELNETCDMHG AYAKVDNPVS FIVIEDLSRY RSSQGRSPRE NSRLMKWCHR AVRDKLKEMC EVFFPLCERR KAGSAWVSLP PLLETPAAYS SRFCSRSGVA GFRAVEVIPG FELKYPWSWL KDKKDKAGNL AKEALNIRTV SEQLKAFNQD KPEKPRTLLV PIAGGPIFVP ISEVGLSSFG LKPQVVQADI NAAINLGLRA ISDPRIWEIH PRLRTEKRDG RLFAREKRKY GEEKVEVQPS KNEKAKKVKD DRKPNYFADF SGKVDWGFGN IKNESGLTLV SGKALWWTIN QLQWERCFDI NKRHIEDWSN KQKQ Omnitrophica MNRIYQGRVT KVEKLKNGKS PDDREELKDW QTALWRHHEL FQDAVSYYTL(SEQ IDWOR_2 bacterium ALAAMAEGLP DKHPINVLRK RMEEAWEEFP RKTVTPAKNL RDSVRPWLGL NO: 179) RIFCSPHIGHO2 SESASFGDAL KKILPPAPEN KEVRALAVAL LAEKARTLKP QKTSASYWGR FCDDLKKKPN WDYSEEELAR KTGSGDWVAG LWSEDALNKI DELAKSLKLS OGX36711.1 SLVKCVPDGQ INPEGARNLV KEALDHLEGV SNGTKKEKND PGPAKKTNNW LRQHASDVRN FIHKNKNQFS SLPNGRLITE RARGGGININ KTYAGVLFKA FPCPFTFDYV RAAVPEPKVK KVDQEKKSEQ SATWTELEKR ILRIGDDPIE LARKNNKPIF KAFTALEKWS DQNSKSCWSD FDKCAFEEAL KTLNQFNQKT EEREKRRSEA EAELKYMMDE NPEWKPKKET EGDDVREVPI LKGDPRYEKL VKLFGDLDEE GSEHATGKIY GPSRASLRGF GKLRNEWVDL FTKANDNPRE QDLQKAVTGF QREHKLDMGY TAFFLKLCER DYWDIWRDDT EVEVKKIREK RWVKSVVYAA ADTRELAEEL ERLQEPVRYT PAEPQFSRRL FMFSDIKGKQ GAKHIREGLV EVSLAVKDQS GKYGTCRVRL HYSAPRLIRD HLSDGSSSMW LQPMMAALGL SSDARGCFTR DSKGNVKEPA VALMSDFVGR KRELRMLLNF PVDLDISKLE ENIGKKARWE KQMNTAYEKN KLKQRFHLIW PGMELKETQE PGQFWWDNPT IQKEGMYCLA IDLSQRRAAD YALLHAGVNR DSKTFVELGQ AGGQSWFTKL CAAGSLRLPG EDTEVIREGK RQIELSGKKG RNATQSEYDQ AIALAKQLLH NENSAELESA ARDWLGDNAK RFSFPEQNDK LIDLYYGALS RYKTWLRWSW RLTEQHKELW DKTLDEIRKV PYFASWGELA GNGTNEATVQ QLQKLIADAA VDLRNFLEKA LLHIAYRALP LRENTWRWIE NGKDGKGKPL HLLVSDGQSP AEIPWLRGQR GLSIARIEQL ENFRRAVLSL NRLLRHEIGT KPEFGSSTCG ESLPDPCPDL TDKIVRLKEE RVNQTAHLII AQSLGVRLKG HSLFTEEREK ADMHGEHEVI PGRSPVDFVV LEDLSRYTTD KSRSRSENSR LMKWCHRKIN EKVKLLAEPF GIPVIEVFAS YSSKFDARTG APGFRAVEVT SEDRPFWRKT IEKQSVAREV FDCLDNLVGK GLNGIHLVLP QNGGPLFIAA VKEDQPLPAI RQADINAAVN IGLRAIAGPS CYHAHPKVRL IKGESGTDKGTable 6 - Cas12b (C2c1) orthologsKWLPRKGKEA NKRENAQFGN VDLDLEVKFN RLDIDSDVLK GDNTNLFHDP LNIACYGFAT IQNLQHPFLA HASAVFSRQK GAVARLQWEV CRAINSRRLE AWQKKAEKAA VKR Phycisphaerae MATKSYRARI LTDSRLAAAL DRTHVVFVES LKQMINTYLR MQNGKFGPDH(SEQ IDbacterium ST- KKLAQIMLSR SNTFAHGVMD QITRDQPTST LDEEWTDLAR RIHKTTGPLF NO: 180) NAGAB-D1 LQAERFATVK NRAIHTKSRG KVIPSPETLA VPAKFWHQVC DSASAYIRSN (transposase) RELMQQWRKD RAAWLKDKNE WQQKHPEFMQ FYNGPYQNFL KLCDDDRITS QLAAEQQPTA SKNNRPRKTG KRFARWHLWY KWLSENPEII EWRNKASASD AQT69685.1 FKTVTDDVRK QIITKYPQQN KYITRLLDWL EDNNPELKTL ENLRRTYVKK FDSFKRPPTL TLPSPYRHPY WFT...

Claims

WHAT IS CLAIMED IS:

1. A nucleic acid construct, comprising: a polynucleotide encoding an integrationenzyme, wherein the polynucleotide comprises an intron, whereby the intron prevents the expression of the integration enzyme in prokaryotic cells.

2. The nucleic acid construct of claim 1, further comprising a first expression controlsequence, wherein the first expression control sequence is operably linked to the polynucleotide encoding the integration enzyme.

3. The nucleic acid construct of claim 2, wherein the expression control sequence is aregulatable expression control sequence.

4. The nucleic acid construct of claim 3, wherein the regulatable expression controlsequence is a Tet-off expression control sequence or a Tet-on expression control sequence.

5. The nucleic acid construct of any one of claims 1 to 4, wherein the integration enzymeis selected from: BxB1, Bcec, Sscd, Sacd, Int10, and Pa01.

6. The nucleic acid construct of any one of claims 1 to 5, further comprising:(a) a polynucleotide encoding a gene editor polypeptide; (b) a polynucleotide encoding a first attachment site-containing guide RNA (atgRNA), wherein the first atgRNA comprises a sequence encoding at least a portion of a first integration recognition site recognizable by the encoded integration enzyme; and (c) a polynucleotide encoding a second atgRNA, wherein the second atgRNA comprises a sequence encoding at least a portion of the first integration recognition site.

7. The nucleic acid construct of claim 6, further comprising a second expression controlsequence, wherein the second expression control sequence is operably linked to the polynucleotide encoding the gene editor.

8. The nucleic acid construct of claim 7, wherein the second expression control sequenceis a constitutive expression control sequence.

9. The nucleic acid construct of any one of claims 6 to 8, wherein the gene editorpolypeptide comprises a nickase and a reverse transcriptase (RT).

10. The nucleic acid construct of claim 9, wherein the nickase and the reversetranscriptase are expressed as a fusion protein.

11. The nucleic acid construct of claim 10, wherein the nickase is linked to the reversetranscriptase by in-frame fusion.

12. The nucleic acid construct of claim 10, wherein the nickase is linked to the reversetranscriptase by a linker.

13. The nucleic acid construct of claim 12, wherein the linker is a peptide fused in-framebetween the nickase and reverse transcriptase.

14. The nucleic acid construct of any one of claims 6 to 13, wherein the first atgRNA andthe second atgRNA are operably linked to one or more additional expression control sequences.

15. The nucleic acid construct of claim 14, wherein the one or more additional expressioncontrol sequences operably linked to the sequences encoding the atgRNAs are U6 promoters.

16. The nucleic acid construct of any one of claims 6 to 15, wherein the first atgRNA andthe second atgRNA have an overlap of 20 bp or less at the sequence encoding at least aportion of the first integration recognition site.

17. The nucleic acid construct of any one of claims 6 to 16, wherein the first atgRNA andthe second atgRNA are symmetrical.

18. The nucleic acid construct of any one of claims 6 to 16, wherein the first atgRNA andthe second atgRNA are asymmetrical.

19. The nucleic acid construct of any one of claims 6 to 18, wherein the first atgRNA andthe second atgRNA are an at least first pair of atgRNA, whereinthe at least first pair of atgRNA have domains that are capable of guiding the gene editor to a target sequence; the first atgRNA further includes a first RT template that comprises at least a portion of the first integration recognition site; the second atgRNA further includes a second RT template that comprises at least a portion of the first integration recognition site; and the first atgRNA and the second atgRNA collectively encode the entirety of the first integration recognition site.

20. The nucleic acid construct of any one of claims 6 to 19, wherein the first integrationrecognition site is selected from attB, attB2, attP, and attP2.

21. The nucleic acid construct of any one of claims 1 to 20, further comprising a cargopolynucleotide linked to a polynucleotide encoding a second integration recognition site recognized by the encoded integrase, wherein the second integration recognition site is a cognate of the first integration recognition site.

22. The nucleic acid construct of claim 21, wherein the cargo polynucleotide is flanked bythe two integration recognition sites.

23. The nucleic acid construct of claim 21 or 22, wherein the cargo is a therapeutic agent.

24. The nucleic acid construct of claim 23, wherein the therapeutic agent is selected froma gene, a gene fragment, or encodes a nucleic acid-based therapeutic.

25. A nucleic acid construct, comprising:(a) a polynucleotide encoding a gene editor polypeptide; (b) a polynucleotide encoding a first attachment site-containing guide RNA (atgRNA), wherein the first atgRNA comprises a sequence encoding at least a portion of a first integration recognition site recognizable by the encoded integration enzyme; (c) a polynucleotide encoding a second atgRNA, wherein the second atgRNA comprises a sequence encoding at least a portion of the first integration recognition site;(d) a polynucleotide encoding an integration enzyme, wherein the polynucleotide comprises an intron; and (e) a cargo polynucleotide linked to a polynucleotide encoding a second integration recognition site, wherein the second integration recognition site is a cognate of the first integration recognition site.

26. The nucleic acid construct of claim 25, wherein the first atgRNA and the secondatgRNA have an overlap of 20 bp or less.

27. The nucleic acid construct of claim 25 or 26, wherein the first atgRNA and the secondatgRNA are symmetrical.

28. The nucleic acid construct of claim 25 or 26, wherein the first atgRNA and the secondatgRNA are asymmetrical.

29. A nucleic acid construct, comprising:(a) a polynucleotide encoding a gene editor polypeptide; (b) a polynucleotide encoding a first attachment site-containing guide RNA (atgRNA), wherein the first atgRNA comprises a sequence encoding at least a portion of a first integration recognition site; (c) a polynucleotide encoding a second atgRNA, wherein the second atgRNA comprises a sequence encoding at least a portion of the first integration recognition site; and (d) a cargo polynucleotide linked to a polynucleotide encoding a second integration recognition site, wherein the second integration recognition site is a cognate pair of the first integration recognition site; and wherein the first atgRNA and the second atgRNA have an overlap of 20 bp or less.

30. The nucleic acid construct of claim 29, wherein the first atgRNA and the secondatgRNA are symmetrical.

31. The nucleic acid construct of claim 29, wherein the first atgRNA and the secondatgRNA are asymmetrical.

32. A nucleic acid construct, comprising:(a) a polynucleotide encoding a gene editor polypeptide; (b) a polynucleotide encoding a first attachment site-containing guide RNA (atgRNA), wherein the first atgRNA comprises a sequence encoding at least a portion of a first integration recognition site; and (c) a polynucleotide encoding a second atgRNA, wherein the second atgRNA comprises a sequence encoding at least a portion of the first integration recognition site; wherein the first atgRNA and the second atgRNA have an overlap of 20 bp or less.

33. The nucleic acid construct of claim 32, wherein the first atgRNA and the secondatgRNA are symmetrical.

34. The nucleic acid construct of claim 32, wherein the first atgRNA and the secondatgRNA are asymmetrical.

35. The nucleic acid construct of any one of claims 1 to 34, wherein the nucleic acidconstruct is part of a recombinant viral genome.

36. The nucleic acid construct of claim 35, wherein the viral construct is an adenoviralconstruct.

37. The nucleic acid construct of claim 36, wherein the adenoviral construct is a helper-dependent adenoviral (HDAd) construct.

38. The nucleic acid construct of claim 37, further comprising a stuffer sequence.

39. The nucleic acid construct of claim 38, wherein the stuffer sequence has a length ofabout 500 nucleotides to about 10,000 nucleotides.

40. The nucleic acid construct of claim 38 or 39, wherein the length of the stuffersequence is selected such that the HDAd construct is about 30,000 to 35,000 nucleotides in length.

41. The nucleic acid construct of any one of claims 35 to 40, further comprising apackaging signal (Ψ).

42. The nucleic acid construct of claim 41, wherein the packaging signal (Ψ) is selectedfrom an adenovirus 2 packaging single (Ad2 Ψ) and an adenovirus 5 packaging signal (Ψ) (Ad5 Ψ).

43. A helper-dependent adenovirus (HDAd) virion, comprising: a HDAd genomecomprising the nucleic acid construct of any one of claims 37 to 42.

44. A cell comprising the nucleic acid construct of any one of claims 1 to 42 or the HDAdvirion of claim 43.

45. A method of making a helper-dependent adenovirus (HDAd) virion, comprising:(a) introducing into a cell line suitable for making HDAd: (i) the nucleic acid construct of any one of claims 37 to 42 or the HDAd virion of claim 43 and (ii) ahelper virus (HV); (b) culturing the cell line under conditions suitable for encapsidating the HDAd genome into the HDAd virion capsid; (c) collecting the HDAd; and (d) purifying the HDAd, wherein the HDAd genome is not recombined in the HDAd virion.

46. The method of claim 45, wherein the cell line suitable for making HDAd is selectedfrom: HEK293, 911, AE1-2A, and LP-293.

47. The method of claim 45 or 46, wherein the cell line suitable for making HDAd isengineered to prevent the expression of the integration enzyme or to inactivate the integration enzyme.

48. The method of claim 47, wherein the cell line suitable for making HDAd isengineered to express an shRNA that inhibits the expression of the integration enzyme.

49. The method of claim 48, wherein the cell line suitable for making HDAd isengineered to express a BxB1 shRNA.

50. The method of claim 47, wherein the cell line suitable for making HDAd isengineered to express an antibody specific to the integration enzyme.

51. The method of claim 50, wherein the cell line suitable for making HDAd isengineered to express an anti-BxB1 antibody.

52. The method of claim 51, wherein the anti-BxB1 antibody is a VHH single domainantibody (Nanobody®).

53. The method of any one of claims 45 to 52, wherein the introducing step comprisestwo or more rounds of introducing (i) and (ii).

54. The method of any one of claims 45 to 53, wherein the HV comprises a variantpackaging signal (Ψ).

55. The method of claim 54, wherein the variant packaging signal (Ψ) is selected from avariant adenovirus 2 packaging single (Ad2 Ψ) and a variant adenovirus 5 packaging signal (Ad5 Ψ).

56. The method of any one of claims 45 to 55, wherein the culturing step comprisesculturing the cell line in the presence of an agent that inhibits the first expression control sequence, thereby preventing the expression of the integration enzyme.

57. The method of any one of claims 45 to 55, wherein the culturing step comprisesculturing the cell line in the absence of an agent that activates the first expression control sequence, thereby preventing the expression of the integration enzyme.

58. The method of claim 56 or 57, wherein the agent is tetracycline or a tetracycline-derivative.

59. The method of claim 58, wherein the tetracycline-derivative is doxycycline.

60. The method of any one of claims 45 to 59, wherein the purifying step comprisespurifying the HDAd from the HV.

61. An HDAd virion made using the methods of any one of claims 45 to 60.

62. An engineered cell line suitable for making HDAd, wherein the cell line is engineeredto prevent the expression of an integration enzyme or to inactivate an integration enzyme.

63. The engineered cell line of claim 62, wherein the cell line is engineered to express anshRNA that inhibits the expression of the integration enzyme.

64. The engineered cell line of claim 63, wherein the cell line is engineered to express aBxB1 shRNA.

65. The engineered cell line of claim 62, wherein the cell line is engineered to express anantibody specific to the integration enzyme.

66. The engineered cell line of claim 65, wherein the cell line is engineered to express afirst anti-BxB1 antibody.

67. The engineered cell line of claim 66, wherein the first anti-BxB1 antibody is a VHHsingle domain antibody (Nanobody®).

68. The engineered cell line of claim 66 or 67, wherein the cell line is engineered toexpress a second anti-BxB1 antibody.

69. The engineered cell line of claim 68, wherein the second anti-BxB1 antibody is aNanobody®.

70. A method for site-specifically integrating an exogenous nucleic acid into a genome ofa cell at a target sequence, the method comprising: (a) introducing into the cell a nucleic acid construct of any one of claims 1 to 42 or theHDAd virion of claim 43 or 61; and(b) culturing the cell under conditions sufficient to activate the first expression control sequence, thereby driving expression of the integration enzyme.

71. The method of claim 70, wherein (b) comprises culturing the cell in the presence of anagent that activates the first expression control sequence, thereby allowing expression of the integration enzyme.

72. The method of claim 70, wherein (b) comprises culturing the cell in the absence of anagent that inhibits the first expression control sequence, thereby allowing expression of the integration enzyme.

73. An in vivo method for site-specifically integrating an exogenous nucleic acid into acellular genome at a target sequence, the method comprising: administering to a subject theHDAd virion of claim 43 or 61 and an agent,wherein the agent activates the first expression control sequence, thereby allowing expression of the integration enzyme.

74. An in vivo method for site-specifically integrating an exogenous nucleic acid into acellular genome at a target sequence, the method comprising: administering to a subject theHDAd virion of claim 43 or 61 in the absence of an agent,wherein the agent inhibits the first expression control sequence, thereby allowing expression of the integration enzyme.

Citation Information

Patent Citations

  • Systems, methods, and compositions for site-specific genetic engineering using programmable addition via site-specific targeting elements (PASTE)

    WO2022087235A1

  • Single construct platform for simultaneous delivery of gene editing machinery and nucleic acid cargo

    WO2023077148A1