DNA Base Identification Quality Characterization

Resolve Bottlenecks,
Find Innovative Solutions
Generate Solutions

Solution Overview

Problem

Current DNA sequencing technologies face challenges in accurately predicting DNA base identifications due to limitations in equipment performance and chemistry, leading to variability in base calling accuracy across different sequencing experiments and even within experiments.

Innovation Solution

A method and system that utilize training data sets to define subsets, compare predicted DNA base identifications with actual ones, determine sampling characteristics, and calculate quality characterization for predicted base identifications, enhancing the accuracy of DNA base predictions by analyzing signal characteristics and assigning quality scores.

Engineering Contradictions & Design Principles

VSEngineering Contradiction Analysis

1Productivity

If automated DNA sequencers are used to process vast amounts of DNA sequence information, then productivity is improved, but measurement precision deteriorates due to equipment performance limitations and chemistry variations

Engineering Contradiction:
Improveprocessing speed of DNA sequencingVSAvoidaccuracy of base identification
Core Design Contradiction:
ProductivityVSMeasurement precision

Solution Approach 1:

The patent implements a feedback mechanism by comparing predicted base identifications with actual known base identifications from training data. Quality scores are calculated based on this comparison and sampling characteristics, then used to assess and improve the reliability of base calling predictions in real-time sequencing operations

Inventive Principle:
Principle #23Feedback

Solution Approach 2:

The patent changes parameters by dividing training data into multiple subsets with different sampling characteristics (e.g., different error rates, different base compositions). Quality scores are determined based on these varying parameters, allowing the system to adapt to different sequencing conditions and improve overall accuracy

Inventive Principle:
Principle #35Parameter changes

2Measurement precision

If base calling accuracy is improved through multiple comparisons and quality assessments, then measurement precision is improved, but device complexity increases

Engineering Contradiction:
Improveaccuracy of base identificationVSAvoidcomplexity of quality assessment system
Core Design Contradiction:
Measurement precisionVSDevice complexity

Solution Approach 1:

The patent segments the training data into multiple subsets, each characterized by different sampling characteristics. This segmentation allows for more precise quality assessment by comparing predictions against diverse reference sets, improving measurement precision while organizing complexity into manageable segments

Inventive Principle:
Principle #1Segmentation

Solution Approach 2:

The patent introduces quality scores as an intermediary metric that mediates between predicted base identifications and actual base identifications. This intermediary provides a quantitative measure of reliability that simplifies the overall assessment process while maintaining high measurement precision

Inventive Principle:
Principle #24Intermediary (Mediator)

Data Source

PatentUS8965711B2Method and system for determining the accuracy of DNA base identifications
Publication Date: 2015.02.24 ILLUMINA INC
  • US8965711B2 patent drawing
  • US8965711B2 patent drawing
  • US8965711B2 patent drawing

AI summary

A system for determining the quality of predicted DNA base identifications is disclosed, the system comprising a processor configured to receive a training data set, the training data set comprising a plurality of predicted DNA base identifications, define a group of subsets, compare the predicted DNA base identifications with actual DNA base identifications for training data within each subset of the group, determine a sampling characteristic for each subset of the group based on training data within the respective subset, and determine a quality characterization for predicted DNA base identifications within at least one of subset of the group based on the comparison and determined sampling characteristic, wherein the sampling characteristic comprises a confidence value comprising a binomial proportion confidence interval value.