Back

RealSeq2: a software integrated with UMI identification, error correction, and methylation modifications storing

Wang, K.; Song, M.; Li, M.; Cui, T.; Liu, Z.; Yu, E.; Fang, H.; Gao, X.; Xia, X.; Wang, J.; Guan, Y.; Liu, T.; Yi, X.

2023-05-18 bioinformatics
10.1101/2023.05.16.539668 bioRxiv
Show abstract

High-throughput UMI technology sequencing is widely used in early tumor screening, detection, recurrence monitoring, etc. Detecting extremely low-frequency mutations is especially important for monitoring tumor recurrence, so high-precision data, as well as high-quality data, are required. We developed RealSeq2, a new integrated data-preprocessing software based on fastp and gencore, to achieve adapter removal, quality control, UMI identification, and generate consensus reads by clustering and error correction using multithreading in high-throughput next-generation sequencing background. RealSeq2 also supports methylation data of 5-methylcytosine bisulfite-free sequencing. RealSeq2 defined a new tag in SAM for storing methylation information, which is beneficial for co-identifying methylation sites and mutation sites for downstream analysis. RealSeq2 includes three submodules: ReadsProfiler, ReadsCleaner, and ReadsRecycler. In addition, the output format file (BAM or SAM) is universal for downstream analyses. RealSeq2 is the preferred upstream analysis software for the co-detection of ultra-low frequency mutations and bisulfite-free methylation data. The error profile provides data support for downstream analysis. Additionally, XM tags will become a standard protocol for recording methylation signals.

Matching journals

The top 5 journals account for 50% of the predicted probability mass.

1
BMC Bioinformatics
457 papers in training set
Top 0.1%
18.9%
2
Bioinformatics
1204 papers in training set
Top 2%
11.2%
3
Briefings in Bioinformatics
354 papers in training set
Top 0.8%
8.0%
4
PLOS ONE
5266 papers in training set
Top 23%
7.4%
5
BMC Genomics
406 papers in training set
Top 1%
4.9%
50% of probability mass above
6
PLOS Computational Biology
1863 papers in training set
Top 8%
4.1%
7
Journal of Bioinformatics and Systems Biology
15 papers in training set
Top 0.1%
3.3%
8
Gigabyte
62 papers in training set
Top 0.3%
3.3%
9
GigaScience
212 papers in training set
Top 1%
3.2%
10
Frontiers in Genetics
230 papers in training set
Top 1%
2.8%
11
PeerJ
308 papers in training set
Top 3%
2.4%
12
Scientific Reports
3612 papers in training set
Top 46%
2.2%
13
NAR Genomics and Bioinformatics
242 papers in training set
Top 2%
1.8%
14
Genomics, Proteomics & Bioinformatics
172 papers in training set
Top 1%
1.8%
15
Computational and Structural Biotechnology Journal
242 papers in training set
Top 3%
1.8%
16
F1000Research
88 papers in training set
Top 1%
1.8%
17
Genes
144 papers in training set
Top 2%
1.8%
18
Journal of Computational Biology
48 papers in training set
Top 0.7%
1.5%
19
Database
61 papers in training set
Top 0.5%
1.5%
20
Journal of Genetics and Genomics
38 papers in training set
Top 0.7%
0.9%
21
Nucleic Acids Research
1281 papers in training set
Top 13%
0.9%
22
Bioinformatics Advances
203 papers in training set
Top 5%
0.6%
23
Gene
46 papers in training set
Top 2%
0.6%
24
Genomics
64 papers in training set
Top 2%
0.6%
25
Computational Biology and Chemistry
28 papers in training set
Top 1%
0.6%
26
Computers in Biology and Medicine
128 papers in training set
Top 5%
0.6%
27
Informatics in Medicine Unlocked
22 papers in training set
Top 1%
0.6%