Ở các phần trước, chúng ta đã đi từ tầm nhìn và kiến trúc đến nguyên tắc thiết kế, lộ trình triển khai, phân tích cohort, lưu trữ, và hành trình 2018 → 2026 của Việt Nam. Phần cuối này giữ mọi thứ ngắn gọn: tóm tắt nhanh cách xây dựng và vận hành chương trình, các hướng mở rộng và lộ trình tương lai, cùng những câu hỏi phía trước.
Tổng quan chuỗi bài
- Phần 1: Tầm nhìn và kiến trúc tổng thể
- Phần 2: Nguyên tắc thiết kế và lộ trình triển khai
- Phần 3: Gọi biến thể, phân tích cohort và tổ chức dữ liệu
- Phần 4: Hạ tầng, nhân lực và hỗ trợ của Chính phủ: 2018 → 2026
- Phần 5 (bài này): Tóm tắt, mở rộng và những câu hỏi phía trước
1. Tóm tắt: cách xây dựng và những gì tiếp theo
Stack kỹ thuật trong một dòng: gọi biến thể chuẩn hóa (Nextflow + nf-core) → joint genotyping song song theo vùng (GLnexus/DPGT) → phân tích cohort (Hail MatrixTable) → lưu trữ tương thích S3 ngay trong nước.
Con đường ngắn nhất từ số 0 đến 1.000 hệ gen:
- Giai đoạn 1 - Pilot (tháng 1-3): bắt đầu với 100-500 mẫu trên hạ tầng nhỏ gọn — 1 node đăng nhập SLURM + 4 node tính toán, ~50 TB S3, một instance Nextflow, cụm Hail 4 node và đội ngũ cốt lõi 2-3 FTE. Rà soát thủ công từng mẫu, thiết lập đường cơ sở QC và tài liệu hóa quy trình vận hành chuẩn.
- Giai đoạn 2 - Mở rộng lên 1k (tháng 4-12): vẫn kiến trúc đó, mở rộng lên 20-30 node tính toán, 50-100 TB S3 và cụm Hail 8-12 node. Ở quy mô 1k, joint genotyping bằng GLnexus không cần cụm Spark. Đầu ra: 1.000 mẫu đã QC, VCF cohort được chốt và đánh phiên bản, xuất PLINK/BGEN đã kiểm thử, QC và giám sát tự động, cùng cơ sở dữ liệu tần số allele công khai.
- Giai đoạn 3 - Vận hành và hỗ trợ nghiên cứu (năm 2+): đội ngũ bền vững 2-3 FTE hỗ trợ truy vấn GWAS, chẩn đoán bệnh hiếm, hợp tác phòng xét nghiệm lâm sàng và phản hồi cho người tham gia.
Nguồn lực cần thiết: năng lực tính toán trị giá khoảng 150-300 nghìn USD — một cụm HPC tại chỗ, hoặc lượng tương đương dùng dưới dạng dịch vụ cloud — cộng 55-95 nghìn USD/năm chi phí vận hành (thù lao đội ngũ theo thị trường lao động địa phương), hợp đồng lưu trú dữ liệu dài hạn với nhà cung cấp S3 trong nước và cơ chế quản trị truy cập dữ liệu rõ ràng.
Vì sao đáng làm: tần số allele đặc thù quần thể, chẩn đoán bệnh hiếm với bối cảnh cohort, GWAS mạnh hơn nhờ biến thể địa phương và y học chính xác may đo cho quốc gia của bạn.
Mở rộng & lộ trình tương lai (tùy chọn): khi chương trình cốt lõi thành công, đây là những bước đi tự nhiên tiếp theo:
- Đa omics (năm 2-4+): thêm proteomics, rồi transcriptomics, rồi metabolomics và hình ảnh để đi từ danh sách biến thể đến sinh học hệ thống — liên kết bệnh - biến thể - protein, bộ biomarker và y học chính xác.
- Liên kết EHR & kiểu hình (năm 2+): dữ liệu lâm sàng có cấu trúc, rồi kiểu hình hóa bằng NLP, rồi theo dõi kết cục — mở ra chẩn đoán bệnh hiếm và GWAS có ý nghĩa lâm sàng. Chi phí khoảng +100-200 nghìn USD vốn và +30-50 nghìn USD/năm.
- Cổng tra cứu tần số allele tương tác (~5-20 nghìn USD): cho phép nhà nghiên cứu toàn cầu tra cứu tần số trong quần thể của bạn và so sánh với gnomAD — nơi tần số địa phương thường thay đổi cách giải thích lâm sàng.
- Cohort con theo bệnh cụ thể: làm giàu các nhóm bệnh hiếm hoặc ung thư trong 1k mẫu để phát hiện biến thể với sức mạnh cao hơn; chi phí chủ yếu là vận hành qua hợp tác lâm sàng.
- Học máy & điểm nguy cơ đa gen (~20-50 nghìn USD): xây dựng PRS đặc thù quần thể, kiểm chứng trên cohort bên ngoài và triển khai lâm sàng khi có khả năng dự đoán.
Không nội dung nào ở trên là bắt buộc để chương trình 1k mẫu thành công. Đây là những cơ hội mở ra khi phần cốt lõi thành công, các bên liên quan muốn mở rộng, tài trợ cho phép và quan hệ đối tác quốc tế phát triển.
Công nghệ đã sẵn sàng. Hạ tầng đã được chứng minh. Câu hỏi bây giờ là: Khi nào quốc gia của bạn bắt đầu xây dựng?
2. Năm 2026, một dự án 1.000 hệ gen tốn bao nhiêu và mất bao lâu?
Bài toán chi phí đã thay đổi rõ rệt. Đến năm 2026, một chương trình 1.000 hệ gen không còn là điều xa vời mà là một dịch vụ đã công nghiệp hóa: giải trình tự toàn hệ gen, phân tích thứ cấp và tập hợp cohort đều được cung cấp dưới dạng hợp đồng trọn gói, và cùng mô hình vận hành đó đã được chứng minh ở quy mô lớn hơn hàng trăm lần (UK Biobank, All of Us). Một quốc gia không cần tự xây dựng toàn bộ chuỗi giá trị:
- Giải trình tự — thuê trọn gói. Illumina và các nhà cung cấp tương đương cung cấp giải pháp đầu-cuối từ giải trình tự, phân tích đến tổng hợp dữ liệu. Ở quy mô 1.000 mẫu, các đơn vị trong nước như Gene Solutions có thể thích ứng dịch vụ sẵn có, giữ logistics, giá cả và hỗ trợ trong nước. Các mốc tham chiếu công khai năm 2026 cho WGS 30x cấp nghiên cứu — gồm chuẩn bị thư viện và phân tích cơ bản — ở mức 220-650 USD/mẫu (khoảng 221 USD trên Ultima UG100, ~650 USD trên NovaSeq X Plus), trong khi Illumina niêm yết 200 USD/hệ gen cho riêng vật tư tiêu hao flow-cell.
- Dữ liệu và nền tảng — tự sở hữu trong nước. Cohort có thể được lưu trữ trên nhà cung cấp cloud trong nước (Viettel, FPT, VNPT hoặc CMC), trong khi lớp phần mềm lưu trữ, kiểm soát truy cập và quản lý cohort được xây dựng nội địa. Lưu trữ đối tượng cho 50-100 TB tốn khoảng 1.000-3.000 USD/tháng, và quốc gia giữ quyền sở hữu cả dữ liệu lẫn nền tảng.
- Thời gian xử lý — nhanh khi pipeline đã có. Khi đã có dữ liệu thô và pipeline được kiểm chứng, việc tập hợp cohort được quản lý chỉ mất vài ngày. Trong điều kiện thuận lợi — đủ tài nguyên tính toán cloud và workflow đã kiểm chứng — hoàn thành một lượt 1k trong một ngày là hoàn toàn khả thi.
Ngân sách năm đầu ước tính cho 1.000 hệ gen cấp nghiên cứu do đó vào khoảng 0,5 triệu USD (khoảng 0,4-0,8 triệu USD tùy giá địa phương), trong đó chi phối là giải trình tự và con người chứ không phải hạ tầng:
- Giải trình tự và phân tích cơ bản: ~0,3-0,6 triệu USD
- Lưu trữ và tính toán cloud: ~30-60 nghìn USD cho cả năm (hoặc 150-300 nghìn USD một lần cho cụm tại chỗ, như mô tả ở Phần 1)
- Đội ngũ cốt lõi (2-3 FTE): lương theo thị trường địa phương — khoản chi thường xuyên lớn nhất
Khoảng ước tính này chưa gồm thu thập mẫu, đồng thuận, phê duyệt đạo đức và kiểu hình hóa lâm sàng — những chi phí phụ thuộc vào hệ thống y tế và thiết kế nghiên cứu của từng quốc gia. So với năm 2018 — khi chương trình tương tự bị giới hạn bởi chuyên môn và hạ tầng khan hiếm — chi phí khởi đầu nay thấp hơn nhiều lần, và khoản đầu tư chi phối là thực thi: một đội ngũ nhỏ, pipeline được kiểm chứng và một hợp đồng lưu trữ. Lộ trình thời gian cũng tương ứng: pilot 100-500 mẫu trong những tháng đầu, đủ 1.000 mẫu trong khoảng một năm.
3. Làm thế nào để dự án duy trì và tiếp tục phát triển sau 1.000 mẫu đầu tiên?
Bàn giao cohort đầu tiên là một cột mốc, không phải đích đến. Các chương trình dừng lại ở 1k thường thất bại vì cùng một lý do: dữ liệu đã có, nhưng không có gì duy trì việc sử dụng nó. Những chương trình vươn tới 50k hay 500k thường chia sẻ ba đặc điểm:
- Kiểu hình và theo dõi dọc, không chỉ kiểu gen. Ở quy mô lớn, giá trị chuyển từ biến thể sang kết cục — tỷ lệ ung thư, tiến triển bệnh, đáp ứng điều trị và theo dõi dài hạn. Đây là điều cho phép cohort 50k hay 500k trả lời những câu hỏi lâm sàng mà cohort 1k không thể.
- Đa omics vượt ra ngoài gọi biến thể germline. Methyl hóa, transcriptomics, proteomics và metabolomics biến một danh mục biến thể thành tài nguyên cấp hệ thống, mở rộng cả giá trị khoa học lẫn giá trị thương mại.
- Mô hình doanh thu để tái đầu tư. Các chương trình bền vững nhất kết hợp hỗ trợ công và tư. Quyền truy cập được phê duyệt vào dữ liệu và tài nguyên tính toán có thể được cấp phép cho phân tích hạ nguồn — y học chính xác, tầm soát bệnh, tiên lượng — với các đối tác dược phẩm và chẩn đoán mang lại nguồn thu duy trì và mở rộng nền tảng. Các cơ chế quản trị và thu hồi chi phí ở Phần 1 (môi trường phân tích an toàn, phân bổ theo hạn mức, thu hồi chi phí) là xương sống của mô hình này.
Điều này dẫn tới câu hỏi chiến lược thẳng thắn: liệu có đáng đầu tư vào 50.000 mẫu và thêm các lớp omics khi sự tồn tại của người mua — và do đó thành công — không được đảm bảo? Câu trả lời là thành công được thiết kế, không phải giả định. Chương trình 1k chính là bước giảm thiểu rủi ro: nó chứng minh pipeline, năng lực quản trị và những kết quả nghiên cứu đầu tiên, đồng thời xây dựng quan hệ với ngành. Mở rộng nên được chia giai đoạn: chỉ tăng quy mô khi nhu cầu và đồng tài trợ đã được chứng minh, để mỗi lần tăng đầu tư đều dựa trên bằng chứng thay vì kỳ vọng.
4. Bước tiếp theo của VN1K là gì?
VN1K đã hoàn thành phần khó nhất của nền tảng: tài nguyên đa omics và phenomics dựa trên pangenome, xây dựng từ 1.011 cá nhân tại 53 tỉnh thành, với 42 triệu biến thể — trong đó 8,5 triệu chưa từng xuất hiện trong các cơ sở dữ liệu toàn cầu. Trong bài phỏng vấn gần đây trên VietNamNet, GS. Vũ Hà Văn đã nêu những gì nền tảng này mở ra: xét nghiệm di truyền dự phòng, chọn thuốc cá nhân hóa, điều trị chính xác và cả VinGenChip để xác định danh tính liệt sĩ. Cũng trong bài phỏng vấn đó, ràng buộc tiếp theo được nói rõ: phần lớn công việc giá trị nhất — điểm nguy cơ đa gen (PRS) và dược di truyền học (PGx) — cần nhiều hơn 1.000 hệ gen khỏe mạnh.
Vì sao 1.000 mẫu khỏe mạnh là chưa đủ.
- PRS cần hàng chục nghìn người tham gia có kiểu hình bệnh và kết cục để huấn luyện và kiểm chứng mô hình nguy cơ. Cohort 1k khỏe mạnh mô tả được tần số allele, nhưng không đủ sức thống kê cho dự đoán nguy cơ bệnh — và các điểm nguy cơ xây dựng từ quần thể châu Âu chuyển giao kém sang quần thể Đông Á, đúng lý do vì sao mô hình đặc thù người Việt quan trọng.
- PGx cần kiểu gen gắn với đáp ứng thuốc và biến cố bất lợi, cùng đủ số người mang các biến thể có thể can thiệp. Những ví dụ quan trọng ở quần thể Đông Á —
HLA-B*15:02 với carbamazepine, CYP2C19 với clopidogrel, CYP2C9/VKORC1 với warfarin — đòi hỏi cả quy mô lẫn chú giải lâm sàng trước khi có thể hướng dẫn kê đơn.
- Cả hai đều cần kiểu hình dọc, liên kết EHR và khung đồng thuận vượt ra ngoài một nghiên cứu lấy mẫu một lần.
Lộ trình từng bước.
- Mở rộng cohort từ 1.000 cá nhân khỏe mạnh lên ít nhất 10.000-50.000, bổ sung cohort bệnh và các nhóm dân tộc còn ít được đại diện (lấy mẫu hiện phủ 53/63 tỉnh thành).
- Làm sâu lớp kiểu hình qua hợp tác bệnh viện: chẩn đoán dọc, thuốc, giá trị xét nghiệm và kết cục theo dõi.
- Xây dựng bảng PRS và PGx đặc thù người Việt trên cohort mở rộng, kiểm chứng tại môi trường lâm sàng địa phương trước khi triển khai.
- Tiếp tục công việc đa omics — giải trình tự đọc dài, RNA và methyl hóa đã có trong tài nguyên VN1K — để giải nghĩa biến thể và ưu tiên những biến thể có thể can thiệp.
- Chuyển hóa thành sản phẩm, như bài phỏng vấn mô tả: kit xét nghiệm dự phòng, hướng dẫn chọn thuốc và VinGenChip.
Vì sao tài trợ chính phủ phù hợp. Các lớp nền tảng — mở rộng cohort, hạ tầng dữ liệu và tính toán an toàn, quản trị và kiểm chứng lâm sàng — là hàng hóa công: lợi ích tích lũy cho hệ thống y tế qua nhiều thập kỷ chứ không cho một công ty đơn lẻ, nên chỉ ưu đãi thị trường sẽ đầu tư thiếu. Đây là nơi đầu tư nhà nước hiệu quả nhất — không phải trợ cấp lợi nhuận, mà là đầu tư cho y tế tương lai, như các ngân hàng sinh học quốc gia khác (UK Biobank, All of Us). Với giá giải trình tự năm 2026 ở câu hỏi đầu tiên, mở rộng lên 10.000 hệ gen tương đương cam kết giải trình tự khoảng 3-6 triệu USD, cộng thêm chi phí kiểu hình hóa và theo dõi; các đối tác tư nhân và doanh thu sản phẩm có thể duy trì các lớp hạ nguồn, như câu hỏi trước đã trình bày. Kết quả VN1K — 8,5 triệu biến thể mới và công nghệ nội địa có thể rẻ hơn công nghệ nhập khẩu hai đến ba lần — đã là bằng chứng cho lợi tức của khoản đầu tư đó.
Một lời ghi nhận và động viên dành cho đội ngũ VN1K. Xây dựng tài nguyên đa omics dựa trên pangenome ở quy mô quần thể từ 1.011 cá nhân tại 53 tỉnh thành — với 8,5 triệu biến thể chưa từng xuất hiện trong các cơ sở dữ liệu toàn cầu — là công việc đòi hỏi nhiều năm nỗ lực tỉ mỉ, và cột mốc này tự nó đã là một thành tựu. Chặng đường phía trước không hề dễ: mở rộng cohort, xây dựng lớp kiểu hình và chuyển dữ liệu thành các công cụ PRS và PGx đến được với bệnh nhân sẽ cần hỗ trợ bền vững. Nhưng bước khó nhất — từ số 0 đến một tài nguyên tham chiếu cho người Việt — đã được thực hiện, và nó được thực hiện bởi chính đội ngũ này. Công việc đó xứng đáng được ghi nhận, và giai đoạn tiếp theo xứng đáng được đầu tư để tiếp tục.
Nếu bạn quan tâm đến blog của tôi, hãy thoải mái trao đổi với tôi qua:
Tài liệu tham khảo
Repository của chuỗi bài
- omicslab-hpc — tự động hóa Ansible để dựng cụm SLURM HPC. https://github.com/vieomics/omicslab-hpc
- nf-germline-short-read-variant-calling — pipeline gọi biến thể germline chuẩn hóa từ dữ liệu đọc ngắn. https://github.com/vieomics/nf-germline-short-read-variant-calling
- nf-modules — module và subworkflow Nextflow dùng chung giữa các pipeline trong chuỗi bài. https://github.com/vieomics/nf-modules
- omicslab-kit — các triển khai gkit (GLnexus, DPGT, Spark-on-SLURM, Hail). https://github.com/vieomics/omicslab-kit
Các dự án & nghiên cứu nền tảng
- 1000 Genomes Project (2015). "A global reference for human genetic variation." Nature, 526(7571), 68-74. https://www.nature.com/articles/nature15393
- UK Biobank (2015). "UK Biobank: An Open Access Resource for Identifying the Causes of a Wide Range of Complex Diseases of Middle and Old Age" PLOS Medicine (now widely cited). https://doi.org/10.1371/journal.pmed.1001779
- All of Us Research Program. National Institutes of Health. https://allofus.nih.gov/
Bài tổng quan về các ngân hàng sinh học hệ gen
- Hyeji Lee et al. (2025). "Lessons from national biobank projects utilizing whole-genome sequencing for population-scale genomics." Genomics & Informatics. https://link.springer.com/article/10.1186/s44342-025-00040-9
Công cụ & hạ tầng
Quản lý workflow
- Nextflow: https://www.nextflow.io/
- nf-core: https://nf-co.re/
- Hệ sinh thái nf-modules: https://github.com/vieomics/nf-modules
Gọi biến thể
- GATK (Genome Analysis Toolkit): https://gatk.broadinstitute.org/
- DeepVariant: https://github.com/google/deepvariant
- PoC của Omicslab: pipeline nf-germline-short-read-variant-calling, https://github.com/vieomics/nf-germline-short-read-variant-calling
Joint genotyping
- GLnexus: https://github.com/dnanexus-rnd/GLnexus
- DPGT (Distributed Powerful Genotyping Tool): https://github.com/BGI-flexlab/DPGT
- PoC của Omicslab: các triển khai gkit (GLnexus, DPGT, Spark-on-SLURM, Hail), https://github.com/vieomics/omicslab-kit
Phân tích quần thể
- Hail (nền tảng cho di truyền học quy mô quần thể): https://hail.is/
- Spark (framework tính toán phân tán): https://spark.apache.org/
Lưu trữ & hạ tầng
- SLURM (Simple Linux Utility for Resource Management): https://slurm.schedmd.com/
- PoC của Omicslab: omicslab-hpc (tự động hóa Ansible cho cụm SLURM), https://github.com/vieomics/omicslab-hpc
Tiêu chuẩn & khả năng tương tác
Tiêu chuẩn dữ liệu hệ gen
- GA4GH (Global Alliance for Genomics and Health): https://www.ga4gh.org/
- Beacon API cho khám phá biến thể
- Data Repository Service (DRS) cho truy cập dữ liệu
- Đặc tả định dạng VCF
- VCF (Variant Call Format): https://samtools.github.io/hts-specs/
- gVCF (genomic VCF): định dạng gọi biến thể hệ gen, giữ lại thông tin no-call
Tiêu chuẩn kiểm soát chất lượng
- bcftools: công cụ thao tác VCF, https://samtools.github.io/bcftools/
Chú giải & giải nghĩa biến thể
- VEP (Variant Effect Predictor): https://www.ensembl.org/info/docs/tools/vep/
- ClinVar: cơ sở dữ liệu biến thể - kiểu hình được kiểm duyệt, https://www.ncbi.nlm.nih.gov/clinvar/
- gnomAD: cơ sở dữ liệu biến thể quy mô quần thể (55k hệ gen), https://gnomad.broadinstitute.org/
Quyền riêng tư & quản trị dữ liệu
- Các quy định bảo vệ dữ liệu: GDPR (EU), HIPAA (Mỹ) và các quy định tương đương theo khu vực
- GA4GH Data Use Ontology: https://www.ga4gh.org/post/data-use-ontology
Genomics lâm sàng & giải nghĩa bệnh
- OMIM (Online Mendelian Inheritance in Man): https://omim.org/
- ClinGen (Clinical Genome Resource): https://clinicalgenome.org/ - tiêu chuẩn giải nghĩa biến thể
- Mạng lưới bệnh hiếm & bệnh chưa chẩn đoán: ví dụ từ Mỹ, EU, Úc, v.v.
Di truyền quần thể & GWAS
- PLINK: bộ công cụ phân tích liên kết toàn hệ gen, https://www.cog-genomics.org/plink/
- GCTA (Genome-wide Complex Trait Analysis): https://cnsgenomics.com/software/gcta/
- Tiêu chuẩn kiểm định cân bằng Hardy-Weinberg
- Tính tần số allele và phân tầng theo tổ tiên
Việt Nam & VN1K
- VN1K is a pangenome-informed multi-omics and phenomics resource for the Vietnamese population (2026). Nature Communications. https://www.nature.com/articles/s41467-026-75375-0
- Thanh Hung (2026). "Vietnamese genome project has multiple practical applications: Prof Vu Ha Van." VietNamNet. https://vietnamnet.vn/en/vietnamese-genome-project-has-multiple-practical-applications-prof-vu-ha-van-2541109.html
Tham chiếu chi phí
- Illumina. "200 USD/hệ gen trên NovaSeq X Series." https://www.illumina.com/systems/sequencing-platforms/novaseq-x-plus/applications/broad-sequencing.html
- University of Minnesota Genomics Center. "Human Whole Genome Sequencing with Analysis." https://genomics.umn.edu/service/human-whole-genome-sequencing
Chuỗi bài về xây dựng dự án 1000 hệ gen quốc gia khép lại ở đây. Cảm ơn bạn đã theo dõi!