19 tháng 04, 2026

Phần 4/5 — Làm thế nào một quốc gia xây dựng dự án 1000 Genomes của riêng mình? Hành trình Việt Nam từ 2018 đến 2026

image

Ở Phần 3, chúng ta đã đi qua gọi biến thể, phân tích cohort và kiến trúc lưu trữ. Phần này tạm rời khỏi stack kỹ thuật để nhìn bức tranh lớn hơn: hành trình của Việt Nam từ năm 2018 — khi VN1K khởi động — đến năm 2026. Ba thứ đã thay đổi trên chặng đường đó: hạ tầng, nhân lực và sự hỗ trợ của Chính phủ. Cùng với nhau, chúng quyết định liệu một dự án 1000 hệ gen cấp quốc gia có khả thi ngay lúc này hay không.

Tổng quan chuỗi bài

  • Phần 1: Tầm nhìn và kiến trúc tổng thể
  • Phần 2: Nguyên tắc thiết kế và lộ trình triển khai
  • Phần 3: Gọi biến thể, phân tích cohort và tổ chức dữ liệu
  • Phần 4 (bài này): Hạ tầng, nhân lực và hỗ trợ của Chính phủ: 2018 → 2026
  • Phần 5: Tóm tắt, mở rộng và những câu hỏi phía trước

1. Hành trình Việt Nam: 2018 → 2026

VN1K trong ngắn gọn. Khởi động năm 2018 tại Viện Nghiên cứu Dữ liệu lớn (nay thuộc VinUniversity), VN1K là nguồn tài nguyên đa omics và phenomics quy mô lớn đầu tiên cho quần thể người Việt: 1.011 cá nhân từ 53 tỉnh thành, hơn 42 triệu biến thể di truyền — khoảng 8,5 triệu biến thể chưa từng được ghi nhận trong các cơ sở dữ liệu quốc tế lớn — cùng Hệ gen tham chiếu toàn hệ (Vietnamese PanGenome Reference — VPR), hệ gen tham chiếu đặc thù quần thể đầu tiên cho người Việt. Công trình đã công bố trên Nature Communications năm 2026 (thông tin từ VinUni).

1.1. Điểm khởi đầu: VN1K năm 2018

Tám năm là khoảng thời gian dài trong lĩnh vực genomics. Khi VN1K khởi động năm 2018, Việt Nam chưa có hệ gen tham chiếu quy mô quần thể của riêng mình: các nghiên cứu di truyền cho người Việt chủ yếu dựa vào dữ liệu tham chiếu được xây dựng từ các quần thể khác — đúng khoảng trống mà dự án đặt mục tiêu lấp đầy.

Môi trường xung quanh dự án cũng đầy thách thức. Năng lực giải trình tự quy mô lớn còn hạn chế và thường phải dựa vào đối tác nước ngoài. Hạ tầng tính toán và lưu trữ cho phân tích cấp quần thể rất khan hiếm — chạy joint genotyping trên cả nghìn hệ gen theo cách Phần 1 mô tả là điều nằm ngoài tầm với của hầu hết các nhóm. Số người có thể vận hành trọn vẹn một pipeline quy mô quần thể chỉ đếm trên đầu ngón tay. Và chính sách riêng cho dữ liệu hệ gen và y học chính xác vẫn còn ở giai đoạn đầu.

VN1K vẫn bắt đầu. Từ năm 2018 đến khi công bố, nhóm đã thu thập mẫu từ 1.011 cá nhân tại 53 tỉnh thành và tạo ra dữ liệu giải trình tự toàn hệ gen đọc ngắn độ sâu cao cùng microarray, giải trình tự đọc dài, RNA sequencing và hồ sơ methyl hóa toàn hệ gen đầu tiên dựa trên dữ liệu đọc dài. Cổng dữ liệu VN1K hiện mở nguồn tài nguyên này cho cộng đồng nghiên cứu.

1.2. Hạ tầng: từ khan hiếm đến sẵn sàng

Năm 2018, tính toán là nút thắt. Hầu hết các nhóm làm việc trên cụm nhỏ hoặc máy chủ đơn lẻ, dữ liệu nằm trên ổ đĩa cục bộ, và joint genotyping hay phân tích cohort cấp quần thể đòi hỏi hạ tầng gần như không tồn tại.

Lớp trung tâm dữ liệu kể câu chuyện tương tự bằng những con số:

Trung tâm dữ liệu 2018 2026
Thị trường Tăng ~12,7%/năm từ 2016, đạt ~858 triệu USD năm 2020 Ước tính khác nhau theo phương pháp: ~1,0–2,1 tỷ USD năm 2025; công suất dự kiến ~950 MW vào 2030
Nhà vận hành Cơ sở cấp viễn thông của Viettel, VNPT, FPT và CMC Viettel IDC, VNPT, FPT Telecom và CMC Telecom dẫn đầu về công suất; Hanoi Telecom và VNG cũng vận hành; các tên nước ngoài đang gia nhập
Dự án tiêu biểu Cụm Viettel Hòa Lạc: ~800 rack khi khai trương (giữa thập niên 2010) Viettel Hòa Lạc: 21.000 m², 30 MW, 2.400 rack; cụm hyperscale 140 MW của Viettel đang xây tại TP. Hồ Chí Minh; FPT AI Factory (cloud GPU NVIDIA)
Hạ tầng quốc gia Chưa có Trung tâm Dữ liệu Quốc gia số 1 tại Hòa Lạc; Luật Dữ liệu (2024); các quy định lưu trú dữ liệu
Danh mục triển khai — ~5,15 triệu sq ft diện tích sàn trắng sắp tới so với ~0,95 triệu sq ft đang vận hành

Hôm nay, thị trường được dẫn dắt bởi bốn nhà vận hành carrier-class — Viettel IDC, VNPT, FPT Telecom và CMC Telecom — cùng Hanoi Telecom và VNG, với tổng cộng 33 trung tâm dữ liệu thương mại. Các tên nước ngoài như Gaw Capital và Worldwide DC Solution (Singapore) đã gia nhập, và danh mục đang triển khai (~5,15 triệu sq ft diện tích sàn trắng so với ~0,95 triệu sq ft đang vận hành) gấp nhiều lần cơ sở hiện hữu. FPT AI Factory bổ sung tầng GPU: cloud trị giá 200 triệu USD với hàng nghìn GPU NVIDIA H100, hoạt động từ tháng 1/2025 — năng lực đáng kể cho genomics, nơi các công cụ như DeepVariant có thể chạy trên GPU.

Với stack phân tích genomics, bức tranh cũng đã khác. Giải trình tự thông lượng cao có thể tiếp cận trong nước, còn phần tính toán có thể xây dựng hoặc thuê tại chỗ: cụm HPC SLURM, node GPU cho các công cụ như DeepVariant, và lưu trữ đối tượng tương thích S3 từ các nhà cung cấp trong nước — đúng kiến trúc được mô tả ở Phần 2 và Phần 3. Stack mã nguồn mở mà chuỗi bài đề xuất (Nextflow, nf-core, GLnexus/DPGT, Hail) chạy được trên hạ tầng đó ngay hôm nay; các repository proof-of-concept được nhắc đến xuyên suốt chuỗi bài đều công khai và có thể tái lập.

Điểm mấu chốt không phải là hạ tầng miễn phí — nó vẫn cần vốn và kỷ luật vận hành. Điểm mấu chốt là: năm 2018, kiến trúc này chỉ là khát vọng; đến 2026, nó đã có thể triển khai bằng nguồn lực trong nước.

1.3. Nhân lực: từ vài người tiên phong đến cả một thế hệ

Năm 2018, chuyên môn tập trung vào một số ít người, nhiều người ở nước ngoài, và gần như mỗi dự án phải tự đào tạo đội ngũ của mình.

Đến 2026, bức tranh đã khác. Các chương trình đại học, sáng kiến đào tạo chuyên sâu và làn sóng trí thức quay về đã mở rộng nguồn nhân lực đáng kể, và hợp tác giữa nhiều viện trường đã trở thành chuẩn mực thay vì ngoại lệ. Khoảng trống còn lại không phải là số lượng người, mà là kinh nghiệm ở quy mô quần thể — thứ chỉ những dự án dài hơi mới tạo ra được.

Nút thắt đang dịch chuyển. Tìm người không còn là phần khó nhất; giữ người, tổ chức họ giữa nhiều viện trường và giao cho họ những dự án dài hơi mới là bài toán mới. Đó là một vấn đề dễ chịu hơn nhiều đối với một quốc gia.

1.4. Hỗ trợ của Chính phủ: vai trò ngày càng rõ nét

Năm 2018, genomics ở Việt Nam chủ yếu được thúc đẩy bởi khu vực tư nhân và các trường đại học; các chính sách về dữ liệu hệ gen vẫn đang trong quá trình hình thành.

Đến 2026, chính sách đã cùng hướng với công nghệ:

  • Y tế và dân số: Quốc hội phê duyệt chương trình mục tiêu quốc gia về chăm sóc sức khỏe, dân số và phát triển giai đoạn 2026–2035 (Nghị quyết 262/2025/QH15).
  • Công nghệ cao: Luật Công nghệ cao 133/2025/QH15 và Nghị định 260/2026 có hiệu lực từ ngày 1/7/2026, với ưu đãi cho các công nghệ cao ưu tiên.
  • Ngân sách: khoảng 3,8 tỷ USD ngân sách nhà nước năm 2026 dành cho khoa học, công nghệ, đổi mới sáng tạo, chuyển đổi số và Đề án 06 (chương trình chuyển đổi số quốc gia và dữ liệu dân cư).
  • Tham vọng công nghệ sinh học: Việt Nam hướng tới trung tâm sinh học (biohub) đầu tiên của khu vực, với trọng tâm là hội tụ AI - công nghệ sinh học (VIR).
  • Đà tăng trưởng thị trường: thị trường genomics Việt Nam được ước tính ở mức 180–220 triệu USD và dự kiến tăng gần gấp đôi vào năm 2030 (Global Health Week Vietnam).

Genomics cũng đang trực tiếp phục vụ các nhiệm vụ quốc gia: VinGenChip — biochip đầu tiên được thiết kế từ dữ liệu hệ gen người Việt, do GeneStory phát triển dựa trên kết quả VN1K — đang được dùng trong chương trình xác định danh tính liệt sĩ, nơi hàng triệu mẫu DNA được phân tích để ghép nối thân nhân với các phần mộ chưa xác định danh tính.

1.5. Ý nghĩa cho một dự án 1000 hệ gen cấp quốc gia

Ghép ba yếu tố trên lại, kết luận khá rõ ràng. Năm 2018, VN1K phải xây dựng hạ tầng, đội ngũ và phương pháp từ đầu. Đến 2026, một dự án quốc gia có thể đứng trên những gì VN1K và các nhóm khác đã dựng nên: hệ gen tham chiếu đã có, nguồn nhân lực rộng hơn, công cụ là mã nguồn mở, và chính sách đã đồng hành.

Điều còn lại là thực thi và quản trị — cũng chính là các chủ đề của chuỗi bài: gọi biến thể chuẩn hóa, joint genotyping có khả năng mở rộng, tầng phân tích sẵn sàng cho nghiên cứu, lưu trữ có chủ quyền và quy tắc truy cập dữ liệu rõ ràng. Đó là bài toán kỹ thuật và tổ chức, không còn là ẩn số khoa học.

Hạng mục 2018 2026
Hạ tầng Cụm tính toán nhỏ, ổ đĩa cục bộ; phân tích cấp quần thể ngoài tầm với của hầu hết các nhóm Cụm HPC SLURM, GPU và lưu trữ đối tượng tương thích S3 trong nước; stack mã nguồn mở chạy được tại chỗ
Nhân lực Một số ít chuyên gia, nhiều người ở nước ngoài; mỗi dự án tự đào tạo Nguồn nhân lực rộng hơn nhờ các chương trình đại học, sáng kiến đào tạo và trí thức quay về; hợp tác đa viện trường
Hỗ trợ của Chính phủ Giai đoạn đầu; genomics chủ yếu do tư nhân và trường đại học thúc đẩy Chương trình mục tiêu quốc gia y tế - dân số 2026–2035; Luật Công nghệ cao 2025; khoảng 3,8 tỷ USD ngân sách 2026 cho khoa học, đổi mới và chuyển đổi số
Dữ liệu và tham chiếu Chưa có hệ gen tham chiếu người Việt; phụ thuộc tham chiếu nước ngoài VPR — hệ gen tham chiếu đầu tiên cho người Việt; hơn 42 triệu biến thể (~8,5 triệu biến thể mới); panel imputation

References

Repository của chuỗi bài

  1. omicslab-hpc — tự động hóa Ansible để dựng cụm SLURM HPC. https://github.com/vieomics/omicslab-hpc
  2. nf-germline-short-read-variant-calling — pipeline gọi biến thể germline chuẩn hóa từ dữ liệu đọc ngắn. https://github.com/vieomics/nf-germline-short-read-variant-calling
  3. nf-modules — module và subworkflow Nextflow dùng chung giữa các pipeline trong chuỗi bài. https://github.com/vieomics/nf-modules
  4. omicslab-kit — các triển khai gkit (GLnexus, DPGT, Spark-on-SLURM, Hail). https://github.com/vieomics/omicslab-kit

Sources

Các nguồn chính cho phần này — số liệu thị trường giữa các công ty nghiên cứu có thể khác nhau do phương pháp và phạm vi:

  1. VN1K — bài trên Nature Communications · thông tin từ VinUni · cổng dữ liệu
  2. Thị trường trung tâm dữ liệu 2016–2020 (~858 triệu USD năm 2020) — VietnamNet
  3. Viettel Hòa Lạc (21.000 m², 30 MW, 2.400 rack) — Viettel Family · cụm 800 rack giai đoạn trước
  4. Trung tâm dữ liệu hyperscale đầu tiên (140 MW, 10.000 rack) — PS Market Research
  5. Ước tính thị trường và công suất 2025 — Expert Market Research · Mordor Intelligence
  6. Nhà vận hành, 33 trung tâm dữ liệu và danh mục triển khai — Vietnam.vn · Arizton
  7. FPT AI Factory (GPU NVIDIA H100, ~200 triệu USD) — FPT · Vietnam.vn
  8. Luật Dữ liệu và Trung tâm Dữ liệu Quốc gia — Tilleke & Gibbins · VOV
  9. Lưu trú dữ liệu (Nghị định 53/2022) — Cơ quan Thương mại Quốc tế Hoa Kỳ
  10. Ngân sách nhà nước 2026 (~3,8 tỷ USD cho khoa học, đổi mới, chuyển đổi số) — VietnamNet
  11. Chương trình y tế - dân số 2026–2035 — Nghị quyết 262/2025/QH15
  12. Luật Công nghệ cao 2025 — KPMG
  13. Biohub và thị trường genomics — VIR · Global Health Week Vietnam

Ở Phần 5, chúng ta tóm tắt nhanh cách xây dựng chương trình, các hướng mở rộng và lộ trình tương lai, cùng những câu hỏi phía trước.

Đây là Phần 4 của chuỗi bài. Tiếp tục đến Phần 5 để xem bản tóm tắt, lộ trình mở rộng và những câu hỏi phía trước.

Bài viết gần đây