Cuộc đua AI đang nóng lên, và việc tiếp cận hạ tầng cutting-edge là một rào cản lớn đối với doanh nghiệp ở mọi quy mô. Các tập đoàn lớn thường “độc chiếm” tài nguyên, khiến startup và SME rất khó cạnh tranh. GreenNode đang thay đổi cuộc chơi này tại Đông Nam Á. 

Tháng 6/2024, GreenNode trở thành đơn vị đầu tiên tại SEA triển khai thành công GPU cluster chuyên cho các ứng dụng HPC, AI training và tích hợp. Trong bài blog này, chúng tôi sẽ chia sẻ hậu trường hành trình triển khai một trong những cụm AI Cloud đầu tiên trong khu vực được vận hành trên nền tảng NVIDIA. Đó không phải là việc dễ dàng, nhưng bằng quyết tâm và tinh thần teamwork, chúng tôi thực sự đã làm được một điều đáng nhớ. 

Việc triển khai Cloud GPU thành công mang lại một nguồn lực “sẵn dùng” với chi phí ưu đãi, phù hợp với nguồn lực hạn chế của các doanh nghiệp nhỏ và vừa tại khu vực châu Á. Đây cũng là bước khởi động cho việc tăng tốc xây thêm nhiều GPU cluster mới trong tương lai, nhằm phục vụ nhu cầu AI đang tăng mạnh tại châu Á. 

Hãy cùng theo dõi! 

Nút thắt AI tại APAC: Chi phí, độ phức tạp và sự bất định 

Cuộc cách mạng AI đang thay đổi ngành công nghiệp với tốc độ chưa từng có, và doanh nghiệp ở mọi quy mô đều muốn tận dụng sức mạnh này. Theo Market Data Forecast, thị trường AI khu vực châu Á – Thái Bình Dương được dự báo tăng trưởng CAGR 39,93% từ 2024 đến 2029 và dự kiến đạt quy mô 356,13 tỷ USD vào năm 2029, tăng từ 66,38 tỷ USD năm 2024. Trong cuộc đua này, công nghệ tiên phong và hạ tầng là “nhiên liệu lõi” để có thể tham gia. 

Blog 10.jpg
Nút thắt AI tại khu vực APAC: chi phí, độ phức tạp và sự bất định

Tuy nhiên, tham gia cuộc đua AI có thể “ngốn” của bạn cả một gia tài. CEO NVIDIA Jensen Huang gần đây dự đoán rằng trong 4 năm tới, các tổ chức sẽ chi khoảng 1 nghìn tỷ USD để nâng cấp data center phục vụ AI. Khi nguồn lực và công nghệ tập trung trong tay các “ông lớn”, những startup AI – đặc biệt tại các khu vực đi sau về công nghệ – sẽ rất khó tạo ra bước nhảy đột phá. 

Bên cạnh đó, bức tranh hạ tầng AI hiện tại cũng là một thách thức lớn cho người mới. Việc tiếp cận hạ tầng AI thường bị giới hạn, chi phí cao và đi kèm nhiều bất định. Xây dựng một AI Cloud cluster phức tạp có thể là quá trình thủ công, nhiều thử–sai, đầy sự cố và trì hoãn. 

Làm sao để xây GPU cluster từ con số 0? 

Theo Forbes, first-pass yield (tỷ lệ phần trăm sản phẩm đạt chất lượng cao ngay từ lần lắp ráp đầu tiên trên dây chuyền) cho việc tích hợp GPU thủ công vào server có thể thấp hơn 50%.  

Thiết lập và triển khai một GPU cluster thành công hoàn toàn không đơn giản. Quy trình này đòi hỏi rất nhiều giờ công của đội ngũ kỹ sư với đa dạng background kỹ thuật. 

Ngoài GPU là lõi, việc xây một cluster tăng tốc GPU trong data center on-prem yêu cầu xem xét kỹ lưỡng hàng loạt thiết bị và thành phần hạ tầng khác: từ phần cứng, mạng, kiến trúc đến các lớp tích hợp. 

Blog 9.jpg
Xây một GPU cluster từ con số 0 là một bài toán rất thách thức

Xây dựng một “AI Factory” có thể đòi hỏi một facility chuyên biệt hoặc tích hợp vào một data center công suất cao sẵn có. Phần lớn các DC phổ thông vài năm gần đây không được thiết kế cho workload loại này, nên việc tìm “chỗ đặt” cluster compute hiệu năng cao là bài toán không hề dễ. 

Nói cách khác, tự xây GPU cluster là một nhiệm vụ phức tạp, cần chuyên môn sâu và kế hoạch rất kỹ lưỡng. Trong trường hợp này, hợp tác với một AI cloud provider đáng tin cậy như GreenNode giúp bạn bỏ qua phần “hạ tầng khó nhằn” và tập trung vào việc khai thác sức mạnh AI để mở khóa tiềm năng và cơ hội kinh doanh nhanh nhất. 

Thông số GPU cluster AI Cloud của GreenNode 

Cam kết không ngừng đổi mới đã đưa GreenNode bước vào một dự án đầy tham vọng: xây dựng cụm AI Cloud quy mô lớn đầu tiên tại Đông Nam Á. Giải pháp GPU Cluster của chúng tôi, đồng hành cùng NVIDIA với vai trò NCP để xây kiến trúc GPU Cloud mới nhất, mang lại hạ tầng lý tưởng cho SME tận dụng AI training và inference theo giờ.  

Với các thế hệ GPU mới nhất được tối ưu hiệu năng từ nhà cung cấp chip hàng đầu NVIDIA, chúng tôi tập trung hỗ trợ những doanh nghiệp muốn tham gia cuộc đua AI. Dù thách thức là rất lớn, mục tiêu của GreenNode là “san bằng sân chơi” cho các doanh nghiệp Đông Nam Á. 

STT Blog-1.jpg
GreenNode đồng hành cùng doanh nghiệp trong cuộc đua AI

GPU cluster của GreenNode bao gồm 128 bare-metal server với tổng cộng 1.024 NVIDIA H100 Tensor Core GPU. Các cluster GPU thế hệ mới này được thiết kế để đáp ứng nhu cầu hiệu năng cao và khả năng mở rộng cho workload AI/ML và HPC. Chúng mang lại tới 9× tốc độ huấn luyện so với các instance GPU thế hệ trước, rút ngắn thời gian training từ vài ngày xuống còn vài giờ.  

Mỗi GPU server cung cấp: 

  • 8 x NVIDIA H100 Tensor Core GPU với NVLink 900 GB/s 
  • 640 GB bộ nhớ GPU băng thông cao 
  • 3,35 TB/s băng thông bộ nhớ 

    STT Blog-2.jpg
    Thông số GPU cluster AI Cloud của GreenNode 

GPU cluster của chúng tôi cũng đáp ứng các tiêu chuẩn hạ tầng DC toàn cầu tiên tiến nhất, bao gồm: 

  • Chứng nhận LEED Gold, TIA 942 Rating-3 DCDV và chuẩn Uptime Tier III. 
  • Công suất riêng 20 MW từ data center của chúng tôi tại Bangkok, Thái Lan. 
  • Công nghệ mạng InfiniBand mới nhất từ NVIDIA với băng thông lên tới 3,2 Tbps. 
  • Nền tảng lưu trữ multi-tenant hyper-scale với tùy chọn 1, 2, 4 hoặc 8 NVIDIA H100 Tensor Core GPU cho mỗi instance. 
  • Hệ thống lưu trữ tốc độ cao của VAST Data – đã được NVIDIA chứng nhận cho nhiều loại nhu cầu storage, bao gồm checkpoint storage cho workload huấn luyện LLM. 

Khi được đưa vào vận hành, GPU cluster xây trên kiến trúc mới nhất của NVIDIA sẽ giúp người dùng triển khai các mô hình AI training mạnh mẽ hơn rất nhiều. Điểm mạnh của GreenNode là tối ưu hạ tầng AI chuyên cho các mô hình LLM. Để tìm hiểu thêm về các ứng dụng LLM trên GreenNode, xem: LLM Diary: GreenNode Makes Striking Debut with Exceptional Results at VLSP 2023. 

Hành trình GreenNode chinh phục AI với GPU cluster quy mô lớn đầu tiên tại Đông Nam Á 

Ngay cả khi đã có đội ngũ hơn 200 kỹ sư AI/ML chuyên sâu, việc hoàn thiện hyper-scale GPU cluster vẫn là một thử thách khổng lồ. Chúng tôi huy động một team chuyên trách, kết nối thêm đồng nghiệp từ Israel và Trung Quốc để bổ sung hỗ trợ. Bằng cách phối hợp xuyên múi giờ, vượt qua rào cản ngôn ngữ, chúng tôi trực diện giải quyết các bài toán kỹ thuật. Nhiều đêm liền, đội ngũ phải túc trực trong data center tại Thái Lan, vừa chạy đua với deadline vừa xử lý vô số vấn đề của một công nghệ gần như “đất mới”. 

STT Blog-3.jpg
Hành trình GreenNode chinh phục AI với GPU cluster quy mô lớn đầu tiên tại Đông Nam Á  

Việc đưa cluster vào hoạt động để đáp ứng nhu cầu khách hàng đòi hỏi quá trình setup chuyên sâu, kiểm thử nghiêm ngặt và troubleshooting liên tục. Dù nhận được sự hỗ trợ mạnh mẽ từ đội kỹ sư nội bộ của VNG Digital Business và các đối tác NVIDIA, VAST Data và STT Data Center, việc xây dựng một hạ tầng ổn định, sẵn sàng cao (high-availability) là cực kỳ thách thức vì tính mới của giải pháp. 

Dù vậy, tinh thần hợp tác và năng lực kỹ thuật của GreenNode đã thể hiện rất rõ. Sự cam kết bền bỉ và trình độ chuyên môn là nền tảng cho thành công này. Dựa trên kinh nghiệm triển khai hạ tầng cloud cho hơn 1.000 doanh nghiệp, GreenNode luôn giải quyết từng bài toán một cách chủ động, với trọng tâm là vận hành ổn định. Sự kỹ lưỡng trong thiết kế và thực thi là yếu tố giúp quá trình launch và tự vận hành giải pháp hyper-scale này diễn ra trơn tru. 

Sau 6 tháng làm việc cường độ cao, chúng tôi rất tự hào thông báo GPU cluster hiệu năng cao đã sẵn sàng cung cấp rộng rãi. Được “tiếp sức” bởi hàng nghìn NVIDIA H100 Tensor Core GPU, GPU Cluster của GreenNode được thiết kế để tạo ra một hạ tầng AI on-demand có khả năng scale vượt trội. Cluster này được tối ưu cho việc huấn luyện các mô hình ngôn ngữ lớn (LLM) phức tạp và xây dựng ứng dụng generative AI, đẩy giới hạn những gì có thể làm được với AI. 

STT Blog-5.jpg
AI Cloud cluster của GreenNode đã chính thức trở thành hiện thực

AI Cloud cluster của GreenNode giờ đây đã là hiện thực, đưa chúng tôi trở thành một trong những đơn vị tiên phong trong cuộc cách mạng AI tại Đông Nam Á. Thành tựu này vượt ra ngoài câu chuyện kỹ thuật; nó là kết quả của teamwork, sự cống hiến và nỗ lực không ngừng hướng tới sự xuất sắc. Việc triển khai cluster thành công đánh dấu một kỷ nguyên mới cho AI training của doanh nghiệp châu Á và các startup AI. 

Và sẽ còn nhiều đổi mới hơn nữa... 

Việc ra mắt hạ tầng GPU AI hyper-scale đầu tiên tại Thái Lan sẽ mở đường cho các nền tảng đổi mới AI tại những khu vực khác. Tận dụng vị thế tiên phong, GreenNode sẽ cung cấp hỗ trợ toàn diện cho doanh nghiệp và đối tác trong việc triển khai hạ tầng AI được thiết kế riêng cho nhu cầu của họ. GreenNode cam kết mang lại độ tin cậy dịch vụ cao, năng lực công nghệ vượt trội và đáp ứng nhu cầu AI toàn cầu đang tăng nhanh. 

Là nhà cung cấp cloud của NVIDIA và đối tác tham gia chương trình NVIDIA Inception, GreenNode tập trung hỗ trợ các ứng dụng AI trong khu vực APAC. Với đội ngũ kỹ sư AI giàu kinh nghiệm, GreenNode có đủ năng lực để hỗ trợ startup về hạ tầng, kiến trúc và kinh nghiệm triển khai trong việc phát triển và ứng dụng các công nghệ cutting-edge. 

Liên hệ với chúng tôi ngay hôm nay hoặc đặt lịch hẹn để nhận tư vấn miễn phí về các giải pháp GreenNode.