Model AI mã nguồn mở tháng 7/2026: cái nào tự-host được ngay?

Model AI mã nguồn mở 2026 tự-host cho doanh nghiệp

Model AI mã nguồn mở là những mô hình ngôn ngữ lớn được nhà phát triển công khai trọng số (weights) để bất kỳ ai cũng tải về, chạy trên hạ tầng riêng và tùy biến, thay vì chỉ gọi qua API trả phí. Tháng 7/2026 chứng kiến làn sóng công bố dồn dập, phần lớn từ các lab Trung Quốc quanh sự kiện WAIC Thượng Hải. Nhưng với đội kỹ thuật đang cân nhắc tự-host để kiểm soát dữ liệu và cắt chi phí, câu hỏi quan trọng nhất không phải “model nào nhiều tham số nhất” mà là: cái nào thật sự tải weights được ngay, cái nào mới chỉ là công bố hoặc preview? Bài viết này của TOT trả lời trực tiếp câu hỏi đó (số liệu tính đến 26/07/2026).

Quick Summary (TL;DR)

  • Tải được ngay: DeepSeek V4 (giấy phép MIT) và Tencent HunYuan 3.0 (Apache 2.0) đã có weights mở trên HuggingFace, chạy tự-host được thực tế.
  • Mới công bố, chưa tự-host được: Kimi K3 hẹn mở weights 27/07/2026; Qwen3.8-Max mới là bản preview qua API; Mistral mới ở dạng teaser.
  • Chi phí phục vụ phụ thuộc active params (MoE), không phải tổng tham số — đây là yếu tố quyết định cấu hình GPU cần thuê/mua.
  • Tự-host hay gọi API là bài toán đánh đổi giữa kiểm soát dữ liệu, chi phí cố định và độ phức tạp vận hành — không có đáp án chung cho mọi doanh nghiệp.

Model AI mã nguồn mở là gì và vì sao doanh nghiệp quan tâm?

Về bản chất, đây là mô hình mà nhà phát triển công khai trọng số đã huấn luyện, kèm giấy phép cho phép tải về và triển khai trên hạ tầng riêng. Cần phân biệt rạch ròi: “mở weights” không đồng nghĩa với “mở nguồn hoàn toàn”. Nhiều model chỉ công khai trọng số, còn dữ liệu và mã huấn luyện thì không — bạn chạy và tinh chỉnh được model, nhưng không tái tạo lại quá trình huấn luyện từ đầu.

Lý do đội kỹ thuật quan tâm gói gọn trong ba điểm. Thứ nhất là kiểm soát dữ liệu: khi tự-host, prompt và dữ liệu nhạy cảm không rời khỏi hạ tầng của bạn — quan trọng với các ngành có yêu cầu tuân thủ chặt. Thứ hai là chi phí ở quy mô lớn: khi lượng truy vấn đủ cao, một máy chủ GPU cố định có thể rẻ hơn trả phí API theo token. Thứ ba là khả năng tùy biến: fine-tune trên dữ liệu nội bộ, tích hợp sâu vào quy trình mà không phụ thuộc vòng đời phát hành của nhà cung cấp. Đây cũng là lằn ranh nối các khái niệm nền tảng như học máydeep learning với bài toán triển khai thực tế.

Một điểm kỹ thuật cần nắm trước khi đọc thông số: gần như toàn bộ model lớn hiện nay dùng kiến trúc MoE (Mixture-of-Experts). Tổng tham số có thể rất lớn, nhưng mỗi lần suy luận chỉ kích hoạt một phần nhỏ — gọi là active params. Chính con số active này, chứ không phải tổng tham số, quyết định chi phí GPU khi phục vụ. Chúng ta sẽ quay lại điểm này ở phần hạ tầng.

Toàn cảnh model AI mã nguồn mở tháng 7 2026

Model tự-host được ngay: DeepSeek V4 và HunYuan 3.0

Đây là hai cái tên mà đội kỹ thuật có thể tải weights và dựng thử ngay hôm nay, với giấy phép thoáng cho thương mại.

DeepSeek V4 — open-weight, giấy phép MIT

DeepSeek V4 có weights mở trên HuggingFace ở hai biến thể DeepSeek-V4-ProDeepSeek-V4-Flash, phát hành dưới giấy phép MIT — một trong những giấy phép thoáng nhất cho mục đích thương mại. Cả hai đều theo kiến trúc MoE: bản Pro có 1.6 nghìn tỷ tham số tổng nhưng chỉ 49 tỷ active, còn bản Flash gọn hơn với 284 tỷ tổng / 13 tỷ active. Context lên tới khoảng 1 triệu token. Cần lưu ý model này chỉ xử lý văn bản (text-only), không đa phương thức.

Bản preview xuất hiện từ 24/04/2026; bản chính thức cùng cơ chế giá API theo “giờ cao/thấp điểm” dự kiến ra mắt giữa tháng 7/2026 (ghi “dự kiến” vì chưa xác minh đã áp đúng lịch chưa). Về hiệu năng, theo model card bản Base, DeepSeek V4 đạt MMLU 90.1, HumanEval 76.8 và GSM8K 92.6 — số liệu từ tài liệu chính thức nên đáng tham chiếu. Với giấy phép MIT, bản Flash active nhỏ và weights sẵn có, đây là ứng viên tự-host đáng cân nhắc nhất trong đợt này.

Tencent HunYuan 3.0 (“Hy3”) — weights mở hoàn toàn, Apache 2.0

Bản đầy đủ của HunYuan 3.0 được Tencent phát hành ngày 06/07/2026, với weights mở hoàn toàn trên HuggingFace và ModelScope — quan trọng cho đội tự-host là đã có sẵn cả bản FP8 và GGUF, giúp giảm yêu cầu bộ nhớ và dễ chạy trên nhiều loại phần cứng hơn. Model dùng MoE 295 tỷ tham số tổng / 21 tỷ active (“295B A21B”), 192 expert chọn top-8 mỗi lượt, context 256K và cũng chỉ xử lý văn bản. Giấy phép là Apache 2.0, rất thoáng cho triển khai thương mại.

Về chất lượng, HunYuan 3.0 được đánh giá mạnh ở nhóm tác vụ code và agent. Chúng tôi cố tình không chốt con số benchmark cụ thể vì các nguồn hiện chưa nhất quán, và cũng không so ngang với bất kỳ model đóng nào — đó là điều bạn nên tự kiểm chứng trên tác vụ thực tế trước khi đưa vào sản xuất. Điểm cộng lớn với đội tự-host là active params chỉ 21 tỷ, thấp hơn cả DeepSeek V4-Pro, nên chi phí phục vụ thân thiện hơn nhiều so với con số tổng 295 tỷ nghe qua có vẻ đồ sộ.

Model mới công bố nhưng chưa tự-host được: Kimi K3, Qwen, Mistral

Nhóm này gây nhiều tiếng vang trên truyền thông, nhưng tính đến 26/07/2026 vẫn chưa thể tải về để tự-host. Doanh nghiệp cần tỉnh táo phân biệt “đã phát hành weights” với “mới công bố”.

  • Kimi K3 (Moonshot AI): công bố ngày 16–17/07/2026, được nhiều hãng uy tín đưa tin (CNBC, Bloomberg, Forbes, TechCrunch, VentureBeat). Weights đầy đủ hẹn phát hành 27/07/2026; tính đến 26/07 chưa có repo Kimi-K3 trên HuggingFace (mới nhất là Kimi-K2.7). Model được mô tả khoảng 2.8 nghìn tỷ tham số tổng (TechCrunch dè dặt ghi “2–3T”), MoE 896 expert, context 1 triệu token, có hỗ trợ đa phương thức đầu vào. Mọi xếp hạng kiểu “#2 trên Vals” hay “vượt các model Mỹ” hiện đều là công bố tiền-phát-hành, chưa có kiểm chứng độc lập; chính hãng cũng thừa nhận vẫn kém các model top của Mỹ.
  • Alibaba Qwen3.8-Max: hiện chỉ có bản Qwen3.8-Max-Preview, công bố 19/07/2026 tại WAIC. Chưa mở weights, chưa có giấy phép, không model card và không benchmark chính thức — chỉ dùng được qua API. Các con số như “2.4 nghìn tỷ tham số” hay tuyên bố về thứ hạng đều là phát biểu của Alibaba, chưa kiểm chứng; active params không được công bố. Với đội tự-host, đây mới là tín hiệu, chưa phải lựa chọn.
  • Mistral: CEO Arthur Mensch đầu tháng 7/2026 mới teaser một dòng MoE kiểu “fat but sparse” (tổng lớn, active thấp), lớn hơn Mistral Large 3. Chưa có tên gọi, thông số, context, giấy phép, benchmark hay repo HuggingFace — mới ở mức early access cho đối tác. Đây là dấu hiệu cho thấy phương Tây cũng đang chuẩn bị đối trọng trong cuộc đua model mở.

Bảng so sánh nhanh (tính đến 26/07/2026)

ModelTổng / ActiveContextLicenseWeightsPhù hợp tự-host?
DeepSeek V4-Pro1.6T / 49B~1MMITĐã mở (HuggingFace)Có, cần hạ tầng lớn
DeepSeek V4-Flash284B / 13B~1MMITĐã mở (HuggingFace)Có, thân thiện nhất
HunYuan 3.0 (Hy3)295B / 21B256KApache 2.0Đã mở (có FP8/GGUF)
Kimi K3~2.8T / —1MHẹn 27/07/2026Chưa (chờ weights)
Qwen3.8-Max~2.4T (claim) / —Chưa (chỉ API preview)Chưa
Mistral (dòng MoE mới)Chưa (mới teaser)Chưa
Ô ghi “—” nghĩa là chưa có thông tin xác minh tại thời điểm 26/07/2026.
Tiêu chí chọn model AI mã nguồn mở để tự-host

Tự-host hay dùng API? Chi phí và hạ tầng cần gì?

Điểm mấu chốt khi ước lượng hạ tầng là quay lại con số active params. Trong kiến trúc MoE, dù tổng tham số lên tới nghìn tỷ, mỗi lượt suy luận chỉ nạp và tính trên phần active; VRAM cần thiết vì thế bám sát active params cùng độ chính xác lưu trữ, chứ không phải tổng. Nhẩm thô: ở định dạng FP8, mỗi tỷ tham số active tốn khoảng 1GB VRAM cho trọng số, cộng bộ nhớ KV-cache (tăng theo độ dài context) và biên an toàn. Vì vậy bản DeepSeek V4-Flash 13B active hay HunYuan 3.0 21B active dễ tiếp cận hơn nhiều so với bản Pro 49B active — dù “1.6 nghìn tỷ tham số” nghe qua có vẻ ngoài tầm với.

Định dạng lưu trữ cũng quan trọng. FP8 giúp giảm một nửa bộ nhớ so với BF16 mà giữ chất lượng tốt, phù hợp GPU máy chủ đời mới. GGUF (kèm các mức lượng tử hóa) mở đường chạy trên phần cứng phổ thông và CPU, đánh đổi một phần tốc độ hoặc chất lượng. Việc HunYuan 3.0 phát hành sẵn cả FP8 và GGUF chính là lợi thế triển khai thực tế, giúp đội kỹ thuật thử nghiệm nhanh trước khi cam kết đầu tư phần cứng.

Về giấy phép, hãy đọc kỹ trước khi đưa vào sản phẩm. MIT (DeepSeek V4) và Apache 2.0 (HunYuan 3.0) đều cho phép sử dụng thương mại rộng rãi — đây là điều kiện cần để yên tâm tích hợp vào phần mềm bán ra. Với các model chưa công bố giấy phép như Kimi K3, Qwen3.8-Max hay dòng mới của Mistral, chưa nên đưa vào kế hoạch tự-host cho tới khi có văn bản license rõ ràng.

Vậy khi nào nên tự-host, khi nào nên gọi API? Nguyên tắc thực dụng: gọi API khi lưu lượng còn thấp hoặc không đều, khi bạn cần thử nghiệm nhanh và không muốn gánh chi phí vận hành GPU. Tự-host khi dữ liệu buộc phải ở lại nội bộ vì lý do tuân thủ, khi lưu lượng đủ lớn để chi phí GPU cố định rẻ hơn phí token, hoặc khi bạn cần fine-tune sâu và kiểm soát toàn bộ vòng đời. Nhiều doanh nghiệp chọn mô hình lai: dùng API cho giai đoạn xây dựng nhanh, rồi chuyển dần sang tự-host khi khối lượng và yêu cầu dữ liệu tăng lên. Đây cũng chính là những đánh đổi mà TOT thường cùng khách hàng phân tích khi tư vấn triển khai giải pháp trí tuệ nhân tạo theo yêu cầu.

Câu hỏi thường gặp

Model AI mã nguồn mở nào tải weights được ngay trong tháng 7/2026?

Tính đến 26/07/2026, hai cái tên có weights mở và tự-host được thực tế là DeepSeek V4 (biến thể Pro và Flash, giấy phép MIT) và Tencent HunYuan 3.0 (Apache 2.0, có sẵn bản FP8 và GGUF). Các model như Kimi K3, Qwen3.8-Max hay dòng mới của Mistral vẫn ở dạng công bố, preview hoặc teaser.

Vì sao active params quan trọng hơn tổng tham số?

Với kiến trúc MoE, mỗi lượt suy luận chỉ kích hoạt phần active params, nên chi phí tính toán và VRAM cần thiết bám sát con số active chứ không phải tổng. Một model 295 tỷ tổng nhưng chỉ 21 tỷ active sẽ dễ phục vụ hơn nhiều so với cảm nhận ban đầu từ con số tổng.

Tự-host model mở có giúp bảo vệ dữ liệu doanh nghiệp không?

Có. Khi tự-host, prompt và dữ liệu suy luận không rời khỏi hạ tầng của bạn, phù hợp với các ngành có yêu cầu tuân thủ chặt. Đổi lại, bạn phải tự đảm nhận vận hành, bảo mật hệ thống và cập nhật model.

Giấy phép MIT và Apache 2.0 có cho dùng thương mại không?

Cả MIT (DeepSeek V4) và Apache 2.0 (HunYuan 3.0) đều là giấy phép thoáng, cho phép sử dụng thương mại rộng rãi. Dù vậy, bạn vẫn nên đọc kỹ toàn văn giấy phép và điều khoản đi kèm trước khi tích hợp vào sản phẩm bán ra.

“Mở weights” có phải là “mã nguồn mở hoàn toàn” không?

Không hẳn. Nhiều model chỉ công khai trọng số đã huấn luyện, còn dữ liệu và mã huấn luyện thì không mở. Bạn có thể chạy và tinh chỉnh model, nhưng không tái tạo lại được toàn bộ quá trình huấn luyện từ đầu.

Nguồn tham khảo

Kết luận: chọn đúng model, triển khai đúng cách

Làn sóng model AI mã nguồn mở tháng 7/2026 mở ra cơ hội thật để doanh nghiệp kiểm soát dữ liệu và tối ưu chi phí AI, nhưng chỉ khi bạn nhìn xuyên qua các con số marketing để phân biệt cái nào tự-host được ngay với cái mới chỉ là công bố. Hiện tại, DeepSeek V4 và HunYuan 3.0 là hai lựa chọn sẵn sàng, giấy phép thương mại thoáng và active params đủ nhỏ để phục vụ hiệu quả; các cái tên còn lại đáng theo dõi nhưng chưa nên đưa vào kế hoạch triển khai.

Nếu đội của bạn đang cân nhắc tự-host một model mở, hoặc muốn tích hợp AI vào sản phẩm sẵn có, TOT có thể đồng hành từ khâu chọn model, ước lượng hạ tầng GPU, đến xây dựng và vận hành giải pháp. Tìm hiểu thêm về dịch vụ viết phần mềm theo yêu cầu và tư vấn triển khai AI của chúng tôi để biến các model mã nguồn mở thành lợi thế thực tế cho doanh nghiệp.

Liên hệ

Bạn đã sẵn sàng chưa?

Cùng TOT bắt đầu hành trình xây dựng dự án ngay hôm nay!

Gửi tin nhắn cho chúng tôi. Chúng tôi sẽ đề xuất giải pháp để nâng tầm doanh nghiệp của bạn.

Sự khác biệt:

Đặt lịch tư vấn miễn phí