Kimi K3 là mô hình AI mã nguồn mở của Moonshot AI, nổi bật với kiến trúc Mixture-of-Experts (MoE), quy mô 2,8 nghìn tỷ tham số và khả năng xử lý ngữ cảnh lên đến 1 triệu token. Model được định hướng cho coding, reasoning, knowledge work và AI Agent, đồng thời hỗ trợ xử lý dữ liệu đa phương thức. Trong bài viết này, TOT sẽ giúp bạn tìm hiểu Kimi K3 là gì, các tính năng nổi bật, mức giá, cách sử dụng và khả năng ứng dụng thực tế.
Tóm tắt nhanh
- Kimi K3 là mô hình AI open-weight của Moonshot AI, nổi bật với 2,8 nghìn tỷ tham số, context lên đến 1 triệu token và khả năng xử lý đa phương thức. Model được tối ưu cho coding, reasoning, knowledge work và AI Agent.
- K3 có thể hỗ trợ viết và debug code, phân tích tài liệu dài, nghiên cứu, xử lý hình ảnh, làm việc với codebase lớn và thực hiện các workflow nhiều bước. Người dùng có thể tiếp cận K3 qua Kimi, Kimi Code và Kimi API.
- Về chi phí, K3 API có giá từ $0.30/MTok (~7.900 VNĐ) cho input cache-hit; các gói Kimi bắt đầu từ ¥49 (~180.000 VNĐ)/tháng. Tuy nhiên, K3 cũng yêu cầu hạ tầng lớn khi self-host và chi phí có thể tăng với tác vụ dài.
- Nhìn chung, Kimi K3 phù hợp với các nhu cầu cần context lớn, coding chuyên sâu và AI Agent, nhưng nên lựa chọn dựa trên workload, ngân sách và yêu cầu hạ tầng thực tế.
Kimi K3 là gì?
Kimi K3 là mô hình AI open-weight do Moonshot AI phát triển, ra mắt vào tháng 7/2026, với quy mô 2,8 nghìn tỷ tham số. Model sử dụng kiến trúc Mixture-of-Experts (MoE), gồm 896 chuyên gia và kích hoạt một phần tham số cho mỗi lần xử lý. Kimi K3 được xây dựng với khả năng nhìn và hiểu hình ảnh, cửa sổ ngữ cảnh lên đến 1 triệu token, đồng thời hỗ trợ các tác vụ như lập trình, suy luận chuyên sâu, xử lý công việc tri thức và xây dựng AI Agent. Moonshot AI cũng áp dụng Kimi Delta Attention (KDA) và Attention Residuals (AttnRes) trong kiến trúc của mô hình.
Thông số nhanh của Kimi K3
| Thông số | Chi tiết |
|---|---|
| Tên model | Kimi K3 |
| Nhà phát triển | Moonshot AI |
| Thời điểm ra mắt | Tháng 7/2026 |
| Loại model | Open-weight, đa phương thức |
| Tổng số tham số | 2,8 nghìn tỷ (2,8T) |
| Kiến trúc | Mixture-of-Experts (MoE) |
| Số lượng chuyên gia | 896 |
| Tham số được kích hoạt | 104 tỷ |
| Công nghệ Attention | Kimi Delta Attention (KDA) |
| Kiến trúc bổ sung | Attention Residuals (AttnRes) |
| Cửa sổ ngữ cảnh | Lên đến 1 triệu token |
| Khả năng đa phương thức | Hỗ trợ hiểu hình ảnh và dữ liệu trực quan |
| Tác vụ trọng tâm | Lập trình, suy luận, công việc tri thức, AI Agent |
| Hình thức sử dụng | Nền tảng Kimi, Kimi Code và Kimi API |
Với quy mô 2,8 nghìn tỷ tham số, Kimi K3 thuộc nhóm các mô hình AI có tổng số tham số rất lớn. Tuy nhiên, toàn bộ 2,8T tham số không được sử dụng trong mỗi lần xử lý. Kiến trúc Mixture-of-Experts cho phép mô hình lựa chọn các chuyên gia phù hợp với từng yêu cầu, với khoảng 104 tỷ tham số được kích hoạt. Cách thiết kế này giúp giảm lượng tính toán cần thiết so với việc kích hoạt toàn bộ tham số ở mọi lượt xử lý.
Một điểm đáng chú ý khác của Kimi K3 model là cửa sổ ngữ cảnh lên đến 1 triệu token. Dung lượng này cho phép model xử lý lượng lớn thông tin trong cùng một phiên, chẳng hạn như mã nguồn của một dự án lớn, nhiều tài liệu nghiên cứu hoặc các bộ tài liệu dài. Kimi K3 cũng được Moonshot AI định hướng cho lập trình, suy luận chuyên sâu, công việc tri thức và các quy trình AI Agent nhiều bước, thay vì chỉ phục vụ các cuộc hội thoại hỏi – đáp thông thường.

Các tính năng nổi bật của Kimi K3
Kimi K3 được Moonshot AI định vị là mô hình AI dành cho lập trình dài hạn, công việc tri thức và suy luận, thay vì chỉ phục vụ hội thoại hỏi – đáp. Điểm đáng chú ý của model nằm ở quy mô 2,8 nghìn tỷ tham số, cửa sổ ngữ cảnh 1 triệu token, khả năng đa phương thức và năng lực thực hiện các tác vụ nhiều bước.
2,8 nghìn tỷ tham số với kiến trúc Mixture-of-Experts
Kimi K3 có tổng cộng 2,8 nghìn tỷ tham số, nhưng con số này không có nghĩa là toàn bộ 2,8T tham số đều hoạt động trong mỗi lần xử lý. Model sử dụng kiến trúc Mixture-of-Experts (MoE), trong đó hệ thống gồm 896 expert (chuyên gia) và chỉ lựa chọn một phần expert phù hợp để xử lý từng yêu cầu. Theo Moonshot AI, Kimi K3 kích hoạt 16/896 expert trong mỗi lượt xử lý, tương ứng với khoảng 104 tỷ tham số được kích hoạt.
Cách thiết kế này cho phép Kimi K3 duy trì quy mô tham số rất lớn mà không phải thực hiện tính toán trên toàn bộ model ở mọi lượt. Nhờ đó, model có thể mở rộng năng lực xử lý trong khi vẫn tối ưu hiệu quả sử dụng tài nguyên. Kimi K3 cũng kết hợp Kimi Delta Attention (KDA) và Attention Residuals (AttnRes) để cải thiện khả năng mở rộng khi xử lý các chuỗi thông tin dài.
Context window lên đến 1 triệu token
Một trong những điểm nổi bật nhất của Kimi K3 là cửa sổ ngữ cảnh lên đến 1 triệu token. Hiểu đơn giản, context window xác định lượng thông tin mà model có thể tiếp nhận và sử dụng trong một phiên xử lý. Với dung lượng này, Kimi K3 có thể duy trì nhiều thông tin hơn khi làm việc với các nhiệm vụ phức tạp và kéo dài. Moonshot AI cho biết K3 được thiết kế cho các cuộc hội thoại dài và dự án phức tạp.
Trong thực tế, khả năng này hữu ích khi phân tích một bộ tài liệu dài, đọc nhiều báo cáo cùng lúc hoặc nghiên cứu một chủ đề cần đối chiếu nhiều nguồn. Với lập trình, model có thể làm việc với codebase lớn, theo dõi nhiều tệp và duy trì ngữ cảnh trong các phiên sửa lỗi, kiểm thử và tối ưu liên tục. Với AI Agent, context lớn cũng giúp hệ thống lưu giữ nhiều thông tin hơn trong một workflow nhiều bước, giảm nhu cầu chia nhỏ nhiệm vụ hoặc liên tục cung cấp lại dữ liệu cho model.
Khả năng đa phương thức và hiểu hình ảnh
Kimi K3 là mô hình đa phương thức (multimodal) với khả năng nhìn nguyên bản (native vision). Theo thông tin chính thức của Kimi, model có thể hiểu văn bản, hình ảnh và video, đồng thời xử lý các dạng dữ liệu trực quan như screenshot và tài liệu.
Khả năng này mở rộng phạm vi sử dụng của Kimi K3 so với một mô hình chỉ xử lý văn bản. Người dùng có thể đưa screenshot giao diện để model phân tích, nhận diện vấn đề trong thiết kế hoặc hỗ trợ viết mã dựa trên giao diện trực quan. Với dữ liệu biểu đồ, hình ảnh và tài liệu, mô hình có thể kết hợp thông tin trực quan với nội dung văn bản để thực hiện phân tích. Moonshot AI cũng minh họa khả năng K3 sử dụng ảnh chụp màn hình trong vòng lặp giữa code và kết quả hiển thị, từ đó liên tục điều chỉnh sản phẩm trong các tác vụ phát triển game và giao diện.
Khả năng reasoning, coding và AI Agent
Kimi K3 được thiết kế xoay quanh ba nhóm năng lực chính: suy luận (reasoning), lập trình (coding) và quy trình tác vụ theo tác nhân (agentic workflow). Trong lập trình, K3 có thể duy trì các phiên làm việc dài, xử lý kho mã lớn và điều phối công cụ dòng lệnh với mức độ giám sát của con người thấp hơn.
Với reasoning, model được định hướng cho các nhiệm vụ cần phân tích nhiều bước thay vì chỉ đưa ra câu trả lời dựa trên một lượt hỏi. Còn với AI Agent, Kimi K3 có thể kết hợp lập kế hoạch, gọi công cụ, thực thi, kiểm tra kết quả và điều chỉnh dựa trên phản hồi. Kimi mô tả K3 có khả năng hiểu codebase lớn, điều phối terminal tools và liên tục thay đổi cách tiếp cận dựa trên kết quả nhận được. Vì vậy, Kimi K3 model được định vị nhiều hơn như một nền tảng hỗ trợ hoàn thành công việc phức tạp, thay vì chỉ là chatbot hỏi – đáp.
Open-weight và khả năng tự triển khai
Open-weight nghĩa là trọng số của mô hình được công bố để người dùng có thể tải về và triển khai theo điều kiện giấy phép đi kèm. Với Kimi K3, Moonshot AI đã công bố đầy đủ model weights và cho phép người dùng chạy, triển khai, tinh chỉnh (fine-tune) và sửa đổi model khi tuân thủ Kimi K3 License.
Điều này mang lại lợi ích cho doanh nghiệp và đội ngũ kỹ thuật cần kiểm soát môi trường triển khai hoặc dữ liệu. Tuy nhiên, tự triển khai Kimi K3 đòi hỏi hạ tầng tính toán rất lớn do mô hình có quy mô 2,8T tham số. Moonshot AI khuyến nghị cấu hình triển khai với 64 accelerator trở lên trong môi trường supernode để phục vụ model hiệu quả.
Đối với coding, Kimi K3 còn được thiết kế để làm việc với codebase lớn, sử dụng terminal tools và thực hiện nhiều vòng viết mã → kiểm tra → nhận phản hồi → điều chỉnh. Đây là yếu tố quan trọng khi triển khai model cho các workflow kỹ thuật kéo dài thay vì chỉ sử dụng cho những yêu cầu tạo mã đơn lẻ.

Kimi K3 có thể làm được gì?
Kimi K3 được thiết kế cho các tác vụ vượt ra ngoài hỏi–đáp thông thường, đặc biệt là lập trình, nghiên cứu, xử lý tri thức và các quy trình công việc nhiều bước. Moonshot AI công bố nhiều trường hợp sử dụng cho thấy K3 có thể kết hợp khả năng suy luận, lập trình, xử lý hình ảnh và công cụ để thực hiện các dự án phức tạp với mức độ can thiệp của con người thấp hơn.
Kimi K3 hỗ trợ lập trình và phát triển phần mềm
K3 có thể thực hiện các tác vụ lập trình dài hạn như tối ưu nhân GPU, phát triển trình biên dịch GPU và xây dựng phần mềm. Trong một thử nghiệm, Kimi K3 đã phát triển MiniTriton, một trình biên dịch theo hướng Triton với lớp biểu diễn trung gian (IR), các bước tối ưu và quy trình tạo mã PTX.
Moonshot AI cũng công bố trường hợp K3 tham gia tối ưu nhân GPU trong quá trình phát triển mô hình. K3 có thể làm việc trong môi trường thử nghiệm, đo hiệu năng, viết lại mã nguồn và đánh giá kết quả qua các vòng kiểm thử.
Kimi K3 hỗ trợ nghiên cứu và xử lý tri thức
K3 có thể kết hợp tài liệu nghiên cứu, tìm kiếm thông tin, lập trình và phân tích dữ liệu để thực hiện các quy trình nghiên cứu phức tạp. Một trường hợp được Moonshot AI công bố cho thấy K3 đã đối chiếu hơn 20 bài nghiên cứu, triển khai quy trình tính toán, đánh giá hơn 300 phương trình trạng thái và tạo hơn 3.000 dòng mã Python trong một nghiên cứu vật lý thiên văn.
Trong nghiên cứu ngành, K3 cũng được sử dụng để tạo báo cáo tương tác về 42 năm ngành chip AI ASIC. Quy trình này sử dụng hơn 2.800 lượt tìm kiếm và thu thập dữ liệu, 1.100 lượt truy xuất dữ liệu qua công cụ dòng lệnh và xử lý dữ liệu từ hơn 11.000 trang.
Kimi K3 hỗ trợ tác vụ AI Agent nhiều bước
K3 có thể thực hiện các quy trình yêu cầu lập kế hoạch, gọi công cụ, thực hiện nhiều bước và kiểm tra kết quả. Một trường hợp nổi bật được Moonshot AI công bố là K3 tự thiết kế, tối ưu và kiểm chứng một chip dành cho mô hình nano trong một phiên làm việc tự động kéo dài 48 giờ, sử dụng các công cụ thiết kế chip điện tử mã nguồn mở.
Trong một nghiên cứu khác về 391 sự kiện sóng hấp dẫn, K3 sử dụng hơn 20 tác nhân AI con để thực hiện các nhiệm vụ song song, đồng thời tạo biểu đồ trực quan, bảng dữ liệu và tổng hợp tài liệu.
Các trường hợp trên cho thấy K3 có thể phối hợp nhiều công cụ và bước xử lý để hoàn thành một nhiệm vụ, thay vì chỉ tạo một câu trả lời duy nhất.
Kimi K3 xử lý hình ảnh, video và nội dung trực quan
K3 có khả năng kết hợp văn bản, hình ảnh và video trong các quy trình sáng tạo và kỹ thuật. Moonshot AI giới thiệu trường hợp K3 xây dựng một thế giới mở 3D có thể tương tác bằng cách kết hợp khả năng suy luận không gian, lập trình và xử lý hình ảnh.
Trong quy trình này, K3 có thể tìm tài liệu tham khảo, tạo tài nguyên 3D, viết logic trò chơi và sử dụng ảnh chụp màn hình để tiếp tục điều chỉnh sản phẩm.
K3 cũng được sử dụng để chỉnh sửa một video giới thiệu từ 56 đoạn video nguồn, bao gồm lựa chọn cảnh, cắt theo chuyển động, đồng bộ nhịp, xử lý âm thanh và thực hiện nhiều vòng chỉnh sửa. Các trường hợp này cho thấy K3 có thể ứng dụng vào phát triển game, thiết kế trực quan và biên tập video.

Đánh giá Kimi K3 qua benchmark
Benchmark là một trong những cách phổ biến để đánh giá năng lực của mô hình AI trên các nhóm tác vụ cụ thể. Theo bộ kết quả do Moonshot AI công bố, Kimi K3 đạt kết quả cạnh tranh ở coding, tác vụ Agent, nghiên cứu và suy luận. Tuy nhiên, benchmark không đại diện hoàn toàn cho hiệu năng khi triển khai thực tế. Kết quả có thể thay đổi theo bộ dữ liệu, prompt, mức độ suy luận, công cụ và agent harness được sử dụng.
Kimi K3 đạt kết quả như thế nào?
Moonshot AI đánh giá Kimi K3 ở nhiều benchmark về lập trình, tác vụ agent và suy luận. Một số kết quả tiêu biểu gồm:
| Nhóm đánh giá | Benchmark | Kimi K3 | Ý nghĩa chính |
|---|---|---|---|
| Coding | DeepSWE | 67,5 | Xử lý tác vụ kỹ thuật phần mềm |
| Coding | Terminal-Bench 2.1 | 88,3 | Thực hiện tác vụ thông qua terminal |
| Coding | FrontierSWE | 81,2 | Coding với tác vụ phần mềm phức tạp |
| Coding | Program Bench | 77,8 | Giải quyết bài toán lập trình |
| Coding | SWE Marathon | 42,0 | Coding theo quy trình dài |
| Agent | BrowseComp | 91,2 | Nghiên cứu và duyệt web theo tác vụ |
| Agent | DeepSearchQA | 95,0 | Tìm kiếm và tổng hợp thông tin |
| Agent | Automation Bench | 30,8 | Tự động hóa tác vụ nhiều bước |
| Reasoning | GPQA-Diamond | 93,5 | Suy luận trên câu hỏi chuyên môn |
| Multimodal | MMMU-Pro | 81,6 | Suy luận trên dữ liệu đa phương thức |
| Multimodal | OmniDocBench | 91,1 | Hiểu tài liệu kết hợp văn bản và hình ảnh |
Lưu ý: Các điểm số được tổng hợp từ công bố benchmark của Moonshot AI; một số benchmark sử dụng harness khác nhau nên không nên dùng bảng trên để tạo ra một thứ hạng tổng thể giữa các model.
Các kết quả trên được thực hiện với mức độ suy luận tối đa, nhưng không phải tất cả các mô hình đều được đánh giá trong cùng một môi trường. Moonshot AI cho biết Kimi K3 sử dụng Kimi Code, Claude Code hoặc Codex tùy theo benchmark, trong khi kết quả của các model khác có thể đến từ những harness khác nhau. Vì vậy, việc lấy một điểm benchmark riêng lẻ để kết luận model nào mạnh hơn toàn diện có thể dẫn đến cách hiểu sai.
Benchmark cũng không phản ánh đầy đủ hiệu năng production. Trong thực tế, doanh nghiệp còn phải xem xét độ trễ, độ ổn định, chi phí token, khả năng tích hợp công cụ, giới hạn API và đặc điểm workload. Một model có điểm benchmark cao chưa chắc tạo ra hiệu quả tương ứng trong mọi quy trình thực tế.
Kimi K3 mạnh nhất ở đâu?
Nhìn từ cấu trúc benchmark và các trường hợp sử dụng Moonshot AI công bố, Kimi K3 nổi bật ở những workflow yêu cầu nhiều bước xử lý và duy trì ngữ cảnh trong thời gian dài. Coding Agent là một ví dụ rõ ràng: K3 có thể điều hướng kho mã lớn, sử dụng terminal, chạy kiểm tra và tiếp tục điều chỉnh mã trong các phiên làm việc kéo dài.
Long-context cũng là một điểm đáng chú ý. Với cửa sổ 1 triệu token, Kimi K3 có thể tiếp nhận lượng lớn tài liệu hoặc thông tin trong một workflow mà không cần liên tục chia nhỏ dữ liệu đầu vào. Tuy nhiên, kích thước context không đồng nghĩa model luôn khai thác hiệu quả 100% lượng thông tin được đưa vào.
Ở nhóm AI Agent, kết quả BrowseComp, DeepSearchQA và Automation Bench cho thấy K3 có năng lực đáng chú ý trong các tác vụ cần tìm kiếm, sử dụng công cụ và thực hiện nhiều bước. Moonshot AI cũng công bố các thử nghiệm trong đó K3 thực hiện nghiên cứu với hàng nghìn lượt tìm kiếm và truy xuất dữ liệu, sau đó tổng hợp thành báo cáo trực quan.
Kimi K3 có thực sự vượt GPT và Claude?
Không thể trả lời câu hỏi này bằng một kết luận “có” hoặc “không”. Ngay trong công bố của Moonshot AI, hãng ghi nhận hiệu năng tổng thể của Kimi K3 vẫn thấp hơn các model độc quyền mạnh nhất mà hãng đưa vào so sánh, dù K3 đạt mức hiệu năng rất cao trong nhiều bài đánh giá.
Có thể nhìn Kimi K3 theo từng tiêu chí:
- Coding: K3 có kết quả mạnh ở nhiều benchmark, nhưng không dẫn đầu tất cả. Ví dụ, K3 đạt 88,3 trên Terminal-Bench 2.1, trong khi GPT-5.6 Sol đạt 88,8 theo bảng benchmark của Moonshot AI; ở FrontierSWE, K3 đạt 81,2 trong khi Claude Fable 5 đạt 86,6.
- Long-context: cửa sổ 1 triệu token là một thông số đáng chú ý, đặc biệt với nghiên cứu, codebase lớn và workflow nhiều bước. Tuy nhiên, khả năng khai thác context cần được đánh giá theo từng loại tác vụ.
- Open-weight: Kimi K3 có lợi thế về khả năng tiếp cận trọng số mô hình và triển khai trong môi trường riêng, khác với các mô hình đóng chỉ được cung cấp thông qua dịch vụ của nhà phát triển.
- Trợ lý AI tổng quát: hiệu quả phụ thuộc vào từng tác vụ cụ thể. Một model có điểm cao trên coding Agent chưa chắc cũng dẫn đầu ở mọi nhu cầu hội thoại, sáng tạo hoặc xử lý tài liệu.
- Chi phí: giá model cần được đánh giá cùng với lượng token đầu vào, đầu ra, tỷ lệ cache-hit và số lần gọi model. Kimi K3 có giá API được Moonshot AI công bố là 3 USD/1 triệu token đầu vào không cache và 15 USD/1 triệu token đầu ra, trong khi input cache-hit là 0,30 USD/1 triệu token.
Do đó, khi lựa chọn giữa Kimi K3, ChatGPT và Claude, cách đánh giá phù hợp hơn là xác định workload cụ thể rồi so sánh benchmark, chất lượng đầu ra, latency, chi phí và yêu cầu triển khai. Benchmark cung cấp dữ liệu định lượng hữu ích, nhưng không thay thế việc kiểm thử trên dữ liệu và quy trình thực tế của doanh nghiệp.
Kimi K3 giá bao nhiêu?
Kimi K3 giá bao nhiêu phụ thuộc vào cách sử dụng: qua nền tảng Kimi hoặc thông qua API. Với phiên bản sử dụng trên Kimi, K3 được tính vào hạn mức tín dụng chung của gói thành viên, thay vì có một mức giá riêng cho từng lượt sử dụng. Theo bảng giá chính thức hiện tại, Kimi có bốn gói thành viên từ 49 đến 699 nhân dân tệ/tháng (khoảng 180.000–2,53 triệu VNĐ/tháng).
| Gói Kimi | Giá theo tháng | Một số quyền lợi liên quan đến K3 |
|---|---|---|
| Andante | ¥49/tháng (~190.000 VNĐ/tháng) | Kimi Code, Agent, xử lý tài liệu, Deep Research |
| Moderato | ¥99/tháng (~383.000 VNĐ/tháng) | Nhiều hạn mức Agent hơn, Agent Swarm, Kimi Code |
| Allegretto | ¥199/tháng (~770.000 VNĐ/tháng) | Agent nâng cao, Agent Swarm, Goal Mode, Kimi Code |
| Allegro | ¥699/tháng (~2,71 triệu VNĐ/tháng) | Hạn mức cao nhất, hỗ trợ hội thoại K3 dài 1 triệu token, Kimi Code |
Các gói thành viên sử dụng một hạn mức tín dụng chung cho nhiều tính năng như K3, Agent, Deep Research, Kimi Code, Kimi Work và các tính năng khác. Lượng tín dụng được trừ dựa trên mức tiêu thụ token thực tế, vì vậy chi phí sử dụng không chỉ phụ thuộc vào tên gói mà còn phụ thuộc vào độ dài và độ phức tạp của tác vụ. Gói trả theo năm có mức tiết kiệm cao hơn, với mức giảm tối đa được Kimi công bố là ¥1.680 (khoảng 610.000 VNĐ).
Kimi K3 giá bao nhiêu khi sử dụng API?
Nếu sử dụng Kimi K3 API, mô hình được tính phí theo lượng token đầu vào và đầu ra. Theo thông tin chính thức của Kimi, mức giá hiện tại là 0,30 USD/1 triệu token đầu vào có cache (khoảng 7.900 VNĐ), 3 USD/1 triệu token đầu vào không có cache (khoảng 79.000 VNĐ) và 15 USD/1 triệu token đầu ra (khoảng 395.000 VNĐ). Kimi K3 có context window 1 triệu token, nhưng chi phí vẫn được tính dựa trên lượng token thực tế sử dụng.
| Loại sử dụng Kimi K3 API | Giá |
|---|---|
| Input – cache hit | $0,30 / 1 triệu token (~7.900 VNĐ) |
| Input – cache miss | $3,00 / 1 triệu token (~79.000 VNĐ) |
| Output | $15,00 / 1 triệu token (~395.000 VNĐ) |
Với doanh nghiệp hoặc đội ngũ phát triển phần mềm, Kimi K3 API phù hợp hơn khi cần tích hợp model vào ứng dụng, hệ thống AI Agent hoặc quy trình coding tự động. Khi ước tính chi phí, nên tính cả số token đầu vào, token đầu ra, tỷ lệ cache hit và số lần gọi model thay vì chỉ nhìn vào giá trên mỗi triệu token. Kimi cũng cung cấp cơ chế Context Caching để giảm chi phí khi thường xuyên gửi lại cùng một phần ngữ cảnh.
Lưu ý: Giá và quyền lợi thành viên/API có thể được Kimi điều chỉnh theo thời điểm hoặc khu vực. Khi đăng ký hoặc tích hợp production, nên kiểm tra mức giá hiển thị trực tiếp trên trang Kimi tại thời điểm thanh toán.
Cách sử dụng Kimi K3
Kimi K3 có thể được sử dụng theo nhiều hình thức, từ nền tảng Kimi dành cho người dùng phổ thông đến Kimi Code cho lập trình viên và Kimi API cho các ứng dụng cần tích hợp mô hình. Cách lựa chọn phụ thuộc vào mục đích sử dụng, yêu cầu về ngữ cảnh và mức độ kiểm soát hệ thống. Với Kimi Code, tài liệu chính thức hiện xác nhận K3 có hai model ID là k3 và k3-256k, tương ứng với cửa sổ ngữ cảnh tối đa 1 triệu và 256.000 token.
Cách dùng Kimi K3 trên web
Để sử dụng Kimi K3 trên nền tảng web, người dùng có thể thực hiện theo các bước:
- Truy cập nền tảng Kimi và đăng nhập vào tài khoản bằng số điện thoại.
- Mở khu vực trò chuyện hoặc tính năng hỗ trợ model K3.
- Chọn Kimi K3 nếu gói tài khoản được hỗ trợ.
- Nhập yêu cầu vào ô trò chuyện, có thể kèm tài liệu hoặc dữ liệu hình ảnh phù hợp.
- Gửi prompt và chờ Kimi xử lý.
- Với các tác vụ cần suy luận sâu hoặc thực hiện nhiều bước, lựa chọn mức độ reasoning/Agent phù hợp nếu giao diện cung cấp tùy chọn.

Quyền truy cập K3 và cửa sổ ngữ cảnh 1 triệu token phụ thuộc vào gói thành viên. Theo tài liệu Kimi Code hiện tại, K3 khả dụng từ Plus/Moderato trở lên, trong khi quyền sử dụng context 1 triệu token yêu cầu Pro/Allegretto trở lên.
Cách dùng Kimi K3 trên ứng dụng di động
Kimi cung cấp ứng dụng dành cho thiết bị di động, giúp người dùng truy cập các tính năng AI trên Android và iOS. Sau khi cài ứng dụng Kimi từ nền tảng được hỗ trợ, người dùng đăng nhập tài khoản, mở giao diện trò chuyện và lựa chọn model hoặc tính năng tương ứng với quyền truy cập của tài khoản.
Khả năng hiển thị model và hạn mức sử dụng có thể thay đổi theo gói thành viên, khu vực và phiên bản ứng dụng. Vì vậy, người dùng nên kiểm tra model K3 trực tiếp trong ứng dụng tại thời điểm sử dụng.

Cách sử dụng Kimi K3 cho coding
Với lập trình viên, Kimi Code là lựa chọn phù hợp để đưa Kimi K3 vào quy trình phát triển phần mềm. Kimi Code hỗ trợ Desktop, CLI và VS Code, đồng thời cho phép chuyển model trực tiếp trong giao diện.
Kimi Code hiện cung cấp hai model ID dành cho K3:
k3: phiên bản K3 với context tối đa 1.048.576 token trên các gói được hỗ trợ.k3-256k: phiên bản K3 với context cố định 262.144 token.
Cả hai model hỗ trợ các mức độ suy luận low, high và max. Khi sử dụng CLI, có thể nhập /model để chuyển model; trên VS Code, model được chọn từ danh sách trong thanh nhập liệu.

Cách sử dụng Kimi K3 API
Để tích hợp Kimi K3 vào ứng dụng, hệ thống AI Agent hoặc công cụ lập trình, nhà phát triển cần tạo API Key, cấu hình địa chỉ API và chỉ định đúng Model ID. Kimi Code API hiện hỗ trợ giao thức tương thích với OpenAI và Anthropic.
Với giao thức OpenAI-compatible, endpoint dành cho thị trường quốc tế là https://api.kimi.ai/coding/v1; model có thể đặt là k3 hoặc k3-256k. Sau khi gửi request, hệ thống trả về nội dung đầu ra và lượng token sử dụng để tính hạn mức/chi phí theo chính sách tương ứng. Khi triển khai thực tế, cần kiểm tra API key, model ID, giới hạn token, context window và giá API trước khi đưa vào production.
So sánh Kimi K3 với các mô hình AI khác
Kimi K3 thuộc nhóm mô hình AI có định hướng rõ về coding, AI Agent, reasoning và xử lý ngữ cảnh dài. Khi so sánh với các model khác, cần xét đồng thời kiến trúc, cửa sổ ngữ cảnh, khả năng đa phương thức, công cụ Agent và chi phí API. Các thông số dưới đây được tổng hợp từ tài liệu chính thức của từng nhà phát triển; giá API có thể thay đổi theo thời điểm và khu vực.
Kimi K3 so sánh với các mô hình AI ở Mỹ
Kimi K3 vs ChatGPT
Trong bảng dưới đây, GPT-5.4 được dùng làm đại diện cho dòng GPT hiện hành để so sánh trực tiếp với Kimi K3. GPT-5.4 có cửa sổ ngữ cảnh 1,05 triệu token, hỗ trợ suy luận, hình ảnh, công cụ máy tính và MCP; API có giá 2,50 USD/1 triệu token đầu vào và 15 USD/1 triệu token đầu ra.
| Tiêu chí | Kimi K3 | GPT-5.4 |
|---|---|---|
| Nhà phát triển | Moonshot AI | OpenAI |
| Thời điểm ra mắt | 16/07/2026 | 05/03/2026 |
| Trọng số mở | Có | Không |
| Cửa sổ ngữ cảnh | 1 triệu token | 1,05 triệu token |
| Suy luận | Mạnh, tập trung reasoning nhiều bước | Hỗ trợ reasoning với nhiều mức độ |
| Lập trình | Coding Agent, codebase lớn, terminal | Coding, Codex, công cụ phát triển |
| Đa phương thức | Native vision | Văn bản + hình ảnh |
| AI Agent | Agentic coding, tool use, workflow dài | Responses API, computer use, MCP, hosted shell |
| Giá API | $0,30–$3 input; $15 output/1M token | $2,50 input; $15 output/1M token |
| Ứng dụng nổi bật | Coding Agent, knowledge work, reasoning | Coding, công việc chuyên môn, Agent |
Kimi K3 có lợi thế rõ về open-weight và được thiết kế ngay từ đầu cho các workflow coding dài. GPT-5.4 có hệ sinh thái công cụ và API rộng, đồng thời cũng hỗ trợ context trên 1 triệu token.
Kimi K3 vs Claude
Claude Opus 4.6 là đại diện phù hợp để so sánh trong nhóm tác vụ coding và agent. Anthropic công bố Opus 4.6 có context 1 triệu token ở chế độ beta, khả năng coding, agentic task và xử lý codebase lớn; giá API tiêu chuẩn là 5 USD/1 triệu token đầu vào và 25 USD/1 triệu token đầu ra.
| Tiêu chí | Kimi K3 | Claude Opus 4.6 |
|---|---|---|
| Nhà phát triển | Moonshot AI | Anthropic |
| Thời điểm ra mắt | 16/07/2026 | 05/02/2026 |
| Trọng số mở | Có | Không |
| Cửa sổ ngữ cảnh | 1 triệu token | 1 triệu token (beta) |
| Suy luận | Reasoning nhiều bước | Extended/adaptive thinking |
| Lập trình | Agentic coding, codebase lớn | Coding, debugging, code review |
| Đa phương thức | Native vision | Vision |
| AI Agent | Agent, tool calling, terminal | Agent teams, computer/tool use |
| Giá API | $0,30–$3 input; $15 output/1M token | $5 input; $25 output/1M token |
| Ứng dụng nổi bật | Coding Agent, knowledge work | Coding, nghiên cứu, workflow doanh nghiệp |
Kimi K3 so sánh với các mô hình AI ở Trung Quốc
Kimi K3 vs DeepSeek
DeepSeek là nhóm model đáng chú ý khi so sánh với Kimi K3 về open-weight, reasoning và coding. Tuy nhiên, Kimi K3 nổi bật với context 1 triệu token, trong khi các phiên bản DeepSeek cần được xét riêng theo model và thời điểm sử dụng. Vì giá và model ID của DeepSeek thay đổi khá nhanh, doanh nghiệp nên kiểm tra bảng giá chính thức trước khi triển khai.
| Tiêu chí | Kimi K3 | DeepSeek |
|---|---|---|
| Nhà phát triển | Moonshot AI | DeepSeek |
| Trọng số mở | Có | Có ở các model được công bố |
| Cửa sổ ngữ cảnh | 1 triệu token | Phụ thuộc phiên bản |
| Suy luận | Reasoning nhiều bước | Reasoning mạnh |
| Lập trình | Coding Agent, terminal, codebase lớn | Coding và reasoning |
| Đa phương thức | Native vision | Phụ thuộc model |
| AI Agent | Agentic coding, tool use | Hỗ trợ tool/API theo model |
| Giá API | $0,30–$15/1M token tùy loại token | Thay đổi theo model |
| Ứng dụng nổi bật | Coding Agent, workflow dài | Reasoning, coding, AI ứng dụng |
Kimi K3 vs Qwen
Qwen3-Max là mô hình thương mại của Alibaba Cloud, hỗ trợ suy luận, công cụ Agent, tìm kiếm web và fine-tuning. Qwen3-Max có context 262.144 token trên QwenCloud; mức giá quốc tế được công bố từ 1,20 USD/1 triệu token đầu vào và 6 USD/1 triệu token đầu ra với yêu cầu dưới 32K token.
| Tiêu chí | Kimi K3 | Qwen3-Max |
|---|---|---|
| Nhà phát triển | Moonshot AI | Alibaba Cloud/Qwen |
| Trọng số mở | Có | Không đối với Qwen3-Max |
| Cửa sổ ngữ cảnh | 1 triệu token | 262K token |
| Suy luận | Reasoning chuyên sâu | Thinking/Non-thinking |
| Lập trình | Coding Agent | Coding và Agent |
| Đa phương thức | Native vision | Tùy model Qwen |
| AI Agent | Agent, tool calling | Web search, Agent, tool use |
| Giá API | $0,30–$15/1M token | Từ $1,20/$6/1M token |
| Ứng dụng nổi bật | Coding, knowledge work, workflow dài | AI ứng dụng, Agent, doanh nghiệp |
Kimi K3 vs GLM-5.2
GLM-5.2 của Z.ai là model được thiết kế cho các tác vụ dài, với context 1 triệu token, khả năng coding nâng cao và nhiều mức độ suy luận. Z.ai cho biết GLM-5.2 hỗ trợ các công cụ coding như ZCode, Claude Code và OpenCode.
| Tiêu chí | Kimi K3 | GLM-5.2 |
|---|---|---|
| Nhà phát triển | Moonshot AI | Z.ai |
| Thời điểm ra mắt | 16/07/2026 | 16/06/2026 |
| Trọng số mở | Có | Có |
| Cửa sổ ngữ cảnh | 1 triệu token | 1 triệu token |
| Suy luận | Reasoning nhiều bước | Nhiều mức độ suy luận |
| Lập trình | Coding Agent, terminal | Coding, long-horizon task |
| Đa phương thức | Native vision | Tùy triển khai/model |
| AI Agent | Agentic workflow | Coding Agent, công cụ Agent |
| Giá API | $0,30–$15/1M token | Phụ thuộc nền tảng triển khai |
| Ứng dụng nổi bật | Coding, knowledge work, Agent | Coding và tác vụ dài |
Nhìn tổng thể, Kimi K3, GPT-5.4, Claude Opus 4.6 và GLM-5.2 đều đã hướng tới các workflow dài và AI Agent, nên khác biệt không chỉ nằm ở điểm benchmark. Kimi K3 nổi bật với trọng số mở, context 1 triệu token và định hướng coding agent; GPT-5.4 và Claude có hệ sinh thái công cụ/API riêng; Qwen và DeepSeek cung cấp những lựa chọn khác trong hệ sinh thái AI Trung Quốc. Việc chọn model nên dựa trên workload cụ thể, yêu cầu triển khai, khả năng tích hợp, độ trễ và tổng chi phí vận hành thay vì chỉ dựa vào một tiêu chí đơn lẻ.
Kimi K3 có những hạn chế nào?
Kimi K3 sở hữu quy mô 2,8 nghìn tỷ tham số, context window lên đến 1 triệu token và được thiết kế cho các tác vụ coding, reasoning, knowledge work và AI Agent dài hạn. Tuy nhiên, những lợi thế này cũng đi kèm với một số hạn chế cần cân nhắc khi sử dụng thực tế.
Thứ nhất, yêu cầu hạ tầng lớn nếu tự triển khai. Moonshot AI khuyến nghị triển khai Kimi K3 trên cấu hình supernode với từ 64 accelerator trở lên để đạt hiệu quả suy luận phù hợp. Vì vậy, doanh nghiệp muốn self-host model cần đầu tư đáng kể vào GPU, bộ nhớ, mạng và hệ thống inference.
Thứ hai, không phải tác vụ nào cũng cần model 2,8T. Với các yêu cầu như hỏi đáp ngắn, viết nội dung đơn giản, code completion hoặc chỉnh sửa một vài file, một model nhỏ hơn có thể đáp ứng đủ nhu cầu với mức sử dụng tài nguyên thấp hơn. Kimi Code cũng cung cấp phiên bản K3-256K, trong đó K3 1M tiêu thụ quota khoảng gấp đôi phiên bản 256K.
Thứ ba, chi phí có thể tăng nhanh với workflow dài. API Kimi K3 có giá $0.30/MTok cache-hit input, $3/MTok cache-miss input và $15/MTok output. Các agent chạy nhiều vòng, xử lý codebase lớn hoặc sử dụng context dài có thể phát sinh lượng token đáng kể.
Thứ tư, benchmark không phản ánh toàn bộ hiệu năng production. Kết quả benchmark của K3 được thực hiện với thiết lập reasoning và agentic harness khác nhau tùy bài test, nên không nên xem điểm số như đại diện tuyệt đối cho mọi workload.
Cuối cùng, 1 triệu token không đồng nghĩa với việc mọi ứng dụng đều tận dụng hiệu quả toàn bộ context. Chất lượng prompt, cách quản lý context, công cụ agent và kiến trúc ứng dụng vẫn ảnh hưởng lớn đến kết quả. Với doanh nghiệp, cần đánh giá thêm bảo mật dữ liệu, quyền kiểm soát hạ tầng, chi phí vận hành và khả năng tích hợp trước khi triển khai Kimi K3 ở quy mô lớn.
Kết luận
Kimi K3 là một mô hình AI nổi bật với quy mô 2,8 nghìn tỷ tham số, context 1 triệu token, khả năng coding, reasoning, xử lý đa phương thức và xây dựng AI Agent. Bên cạnh hiệu năng trên các tác vụ phức tạp, Kimi K3 còn tạo lợi thế nhờ khả năng open-weight và hỗ trợ nhiều hình thức sử dụng từ nền tảng Kimi đến API và Kimi Code. Tuy nhiên, chi phí token, yêu cầu hạ tầng khi self-host và khả năng khai thác context lớn vẫn cần được cân nhắc theo từng workload. Với doanh nghiệp và đội ngũ phát triển, việc lựa chọn Kimi K3 nên dựa trên nhu cầu thực tế, ngân sách và yêu cầu bảo mật.
Câu hỏi thường gặp
Kimi AI là gì?
Kimi AI là trợ lý AI được Moonshot AI phát triển, hỗ trợ trò chuyện, tìm kiếm web, suy luận, xử lý nội dung đa phương thức và các tác vụ agent. Người dùng có thể truy cập Kimi trên web hoặc ứng dụng di động, trong khi lập trình viên có thể sử dụng Kimi Code và Kimi API để tích hợp AI vào sản phẩm, công cụ hoặc quy trình phát triển phần mềm.
Kimi K3 có gì mới so với các phiên bản trước?
Kimi K3 nâng cấp đáng kể về quy mô và khả năng xử lý tác vụ dài so với các thế hệ trước. Model có 2,8 nghìn tỷ tham số, kiến trúc Kimi Delta Attention và Attention Residuals, native vision cùng context lên đến 1 triệu token. K3 cũng tăng cường coding, reasoning và Agentic Coding, cho phép làm việc với codebase lớn, sử dụng công cụ terminal và thực hiện workflow nhiều bước.
Kimi K3 có những tính năng API nào hỗ trợ lập trình viên?
Kimi K3 API cho phép lập trình viên tích hợp model vào ứng dụng thông qua API tương thích với định dạng OpenAI. Kimi API hỗ trợ text generation, hội thoại nhiều lượt, phân tích file và web search, đồng thời cung cấp model ID kimi-k3 cho K3. Với Kimi Code, lập trình viên còn có thể sử dụng API tương thích OpenAI hoặc Anthropic, cùng các model ID k3 và k3-256k.
Kimi K3 giá bao nhiêu?
Kimi K3 giá phụ thuộc vào cách sử dụng. Với API, mức giá là $0.30/MTok (~7.900 VNĐ) cho input cache-hit, $3.00/MTok (~79.000 VNĐ) cho input cache-miss và $15.00/MTok (~395.000 VNĐ) cho output. Nếu sử dụng Kimi qua gói thành viên, các mức hiện tại gồm ¥49/tháng (~180.000 VNĐ), ¥99 (~360.000 VNĐ), ¥199 (~720.000 VNĐ) và ¥699 (~2,53 triệu VNĐ).
Kimi K3 có miễn phí không?
Kimi K3 không phải lúc nào cũng miễn phí. Quyền sử dụng K3 phụ thuộc vào gói thành viên và hạn mức tín dụng hiện hành. Theo tài liệu Kimi Code, K3 có thể được gọi từ gói Moderato/Plus trở lên, trong khi quyền truy cập context 1 triệu token yêu cầu Allegretto/Pro hoặc cao hơn. API Kimi cũng tính phí theo lượng token sử dụng. Vì vậy, cần kiểm tra gói và hạn mức hiện tại trước khi sử dụng K3 cho workload lớn.
Kimi K3 có mạnh hơn GPT và Claude không?
Không nên kết luận Kimi K3 mạnh hơn GPT hoặc Claude trên mọi tác vụ. Moonshot AI cho biết K3 đạt hiệu năng ở cấp độ frontier trên bộ đánh giá của họ, nhưng hiệu năng tổng thể vẫn thấp hơn các model proprietary mạnh nhất mà hãng so sánh tại thời điểm ra mắt, gồm Claude Fable 5 và GPT 5.6 Sol. Vì benchmark, prompt và agent harness có thể khác nhau, nên nên đánh giá K3 theo workload cụ thể như coding, context dài, agent và chi phí.