Bỏ qua điều hướng, đến nội dung chính

AI

Kimi K3 là gì? Tính năng, giá và cách sử dụng model AI 2,8T

kimi k3

Kimi K3 là mô hình AI mã nguồn mở của Moonshot AI, nổi bật với kiến trúc Mixture-of-Experts (MoE), quy mô 2,8 nghìn tỷ tham số và khả năng xử lý ngữ cảnh lên đến 1 triệu token. Model được định hướng cho coding, reasoning, knowledge work và AI Agent, đồng thời hỗ trợ xử lý dữ liệu đa phương thức. Trong bài viết này, TOT sẽ giúp bạn tìm hiểu Kimi K3 là gì, các tính năng nổi bật, mức giá, cách sử dụng và khả năng ứng dụng thực tế.

Mục lục

Tóm tắt nhanh

  • Kimi K3 là mô hình AI open-weight của Moonshot AI, nổi bật với 2,8 nghìn tỷ tham số, context lên đến 1 triệu token và khả năng xử lý đa phương thức. Model được tối ưu cho coding, reasoning, knowledge work và AI Agent.
  • K3 có thể hỗ trợ viết và debug code, phân tích tài liệu dài, nghiên cứu, xử lý hình ảnh, làm việc với codebase lớn và thực hiện các workflow nhiều bước. Người dùng có thể tiếp cận K3 qua Kimi, Kimi Code và Kimi API.
  • Về chi phí, K3 API có giá từ $0.30/MTok (~7.900 VNĐ) cho input cache-hit; các gói Kimi bắt đầu từ ¥49 (~180.000 VNĐ)/tháng. Tuy nhiên, K3 cũng yêu cầu hạ tầng lớn khi self-host và chi phí có thể tăng với tác vụ dài.
  • Nhìn chung, Kimi K3 phù hợp với các nhu cầu cần context lớn, coding chuyên sâu và AI Agent, nhưng nên lựa chọn dựa trên workload, ngân sách và yêu cầu hạ tầng thực tế.

Kimi K3 là gì?

Kimi K3 là mô hình AI open-weight do Moonshot AI phát triển, ra mắt vào tháng 7/2026, với quy mô 2,8 nghìn tỷ tham số. Model sử dụng kiến trúc Mixture-of-Experts (MoE), gồm 896 chuyên gia và kích hoạt một phần tham số cho mỗi lần xử lý. Kimi K3 được xây dựng với khả năng nhìn và hiểu hình ảnh, cửa sổ ngữ cảnh lên đến 1 triệu token, đồng thời hỗ trợ các tác vụ như lập trình, suy luận chuyên sâu, xử lý công việc tri thức và xây dựng AI Agent. Moonshot AI cũng áp dụng Kimi Delta Attention (KDA) và Attention Residuals (AttnRes) trong kiến trúc của mô hình.

Thông số nhanh của Kimi K3

Thông sốChi tiết
Tên modelKimi K3
Nhà phát triểnMoonshot AI
Thời điểm ra mắtTháng 7/2026
Loại modelOpen-weight, đa phương thức
Tổng số tham số2,8 nghìn tỷ (2,8T)
Kiến trúcMixture-of-Experts (MoE)
Số lượng chuyên gia896
Tham số được kích hoạt104 tỷ
Công nghệ AttentionKimi Delta Attention (KDA)
Kiến trúc bổ sungAttention Residuals (AttnRes)
Cửa sổ ngữ cảnhLên đến 1 triệu token
Khả năng đa phương thứcHỗ trợ hiểu hình ảnh và dữ liệu trực quan
Tác vụ trọng tâmLập trình, suy luận, công việc tri thức, AI Agent
Hình thức sử dụngNền tảng Kimi, Kimi Code và Kimi API

Với quy mô 2,8 nghìn tỷ tham số, Kimi K3 thuộc nhóm các mô hình AI có tổng số tham số rất lớn. Tuy nhiên, toàn bộ 2,8T tham số không được sử dụng trong mỗi lần xử lý. Kiến trúc Mixture-of-Experts cho phép mô hình lựa chọn các chuyên gia phù hợp với từng yêu cầu, với khoảng 104 tỷ tham số được kích hoạt. Cách thiết kế này giúp giảm lượng tính toán cần thiết so với việc kích hoạt toàn bộ tham số ở mọi lượt xử lý.

Một điểm đáng chú ý khác của Kimi K3 model là cửa sổ ngữ cảnh lên đến 1 triệu token. Dung lượng này cho phép model xử lý lượng lớn thông tin trong cùng một phiên, chẳng hạn như mã nguồn của một dự án lớn, nhiều tài liệu nghiên cứu hoặc các bộ tài liệu dài. Kimi K3 cũng được Moonshot AI định hướng cho lập trình, suy luận chuyên sâu, công việc tri thức và các quy trình AI Agent nhiều bước, thay vì chỉ phục vụ các cuộc hội thoại hỏi – đáp thông thường.

kimi k3 là gì
Kimi K3 là mô hình trí tuệ nhân tạo đa phương thức, dạng open-weight. (Nguồn: Internet)

Các tính năng nổi bật của Kimi K3

Kimi K3 được Moonshot AI định vị là mô hình AI dành cho lập trình dài hạn, công việc tri thức và suy luận, thay vì chỉ phục vụ hội thoại hỏi – đáp. Điểm đáng chú ý của model nằm ở quy mô 2,8 nghìn tỷ tham số, cửa sổ ngữ cảnh 1 triệu token, khả năng đa phương thức và năng lực thực hiện các tác vụ nhiều bước.

2,8 nghìn tỷ tham số với kiến trúc Mixture-of-Experts

Kimi K3 có tổng cộng 2,8 nghìn tỷ tham số, nhưng con số này không có nghĩa là toàn bộ 2,8T tham số đều hoạt động trong mỗi lần xử lý. Model sử dụng kiến trúc Mixture-of-Experts (MoE), trong đó hệ thống gồm 896 expert (chuyên gia) và chỉ lựa chọn một phần expert phù hợp để xử lý từng yêu cầu. Theo Moonshot AI, Kimi K3 kích hoạt 16/896 expert trong mỗi lượt xử lý, tương ứng với khoảng 104 tỷ tham số được kích hoạt.

Cách thiết kế này cho phép Kimi K3 duy trì quy mô tham số rất lớn mà không phải thực hiện tính toán trên toàn bộ model ở mọi lượt. Nhờ đó, model có thể mở rộng năng lực xử lý trong khi vẫn tối ưu hiệu quả sử dụng tài nguyên. Kimi K3 cũng kết hợp Kimi Delta Attention (KDA) và Attention Residuals (AttnRes) để cải thiện khả năng mở rộng khi xử lý các chuỗi thông tin dài.

Context window lên đến 1 triệu token

Một trong những điểm nổi bật nhất của Kimi K3 là cửa sổ ngữ cảnh lên đến 1 triệu token. Hiểu đơn giản, context window xác định lượng thông tin mà model có thể tiếp nhận và sử dụng trong một phiên xử lý. Với dung lượng này, Kimi K3 có thể duy trì nhiều thông tin hơn khi làm việc với các nhiệm vụ phức tạp và kéo dài. Moonshot AI cho biết K3 được thiết kế cho các cuộc hội thoại dài và dự án phức tạp.

Trong thực tế, khả năng này hữu ích khi phân tích một bộ tài liệu dài, đọc nhiều báo cáo cùng lúc hoặc nghiên cứu một chủ đề cần đối chiếu nhiều nguồn. Với lập trình, model có thể làm việc với codebase lớn, theo dõi nhiều tệp và duy trì ngữ cảnh trong các phiên sửa lỗi, kiểm thử và tối ưu liên tục. Với AI Agent, context lớn cũng giúp hệ thống lưu giữ nhiều thông tin hơn trong một workflow nhiều bước, giảm nhu cầu chia nhỏ nhiệm vụ hoặc liên tục cung cấp lại dữ liệu cho model.

Khả năng đa phương thức và hiểu hình ảnh

Kimi K3 là mô hình đa phương thức (multimodal) với khả năng nhìn nguyên bản (native vision). Theo thông tin chính thức của Kimi, model có thể hiểu văn bản, hình ảnh và video, đồng thời xử lý các dạng dữ liệu trực quan như screenshot và tài liệu.

Khả năng này mở rộng phạm vi sử dụng của Kimi K3 so với một mô hình chỉ xử lý văn bản. Người dùng có thể đưa screenshot giao diện để model phân tích, nhận diện vấn đề trong thiết kế hoặc hỗ trợ viết mã dựa trên giao diện trực quan. Với dữ liệu biểu đồ, hình ảnh và tài liệu, mô hình có thể kết hợp thông tin trực quan với nội dung văn bản để thực hiện phân tích. Moonshot AI cũng minh họa khả năng K3 sử dụng ảnh chụp màn hình trong vòng lặp giữa code và kết quả hiển thị, từ đó liên tục điều chỉnh sản phẩm trong các tác vụ phát triển game và giao diện.

Khả năng reasoning, coding và AI Agent

Kimi K3 được thiết kế xoay quanh ba nhóm năng lực chính: suy luận (reasoning), lập trình (coding) và quy trình tác vụ theo tác nhân (agentic workflow). Trong lập trình, K3 có thể duy trì các phiên làm việc dài, xử lý kho mã lớn và điều phối công cụ dòng lệnh với mức độ giám sát của con người thấp hơn.

Với reasoning, model được định hướng cho các nhiệm vụ cần phân tích nhiều bước thay vì chỉ đưa ra câu trả lời dựa trên một lượt hỏi. Còn với AI Agent, Kimi K3 có thể kết hợp lập kế hoạch, gọi công cụ, thực thi, kiểm tra kết quả và điều chỉnh dựa trên phản hồi. Kimi mô tả K3 có khả năng hiểu codebase lớn, điều phối terminal tools và liên tục thay đổi cách tiếp cận dựa trên kết quả nhận được. Vì vậy, Kimi K3 model được định vị nhiều hơn như một nền tảng hỗ trợ hoàn thành công việc phức tạp, thay vì chỉ là chatbot hỏi – đáp.

Open-weight và khả năng tự triển khai

Open-weight nghĩa là trọng số của mô hình được công bố để người dùng có thể tải về và triển khai theo điều kiện giấy phép đi kèm. Với Kimi K3, Moonshot AI đã công bố đầy đủ model weights và cho phép người dùng chạy, triển khai, tinh chỉnh (fine-tune) và sửa đổi model khi tuân thủ Kimi K3 License.

Điều này mang lại lợi ích cho doanh nghiệp và đội ngũ kỹ thuật cần kiểm soát môi trường triển khai hoặc dữ liệu. Tuy nhiên, tự triển khai Kimi K3 đòi hỏi hạ tầng tính toán rất lớn do mô hình có quy mô 2,8T tham số. Moonshot AI khuyến nghị cấu hình triển khai với 64 accelerator trở lên trong môi trường supernode để phục vụ model hiệu quả.

Đối với coding, Kimi K3 còn được thiết kế để làm việc với codebase lớn, sử dụng terminal tools và thực hiện nhiều vòng viết mã → kiểm tra → nhận phản hồi → điều chỉnh. Đây là yếu tố quan trọng khi triển khai model cho các workflow kỹ thuật kéo dài thay vì chỉ sử dụng cho những yêu cầu tạo mã đơn lẻ.

tính năng kimi 3
Các tính năng nổi bật của Kimi K3. (Nguồn: TOT)

Kimi K3 có thể làm được gì?

Kimi K3 được thiết kế cho các tác vụ vượt ra ngoài hỏi–đáp thông thường, đặc biệt là lập trình, nghiên cứu, xử lý tri thức và các quy trình công việc nhiều bước. Moonshot AI công bố nhiều trường hợp sử dụng cho thấy K3 có thể kết hợp khả năng suy luận, lập trình, xử lý hình ảnh và công cụ để thực hiện các dự án phức tạp với mức độ can thiệp của con người thấp hơn.

Kimi K3 hỗ trợ lập trình và phát triển phần mềm

K3 có thể thực hiện các tác vụ lập trình dài hạn như tối ưu nhân GPU, phát triển trình biên dịch GPU và xây dựng phần mềm. Trong một thử nghiệm, Kimi K3 đã phát triển MiniTriton, một trình biên dịch theo hướng Triton với lớp biểu diễn trung gian (IR), các bước tối ưu và quy trình tạo mã PTX.

Moonshot AI cũng công bố trường hợp K3 tham gia tối ưu nhân GPU trong quá trình phát triển mô hình. K3 có thể làm việc trong môi trường thử nghiệm, đo hiệu năng, viết lại mã nguồn và đánh giá kết quả qua các vòng kiểm thử.

Kimi K3 hỗ trợ nghiên cứu và xử lý tri thức

K3 có thể kết hợp tài liệu nghiên cứu, tìm kiếm thông tin, lập trình và phân tích dữ liệu để thực hiện các quy trình nghiên cứu phức tạp. Một trường hợp được Moonshot AI công bố cho thấy K3 đã đối chiếu hơn 20 bài nghiên cứu, triển khai quy trình tính toán, đánh giá hơn 300 phương trình trạng thái và tạo hơn 3.000 dòng mã Python trong một nghiên cứu vật lý thiên văn.

Trong nghiên cứu ngành, K3 cũng được sử dụng để tạo báo cáo tương tác về 42 năm ngành chip AI ASIC. Quy trình này sử dụng hơn 2.800 lượt tìm kiếm và thu thập dữ liệu, 1.100 lượt truy xuất dữ liệu qua công cụ dòng lệnh và xử lý dữ liệu từ hơn 11.000 trang.

Kimi K3 hỗ trợ tác vụ AI Agent nhiều bước

K3 có thể thực hiện các quy trình yêu cầu lập kế hoạch, gọi công cụ, thực hiện nhiều bước và kiểm tra kết quả. Một trường hợp nổi bật được Moonshot AI công bố là K3 tự thiết kế, tối ưu và kiểm chứng một chip dành cho mô hình nano trong một phiên làm việc tự động kéo dài 48 giờ, sử dụng các công cụ thiết kế chip điện tử mã nguồn mở.

Trong một nghiên cứu khác về 391 sự kiện sóng hấp dẫn, K3 sử dụng hơn 20 tác nhân AI con để thực hiện các nhiệm vụ song song, đồng thời tạo biểu đồ trực quan, bảng dữ liệu và tổng hợp tài liệu.

Các trường hợp trên cho thấy K3 có thể phối hợp nhiều công cụ và bước xử lý để hoàn thành một nhiệm vụ, thay vì chỉ tạo một câu trả lời duy nhất.

Kimi K3 xử lý hình ảnh, video và nội dung trực quan

K3 có khả năng kết hợp văn bản, hình ảnh và video trong các quy trình sáng tạo và kỹ thuật. Moonshot AI giới thiệu trường hợp K3 xây dựng một thế giới mở 3D có thể tương tác bằng cách kết hợp khả năng suy luận không gian, lập trình và xử lý hình ảnh.

Trong quy trình này, K3 có thể tìm tài liệu tham khảo, tạo tài nguyên 3D, viết logic trò chơi và sử dụng ảnh chụp màn hình để tiếp tục điều chỉnh sản phẩm.

K3 cũng được sử dụng để chỉnh sửa một video giới thiệu từ 56 đoạn video nguồn, bao gồm lựa chọn cảnh, cắt theo chuyển động, đồng bộ nhịp, xử lý âm thanh và thực hiện nhiều vòng chỉnh sửa. Các trường hợp này cho thấy K3 có thể ứng dụng vào phát triển game, thiết kế trực quan và biên tập video.

ứng dụng của Kimi K3 AI
Các ứng dụng của Kimi K3 AI. (Nguồn: TOT)

Đánh giá Kimi K3 qua benchmark

Benchmark là một trong những cách phổ biến để đánh giá năng lực của mô hình AI trên các nhóm tác vụ cụ thể. Theo bộ kết quả do Moonshot AI công bố, Kimi K3 đạt kết quả cạnh tranh ở coding, tác vụ Agent, nghiên cứu và suy luận. Tuy nhiên, benchmark không đại diện hoàn toàn cho hiệu năng khi triển khai thực tế. Kết quả có thể thay đổi theo bộ dữ liệu, prompt, mức độ suy luận, công cụ và agent harness được sử dụng.

Kimi K3 đạt kết quả như thế nào?

Moonshot AI đánh giá Kimi K3 ở nhiều benchmark về lập trình, tác vụ agent và suy luận. Một số kết quả tiêu biểu gồm:

Nhóm đánh giáBenchmarkKimi K3Ý nghĩa chính
CodingDeepSWE67,5Xử lý tác vụ kỹ thuật phần mềm
CodingTerminal-Bench 2.188,3Thực hiện tác vụ thông qua terminal
CodingFrontierSWE81,2Coding với tác vụ phần mềm phức tạp
CodingProgram Bench77,8Giải quyết bài toán lập trình
CodingSWE Marathon42,0Coding theo quy trình dài
AgentBrowseComp91,2Nghiên cứu và duyệt web theo tác vụ
AgentDeepSearchQA95,0Tìm kiếm và tổng hợp thông tin
AgentAutomation Bench30,8Tự động hóa tác vụ nhiều bước
ReasoningGPQA-Diamond93,5Suy luận trên câu hỏi chuyên môn
MultimodalMMMU-Pro81,6Suy luận trên dữ liệu đa phương thức
MultimodalOmniDocBench91,1Hiểu tài liệu kết hợp văn bản và hình ảnh

Lưu ý: Các điểm số được tổng hợp từ công bố benchmark của Moonshot AI; một số benchmark sử dụng harness khác nhau nên không nên dùng bảng trên để tạo ra một thứ hạng tổng thể giữa các model.

Các kết quả trên được thực hiện với mức độ suy luận tối đa, nhưng không phải tất cả các mô hình đều được đánh giá trong cùng một môi trường. Moonshot AI cho biết Kimi K3 sử dụng Kimi Code, Claude Code hoặc Codex tùy theo benchmark, trong khi kết quả của các model khác có thể đến từ những harness khác nhau. Vì vậy, việc lấy một điểm benchmark riêng lẻ để kết luận model nào mạnh hơn toàn diện có thể dẫn đến cách hiểu sai.

Benchmark cũng không phản ánh đầy đủ hiệu năng production. Trong thực tế, doanh nghiệp còn phải xem xét độ trễ, độ ổn định, chi phí token, khả năng tích hợp công cụ, giới hạn API và đặc điểm workload. Một model có điểm benchmark cao chưa chắc tạo ra hiệu quả tương ứng trong mọi quy trình thực tế.

Kimi K3 mạnh nhất ở đâu?

Nhìn từ cấu trúc benchmark và các trường hợp sử dụng Moonshot AI công bố, Kimi K3 nổi bật ở những workflow yêu cầu nhiều bước xử lý và duy trì ngữ cảnh trong thời gian dài. Coding Agent là một ví dụ rõ ràng: K3 có thể điều hướng kho mã lớn, sử dụng terminal, chạy kiểm tra và tiếp tục điều chỉnh mã trong các phiên làm việc kéo dài.

Long-context cũng là một điểm đáng chú ý. Với cửa sổ 1 triệu token, Kimi K3 có thể tiếp nhận lượng lớn tài liệu hoặc thông tin trong một workflow mà không cần liên tục chia nhỏ dữ liệu đầu vào. Tuy nhiên, kích thước context không đồng nghĩa model luôn khai thác hiệu quả 100% lượng thông tin được đưa vào.

Ở nhóm AI Agent, kết quả BrowseComp, DeepSearchQA và Automation Bench cho thấy K3 có năng lực đáng chú ý trong các tác vụ cần tìm kiếm, sử dụng công cụ và thực hiện nhiều bước. Moonshot AI cũng công bố các thử nghiệm trong đó K3 thực hiện nghiên cứu với hàng nghìn lượt tìm kiếm và truy xuất dữ liệu, sau đó tổng hợp thành báo cáo trực quan.

Kimi K3 có thực sự vượt GPT và Claude?

Không thể trả lời câu hỏi này bằng một kết luận “có” hoặc “không”. Ngay trong công bố của Moonshot AI, hãng ghi nhận hiệu năng tổng thể của Kimi K3 vẫn thấp hơn các model độc quyền mạnh nhất mà hãng đưa vào so sánh, dù K3 đạt mức hiệu năng rất cao trong nhiều bài đánh giá.

Có thể nhìn Kimi K3 theo từng tiêu chí:

  • Coding: K3 có kết quả mạnh ở nhiều benchmark, nhưng không dẫn đầu tất cả. Ví dụ, K3 đạt 88,3 trên Terminal-Bench 2.1, trong khi GPT-5.6 Sol đạt 88,8 theo bảng benchmark của Moonshot AI; ở FrontierSWE, K3 đạt 81,2 trong khi Claude Fable 5 đạt 86,6.
  • Long-context: cửa sổ 1 triệu token là một thông số đáng chú ý, đặc biệt với nghiên cứu, codebase lớn và workflow nhiều bước. Tuy nhiên, khả năng khai thác context cần được đánh giá theo từng loại tác vụ.
  • Open-weight: Kimi K3 có lợi thế về khả năng tiếp cận trọng số mô hình và triển khai trong môi trường riêng, khác với các mô hình đóng chỉ được cung cấp thông qua dịch vụ của nhà phát triển.
  • Trợ lý AI tổng quát: hiệu quả phụ thuộc vào từng tác vụ cụ thể. Một model có điểm cao trên coding Agent chưa chắc cũng dẫn đầu ở mọi nhu cầu hội thoại, sáng tạo hoặc xử lý tài liệu.
  • Chi phí: giá model cần được đánh giá cùng với lượng token đầu vào, đầu ra, tỷ lệ cache-hit và số lần gọi model. Kimi K3 có giá API được Moonshot AI công bố là 3 USD/1 triệu token đầu vào không cache và 15 USD/1 triệu token đầu ra, trong khi input cache-hit là 0,30 USD/1 triệu token.

Do đó, khi lựa chọn giữa Kimi K3, ChatGPT và Claude, cách đánh giá phù hợp hơn là xác định workload cụ thể rồi so sánh benchmark, chất lượng đầu ra, latency, chi phí và yêu cầu triển khai. Benchmark cung cấp dữ liệu định lượng hữu ích, nhưng không thay thế việc kiểm thử trên dữ liệu và quy trình thực tế của doanh nghiệp.

Kimi K3 giá bao nhiêu?

Kimi K3 giá bao nhiêu phụ thuộc vào cách sử dụng: qua nền tảng Kimi hoặc thông qua API. Với phiên bản sử dụng trên Kimi, K3 được tính vào hạn mức tín dụng chung của gói thành viên, thay vì có một mức giá riêng cho từng lượt sử dụng. Theo bảng giá chính thức hiện tại, Kimi có bốn gói thành viên từ 49 đến 699 nhân dân tệ/tháng (khoảng 180.000–2,53 triệu VNĐ/tháng).

Gói KimiGiá theo thángMột số quyền lợi liên quan đến K3
Andante¥49/tháng (~190.000 VNĐ/tháng)Kimi Code, Agent, xử lý tài liệu, Deep Research
Moderato¥99/tháng (~383.000 VNĐ/tháng)Nhiều hạn mức Agent hơn, Agent Swarm, Kimi Code
Allegretto¥199/tháng (~770.000 VNĐ/tháng)Agent nâng cao, Agent Swarm, Goal Mode, Kimi Code
Allegro¥699/tháng (~2,71 triệu VNĐ/tháng)Hạn mức cao nhất, hỗ trợ hội thoại K3 dài 1 triệu token, Kimi Code

Các gói thành viên sử dụng một hạn mức tín dụng chung cho nhiều tính năng như K3, Agent, Deep Research, Kimi Code, Kimi Work và các tính năng khác. Lượng tín dụng được trừ dựa trên mức tiêu thụ token thực tế, vì vậy chi phí sử dụng không chỉ phụ thuộc vào tên gói mà còn phụ thuộc vào độ dài và độ phức tạp của tác vụ. Gói trả theo năm có mức tiết kiệm cao hơn, với mức giảm tối đa được Kimi công bố là ¥1.680 (khoảng 610.000 VNĐ).

Kimi K3 giá bao nhiêu khi sử dụng API?

Nếu sử dụng Kimi K3 API, mô hình được tính phí theo lượng token đầu vào và đầu ra. Theo thông tin chính thức của Kimi, mức giá hiện tại là 0,30 USD/1 triệu token đầu vào có cache (khoảng 7.900 VNĐ), 3 USD/1 triệu token đầu vào không có cache (khoảng 79.000 VNĐ) và 15 USD/1 triệu token đầu ra (khoảng 395.000 VNĐ). Kimi K3 có context window 1 triệu token, nhưng chi phí vẫn được tính dựa trên lượng token thực tế sử dụng.

Loại sử dụng Kimi K3 APIGiá
Input – cache hit$0,30 / 1 triệu token (~7.900 VNĐ)
Input – cache miss$3,00 / 1 triệu token (~79.000 VNĐ)
Output$15,00 / 1 triệu token (~395.000 VNĐ)

Với doanh nghiệp hoặc đội ngũ phát triển phần mềm, Kimi K3 API phù hợp hơn khi cần tích hợp model vào ứng dụng, hệ thống AI Agent hoặc quy trình coding tự động. Khi ước tính chi phí, nên tính cả số token đầu vào, token đầu ra, tỷ lệ cache hit và số lần gọi model thay vì chỉ nhìn vào giá trên mỗi triệu token. Kimi cũng cung cấp cơ chế Context Caching để giảm chi phí khi thường xuyên gửi lại cùng một phần ngữ cảnh.

Lưu ý: Giá và quyền lợi thành viên/API có thể được Kimi điều chỉnh theo thời điểm hoặc khu vực. Khi đăng ký hoặc tích hợp production, nên kiểm tra mức giá hiển thị trực tiếp trên trang Kimi tại thời điểm thanh toán.

Cách sử dụng Kimi K3

Kimi K3 có thể được sử dụng theo nhiều hình thức, từ nền tảng Kimi dành cho người dùng phổ thông đến Kimi Code cho lập trình viên và Kimi API cho các ứng dụng cần tích hợp mô hình. Cách lựa chọn phụ thuộc vào mục đích sử dụng, yêu cầu về ngữ cảnh và mức độ kiểm soát hệ thống. Với Kimi Code, tài liệu chính thức hiện xác nhận K3 có hai model ID là k3 và k3-256k, tương ứng với cửa sổ ngữ cảnh tối đa 1 triệu và 256.000 token.

Cách dùng Kimi K3 trên web

Để sử dụng Kimi K3 trên nền tảng web, người dùng có thể thực hiện theo các bước:

  1. Truy cập nền tảng Kimi và đăng nhập vào tài khoản bằng số điện thoại.
  2. Mở khu vực trò chuyện hoặc tính năng hỗ trợ model K3.
  3. Chọn Kimi K3 nếu gói tài khoản được hỗ trợ.
  4. Nhập yêu cầu vào ô trò chuyện, có thể kèm tài liệu hoặc dữ liệu hình ảnh phù hợp.
  5. Gửi prompt và chờ Kimi xử lý.
  6. Với các tác vụ cần suy luận sâu hoặc thực hiện nhiều bước, lựa chọn mức độ reasoning/Agent phù hợp nếu giao diện cung cấp tùy chọn.
đăng nhập Kimi AI
Đăng nhập Kimi AI trên máy tính, sau đó chọn model K3. (Nguồn: TOT)

Quyền truy cập K3 và cửa sổ ngữ cảnh 1 triệu token phụ thuộc vào gói thành viên. Theo tài liệu Kimi Code hiện tại, K3 khả dụng từ Plus/Moderato trở lên, trong khi quyền sử dụng context 1 triệu token yêu cầu Pro/Allegretto trở lên.

Cách dùng Kimi K3 trên ứng dụng di động

Kimi cung cấp ứng dụng dành cho thiết bị di động, giúp người dùng truy cập các tính năng AI trên Android và iOS. Sau khi cài ứng dụng Kimi từ nền tảng được hỗ trợ, người dùng đăng nhập tài khoản, mở giao diện trò chuyện và lựa chọn model hoặc tính năng tương ứng với quyền truy cập của tài khoản.

Khả năng hiển thị model và hạn mức sử dụng có thể thay đổi theo gói thành viên, khu vực và phiên bản ứng dụng. Vì vậy, người dùng nên kiểm tra model K3 trực tiếp trong ứng dụng tại thời điểm sử dụng.

Đăng nhập Kimi AI trên điện thoại di động
Đăng nhập Kimi AI trên điện thoại di động, sau đó chọn model K3 để trải nghiệm. (Nguồn: TOT)

Cách sử dụng Kimi K3 cho coding

Với lập trình viên, Kimi Code là lựa chọn phù hợp để đưa Kimi K3 vào quy trình phát triển phần mềm. Kimi Code hỗ trợ Desktop, CLI và VS Code, đồng thời cho phép chuyển model trực tiếp trong giao diện.

Kimi Code hiện cung cấp hai model ID dành cho K3:

  • k3: phiên bản K3 với context tối đa 1.048.576 token trên các gói được hỗ trợ.
  • k3-256k: phiên bản K3 với context cố định 262.144 token.

Cả hai model hỗ trợ các mức độ suy luận low, high và max. Khi sử dụng CLI, có thể nhập /model để chuyển model; trên VS Code, model được chọn từ danh sách trong thanh nhập liệu.

Kimi K3 Code
Kimi Code hỗ trợ Desktop, CLI và VS Code, đồng thời cho phép người dùng chọn và chuyển đổi model trực tiếp trong quá trình làm việc. (Nguồn: TOT)

Cách sử dụng Kimi K3 API

Để tích hợp Kimi K3 vào ứng dụng, hệ thống AI Agent hoặc công cụ lập trình, nhà phát triển cần tạo API Key, cấu hình địa chỉ API và chỉ định đúng Model ID. Kimi Code API hiện hỗ trợ giao thức tương thích với OpenAI và Anthropic.

Với giao thức OpenAI-compatible, endpoint dành cho thị trường quốc tế là https://api.kimi.ai/coding/v1; model có thể đặt là k3 hoặc k3-256k. Sau khi gửi request, hệ thống trả về nội dung đầu ra và lượng token sử dụng để tính hạn mức/chi phí theo chính sách tương ứng. Khi triển khai thực tế, cần kiểm tra API key, model ID, giới hạn token, context window và giá API trước khi đưa vào production.

So sánh Kimi K3 với các mô hình AI khác

Kimi K3 thuộc nhóm mô hình AI có định hướng rõ về coding, AI Agent, reasoning và xử lý ngữ cảnh dài. Khi so sánh với các model khác, cần xét đồng thời kiến trúc, cửa sổ ngữ cảnh, khả năng đa phương thức, công cụ Agent và chi phí API. Các thông số dưới đây được tổng hợp từ tài liệu chính thức của từng nhà phát triển; giá API có thể thay đổi theo thời điểm và khu vực.

Kimi K3 so sánh với các mô hình AI ở Mỹ

Kimi K3 vs ChatGPT

Trong bảng dưới đây, GPT-5.4 được dùng làm đại diện cho dòng GPT hiện hành để so sánh trực tiếp với Kimi K3. GPT-5.4 có cửa sổ ngữ cảnh 1,05 triệu token, hỗ trợ suy luận, hình ảnh, công cụ máy tính và MCP; API có giá 2,50 USD/1 triệu token đầu vào và 15 USD/1 triệu token đầu ra.

Tiêu chíKimi K3GPT-5.4
Nhà phát triểnMoonshot AIOpenAI
Thời điểm ra mắt16/07/202605/03/2026
Trọng số mởCóKhông
Cửa sổ ngữ cảnh1 triệu token1,05 triệu token
Suy luậnMạnh, tập trung reasoning nhiều bướcHỗ trợ reasoning với nhiều mức độ
Lập trìnhCoding Agent, codebase lớn, terminalCoding, Codex, công cụ phát triển
Đa phương thứcNative visionVăn bản + hình ảnh
AI AgentAgentic coding, tool use, workflow dàiResponses API, computer use, MCP, hosted shell
Giá API$0,30–$3 input; $15 output/1M token$2,50 input; $15 output/1M token
Ứng dụng nổi bậtCoding Agent, knowledge work, reasoningCoding, công việc chuyên môn, Agent

Kimi K3 có lợi thế rõ về open-weight và được thiết kế ngay từ đầu cho các workflow coding dài. GPT-5.4 có hệ sinh thái công cụ và API rộng, đồng thời cũng hỗ trợ context trên 1 triệu token.

Kimi K3 vs Claude

Claude Opus 4.6 là đại diện phù hợp để so sánh trong nhóm tác vụ coding và agent. Anthropic công bố Opus 4.6 có context 1 triệu token ở chế độ beta, khả năng coding, agentic task và xử lý codebase lớn; giá API tiêu chuẩn là 5 USD/1 triệu token đầu vào và 25 USD/1 triệu token đầu ra.

Tiêu chíKimi K3Claude Opus 4.6
Nhà phát triểnMoonshot AIAnthropic
Thời điểm ra mắt16/07/202605/02/2026
Trọng số mởCóKhông
Cửa sổ ngữ cảnh1 triệu token1 triệu token (beta)
Suy luậnReasoning nhiều bướcExtended/adaptive thinking
Lập trìnhAgentic coding, codebase lớnCoding, debugging, code review
Đa phương thứcNative visionVision
AI AgentAgent, tool calling, terminalAgent teams, computer/tool use
Giá API$0,30–$3 input; $15 output/1M token$5 input; $25 output/1M token
Ứng dụng nổi bậtCoding Agent, knowledge workCoding, nghiên cứu, workflow doanh nghiệp

Kimi K3 so sánh với các mô hình AI ở Trung Quốc

Kimi K3 vs DeepSeek

DeepSeek là nhóm model đáng chú ý khi so sánh với Kimi K3 về open-weight, reasoning và coding. Tuy nhiên, Kimi K3 nổi bật với context 1 triệu token, trong khi các phiên bản DeepSeek cần được xét riêng theo model và thời điểm sử dụng. Vì giá và model ID của DeepSeek thay đổi khá nhanh, doanh nghiệp nên kiểm tra bảng giá chính thức trước khi triển khai.

Tiêu chíKimi K3DeepSeek
Nhà phát triểnMoonshot AIDeepSeek
Trọng số mởCóCó ở các model được công bố
Cửa sổ ngữ cảnh1 triệu tokenPhụ thuộc phiên bản
Suy luậnReasoning nhiều bướcReasoning mạnh
Lập trìnhCoding Agent, terminal, codebase lớnCoding và reasoning
Đa phương thứcNative visionPhụ thuộc model
AI AgentAgentic coding, tool useHỗ trợ tool/API theo model
Giá API$0,30–$15/1M token tùy loại tokenThay đổi theo model
Ứng dụng nổi bậtCoding Agent, workflow dàiReasoning, coding, AI ứng dụng

Kimi K3 vs Qwen

Qwen3-Max là mô hình thương mại của Alibaba Cloud, hỗ trợ suy luận, công cụ Agent, tìm kiếm web và fine-tuning. Qwen3-Max có context 262.144 token trên QwenCloud; mức giá quốc tế được công bố từ 1,20 USD/1 triệu token đầu vào và 6 USD/1 triệu token đầu ra với yêu cầu dưới 32K token.

Tiêu chíKimi K3Qwen3-Max
Nhà phát triểnMoonshot AIAlibaba Cloud/Qwen
Trọng số mởCóKhông đối với Qwen3-Max
Cửa sổ ngữ cảnh1 triệu token262K token
Suy luậnReasoning chuyên sâuThinking/Non-thinking
Lập trìnhCoding AgentCoding và Agent
Đa phương thứcNative visionTùy model Qwen
AI AgentAgent, tool callingWeb search, Agent, tool use
Giá API$0,30–$15/1M tokenTừ $1,20/$6/1M token
Ứng dụng nổi bậtCoding, knowledge work, workflow dàiAI ứng dụng, Agent, doanh nghiệp

Kimi K3 vs GLM-5.2

GLM-5.2 của Z.ai là model được thiết kế cho các tác vụ dài, với context 1 triệu token, khả năng coding nâng cao và nhiều mức độ suy luận. Z.ai cho biết GLM-5.2 hỗ trợ các công cụ coding như ZCode, Claude Code và OpenCode.

Tiêu chíKimi K3GLM-5.2
Nhà phát triểnMoonshot AIZ.ai
Thời điểm ra mắt16/07/202616/06/2026
Trọng số mởCóCó
Cửa sổ ngữ cảnh1 triệu token1 triệu token
Suy luậnReasoning nhiều bướcNhiều mức độ suy luận
Lập trìnhCoding Agent, terminalCoding, long-horizon task
Đa phương thứcNative visionTùy triển khai/model
AI AgentAgentic workflowCoding Agent, công cụ Agent
Giá API$0,30–$15/1M tokenPhụ thuộc nền tảng triển khai
Ứng dụng nổi bậtCoding, knowledge work, AgentCoding và tác vụ dài

Nhìn tổng thể, Kimi K3, GPT-5.4, Claude Opus 4.6 và GLM-5.2 đều đã hướng tới các workflow dài và AI Agent, nên khác biệt không chỉ nằm ở điểm benchmark. Kimi K3 nổi bật với trọng số mở, context 1 triệu token và định hướng coding agent; GPT-5.4 và Claude có hệ sinh thái công cụ/API riêng; Qwen và DeepSeek cung cấp những lựa chọn khác trong hệ sinh thái AI Trung Quốc. Việc chọn model nên dựa trên workload cụ thể, yêu cầu triển khai, khả năng tích hợp, độ trễ và tổng chi phí vận hành thay vì chỉ dựa vào một tiêu chí đơn lẻ.

Kimi K3 có những hạn chế nào?

Kimi K3 sở hữu quy mô 2,8 nghìn tỷ tham số, context window lên đến 1 triệu token và được thiết kế cho các tác vụ coding, reasoning, knowledge work và AI Agent dài hạn. Tuy nhiên, những lợi thế này cũng đi kèm với một số hạn chế cần cân nhắc khi sử dụng thực tế.

Thứ nhất, yêu cầu hạ tầng lớn nếu tự triển khai. Moonshot AI khuyến nghị triển khai Kimi K3 trên cấu hình supernode với từ 64 accelerator trở lên để đạt hiệu quả suy luận phù hợp. Vì vậy, doanh nghiệp muốn self-host model cần đầu tư đáng kể vào GPU, bộ nhớ, mạng và hệ thống inference.

Thứ hai, không phải tác vụ nào cũng cần model 2,8T. Với các yêu cầu như hỏi đáp ngắn, viết nội dung đơn giản, code completion hoặc chỉnh sửa một vài file, một model nhỏ hơn có thể đáp ứng đủ nhu cầu với mức sử dụng tài nguyên thấp hơn. Kimi Code cũng cung cấp phiên bản K3-256K, trong đó K3 1M tiêu thụ quota khoảng gấp đôi phiên bản 256K.

Thứ ba, chi phí có thể tăng nhanh với workflow dài. API Kimi K3 có giá $0.30/MTok cache-hit input, $3/MTok cache-miss input và $15/MTok output. Các agent chạy nhiều vòng, xử lý codebase lớn hoặc sử dụng context dài có thể phát sinh lượng token đáng kể.

Thứ tư, benchmark không phản ánh toàn bộ hiệu năng production. Kết quả benchmark của K3 được thực hiện với thiết lập reasoning và agentic harness khác nhau tùy bài test, nên không nên xem điểm số như đại diện tuyệt đối cho mọi workload.

Cuối cùng, 1 triệu token không đồng nghĩa với việc mọi ứng dụng đều tận dụng hiệu quả toàn bộ context. Chất lượng prompt, cách quản lý context, công cụ agent và kiến trúc ứng dụng vẫn ảnh hưởng lớn đến kết quả. Với doanh nghiệp, cần đánh giá thêm bảo mật dữ liệu, quyền kiểm soát hạ tầng, chi phí vận hành và khả năng tích hợp trước khi triển khai Kimi K3 ở quy mô lớn.

Kết luận

Kimi K3 là một mô hình AI nổi bật với quy mô 2,8 nghìn tỷ tham số, context 1 triệu token, khả năng coding, reasoning, xử lý đa phương thức và xây dựng AI Agent. Bên cạnh hiệu năng trên các tác vụ phức tạp, Kimi K3 còn tạo lợi thế nhờ khả năng open-weight và hỗ trợ nhiều hình thức sử dụng từ nền tảng Kimi đến API và Kimi Code. Tuy nhiên, chi phí token, yêu cầu hạ tầng khi self-host và khả năng khai thác context lớn vẫn cần được cân nhắc theo từng workload. Với doanh nghiệp và đội ngũ phát triển, việc lựa chọn Kimi K3 nên dựa trên nhu cầu thực tế, ngân sách và yêu cầu bảo mật.

Câu hỏi thường gặp

Kimi AI là gì?

Kimi AI là trợ lý AI được Moonshot AI phát triển, hỗ trợ trò chuyện, tìm kiếm web, suy luận, xử lý nội dung đa phương thức và các tác vụ agent. Người dùng có thể truy cập Kimi trên web hoặc ứng dụng di động, trong khi lập trình viên có thể sử dụng Kimi Code và Kimi API để tích hợp AI vào sản phẩm, công cụ hoặc quy trình phát triển phần mềm.

Kimi K3 có gì mới so với các phiên bản trước?

Kimi K3 nâng cấp đáng kể về quy mô và khả năng xử lý tác vụ dài so với các thế hệ trước. Model có 2,8 nghìn tỷ tham số, kiến trúc Kimi Delta Attention và Attention Residuals, native vision cùng context lên đến 1 triệu token. K3 cũng tăng cường coding, reasoning và Agentic Coding, cho phép làm việc với codebase lớn, sử dụng công cụ terminal và thực hiện workflow nhiều bước.

Kimi K3 có những tính năng API nào hỗ trợ lập trình viên?

Kimi K3 API cho phép lập trình viên tích hợp model vào ứng dụng thông qua API tương thích với định dạng OpenAI. Kimi API hỗ trợ text generation, hội thoại nhiều lượt, phân tích file và web search, đồng thời cung cấp model ID kimi-k3 cho K3. Với Kimi Code, lập trình viên còn có thể sử dụng API tương thích OpenAI hoặc Anthropic, cùng các model ID k3 và k3-256k.

Kimi K3 giá bao nhiêu?

Kimi K3 giá phụ thuộc vào cách sử dụng. Với API, mức giá là $0.30/MTok (~7.900 VNĐ) cho input cache-hit, $3.00/MTok (~79.000 VNĐ) cho input cache-miss và $15.00/MTok (~395.000 VNĐ) cho output. Nếu sử dụng Kimi qua gói thành viên, các mức hiện tại gồm ¥49/tháng (~180.000 VNĐ), ¥99 (~360.000 VNĐ), ¥199 (~720.000 VNĐ) và ¥699 (~2,53 triệu VNĐ).

Kimi K3 có miễn phí không?

Kimi K3 không phải lúc nào cũng miễn phí. Quyền sử dụng K3 phụ thuộc vào gói thành viên và hạn mức tín dụng hiện hành. Theo tài liệu Kimi Code, K3 có thể được gọi từ gói Moderato/Plus trở lên, trong khi quyền truy cập context 1 triệu token yêu cầu Allegretto/Pro hoặc cao hơn. API Kimi cũng tính phí theo lượng token sử dụng. Vì vậy, cần kiểm tra gói và hạn mức hiện tại trước khi sử dụng K3 cho workload lớn.

Kimi K3 có mạnh hơn GPT và Claude không?

Không nên kết luận Kimi K3 mạnh hơn GPT hoặc Claude trên mọi tác vụ. Moonshot AI cho biết K3 đạt hiệu năng ở cấp độ frontier trên bộ đánh giá của họ, nhưng hiệu năng tổng thể vẫn thấp hơn các model proprietary mạnh nhất mà hãng so sánh tại thời điểm ra mắt, gồm Claude Fable 5 và GPT 5.6 Sol. Vì benchmark, prompt và agent harness có thể khác nhau, nên nên đánh giá K3 theo workload cụ thể như coding, context dài, agent và chi phí.

Bạn cần tư vấn giải pháp công nghệ phù hợp cho doanh nghiệp?

LIÊN HỆ TƯ VẤN NGAY →

Bài viết liên quan

Liên hệ

Bạn đã sẵn sàng chưa?

Cùng TOT bắt đầu hành trình xây dựng dự án ngay hôm nay!

Gửi tin nhắn cho TOT. Đội ngũ TOT sẽ đề xuất giải pháp để nâng tầm doanh nghiệp của bạn.

Sự khác biệt:

  • Dịch vụ cao cấp
  • Giải pháp hiệu quả
  • Cam kết thời gian

Đặt lịch tư vấn miễn phí

top
Liên hệ WhatsApp TopOnTech
Chat on Zalo