● NTA × anh Huy — MSICà phê 1-130/07/2026

Bài toán chọn model, model chọn phần cứng

Không phải ngược lại. Ai không dùng model thì không hiểu vì sao cần phần cứng đó — và không bán được giải pháp, chỉ bán được cái thùng máy.

Bán lẻ tiêu dùng đang hết cửa: laptop bị các chuỗi lớn hút hết nguồn, kênh Game Net gần như biến mất, thị trường Campuchia còn một phần nhỏ. MSI đã đổi ngôn ngữ marketing từ “máy gaming” sang “máy AI” và đang kéo về server, storage, card pro, PC công nghiệp và dự án nhà nước. Buổi này trả lời đúng một câu hỏi anh Huy lặp lại nhiều lần: bắt đầu từ đâu.

0Biến quyết định phần cứng
0VRAM chạy toàn bộ tải chat
0Tham số model đang dùng
0Consumer AI mới tới lượt
Người hỏi: anh Huy — MSI Người trả lời: NTA — GEARVN Hình thức: cà phê, không agenda
Bối cảnh · Đang đứng ở đâu

Kênh cũ mất trụ, kênh mới chưa biết bán

Hai người ngồi ở hai đầu của cùng một vấn đề. Anh Huy có nguồn hàng, quan hệ hãng và kênh dự án nhưng không có giải pháp để bán. NTA có giải pháp đang chạy thật nhưng chưa có kênh doanh nghiệp và quy mô phần cứng. Cả hai đều kết luận giống nhau: bán lẻ tiêu dùng không hồi phục trước sang năm.

Vấn đề 1

Laptop: không có room

Các chuỗi lớn hút gần hết sản lượng. Ai không nằm trong nhóm đó thì không có room ở nhà phân phối. Cơ chế sống sót duy nhất là bảo trợ giá của hãng — hãng cover phần chênh giữa giá bán thực tế và giá nhập.

Vấn đề 2

Game Net gần như mất

Kênh từng chiếm 50–60% nay còn rất ít. Khách vẫn nâng cấp nhưng gần như không có phòng máy mở mới. Hàng phần lớn đang xoay vòng giữa các đại lý và đẩy lên sàn, không phải tiêu thụ thật.

Vấn đề 3

Campuchia còn 10%

Nhóm khách hàng lớn tại Campuchia không còn. Trước đây lợi nhuận từ thị trường này được dùng để bù cho hoạt động trong nước; nay phần bù đó mất.

Vấn đề 4

Không báo giá được

Nhu cầu dự án có thật, nhưng giá thiết bị AI tăng theo từng lô giao — mỗi vài tháng có thể tăng 700–800 USD. Không forecast được nguồn hàng và giá thì không ai dám báo giá cho hợp đồng giao sau.

Chỗ còn sáng — và vì sao
Đang chạy được

Dự án nhà nước và công an

Duyệt nhanh, có ngân sách, có áp lực giải ngân. Một dự án cỡ trăm tới trăm mấy bộ, đi qua các nhà thầu. Đã qua giai đoạn cho mượn thiết bị để test, đang bắt đầu chuyển sang triển khai và đặt hàng.

Vì sao hợp Local AI

Privacy là bắt buộc, không phải tùy chọn

Khối này yêu cầu dữ liệu ở tại chỗ. Nhu cầu gốc là camera và xử lý ngay tại khu vực, nên hệ thống AI buộc phải chạy local — đây không phải lựa chọn kỹ thuật mà là điều kiện tham gia.

Khoảng trống

Dưới enterprise, trên tiêu dùng

AI tạo ngách mà các hãng server lớn chưa phủ. Đồng thời NVIDIA đang dịch lên trên và bớt quan tâm các SKU nhỏ — phần đó rơi xuống kênh commercial phía dưới. Đây chính là chỗ cả hai bên thấy cơ hội.

Điểm ngắm của buổi này. Không phải chọn mua máy nào. Là hiểu đủ để tư vấn được: bài toán nào cần model gì, model đó cần phần cứng nào, và khi nào thì không nên bán phần cứng.

01 · Chiến lược

Thang năm bậc: phần cứng nằm ở giữa, không ở đầu

Đây là thứ tự phải đi khi tư vấn một doanh nghiệp. Bắt đầu từ bậc 3 — tức là chào cấu hình trước khi biết bài toán — là cách nhanh nhất để bán sai máy hoặc mất deal.

01GỐC

Bài toán

Cụ thể tới mức đo được: nhập bao nhiêu hóa đơn một ngày, bao nhiêu đoạn chat, bao nhiêu request cùng lúc, dữ liệu có được rời khỏi công ty không. “Dùng AI cho công ty” không phải một bài toán.

Sai ở bậc này thì bốn bậc trên đều sai theo
02CHỌN

Model

Bài toán phức tạp cần model to có suy luận. Bài toán đơn giản nhưng khối lượng lớn cần model nhỏ hiệu suất cao. Không phải cái gì cũng cần to — đây là chỗ quyết định toàn bộ chi phí phía sau.

Model là trí thông minh đã được nén, càng thông minh càng nặng
03ĐỦ

Phần cứng

Bộ nhớ quyết định model to tới đâu thì load được và chạy được bao nhiêu luồng song song. Băng thông quyết định tốc độ sinh token. Compute quyết định tốc độ nuốt prompt và throughput khi gộp nhiều yêu cầu. Phần cứng phục vụ model, không phải ngược lại.

Cấu hình chỉ đúng khi bậc 1 và bậc 2 đã rõ
04ĐIỀU

Lớp điều phối

Model chỉ là trí thông minh; nó cần một lớp dẫn dắt: bước một làm gì, bước hai làm gì, con nào chạy ở máy nào, tải bao nhiêu thì chuyển. Đây là phần phải tự xây và cũng là phần khó sao chép.

Thiết bị thì sẵn sàng rồi — phần thiếu là lớp này
05BÁN

Dịch vụ và vòng đời

Triển khai, dữ liệu, đào tạo, hỗ trợ, mở rộng theo tải thật. Phần cứng mở cửa và tạo giá trị hợp đồng; phần này tạo biên lợi nhuận và sự khác biệt.

Không có bậc này thì mình chỉ là một chỗ bán thùng máy
Phần cứng nó phục vụ cho cái chuyện model mà. Mình không hiểu model thì mình sẽ không hiểu AI.— NTA
Nhóm khách hàng — ai trả tiền, ai không
NhómĐánh giá tại bànVì saoƯu tiên
Doanh nghiệp vừa trở lênNhóm chínhKiểu gì cũng phải xài. Ngưỡng hợp lý được nêu: doanh thu từ 100–200 tỷ trở lên. Rào cản không phải ngân sách mà là không biết dùngLàm trước
Dự án / chính phủ / công anNhóm okCó ngân sách, duyệt nhanh, privacy bắt buộc nên phải local. Cần giải được bài toán báo giá và nguồn hàngLàm trước
Cộng đồngNhóm okĐược nhắc cùng hai nhóm trên; chưa bàn cách tiếp cậnSau
Content creator (kiến trúc, đồ họa, dựng phim)Chưa kết luậnAnh Huy nêu như một hướng thay thế cho gaming; buổi này không chốtCâu hỏi mở
MMO / farmBỏ quaHọ đã hiểu phần cứng và tự mua card cũ VRAM cao giá rẻ. Họ tự chơi với nhau, không cần mìnhKhông đuổi
Cá nhân / consumerChưa tớiCloud thông minh hơn nhiều bậc và rẻ hơn. Cần 2–3 năm nữa, khi kiến trúc phần cứng mới trôi xuống consumerChờ

Hệ quả trực tiếp cho bán lẻ. Các chương trình mùa vụ kiểu back-to-school gắn nhãn AI hiện chưa có nội dung thật để bán. Máy cá nhân 16 GB VRAM chạy model nhỏ, không suy luận, người dùng vào thử là bỏ ngay. Gắn chữ AI lên tờ rơi không tạo ra lý do mua.

02 · Chiến thuật

Phần kỹ thuật, viết cho người đi bán đọc được

Toàn bộ phần giải thích trong buổi, sắp lại theo thứ tự dùng được khi ngồi trước khách. Đây cũng là bản nháp đầu tiên của giáo trình educate doanh nghiệp.

Nhóm 1

Local only

Dành cho nơi privacy là bắt buộc: nhà nước, công an, y tế, bệnh viện, và các agency làm cho tập đoàn đa quốc gia có điều khoản bảo mật phạt rất nặng. Hồ sơ bệnh án, hồ sơ đất đai, hồ sơ khách hàng không thể đẩy lên cloud.

Hệ quả: vì không có hybrid nên mọi bài toán đều phải chạy model to — phần cứng rất nặng. Model 500 tới 1.000, thậm chí 2.000 tỷ tham số, cần khoảng 300 GB tới gần 1 TB bộ nhớ ở mức lượng tử hóa 4-bit, tương ứng hạ tầng 10–50 tỷ. Ở FP16 thì riêng model 500 tỷ đã chiếm khoảng 1 TB — nên mọi con số dung lượng đều phải đi kèm mức lượng tử hóa, nếu không là so sai.

Nhóm 2

Hybrid — mặc định cho phần lớn

Local lo phần tải lớn và lặp lại, dữ liệu nhạy cảm. Cloud lo phần suy luận khó, tần suất thấp. Không phải chọn một bên.

Vì sao không anti-cloud: với bài toán phức tạp thì cloud là vô địch và chi phí cực rẻ — 20 tới 100 USD một tháng, rẻ so với giá trị mang lại cho một người có chi phí giờ công cao. Local thắng ở chỗ khác: khối lượng.

Bốn biến quyết định phần cứng — trả lời câu “126 TOPS thì sao?”
Biến 1

Bộ nhớ — có chạy được không

Dung lượng cần = số tham số × số byte mỗi tham số. FP16 là 2 byte, 4-bit là 0,5 byte — nên model 12 tỷ chiếm ~24 GB ở FP16 nhưng chỉ ~7 GB ở 4-bit. Nói “bao nhiêu tỷ tham số thì bấy nhiêu GB” chỉ đúng ở mức 8-bit.

Biến 2

Băng thông — tốc độ sinh token

Đây mới là thứ quyết định trả lời nhanh hay chậm. Mỗi token sinh ra phải đọc lại toàn bộ trọng số, nên xấp xỉ: token/giây ≈ băng thông ÷ dung lượng model. Chỗ này khác nhau rất xa giữa Apple, AMD, NVIDIA, Intel, Qualcomm.

Biến 3

Compute (TOPS) — nuốt prompt & batch

Quyết định tốc độ xử lý phần đầu vào và throughput khi gộp nhiều yêu cầu, không quyết định tốc độ sinh token. Đây là con số hay bị đem ra so một mình và cũng là chỗ hay bị hiểu sai nhất.

Biến 4

KV cache — số luồng song song

Phần bộ nhớ còn lại sau khi nạp model dùng để giữ ngữ cảnh cho từng luồng. Nó tăng theo độ dài context nhân với số người dùng cùng lúc — và chính nó, không phải một giới hạn cứng của phần cứng, quyết định phục vụ được bao nhiêu người.

Vì sao TOPS cao mà vẫn chậm — lấy đúng DGX Spark làm ví dụ. Spark có khoảng 1 PFLOP FP4, tức compute rất lớn, nhưng băng thông chỉ 273 GB/s. Kết quả: chạy một luồng thì chậm, dù TOPS rất cao. Nếu TOPS quyết định tốc độ sinh token thì nó đã phải nhanh nhất thị trường. Đây là bằng chứng rõ nhất cho việc đừng so máy bằng con số TOPS trên hộp.

Đính chính một hiểu nhầm phổ biến: “máy này chỉ chạy được vài request cùng lúc”. GPU không xử lý tuần tự từng yêu cầu — server suy luận gộp chúng vào cùng một bước tính (continuous batching). Benchmark thực đo trên DGX Spark cho thấy nó phục vụ được tới 256 luồng đồng thời với tổng throughput khoảng 695 token/giây. Với 128 GB bộ nhớ hợp nhất, concurrency là điểm mạnh của Spark, không phải điểm yếu — điểm yếu của nó nằm ở tốc độ một luồng. Bán ngược chỗ này thì hoặc mất deal oan, hoặc bán thừa máy khi một con đã dư.

Luận điểm trung tâm — bài toán “to” khác bài toán “tải lớn”
Kiểu A

Bài toán phức tạp

Một request nhưng bên dưới có hàng chục bước. Ví dụ: phân tích bệnh án theo lịch sử bệnh, chỉ số và tri thức y khoa để ra một gợi ý; hoặc nghiệp vụ vận hành nhiều bước nối nhau. Cần model to, có suy luận. Đây là nhóm mà không thứ gì qua được các model siêu lớn.

Kiểu B

Bài toán tải lớn

Request đơn giản nhưng khối lượng khổng lồ. Chat real-time hàng ngàn khách cùng lúc, phân loại, OCR, nhập liệu. Model nhỏ hiệu suất cao là đủ — thậm chí không cần suy luận. Đây là nhóm mà local thắng cloud, vì cloud tính quota.

Không phải cái gì cũng cần to. Cái con nào cũng xài WS300 là sai.— NTA
Ví dụ thật — hệ thống đang chạy tại GEARVN
Bài toán không to, nhưng tải rất lớnĐang chạy

Chat liên tục, phản hồi khách, và các event trên website chạy gần như từng mili giây — scroll là một event, click là một event, cộng lại hàng triệu event mỗi ngày. Một luồng phân loại chạy liên tục, cứ khoảng 5–7 section chat thì sinh một ticket để phân tích hội thoại giữa nhân viên và khách: khách hỏi gì, có dấu hiệu không hài lòng không, có bỏ sót không.

Phần cứng cần cho việc đó1 card 16 GB

Một card 16 GB VRAM, chạy model khoảng 12 tỷ tham số ở mức 4-bit — tức model chiếm ~7 GB, còn lại ~9 GB dành cho KV cache nên phục vụ được nhiều luồng cùng lúc. Chạy suốt ngày, chi phí biên gần như bằng 0 vì server đã có sẵn.

Tên model cần xác nhận lại: bản ghi nghe ra “Qwen 3.5 12B” nhưng họ Qwen3 không có bản 12B (8B, 14B, 30B-A3B, 32B); 12B là của Gemma 3.

Đây là câu chuyện bán hàng mạnh nhất: một VGA 16 GB có thể là toàn bộ hạ tầng AI vận hành của một doanh nghiệp bán lẻ — nếu chọn đúng bài toán.

Model vision

Chỉ đọc và trả về thông tin, không suy luận: “đây là MSI”, “đây là cái bút”. Vài tỷ tham số là đủ. Với robot thì phải chạy on-device, không cần mạng.

Model OCR

Hiện rất mạnh và rất nhẹ. Bản mạnh nhất là PaddleOCR-VL của Baidu — chỉ 0,9 tỷ tham số, đạt 94,5 điểm OmniDocBench v1.5 và 96,33 ở v1.6, vượt cả GPT-4o ở tác vụ đọc tài liệu. DeepSeek-OCR là 3 tỷ tham số (570 triệu active).

Model reasoning

Chỉ gọi khi thật sự cần nghĩ nhiều bước. Nguyên tắc: mỗi model dùng đúng phần cứng phù hợp, rồi ghép lại thành một workflow — nhìn, kiểm tra, suy luận, hành động, báo cáo.

Ghép nhiều máy — “stack lại thì có cộng dồn không?”
Phần đã sẵn sàng

Thiết bị và kết nối

Ghép chung hay để rời rạc đều dùng được. Kết nối qua mạng nội bộ, PCIe hoặc các cổng giao tiếp trên main, luôn có một con điều tiết chung gồm CPU, trình điều khiển và hệ điều hành.

Phần phải tự làm

Lớp điều phối

Bài toán nào chạy ở đâu, model nào ở máy nào, tải bao nhiêu thì chuyển, máy nào đang khỏe. Setup thật đang chạy: Mac Studio ở nhà, workstation server 4080 Super, DGX Spark, RTX 5090 và một RTX Pro 6000 mượn — tất cả nối về một con điều phối duy nhất.

Trước AI là dữ liệu — file không phải là dữ liệu
Hiện tại
File rời
Mỗi nhà phân phối một format, mỗi tuần một bản, phải lật từng cái để xem
Làm sạch
ETL
Chuẩn hóa, ghép, bắt lỗi — AI viết và vận hành luồng này
Lưu
Database
Có cấu trúc, có index, quét hàng triệu dòng vẫn nhanh
Truy vấn
Lớp MCP / tool
AI điều khiển cơ sở dữ liệu để lấy đúng thông tin cần
Dùng
Dashboard & agent
Báo cáo, cảnh báo, hỏi đáp trên dữ liệu thật
Vì sao không đọc thẳng file

File chỉ để làm việc

Đọc trực tiếp trên file thì hiệu suất cực kém, dễ vỡ context window, và model sẽ quên trước quên sau rồi nói bậy. Dữ liệu để phân tích và lưu trữ nhiều kỳ thì phải nằm trong database, không phải trong file.

Vì sao cần AI trong ETL

Automation thuần sẽ gãy

Automation là if/else. Tuần này nhà phân phối gửi kiểu này, tuần sau họ đổi format là luồng gãy và không tự sửa được. AI được đặt đúng vào chỗ đó để phát hiện và tự sửa — một agent chuyên trách với skill và bài học riêng, mỗi lần có vấn đề thì được gọi ra fix rồi cập nhật lại.

Tuần nào cũng thế, ngày nào cũng thế, cũng sẽ như thế. Thì tại sao không làm một cái tool — đổ file vào đó là tự động có dữ liệu sạch.— NTA
Agent đang chạy thật — được mở ra xem tại bàn
AgentViệc nó làmĐiểm đáng chú ý
Tra cứu tồn kho & báo giáGộp báo giá và tồn kho từ hàng chục nhà phân phối, mỗi nhà một format. Tự scan và cập nhật 1–2 lần mỗi ngày, tự sửa cái sửa được, báo cái không sửa đượcNhân viên không phải đụng vào, nhà phân phối cũng không phải đổi cách làm
Đổi giá bánKiểm tra có nhầm không, lợi nhuận còn không; tính giá vốn lần nhập gần nhất và giá vốn trung bình 30 ngày; hỏi xác nhận rồi cập nhật đồng thời web, hệ thống bán hàng và hệ thống nội bộChặn sai sót đúng ở chỗ con người hay quên
Theo dõi tiến độ dự ánTự follow-up tiến độ, tự báo cáo hằng ngày cho group vài chục ngườiMọi người không cần nói chuyện với nhau để biết trạng thái
Quản lý khuyến mãiPhát hiện thiếu banner, tư vấn booking, cập nhật chương trình, phản biện lại nội dung nhân viên định đăngAgent tư vấn ngược, không chỉ báo cáo xuôi
Tổ chức sự kiệnDựng trang đăng ký, thanh toán, xác nhận tự động, quản lý đăng ký, mail xác nhận — trong khoảng 2 ngàyMarketing không tham gia họp, chỉ hỏi agent về agenda và nội dung

Chỗ dễ hiểu nhầm. Model chỉ là trí thông minh. Cái làm agent chạy được là lớp bên trên: skill dạy nó vào đâu lấy cái gì, tool mở cổng cho nó, quy trình quy định bước một bước hai. Không có lớp đó thì model dù to cũng chỉ trả lời chứ không làm được việc.

Line-up phần cứng đã xem — danh sách thảo luận, chưa phải BOM
Thiết bị / dòngVai trò được mô tảTrạng thái
Entry (bộ nhỏ)Camera tại shop, model nhỏ, chạy trực tiếp tại máyThảo luận
Jetson ThorRobot tự hành, ứng dụng nhà máy; được nói là NVIDIA đang bán nhiều cho nhà máyChưa kiểm chứng
DGX Spark (GB10)128 GB bộ nhớ hợp nhất, ~1 PFLOP FP4, băng thông 273 GB/s. Mạnh ở nhiều luồng đồng thời (đo được tới 256 luồng, ~695 tok/s tổng), yếu ở tốc độ một luồng vì băng thông thấpĐã xác minh spec
AMD Ryzen AI MaxUnified memory, được đánh giá “ok, hợp lý”; đợt này đặt được hàngThảo luận
RTX Pro 6000Đang được NTA mượn để test trong cụm điều phốiĐã xác nhận
MSI XpertStation WS300Chính là con “WS300” anh Huy mở ra xem — sản phẩm của MSI trên kiến trúc NVIDIA DGX Station GB300. 784 GB bộ nhớ tổng (288 GB HBM3e + 496 GB LPDDR5X), trong đó 748 GB coherent, ~20 PFLOPS AI computeĐã xác minh spec

Hai chi tiết được giải mã sau buổi. Con số “748.000” hiện trên màn hình lúc xem line-up không phải giá — nó là 748 GB, đúng bằng dung lượng coherent memory của DGX Station GB300. Và “WS300” không phải cách gọi tắt của GB300: đó là tên thương mại MSI XpertStation WS300 — tức anh Huy đang cho xem sản phẩm của chính hãng mình. Giá tham chiếu: MSI niêm yết 85.000 USD, CDW từng list 96.996 USD → khoảng 2,2–2,5 tỷ, khớp với mức “2–3 tỷ” nói tại bàn.

Lợi thế của NVIDIA không nằm ở thông số. Hệ sinh thái model open-source hiện support chuẩn của NVIDIA tốt hơn. Đó là lý do kỹ thuật để ưu tiên, chứ không phải vì con số trên hộp.

03 · Action

Bắt đầu từ đâu — bảy bước, theo thứ tự

Anh Huy hỏi đi hỏi lại một câu: “anh đâu có hình dung được giờ nó bắt đầu từ cái gì.” Đây là câu trả lời, xếp đúng thứ tự thực hiện.

Mua gói trả phí và dùng thật

Giai đoạn đầu 20 USD, khi dùng nhiều thì lên 100 USD. Model đủ to cho bài toán phức tạp hiện là GPT và Claude. Không dùng thì không có cách nào hiểu được sự khác nhau giữa các model.

Chọn đúng một bài toán hữu dụng nhất

Chỗ đang mất thời gian nhất và chưa chính xác. Với anh Huy đó là: mỗi tuần năm nhà phân phối gửi năm báo cáo bán hàng khác nhau, phải tốn một người tổng hợp thành báo cáo phía Nam và phía Bắc.

Ngồi máy một tới hai tiếng

Tự đụng vào bài toán đó, không đứng ngoài xem. Đây là điều kiện bắt buộc — không có đường tắt nào thay được.

Làm database

Thuê máy cloud rất rẻ, khoảng 5 USD một tháng. Đổ file vào, có luồng ETL tự làm sạch, lưu vào database, rồi mới xuất lên dashboard.

Dùng nhiều model để biết điểm mạnh yếu

Đây là bước biến người bán phần cứng thành người bán giải pháp. Hiểu model thì mới trả lời được vì sao khách cần con máy đó, và quan trọng hơn — khi nào khách không cần.

Không cần hiểu sâu tầng dưới

NTA nói thẳng: “em cũng đâu phải dân kỹ thuật, đâu phải dân lập trình” nhưng vẫn giải quyết được bằng cách dùng AI. Nhân viên trong công ty cũng không cần hiểu sâu mà vẫn tự động hóa được việc của mình.

Với riêng anh Huy: không cần Local AI

Bài toán của anh là bài toán quản lý cá nhân, hybrid cloud là đủ. Local dành cho doanh nghiệp có bài toán cụ thể phù hợp — đó là thứ để bán, không phải thứ để tự mua.

Ai làm gì
Anh Huy
MSI
  • Mua gói AI trả phí 20 USD, dùng hằng ngày trước khi nghĩ tới chuyện bán.
  • Chọn một bài toán thật của mình để làm mẫu — ứng viên số một là gộp báo cáo bán hàng từ các nhà phân phối.
  • Xác định dải cấu hình có nguồn hàng để đóng gói demo; mức được nhắc là từ 5060 Ti trở lên.
  • Cùng chị Na hoàn thiện plan và budget cho hướng mới.
  • Xác minh lại line-up, giá và nguồn hàng của các thiết bị đã bàn trước khi đưa vào bất kỳ báo giá nào.
NTA
GEARVN
  • Nhận một bài toán từ anh Huy và làm mẫu tại chỗ, vừa làm vừa chỉ cách làm.
  • Dựng luồng ETL → database → dashboard cho bài toán đó để anh Huy thấy đầu ra trước, kỹ thuật sau.
  • Đóng gói phần giải thích trong buổi thành tài liệu training cho đội sale và kỹ thuật.
  • Chuẩn bị nội dung cho workshop chung nếu hai bên chốt đi tiếp.
Bảng việc
#ViệcNgười làmƯu tiênTrạng thái
1Mua gói AI trả phí và dùng thật (20 USD, sau nâng 100 USD)Anh HuyP1Đề xuất — chưa xác nhận mua
2Chọn một bài toán thật để NTA làm mẫu và show cách làmHai bênP1Đã đồng ý nguyên tắc, chưa chọn bài toán
3Gộp báo cáo bán hàng nhiều nhà phân phối → ETL → database → dashboardNTAP1Ứng viên số một cho việc số 2
4Xác định dải cấu hình có nguồn hàng để đóng gói demoAnh HuyP2Đề xuất
5Workshop chung để educate doanh nghiệpHai bênP2Đề xuất — chưa có ngày
6Hoàn thiện plan và budget cho hướng mớiAnh Huy + chị NaP2Đang làm phía MSI
7Xác minh line-up, giá và nguồn hàng các thiết bị đã bànAnh HuyP1Chưa làm — chặn mọi báo giá

Chưa có gì được cam kết. Anh Huy chốt buổi bằng câu “anh là người nghe đầu” và cho biết đang cùng chị Na làm kế hoạch, làm plan, làm budget để bắt đầu. Nhưng phạm vi hợp tác, mô hình chia việc và chia lợi, timeline và người phụ trách hai phía đều chưa có.

04 · Số & chi phí

Những con số đã nói tại bàn

Số nào là mốc tham chiếu của GEARVN đều được ghi rõ. Số thị trường là quan sát trong lúc trò chuyện, chưa kiểm chứng, và không dùng cho báo giá hay kế hoạch tài chính.

0
VRAM cho toàn bộ tải chat
Một card, chạy suốt ngày, chi phí biên gần như bằng 0
0
Tham số model đang dùng
Lớp 12B, quantize 4-bit → chiếm ~7 GB, còn ~9 GB cho KV cache
0
Database trên cloud mỗi tháng
Đủ để bắt đầu toàn bộ luồng dữ liệu
2–3 tr
Cloud AI cho cả công ty / tháng
Deepseek dùng cho phần không nhạy cảm vì quá rẻ
Chi phí AI thật — mốc tham chiếu GEARVN
Đang chi bao nhiêuKhông phải cam kết
  • Cloud AI cho cả công ty
    Phần không nhạy cảm đẩy sang Deepseek
    2–3 triệu / tháng
  • Local AI — phân loại chat, họp, báo cáo
    Vài ngàn ticket mỗi ngày
    0 đồng
  • Tài khoản cá nhân NTA (GPT + Claude)
    Đang cho cả nhóm dùng chung phần dư
    10–14 triệu / tháng
  • Database trên cloud~5 đô / tháng
  • Gói bắt đầu cho một người
    Giai đoạn sau nâng lên 100 đô
    20 đô / tháng
Số thị trường nói tại bànChưa kiểm chứng
  • Kênh Game Net
    Còn nâng cấp, gần như không mở mới
    50–60% → còn rất ít
  • Doanh số Campuchiacòn ~10% năm ngoái
  • Mức tăng giá thiết bị AI theo lô700–800 USD
  • Card cũ VRAM cao từ Trung Quốc
    V100, Tesla — loại 24 GB
    8–10 triệu / con
  • Setup 4–5 con cho nhóm farm30–40 triệu
  • Card 24 GB đời mớicả trăm triệu
  • MSI XpertStation WS300 (DGX Station GB300)
    Đã xác minh: MSI niêm yết 85.000 USD
    ~2,2–2,5 tỷ
  • Ngưỡng doanh thu khách hàng hợp lýtừ 100–200 tỷ

Vì sao quota là lý do kỹ thuật để về local. Xử lý 1.000 file đơn hàng là 1.000 request. Cloud tính quota theo cửa sổ 5 giờ và 7 ngày — chạy vài vòng là hết. Cùng khối lượng đó chạy trên một máy đã mua thì chỉ trả tiền điện. Đây là ranh giới thật giữa cloud và local, không phải chuyện bảo mật hay khẩu hiệu.

Doanh nghiệp là kiểu gì họ cũng phải xài. Chỉ có điều là họ không biết xài, cho nên mình phải đi educate.— NTA
05 · Lộ trình

Bốn chặng, đầu ra trước, kỹ thuật sau

Toàn bộ lộ trình này là đề xuất rút ra từ buổi nói chuyện, chưa phải cam kết của bên nào. Mỗi chặng chỉ mở khi chặng trước đã có kết quả nhìn thấy được.

Chặng 1 Tự dùng

Đụng tay vào một bài toán

Ngay — vài ngày đầu
  • Mua gói 20 đô, dùng hằng ngày
  • Chốt một bài toán thật của anh Huy
  • NTA làm mẫu, vừa làm vừa chỉ
  • Ngồi máy 1–2 tiếng, không đứng ngoài xem
Chặng 2 Có dữ liệu

Dựng luồng dữ liệu đầu tiên

Tháng 8/2026
  • ETL gộp báo cáo các nhà phân phối
  • Database trên cloud ~5 đô/tháng
  • Dashboard xem thay vì lật từng file
  • Bỏ được người ngồi tổng hợp thủ công
Chặng 3 Có sản phẩm

Đóng gói demo cho doanh nghiệp

Đề xuất — chưa có ngày
  • Chốt dải cấu hình có nguồn hàng
  • Một bài toán chạy thật trên cấu hình đó
  • Tài liệu training cho sale và kỹ thuật
  • Kịch bản demo dưới 7 phút
Chặng 4 Ra thị trường

Workshop và đi cùng hãng

Khi ba chặng trước đã đứng
  • Workshop chung để educate doanh nghiệp
  • Mời hãng và NVIDIA xem demo
  • Mở kênh dự án và doanh nghiệp vừa
  • Chốt mô hình hợp tác giữa hai bên

Vì sao thứ tự này quan trọng. Anh Huy không thiếu nguồn hàng, không thiếu quan hệ hãng, không thiếu kênh dự án. Thứ thiếu là hiểu biết ứng dụng. Nên chặng 1 không phải là chọn máy hay làm bảng giá — mà là tự dùng cho tới khi trả lời được câu hỏi của khách.

Rủi ro & kỳ vọng cần chỉnh

Những chỗ dễ mất tiền và mất uy tín nhất

#Rủi roNguyên nhânMức độXử lý
1Báo giá dự án khi chưa chốt được nguồn hàng và giáGiá thiết bị AI tăng theo từng lô, không forecast đượcCaoXác minh line-up và giá trước; không báo giá cho lịch giao xa
2Bán phần cứng khi chưa biết bài toán của kháchĐi từ bậc 3 thay vì bậc 1 của thangCaoHỏi bài toán, tải và yêu cầu privacy trước khi nói tới cấu hình
3Mặc định “bài toán nào cũng cần model to”Nhầm giữa bài toán phức tạp và bài toán tải lớnCaoPhân loại đúng hai kiểu; nhiều trường hợp 16 GB là đủ
4Gắn nhãn AI lên máy tiêu dùng để bán mùa vụMáy 16 GB VRAM chạy model nhỏ, không suy luậnCaoChưa làm consumer; chờ kiến trúc mới trôi xuống, 2–3 năm
5Đuổi theo nhóm MMO / farmHọ đã hiểu phần cứng và mua card cũ giá rẻTrung bìnhBỏ qua nhóm này, tập trung doanh nghiệp và dự án
6So máy bằng con số TOPS trên hộpTưởng compute quyết định tốc độ trả lời, trong khi decode bị chặn bởi băng thôngCaoHỏi băng thông trước, TOPS sau; TOPS chỉ có nghĩa cho prefill và batch
7Nói “máy này chỉ chạy được vài request cùng lúc”Tưởng GPU xử lý tuần tự; bỏ qua continuous batching và KV cacheCaoTính KV cache còn trống; Spark đo được tới 256 luồng đồng thời
8Để AI đọc thẳng file thay vì databaseVỡ context window, model quên trước quên sauTrung bìnhETL đưa về database, đặt lớp truy vấn ở trên
9Dùng automation thuần cho luồng dữ liệu nhiều nguồnNhà phân phối đổi format là luồng gãyThấpĐặt AI vào đúng chỗ tự phát hiện và tự sửa

Câu hỏi còn mở. Mô hình hợp tác là gì — giới thiệu, đồng bán, đồng triển khai, hay chỉ trao đổi kiến thức? Ai đứng tên giải pháp trước khách? Phần cứng đi qua kênh nào và ai bảo vệ deal? Phần giải pháp, triển khai và đào tạo định giá và chia thế nào? Ai bên MSI được training để tư vấn? Chưa câu nào có trả lời.

Phụ lục

Từ ngữ kỹ thuật và những câu đáng nhớ

Phần từ ngữ viết cho người đi bán, để lần sau ngồi trước khách là nói được chứ không phải hỏi lại.

Model — mô hình ngôn ngữ lớn
Trí thông minh đã được nén từ một bộ tri thức, đóng gói lại như một bộ não. Càng thông minh thì càng nặng vì bên trong càng nhiều tham số.
Tham số
Đơn vị đo độ lớn của model. Dung lượng cần = số tham số × số byte mỗi tham số: FP16 là 2 byte, 8-bit là 1 byte, 4-bit là 0,5 byte. Nói con số dung lượng mà không nói mức lượng tử hóa là nói thiếu.
VRAM / bộ nhớ
Quyết định model to tới đâu thì load được, và phần dư ra nuôi được bao nhiêu luồng. Không đủ thì model không lên, bất kể máy mạnh cỡ nào.
Băng thông
Thứ quyết định tốc độ sinh token. Mỗi token phải đọc lại toàn bộ trọng số, nên xấp xỉ: token/giây ≈ băng thông ÷ dung lượng model. Khác nhau rất xa giữa các nền tảng.
TOPS / AI compute
Sức tính toán. Quyết định tốc độ xử lý prompt đầu vào và throughput khi gộp nhiều yêu cầu — không quyết định tốc độ sinh token. DGX Spark là ví dụ: TOPS rất cao nhưng một luồng vẫn chậm vì băng thông thấp.
KV cache
Phần bộ nhớ giữ ngữ cảnh cho từng luồng đang chạy, tăng theo độ dài context nhân số người dùng cùng lúc. Đây mới là thứ giới hạn số luồng phục vụ được.
Concurrency & continuous batching
Server suy luận gộp nhiều yêu cầu vào cùng một bước tính chứ không chạy tuần tự từng cái. Không có con số concurrency cố định theo phần cứng — nó do KV cache còn trống và scheduler quyết định.
Quantize
Nén model xuống độ chính xác thấp hơn (ví dụ 4-bit) để chạy được trên phần cứng nhỏ hơn, đổi lấy một chút chất lượng.
Unified memory
Bộ nhớ dùng chung giữa CPU và GPU. Là thứ khiến máy cá nhân đời mới chạy được model lớn — máy đời cũ gần như không có hiệu quả.
Reasoning / non-reasoning
Model có suy luận nhiều bước, hay chỉ nhận vào rồi trả ra. Model nhỏ non-reasoning trả lời rời rạc từng câu, không nối được ngữ cảnh.
Context window
Lượng nội dung model giữ được cùng lúc. Vượt quá là nó quên trước quên sau và bắt đầu nói bậy — lý do không nên cho đọc thẳng file lớn.
Token & quota
Đơn vị tính của cloud. Quota theo cửa sổ 5 giờ và 7 ngày; bài toán khối lượng lớn sẽ đốt hết quota rất nhanh.
ETL
Luồng lấy dữ liệu từ nguồn, làm sạch rồi lưu vào database. Bình thường là việc của data engineer; nay AI viết và vận hành được.
Database
Kho dữ liệu có cấu trúc và có index, phục vụ tính toán. Quét hàng triệu dòng vẫn nhanh. Khác hẳn file.
MCP
Lớp công cụ để AI truy vấn và can thiệp vào hệ thống thật — kèm quy định cái nào chỉ được đọc, cái nào được ghi.
Agent
Hệ thống dùng model để làm việc thật: có skill dạy nó vào đâu lấy gì, có tool mở cổng, có quy trình từng bước, và có người xác nhận trước khi ghi.
Local / Hybrid / Cloud
Local cho privacy bắt buộc và tải lớn lặp lại. Cloud cho suy luận khó và tần suất thấp. Hybrid là mặc định cho phần lớn doanh nghiệp.
Câu nói định hình tư duy

“Cái con nào cũng xài WS300 là sai.”

— NTA, về việc mặc định dùng model to

“Không phải cái gì cũng cần to.”

— NTA

“Phần cứng nó phục vụ cho cái chuyện model mà.”

— NTA

“Mình không hiểu model thì mình sẽ không hiểu AI. Tại vì nó xoay quanh cái chuyện đó thôi.”

— NTA

“Marketing cũng chuyển hết rồi, đâu bây giờ đâu có kêu máy gaming nữa đâu. Giờ còn máy AI chứ.”

— anh Huy, MSI

“Giờ không làm là chết.”

— anh Huy, về việc phải chuyển hướng

“Anh đâu có hình dung được giờ nó bắt đầu từ cái gì, làm cái gì đâu.”

— anh Huy

“Giống như bây giờ anh đi bán hàng mà anh đâu có biết sản phẩm là cái gì đâu.”

— anh Huy

“Doanh nghiệp là kiểu gì họ cũng phải xài. Chỉ có điều là họ không biết xài.”

— NTA

“Robot mà cần cloud, cần mạng là banh xác rồi.”

— NTA, về model chạy on-device

“Em cũng đâu phải là dân kỹ thuật đâu, em cũng đâu phải dân lập trình đâu.”

— NTA

“Sếp cho em một bài toán, em show cho sếp xem là em làm cái việc đó như thế nào.”

— NTA

“Nên phải có cái tay, chứ không phải cái gì cũng phải nhờ người khác.”

— NTA

“Anh là người nghe đầu.”

— anh Huy, cuối buổi