Gemini 3.6 Flash cùng hai biến thể chuyên biệt là 3.5 Flash-Lite và 3.5 Flash Cyber vừa chính thức được Google giới thiệu. Lần nâng cấp này tập trung giải quyết đúng hai bài toán lớn nhất của các nhà phát triển: tối ưu chi phí vận hành agent và tăng tốc độ xử lý tác vụ mà không làm suy giảm chất lượng đầu ra.
Theo thông báo chính thức từ Google Blog, phiên bản Flash 3.6 không chỉ vượt trội ở các bài kiểm tra lập trình mà còn cắt giảm đáng kể số lượng token hao phí trong các quy trình làm việc đa bước.

Gemini 3.6 Flash: Tối ưu chi phí và bớt tiêu tốn token
Những người xây dựng AI Agent đều biết cảm giác đau đầu khi mô hình chạy vòng lặp suy luận liên tục làm hóa đơn API tăng vọt. Gemini 3.6 Flash ra đời để trực diện xử lý vấn đề này. Theo thống kê trên Artificial Analysis Index, 3.6 Flash tiêu thụ ít hơn 17% số lượng token đầu ra so với phiên bản 3.5 Flash tiền nhiệm.
Google đặt mức giá cực kỳ cạnh tranh: $1.50 cho 1 triệu token đầu vào và $7.50 cho 1 triệu token đầu ra. Nhờ giảm bớt các bước suy luận thừa và hạn chế gọi tool không cần thiết, chi phí thực tế tính trên mỗi tác vụ agent đã giảm đáng kể.

Hiệu năng thực tế qua các bộ Benchmark
Dù tiết kiệm chi phí hơn, năng lực của 3.6 Flash lại có bước tiến rõ rệt ở nhiều kịch bản phức tạp:
- Lập trình nâng cao: Kết quả trên DeepSWE đạt 49% (so với 37% của 3.5 Flash), giảm bớt các thao tác chỉnh sửa mã lỗi và rút ngắn các vòng lặp thực thi. Kết quả nghiên cứu máy học trên MLE Bench tăng lên 63.9%.
- Thao tác máy tính (Computer Use): Chỉ số OSWorld-Verified tăng từ 78.4% lên 83.0%. Tính năng này hiện đã được tích hợp sẵn dưới dạng client-side tool trong Gemini API và Gemini Enterprise.
- Xử lý tri thức & đa phương thức: Đạt điểm số 1421 trên GDPval-AA v2. Các doanh nghiệp như Hebbia hay Harvey ghi nhận mô hình trích xuất bảng biểu, phân tích tài liệu và lập báo cáo tài chính rất chính xác.

Gemini 3.5 Flash-Lite: Tốc độ 350 token/giây cho hệ thống tải cao
Nếu bạn cần một mô hình phản hồi cực nhanh để làm công cụ tìm kiếm cho Agent hoặc xử lý hàng triệu hóa đơn mỗi ngày, 3.5 Flash-Lite là câu trả lời. Với tốc độ xử lý lên đến 350 output token/giây, đây là model nhanh nhất trong dòng 3.5 series.
Mức giá cho 3.5 Flash-Lite là $0.3/1M input token và $2.5/1M output token. Dù giá rẻ, mô hình này vẫn vượt qua cả bản 3 Flash cũ ở các thử nghiệm SWE-Bench Pro (54.2% so với 49.6%) và Terminal-Bench 2.1 (54% so với 31%).

Gemini 3.5 Flash Cyber: Trợ thủ săn lỗ hổng bảo mật
Song song với hai bản đại chúng, Google giới thiệu Gemini 3.5 Flash Cyber – mô hình tinh chỉnh riêng cho bài toán an ninh mạng. Khi kết hợp với agent bảo mật CodeMender, hệ thống có khả năng tự động phát hiện, kiểm thử và vá lỗi hổng phần mềm trước khi kẻ xấu kịp khai thác.
Do tính chất nhạy cảm của công nghệ an ninh mạng, Google cho biết 3.5 Flash Cyber hiện chỉ được phát hành giới hạn cho các cơ quan chính phủ và đối tác tin cậy thông qua chương trình thử nghiệm CodeMender.

Trải nghiệm và đưa mô hình AI mới vào thực tế
Ngay hôm nay, các nhà phát triển đã có thể dùng thử Gemini 3.6 Flash và 3.5 Flash-Lite trên Google AI Studio, Android Studio cũng như nền tảng Google Antigravity. Ngoài ra, Google xác nhận đã bắt đầu đợt huấn luyện sơ bộ (pre-training) cho thế hệ Gemini 4 và sẽ sớm mở rộng bản 3.5 Pro trong thời gian tới.
Nếu doanh nghiệp của bạn đang muốn ứng dụng các mô hình AI mới nhất để tự động hóa quy trình hoặc tối ưu chiến dịch tăng trưởng khách hàng, hãy tham khảo dịch vụ Digital Marketing của DPS.MEDIA để được tư vấn lộ trình phù hợp.
Ý kiến bạn đọc (0)
Chưa có bình luận nào. Hãy là người đầu tiên chia sẻ cảm nghĩ!
Đăng nhập / Tạo tài khoản
Đăng nhập với Google để gửi bình luận và tương tác cùng cộng đồng.
Tiếp tục là đồng ý với điều khoản sử dụng và chính sách bảo mật của DPS Media.