TradingKey - Google (GOOGL) đã ra mắt hai mô hình mới vào ngày 2 tháng 9 theo giờ Miền Đông: Gemini 3.8 Flash và Gemini 3.8 Flash Cyber. Đây là mô hình thuộc dòng Flash thứ ba được Google ra mắt trong 6 tuần qua, tiếp tục duy trì các đặc tính tốc độ cao và chi phí thấp của Gemini 3.7 Flash trước đó, đồng thời tăng cường hơn nữa khả năng tạo mã, suy luận phức tạp, các tác vụ tác tử và năng lực an ninh mạng.
Mô hình đầu tiên được định vị cho kỹ thuật phần mềm, tác tử AI và các tác vụ suy luận đa bước trong các lĩnh vực chuyên môn; mô hình sau tập trung vào việc phát hiện lỗ hổng và khắc phục tự động, chỉ khả dụng cho các nhà phòng thủ bảo mật đáng tin cậy đã qua kiểm duyệt.
Mặc dù hai mô hình hướng tới các trường hợp sử dụng khác nhau, cả hai đều dựa trên cùng một lõi trí tuệ nền tảng và liên tục đánh giá, tối ưu hóa đầu ra của mô hình thông qua các vòng lặp tác tử kéo dài.
Nâng cấp chính trong Gemini 3.8 Flash tập trung vào việc xử lý các tác vụ phức tạp, liên tục đòi hỏi gọi công cụ nhiều lượt. Google cho biết trong các bài kiểm tra được lựa chọn, hiệu suất của mô hình này tiệm cận với hiệu suất của các mô hình chủ lực có chi phí cao hơn.
Trong bài kiểm tra chuẩn kỹ thuật phần mềm dài hạn DeepSWE v1.1, Gemini 3.8 Flash đạt 73,7%, cao hơn mức 65,3% của Gemini 3.7 Flash, đồng thời vượt qua 72,7% của GPT-5.6 Sol và 69,6% của GPT-5.6 Terra, chỉ kém một chút so với 74,0% của Claude Opus 5.

Nguồn: Google
Trong các tác vụ chuyên ngành, Gemini 3.8 Flash cũng thể hiện khả năng cạnh tranh mạnh mẽ. Trong đó, HLE-Verified bao gồm các câu hỏi đa ngành thuộc các lĩnh vực khoa học, công nghệ, nhân văn và kiến thức chuyên môn, nơi Gemini 3.8 Flash cũng vượt qua mức 31,0% của Claude Sonnet 5, 51,1% của GPT-5.6 Terra, 54,4% của Claude Opus 5 và 54,5% của GPT-5.6 Sol.
Về giá cả, Gemini 3.8 Flash duy trì mức giá ban đầu của Gemini 3.7 Flash: 0,75 USD cho mỗi triệu token đầu vào và 3,75 USD cho mỗi triệu token đầu ra.
So với đó, giá token đầu vào và đầu ra của Claude Opus 5 lần lượt là 5 USD và 25 USD; đối với GPT-5.6 Sol là 4 USD và 20 USD; và đối với GPT-5.6 Terra là 2 USD và 12 USD.
Điều này có nghĩa là Gemini 3.8 Flash tiệm cận hoặc thậm chí vượt qua các mô hình lớn hơn trong một số bài kiểm tra chuẩn về lập trình và suy luận, nhưng với chi phí gọi API thấp hơn đáng kể. Đối với các nhà phát triển đang muốn triển khai đại lý mã nguồn (code agent), phân tích tự động và quy trình làm việc doanh nghiệp, hiệu quả chi phí của mô hình này có thể đóng vai trò là điểm bán hàng chủ đạo.
Gemini 3.8 Flash Cyber là một mô hình quan trọng khác được ra mắt lần này, chủ yếu hướng đến các kịch bản phòng thủ an ninh mạng. Google cho biết mô hình này sẽ không được cung cấp rộng rãi, mà thay vào đó sẽ được cung cấp cho các đội ngũ phòng thủ đã qua kiểm duyệt và đáng tin cậy thông qua chương trình Fairwind mới.
Trong bài đánh giá phát hiện lỗ hổng CyberGym được sử dụng phổ biến trong ngành an ninh mạng, Gemini 3.8 Flash Cyber đạt 86,2%, cao hơn mức 77,5% của Gemini 3.5 Flash Cyber, đồng thời vượt qua mức 83,6% của GPT-5.6 Sol, 83,8% của Mythos 5 và 85,6% của GPT-5.5-Cyber.
Trong thử nghiệm kịch bản thực tế nội bộ bao gồm 20 ngôn ngữ lập trình, Gemini 3.8 Flash Cyber đạt tỷ lệ phát hiện lỗ hổng thành công là 71,0%, cao hơn mức 58,9% của Gemini 3.7 Flash và 46,6% của Gemini 3.5 Flash Cyber.
Về tự động khắc phục sự cố, Gemini 3.8 Flash Cyber đạt tỷ lệ pass@1 là 47,2% trong bài thử nghiệm CWE-Bench do Collinear thực hiện, tiệm cận mức 47,8% của các mô hình hàng đầu, mặc dù Google nhấn mạnh chi phí của mô hình này thấp hơn.