Google đang phát triển chip AI mới để tối ưu hóa hiệu suất Gemini

Google đang phát triển chip AI mới được thiết kế để tối ưu hóa hiệu suất Gemini. Chip này được cho là sẽ hiệu quả hơn 6-10 lần so với các chip AI hiện tại của Google, và có thể thay đổi cách các nhà phát triển trên toàn thế giới tương tác với Gemini.

Share
Editorial illustration: A close-up of a silicon wafer under dramatic side-lighting, its intricate circuit pathways and geome — MonstarX

Google đang phát triển chip AI mới để tối ưu hóa hiệu suất Gemini

Hiệu suất cao gấp sáu đến mười lần. Đó là bước nhảy vọt về hiệu năng mà Google đang hướng tới với chip AI thế hệ tiếp theo của mình — và nó có thể thay đổi cách mà mọi nhà phát triển trên thế giới tương tác với Gemini. Google đang phát triển một chip AI mới được thiết kế để tối ưu hóa hiệu suất Gemini tại thời điểm toàn bộ ngành công nghiệp đang tái suy nghĩ về chi phí cơ sở hạ tầng AI thực sự là bao nhiêu, và ai kiểm soát nó.

Đối với các nhà phát triển và người sáng lập trên khắp châu Á, đây không phải là tiếng ồn nền. Đó là một tín hiệu về hướng đi của tính toán AI — và quỹ đạo đó có ý nghĩa gì đối với các sản phẩm bạn đang xây dựng ngay bây giờ.

Điều gì đã xảy ra

Alphabet, công ty mẹ của Google, đang thiết kế một chip máy chủ mới có tên mã nội bộ là "Frozen v2", theo báo cáo của TechCrunch trích dẫn từ The Information. Chip dự kiến sẽ được phát hành vào năm 2028, và mục tiêu hiệu suất là ấn tượng: hiệu quả cao gấp sáu đến mười lần so với các chip AI hiện có của Google, được đo bằng số lượng token được tạo ra trên mỗi đơn vị năng lượng.

Google không xác nhận báo cáo trực tiếp khi TechCrunch liên hệ, nhưng nó cũng không phủ nhận. Tuyên bố của công ty đáng được đọc kỹ:

"Các đội của chúng tôi liên tục nghiên cứu và thử nghiệm các đổi mới mới để cung cấp hiệu suất và hiệu quả tối đa cho người dùng và khách hàng của chúng tôi. Mặc dù không phải mọi dự án đều chuyển sang sản xuất, nhưng sự khám phá nghiêm ngặt này là trung tâm của phương pháp full stack của chúng tôi. Bằng cách thiết kế đồng thời phần cứng và phần mềm của chúng tôi từ đầu, chúng tôi đảm bảo rằng các hệ thống của chúng tôi được tích hợp và tối ưu hóa cao cho các khối lượng công việc thực tế."

Cụm từ đó — "thiết kế đồng thời phần cứng và phần mềm từ đầu" — là tiêu đề thực sự bị chôn vùi bên trong một tuyên bố không xác nhận được lựa chọn từng chữ. Google đang mô tả một chiến lược tích hợp theo chiều dọc: sở hữu toàn bộ stack từ silicon đến mô hình đến API. Đó là một tư thế hoàn toàn khác biệt so với việc mua chip từ bên thứ ba và tối ưu hóa phần mềm xung quanh chúng.

Thời gian cũng quan trọng. Tin tức này xuất hiện khi lo ngại của nhà đầu tư về chi tiêu AI đã bắt đầu làm mát nhiệt tình của thị trường. OpenAI công bố chip suy luận tùy chỉnh đầu tiên của mình, được gọi là Jalapeño, vào tháng Sáu. Anthropic được cho là đang thảo luận với Samsung về một kỹ thuật hợp tác chế tạo chip. Các nhà cung cấp dịch vụ siêu quy mô không chỉ cạnh tranh về các điểm chuẩn mô hình nữa — họ đang cạnh tranh về kinh tế học của suy luận quy mô lớn. Frozen v2 là nước đi của Google trong trò chơi đó.

Tại sao điều này quan trọng đối với châu Á

Châu Á không phải là một người tiêu dùng thụ động của các quyết định cơ sở hạ tầng AI được đưa ra ở Silicon Valley. Khu vực này chạy một số khối lượng công việc AI đòi hỏi nhất trên thế giới — từ dịch thuật thời gian thực trên hàng chục ngôn ngữ đến các hệ thống phát hiện gian lận xử lý hàng triệu giao dịch mỗi giây trên toàn bộ bối cảnh thanh toán phân mảnh của Đông Nam Á. Hiệu quả tính toán không phải là một số liệu trừu tượng ở đây. Nó trực tiếp xác định xem một startup ở Jakarta hay một fintech ở Thành phố Hồ Chí Minh có thể đủ khả năng chạy các tính năng được hỗ trợ bởi Gemini ở quy mô sản xuất hay không.

Hiện tại, chi phí suy luận AI là một ràng buộc thực sự đối với hầu hết các startup châu Á. Kinh tế học của việc gọi API mô hình biên giới hàng chục lần cho mỗi phiên người dùng rất khó để làm việc ở các lợi nhuận mà thị trường Đông Nam Á yêu cầu. Những cải tiến về hiệu quả token-trên-watt không chỉ có lợi cho các trung tâm dữ liệu của Google — chúng cuối cùng sẽ chảy xuống dòng dưới dạng giá API thấp hơn, giới hạn tốc độ cao hơn và thời gian phản hồi nhanh hơn. Mức tăng hiệu quả 6–10x trên cơ sở hạ tầng của Google là, theo thời gian, mức cải tiến 6–10x trong những gì các nhà phát triển có thể đủ khả năng xây dựng.

Cũng có một lớp địa chính trị ở đây. Những tham vọng AI của châu Á liên tục gặp phải một ràng buộc khó khăn: sự thống trị của Nvidia đối với tính toán AI và những áp lực chuỗi cung ứng đi kèm với nó. Mọi người chơi chính — Google, OpenAI, Anthropic, và ngày càng nhiều những nhà vô địch trong nước ở Trung Quốc, Hàn Quốc và Nhật Bản — đều đang cố gắng giảm sự phụ thuộc đó. Đối với các nhà cung cấp dịch vụ đám mây châu Á và các sáng kiến AI được hỗ trợ bởi chính phủ, việc theo dõi Google chứng minh rằng silicon tùy chỉnh có thể cung cấp loại cải tiến hiệu suất này cung cấp một bản thiết kế cụ thể. Hãy mong đợi nhiều người chơi khu vực hơn để tăng tốc độ các chương trình chip của riêng họ để đáp ứng.

Câu chuyện công nghệ châu Á rộng hơn ở đây là về chủ quyền. Các quốc gia như Ấn Độ, Singapore và Hàn Quốc đã thực hiện các khoản đầu tư đáng kể vào cơ sở hạ tầng AI chính xác vì họ hiểu rằng phụ thuộc hoàn toàn vào silicon nước ngoài tạo ra lỗ hổng chiến lược. Dự án Frozen v2 của Google — cho dù nó có được phát hành đúng lịch trình vào năm 2028 hay không — xác nhận logic chiến lược đằng sau những khoản đầu tư đó.

Điều này có ý nghĩa gì đối với các nhà phát triển

Nếu bạn đang xây dựng các sản phẩm được hỗ trợ bởi AI ngày hôm nay, Frozen v2 sẽ không thay đổi kế hoạch sprint của bạn trong 18 tháng tới. Nó được phát hành vào năm 2028, và các tác động hạ lưu đối với giá API và tính khả dụng sẽ mất nhiều thời gian hơn nữa để hiện thực hóa. Nhưng có những điều cụ thể để suy nghĩ ngay bây giờ.

Lựa chọn mô hình sẽ ngày càng trở thành một quyết định cơ sở hạ tầng. Khi Google, OpenAI và Anthropic mỗi cái phát triển silicon tùy chỉnh được tối ưu hóa cho các mô hình của riêng họ, các đặc điểm hiệu suất của những mô hình đó sẽ phân kỳ theo những cách mà bảng xếp hạng điểm chuẩn không nắm bắt được. Một mô hình chạy trên phần cứng suy luận được xây dựng cho mục đích sẽ hoạt động khác nhau trong sản xuất — độ trễ thấp hơn, thông lượng nhất quán hơn, đường cong chi phí tốt hơn ở quy mô — so với cùng một mô hình chạy trên GPU đa năng. Các nhà phát triển hiểu được điều này sẽ đưa ra những lựa chọn kiến trúc tốt hơn.

Nền kinh tế token đang trở nên rẻ hơn, nhưng không đồng đều. Những cải tiến về hiệu quả có xu hướng tập trung trước tiên ở cấp độ nhà cung cấp dịch vụ siêu quy mô, sau đó lan truyền đến các cấp độ doanh nghiệp, và cuối cùng đạt đến API nhà phát triển. Nếu bạn đang xây dựng trên MonstarX hoặc bất kỳ nền tảng phát triển AI-native nào, hãy theo dõi những thay đổi về giá trong các cấp độ Gemini API trong cửa sổ 2027–2028. Những cải tiến về hiệu quả từ Frozen v2 có khả năng sẽ xuất hiện dưới dạng giảm chi phí trước khi chúng xuất hiện dưới dạng các khả năng mới.

Kiến trúc suy luận quan trọng hơn trước đây. Sự chuyển dịch hướng tới các chip suy luận tùy chỉnh — Google với Frozen v2, OpenAI với Jalapeño — báo hiệu rằng ngành công nghiệp đang tối ưu hóa khó khăn cho suy luận thay vì đào tạo. Đối với các nhà phát triển, điều này có nghĩa là khoảng cách giữa "chạy trong một sổ tay" và "chạy trong sản xuất với chi phí chấp nhận được" đang thu hẹp. Đó là tin tốt cho các đội xây dựng các sản phẩm thực tế thay vì các bản demo.

Lên kế hoạch cho rủi ro khóa mô hình. Khi mỗi nhà cung cấp AI chính xây dựng silicon được tối ưu hóa cho các mô hình của riêng họ, chi phí chuyển đổi giữa các nhà cung cấp sẽ tăng lên. Một sản phẩm được tích hợp sâu với bề mặt API của Gemini ngày hôm nay sẽ phải đối mặt với ma sát thực sự khi di chuyển sang một nhà cung cấp khác vào năm 2028, không chỉ vì sự khác biệt về API mà còn vì các đặc điểm hiệu suất cơ bản sẽ được định hình bởi phần cứng chưa tồn tại. Xây dựng với các lớp trừu tượng nơi bạn có thể. Sử dụng connectors và các mẫu tích hợp giữ cho logic ứng dụng của bạn tách biệt khỏi bất kỳ nhà cung cấp mô hình nào.

Theo dõi số liệu token-trên-watt. Đây là số mà Google sử dụng để mô tả mục tiêu hiệu quả của Frozen v2, và nó đáng để thêm vào mô hình tinh thần của bạn về cơ sở hạ tầng AI. Khi những lo ngại về tính bền vững phát triển — đặc biệt là ở các thị trường như Singapore và Nhật Bản nơi tiêu thụ năng lượng trung tâm dữ liệu đang bị giám sát quy định — token-trên-watt sẽ trở thành một tiêu chí mua hàng, không chỉ là một con số tiếp thị.

Những điểm chính

  • Frozen v2 là thực tế, hoặc thực tế đủ. Google không xác nhận cũng không phủ nhận báo cáo, nhưng tuyên bố của nó về "thiết kế đồng thời