Griffin AI của Tavus đã thuyết phục được 26 trên 54 người trong các cuộc gọi video trực tiếp tin rằng họ đang nói chuyện với một con người thật. Chính vì lý do này, công ty vẫn chưa mở rộng mô hình này cho khách hàng sử dụng.
Tavus gọi đây là mô hình AI đầu tiên vượt qua “bài kiểm tra Turing qua video”. Hệ thống trước đây của họ, cũng được thử nghiệm tương tự, chỉ đánh lừa được 1 trong số 41 người tham gia.
Đồng sáng lập kiêm CEO của Tavus, Hassaan Raza, cho rằng con người giao tiếp với nhau không chỉ bằng lời nói, mà còn qua biểu cảm, giọng điệu và nhịp điệu. Trong khi đó, máy móc khiến người dùng phải thích nghi thông qua các lệnh, cú nhấp chuột hoặc prompt chính xác.
Ý tưởng của ông là tạo ra một chiếc máy tính có thể “đọc” được cảm xúc, giọng điệu giống như một người thật, thậm chí trông cũng rất giống người.
Theo dõi chúng tôi trên X để nhận tin tức mới nhất
Introducing Griffin, the first model to pass the video Turing test.48% of people who talked to it live thought it was a real human. Previous systems have had a pass rate <3%. It is #1 on NVIDIA's benchmark for full-duplex AI video.It’s the first Human Interaction Model (HIM). pic.twitter.com/eb11XbC8Xr
— Tavus (@tavus) October 1, 2026
Tavus so sánh Griffin với các hệ thống xếp tầng, nơi nhận diện giọng nói, mô hình ngôn ngữ và tổng hợp giọng nói phải hoạt động lần lượt. Những hệ thống này thường chỉ trả lời sau khi người dùng nói xong.
Griffin có khả năng kiểm tra lại toàn bộ hội thoại từng phần nhỏ của giây, kết hợp đọc đồng thời cả lời nói lẫn tín hiệu phi ngôn ngữ. Đặc biệt, hệ thống này còn quan sát hình ảnh video, điều mà nhiều hệ thống tương tác khác thường bỏ qua.
Nhờ thiết kế này, Griffin có thể gật đầu hoặc đáp lại bằng những câu như “ừm-hừm” ngay khi người đối diện vẫn đang nói, và cũng dễ dàng tiếp tục cuộc trò chuyện nếu bị ngắt quãng.
“Khả năng tạo giọng nói của Griffin-Lite giúp tạo ra âm thanh chất lượng cao với độ trễ tương đương hội thoại thực tế, và có thể sao chép giọng của ai đó chỉ từ khoảng 10 giây âm thanh,” Tavus cho biết.
Bảng đo lường VideoFDB của NVIDIA dùng để kiểm tra khả năng trò chuyện video trực tiếp của AI. Griffin đã đạt điểm 3.83 trên 5.
Bản ghi hình của con người đạt 3.92 điểm, còn hệ thống liền kề tiếp theo là kết hợp Gemini 2.5 và Anam chỉ đạt 2.80 điểm.
Các thành viên tham gia nghiên cứu được yêu cầu trò chuyện 1 phút với một người lạ về dự định cho năm tới. Hơn một nửa không nghĩ đến việc họ đang nói chuyện với AI.
Những người bắt đầu nghi ngờ thường cảm nhận được điều này trong khoảng 20 giây đầu tiên. Tavus thừa nhận tính chân thực như vậy cũng có thể khiến mọi người bị đánh lừa, tưởng mình đang nói chuyện với người thật.
Chính vì thế, Griffin-Lite – phiên bản thử nghiệm – chỉ được mở cho một số người dùng được Tavus chọn lựa và tin cậy. Công ty cho biết họ đang phát triển các tính năng cảnh báo và hợp tác với các tổ chức chuyên về an toàn AI trước khi chính thức phát hành rộng rãi hơn.
Tình trạng lừa đảo trong lĩnh vực crypto là minh chứng cho việc rủi ro này không chỉ là giả định. TRM Labs phát hiện tội phạm sử dụng AI trong lĩnh vực crypto đã tăng 40% theo từng năm vào năm 2026, trong đó các chiêu trò lừa đảo chiếm phần lớn sự gia tăng này.
Nếu các mô hình như Griffin tiếp tục phát triển rộng rãi, thì việc nhìn thấy gương mặt quen thuộc qua cuộc gọi video cũng không còn là bằng chứng xác thực về người đang ở đầu dây bên kia nữa.
Đăng ký kênh YouTube của chúng tôi để theo dõi các chuyên gia, nhà báo phân tích chuyên sâu về lĩnh vực này