← Tất cả hướng dẫn Bên dưới lớp vỏ

Tại sao AI vẫn vẽ sai bàn tay, và khi nào thì không

Bàn tay từng là dấu hiệu nhận biết được nhắc đến nhiều nhất trong hình ảnh do AI tạo ra và hiện hầu như đã được khắc phục. Điều gì khiến việc này từng rất khó, giải pháp nào đã xử lý nó, và trường hợp này nói lên điều gì về mọi dấu hiệu trực quan khác.

· 10 phút đọc · Best AI Image Detector

Bàn tay từng rất khó tạo vì chúng có nhiều khớp, tự che khuất và hiếm khi được chụp theo một cách nhất quán. Đó là vấn đề về dữ liệu huấn luyện chứ không phải giới hạn vĩnh viễn, và nó phần lớn đã được giải quyết trong vòng hai chu kỳ phát hành.

Tại sao bàn tay từng thực sự khó vẽ

Điều này không phải ngẫu nhiên. Bàn tay có nhiều khớp độc lập hơn hầu hết mọi bộ phận khác trên cơ thể, và số lượng tư thế riêng biệt mà nó có thể tạo ra là rất lớn so với khuôn mặt, vốn chỉ thay đổi trong phạm vi hẹp hơn nhiều.

Bàn tay cũng liên tục tự che khuất. Các ngón tay nằm sau ngón tay khác, động tác nắm che gần hết lòng bàn tay, và đường nét nhìn thấy thay đổi hoàn toàn chỉ với một góc xoay nhỏ. Mô hình học từ ảnh chụp sẽ thấy vô số hình dạng rời rạc cho cùng một đối tượng.

Và dữ liệu huấn luyện cũng không mấy hữu ích. Ảnh chụp thường lấy khuôn mặt làm trung tâm, còn bàn tay xuất hiện ở rìa khung hình, bị nhòe do chuyển động, bị cắt bớt hoặc đang cầm vật gì đó che khuất chúng. Các ví dụ rất nhiều nhưng chất lượng lại thấp ở đúng khía cạnh quan trọng.

Tổng hợp lại, điều đó tạo ra lỗi quen thuộc: một mô hình biết rằng bàn tay có các vật thể dạng ngón tay gắn vào, nhưng không có nhận thức đáng tin cậy về số lượng, cách sắp xếp hay tỷ lệ.

Điều gì đã khắc phục lỗi này

Không có gì quá đặc biệt. Nhiều dữ liệu hơn, được gắn nhãn tốt hơn, cộng với những thay đổi về kiến trúc giúp cải thiện cách mô hình xử lý cấu trúc không gian nói chung, cùng với sự tập trung có chủ đích từ các đội ngũ phát triển trước những lời chỉ trích.

  1. 2022
    Bàn tay là chủ đề châm biếm quen thuộc Sáu ngón tay, các ngón dính liền, tư thế cầm nắm bất khả thi.
  2. 2023
    Lời khuyên lan rộng Đếm ngón tay trở thành mẹo phổ biến khắp nơi.
  3. 2023
    Các bản sửa lỗi có mục tiêu được phát hành Gắn nhãn dữ liệu tốt hơn và xử lý không gian chuẩn xác hơn trong các bản phát hành mới.
  4. 2024
    Phần lớn đã được giải quyết Bàn tay vẽ đúng trở thành mặc định thay vì là ngoại lệ.
  5. 2026
    Lời khuyên tồn tại lâu hơn cả lỗi sai Mọi người vẫn đếm ngón tay, và giờ đây nhận định sai theo cả hai chiều.
Tóm tắt tốc độ một hạn chế nổi tiếng không còn là vấn đề.

Dòng cuối cùng là điểm mấu chốt của toàn bộ bài viết. Dấu hiệu nhận biết đã được sửa từ nhiều năm trước nhưng lời khuyên vẫn tiếp tục lan truyền, đồng nghĩa với việc mọi người đang chủ động đọc sai hình ảnh khi áp dụng nó.

Tại sao việc đếm ngón tay hiện thất bại theo cả hai chiều

Đầu tiên là âm tính giả: bàn tay đúng không chứng minh được điều gì. Các mô hình hiện tại kết xuất chúng chuẩn xác trong hầu hết các trường hợp, vì vậy một bức ảnh vượt qua bài kiểm tra ngón tay chỉ là vượt qua một bài kiểm tra mà hầu như ảnh nào cũng đạt.

Thứ hai là dương tính giả, và điều này gây hại nhiều hơn. Bàn tay thật được chụp khi đang chuyển động tạo ra các hình dạng bị nhòe, hòa lẫn và trông như bị biến dạng. Một bức ảnh chụp thật cảnh ai đó đang ra hiệu trong bữa tiệc có thể trông hoàn toàn giống lỗi mà người ta từng được cảnh báo, đối với một người có định kiến phải đếm ngón tay.

Sự bất đối xứng đó rất quan trọng vì cái giá phải trả không đồng đều. Nhận định nhầm một hình ảnh do AI tạo là ảnh thật thường có thể khắc phục được; nhưng buộc tội nhầm một bức ảnh chụp thật và người trong ảnh thì không.

Nó cũng có tính chất tự củng cố. Một người từng được dặn rằng bàn tay là dấu hiệu nhận biết khi thấy một bàn tay trông kỳ lạ sẽ kết luận hình ảnh là giả, rồi lặp lại lời khuyên đã dẫn đến sai sót đó. Đó là cách một quy tắc kinh nghiệm lỗi thời vẫn tồn tại sau nhiều năm hết hạn sử dụng.

Bài học rút ra từ trường hợp này cho mọi dấu hiệu nhận biết khác

Bàn tay là một ví dụ thực tế cho một quy luật chung, và quy luật này hữu ích hơn bất kỳ mẹo cụ thể nào.

  • Lỗi nhìn thấy được là một tiêu chuẩn đánh giá công khai. Bất cứ điều gì gọi tên được đều sẽ bị đo lường, và bất cứ điều gì được đo lường đều sẽ được tối ưu hóa.
  • Sự phổ biến thúc đẩy quá trình sửa lỗi. Một dấu hiệu càng được nhắc lại rộng rãi, thì càng có nhiều động lực để loại bỏ nó.
  • Lời khuyên tồn tại lâu hơn lỗi sai nhiều năm. Lời đính chính không bao giờ lan truyền nhanh bằng mẹo ban đầu.
  • Việc sửa lỗi không đồng đều giữa các công cụ. Một dấu hiệu đã bị loại bỏ trong mô hình hàng đầu có thể vẫn tồn tại ở mô hình cũ hơn hoặc nhỏ hơn.
  • Dấu vết chuyển xuống tầng sâu hơn. Những gì còn lại không phải là các lỗi nhìn thấy được mà là kết cấu thống kê, vốn nằm dưới khả năng phân giải của mắt thường.

Điểm cuối cùng giải thích lý do tại sao các công cụ phát hiện lại tồn tại. Nếu các điểm khác biệt vẫn có thể nhìn thấy bằng mắt, sẽ không ai cần một mô hình để tìm chúng, và toàn bộ lĩnh vực này sẽ chỉ là một danh sách những thứ cần quan sát.

Những yếu tố vẫn còn giá trị

Hai nhóm kiểm tra đã đứng vững trước quy luật này, và cả hai đều liên quan đến tính mạch lạc trên toàn bộ khung hình hơn là các chi tiết cục bộ.

Ánh sáng là yếu tố đầu tiên. Mọi bề mặt trong một bức ảnh chụp đều được chiếu sáng bởi cùng các nguồn sáng, do đó hướng bóng đổ, độ sắc nét và nhiệt độ màu đều phải đồng nhất. Một khung cảnh do AI tạo thường làm đúng chủ thể và làm tương đối đúng phần xung quanh, và sự bất hợp lý sẽ lộ ra ở phần bóng đổ.

Tính liên tục vật lý là yếu tố thứ hai. Dây đeo vòng qua sau vai rồi xuất hiện lại ở sai vị trí, hình phản chiếu hiển thị một căn phòng không thể có ở đó, họa tiết không khớp nhau qua một vật che khuất. Những yếu tố này đòi hỏi một mô hình hiểu về thế giới vật lý thay vì chỉ là một mô hình học về diện mạo bên ngoài.

Không có phép kiểm tra nào trong số này là nhanh chóng, và đó là kết luận thẳng thắn. Các cách kiểm tra vẫn còn hiệu quả đòi hỏi phải nhìn nhận bức ảnh như một không gian thực tế, còn các cách kiểm tra nhanh lại là những thứ đã được khắc phục.

Ý nghĩa của điều này đối với những người giảng dạy

Rất nhiều tài liệu về năng lực truyền thông vẫn mở đầu bằng việc đếm ngón tay, điều này hiện đang dạy người ta một phương pháp dẫn đến những sai lầm với sự tự tin tuyệt đối. Bất kỳ ai biên soạn tài liệu đào tạo, hướng dẫn hoặc bài học ở trường về chủ đề này đều đang gặp vấn đề về phiên bản kiến thức chứ không phải về nội dung.

Phiên bản bền vững của bài học là về phương pháp thay vì về các đặc điểm cụ thể. Hãy dạy rằng các lỗi nhìn thấy được chỉ là tạm thời, bất kỳ dấu hiệu nhận biết nào đủ phổ biến để đem dạy đều đủ phổ biến để được sửa, và các câu hỏi đáng tin cậy phải xoay quanh nguồn gốc và ngữ cảnh.

Cũng cần giảng dạy rõ ràng về trường hợp sai lệch. Một người hiểu rằng bàn tay thật đang chuyển động có thể trông bất thường sẽ ít có khả năng đưa ra lời cáo buộc gây thiệt hại thực sự hơn, đó là gọi một bức ảnh chụp người thật là ảnh giả.

Thông điệp thẳng thắn cho bất kỳ tài liệu nào như vậy là không có phép kiểm tra thị giác nhanh nào còn hiệu quả trước các mô hình hiện tại, và những kỹ năng hữu ích là đặt câu hỏi về nguồn gốc của hình ảnh cũng như ai là người hưởng lợi khi hình ảnh đó được tin là thật.

Các câu hỏi mọi người thường đặt ra

Hình ảnh AI có còn vẽ sai bàn tay không?
Ít hơn nhiều, và nó đã không còn là bài kiểm tra đáng tin cậy từ khoảng năm 2024. Các mô hình hiện tại kết xuất bàn tay chính xác trong phần lớn trường hợp, vì vậy một bàn tay vẽ đúng hầu như không cho bạn biết điều gì, và một bàn tay trông kỳ lạ có khả năng cao là do nhòe chuyển động trong ảnh chụp thật.
Tại sao bàn tay ban đầu lại khó vẽ đến vậy?
Chúng có nhiều khớp, liên tục tự che khuất và xuất hiện trong ảnh huấn luyện chủ yếu ở rìa khung hình, bị nhòe hoặc bị che khuất một phần. Các ví dụ rất nhiều nhưng không hữu ích, đây là vấn đề về dữ liệu chứ không phải giới hạn vĩnh viễn.
Điều gì đã thay thế việc đếm ngón tay để làm dấu hiệu quan sát?
Không có mẹo nào nhanh chóng, đó là câu trả lời thẳng thắn. Tính nhất quán của ánh sáng và tính liên tục vật lý vẫn còn giá trị vì chúng đòi hỏi mô hình hiểu về thế giới vật lý thay vì chỉ là diện mạo, nhưng cả hai đều yêu cầu phải nhìn nhận bức ảnh như một không gian thực tế thay vì chỉ quét tìm lỗi cục bộ.
Tại sao mọi người vẫn lặp lại lời khuyên đó?
Bởi vì thông tin đính chính lan truyền chậm hơn các mẹo vặt. Lời khuyên đếm ngón tay từng thực sự hữu ích trong khoảng 18 tháng, lan truyền rất rộng rãi và đã tồn tại lâu hơn cả lỗi sai nhiều năm. Những người áp dụng nó hiện nay đang chủ động đọc sai hình ảnh theo cả hai chiều.
Các trình tạo ảnh cũ hơn có còn vẽ sai bàn tay không?
Một số vẫn bị, và việc sửa lỗi diễn ra không đồng đều. Một mô hình hàng đầu từ nhà cung cấp lớn có thể kết xuất bàn tay tốt trong khi một checkpoint mã nguồn mở cũ hơn thì vẫn chưa làm được, vì vậy dấu hiệu này chỉ còn tồn tại ở một nhóm nhỏ đầu ra và không còn đúng ở mọi nơi khác.
Tôi có nên nhìn vào răng, tai hoặc mắt để thay thế không?
Chúng cũng đi theo quỹ đạo tương tự và nằm trong cùng danh sách các dấu hiệu nhận biết đã lỗi thời. Bất cứ điều gì có thể mô tả trong một bài đăng lan truyền đều trở thành tiêu chuẩn đánh giá, và bất cứ điều gì bị đánh giá đều sẽ được sửa chữa. Những khác biệt còn lại thuộc về thống kê, đó là thứ mà công cụ phát hiện đọc được còn mắt thường thì không.