Tại sao không có điểm cuối
Mô hình, môi trường chạy và quá trình phân tích đều được tải xuống trình duyệt và chạy ở đó. Đó không phải là một lựa chọn triển khai có thể đảo ngược bằng một cờ; đó là toàn bộ kiến trúc, và là lý do tại sao một hình ảnh không bao giờ rời khỏi thiết bị kiểm tra.
Một API làm ngược lại điều đó. Ai đó gửi hình ảnh lên máy chủ, máy chủ chấm điểm và gửi kết quả về, và lúc này hình ảnh đã tồn tại trên cơ sở hạ tầng do người khác kiểm soát, dù chỉ trong thời gian ngắn và ý định của họ tốt đến đâu.
Đối với một công cụ mà toàn bộ mục tiêu là không có gì được tải lên, việc cung cấp một điểm cuối tải lên sẽ tự mâu thuẫn. Vì vậy, trang này không mô tả lộ trình phát triển; nó mô tả giới hạn và cách giải quyết.
Nói thẳng ra là rất cần thiết vì điều ngược lại sẽ tồi tệ hơn. Một trang web ám chỉ có một điểm cuối nhưng thực tế không tồn tại sẽ lãng phí buổi chiều của một kỹ sư, và trang định giá trên trang web này đã nói rõ rằng không có gói trả phí và không có API.
Mục đích thực sự của tự động hóa
Trước khi tìm kiếm một điểm cuối, cần xác định rõ ràng công việc, vì phần lớn các dự định tự động hóa đều có cách giải quyết tốt hơn.
| Cần dịch vụ | Công cụ trình duyệt hoạt động tốt | Bước xử lý của con người tốt hơn | |
|---|---|---|---|
| Sàng lọc bản tải lên của người dùng trên quy mô lớn | Yes Khối lượng và độ trễ | No | No |
| Kiểm tra hàng giao của nhà cung cấp | No | Yes Một lô 25 bản là đủ xử lý | Partly |
| Đánh giá một hồ sơ yêu cầu bồi thường | No | Yes Một lô cho mỗi lần gửi | Yes Công việc chủ yếu là đánh giá |
| Kiểm toán trang web của riêng bạn | Partly Chỉ khi số lượng khổng lồ | Yes Trích xuất và gom lô | No |
Ba trong bốn hàng đó có thể được giải quyết bằng một người chạy theo lô, đây là điều đáng xác định trước khi ai đó viết mã. Hàng đầu tiên thực sự khác biệt, và đó là trường hợp cần dịch vụ lưu trữ.
Nếu bạn thực sự cần tự động hóa
Có ba hướng đi trung thực, và mỗi hướng đều có sự đánh đổi khác nhau. Giả vờ khác đi không giúp ích được cho ai.
| Tùy chọn | Đánh đổi | Phù hợp với |
|---|---|---|
| Một API thương mại | Hình ảnh rời khỏi cơ sở hạ tầng của bạn | Khối lượng lớn, độ nhạy cảm thấp |
| Tự lưu trữ mô hình mở | Thời gian cho phần cứng và kỹ thuật | Dữ liệu nhạy cảm, năng lực nội bộ |
| Chạy trong trình duyệt bạn kiểm soát | Bất tiện nhưng riêng tư | Khối lượng vừa phải, bảo mật nghiêm ngặt |
| Lấy mẫu thay vì sàng lọc toàn bộ | Phạm vi bao phủ một phần | Hầu hết các khối lượng công việc thực tế |
| Một bước đánh giá bởi con người | Chậm hơn, phán đoán tốt hơn | Bất kỳ thứ gì ảnh hưởng đến một cá nhân |
Hàng thứ ba đáng được giải thích vì nó ít được sử dụng. Một trình duyệt không giao diện chạy trên máy của chính bạn, điều khiển một trang thực hiện phân tích cục bộ, là một cách hợp lệ để tự động hóa mà không cần gửi hình ảnh đi bất cứ đâu. Nó không hào nhoáng nhưng hiệu quả.
Hàng thứ tư là lựa chọn mà hầu hết các nhóm nên chọn nhưng hiếm khi cân nhắc. Việc kiểm tra mọi hình ảnh là tốn kém và thường không cần thiết; lấy mẫu mười phần trăm, cộng với mọi thứ từ một nguồn đã từng gây ra sự cố trước đó, sẽ nắm bắt được phần lớn những gì quan trọng với chi phí chỉ bằng một phần nhỏ.
Nếu bạn tự lưu trữ
Điều này dễ đạt được hơn mọi người tưởng, bởi vì các mô hình nghiên cứu trong lĩnh vực này phần lớn là công khai. Một trạm kiểm xuất được xuất bản với giấy phép mở, một môi trường thực thi suy luận và một máy chủ khiêm tốn sẽ tái tạo phần lớn những gì một dịch vụ thương mại bán.
Những gì bạn đảm nhận là mọi thứ xung quanh mô hình. Giữ cho nó cập nhật khi các trình tạo thay đổi, hiệu chuẩn ngưỡng cho tài liệu của riêng bạn, đo lường tỷ lệ dương tính giả của chính bạn và có người có thể giải thích kết quả khi bị nghi ngờ.
Điểm cuối cùng đó là chi phí ẩn. Một khả năng phát hiện mà không ai trong tổ chức hiểu đủ rõ để bảo vệ là một rủi ro khi quyết định dựa trên nó bị nghi ngờ lần đầu tiên, và câu hỏi đó cuối cùng luôn xảy ra.
Bất kể bạn xây dựng gì, hãy tích hợp điều này
Hai quyết định thiết kế quan trọng hơn việc bạn sử dụng mô hình nào, và cả hai đều liên quan đến những gì xảy ra sau khi có điểm số.
Đừng bao giờ để một điểm số tự động quyết định bất cứ điều gì về một con người. Chuyển các cờ báo cho con người, ghi lại quyết định của con người thay vì những gì mô hình nói và đảm bảo người bị ảnh hưởng có thể được thông báo lý do tại sao một thứ gì đó bị truy vấn.
Và lưu trữ kết quả, không phải điểm số. Một lịch sử các con số có thể tìm kiếm gắn với người dùng hoặc nhà cung cấp được chỉ danh là một hồ sơ cần được biện minh, không mang lại giá trị hoạt động nào và trở thành một vấn đề ngay khi ai đó yêu cầu dữ liệu của họ.
Một điểm khởi đầu thực tế
Đối với hầu hết các nhóm đến đây với mong muốn tự động hóa, phiên bản đầu tiên hợp lý nhất hoàn toàn không liên quan đến kỹ thuật. Một người, một lô cho mỗi bài nộp và một ghi chú trong tệp về những gì họ tìm thấy.
Điều đó tạo ra một thứ có giá trị trong vòng một tuần: cảm nhận về điểm số cho tài liệu của chính bạn. Hầu như không ai có điều đó khi bắt đầu, và nếu không có nó, bất kỳ ngưỡng nào bạn đặt trong mã đều là phỏng đoán về một phân phối mà bạn chưa từng đo lường.
Một khi bạn biết hình ảnh của mình nằm ở đâu, lý do tự động hóa trở nên cụ thể thay vì lý thuyết. Bạn sẽ biết có bao nhiêu bài nộp mỗi tuần thực sự cần xem xét và thường thì câu trả lời khiến cho việc lập trình kỹ thuật trở nên không cần thiết.
Trong trường hợp ngược lại, ít nhất bạn sẽ tự động hóa dựa trên một đường cơ sở đã được đo lường thay vì một đường cơ sở được công bố, đó là sự khác biệt giữa một kiểm soát hoạt động trên dữ liệu của bạn và một kiểm soát hoạt động trên điểm chuẩn của người khác.
Những gì cần đo lường trước khi bạn xây dựng bất cứ thứ gì
Ba con số biến một ý định mơ hồ thành một thông số kỹ thuật và cả ba đều đến từ việc chạy các lô bằng tay trong hai tuần.
Sự phân bố tài liệu của riêng bạn: nơi các hình ảnh chân thực từ các nguồn bình thường của bạn thực sự nằm ở đâu. Hầu như mọi nhóm đều ngạc nhiên, thường là vì đầu vào của họ được xử lý nhiều hơn họ tưởng.
Tỷ lệ dương tính giả của riêng bạn: mức độ thường xuyên một cờ báo hóa ra là xử lý thông thường khi ai đó điều tra. Đây là con số quyết định xem một kiểm soát có thể sử dụng được trên người thật hay không, và nó không bao giờ là con số trên trang của nhà cung cấp.
Khối lượng thực sự sẽ bị gắn cờ: số lượng mục mỗi tuần mà một người cần xem xét. Nếu con số đó nhỏ, tự động hóa mà bạn đang dự định chỉ là một bảng tính và một thói quen.