1. Báo cáo đo sự tương đồng, không tự động kết luận đạo văn
C-checker tìm những nguồn công khai có đoạn chữ hoặc ý nghĩa gần với văn bản được kiểm tra. Báo cáo giúp người đọc xác định vị trí cần xem lại, nhưng không biết người viết đã trích dẫn đúng hay chưa, có được phép sử dụng tài liệu hay không, hoặc sự giống nhau có xuất phát từ một thuật ngữ bắt buộc hay không. Vì vậy, nhãn “cao”, “trung bình” hay “thấp” là mức cảnh báo kỹ thuật, không phải phán quyết học thuật hoặc pháp lý.
2. Hiểu phần tổng quan của báo cáo
Trùng lặp cả bài
Đây là điểm trung bình của các câu đã kiểm tra. Với mỗi câu, hệ thống lấy ứng viên có điểm cao nhất; sau đó tính trung bình trên toàn bộ số câu. Con số này phản ánh mức độ tương đồng phân bố trong tài liệu tốt hơn việc chỉ nhìn một câu đơn lẻ. Nó không phải tỷ lệ phần trăm số chữ đã sao chép theo nghĩa tuyệt đối.
Câu đã kiểm tra
Cho biết số đơn vị văn bản được hệ thống tách và phân tích. Các đoạn dài có thể được chia thành khối tối đa khoảng 120 ký tự, nên “câu” trong báo cáo đôi khi là một phần câu hoặc một khối văn bản chứ không hoàn toàn trùng với dấu câu trong bản gốc.
Đoạn nghi ngờ và đoạn trùng lặp cao nhất
“Đoạn nghi ngờ” là tổng số kết quả nguồn đạt ngưỡng hiển thị, không nhất thiết bằng số câu bị nghi ngờ vì một câu có thể dẫn tới nhiều nguồn. “Đoạn trùng lặp cao nhất” là mức Final lớn nhất trong các kết quả được giữ lại. Một đoạn có mức trùng lặp cao cần được kiểm tra kỹ, nhưng không nên dùng nó thay cho đánh giá toàn văn bản.
3. Năm chỉ số trong từng thẻ nguồn
Mỗi nguồn nghi ngờ được chấm theo bốn phép đo, sau đó kết hợp thành điểm Final:
LCS — 35%
Đo độ dài chuỗi từ chung theo đúng thứ tự, kể cả khi giữa các từ có phần được chèn thêm. Chỉ số này nhạy với việc giữ nguyên nhiều từ nhưng chỉnh sửa rải rác.
N-gram — 20%
So sánh các cặp từ liền nhau. Điểm tăng khi hai đoạn giữ lại nhiều cụm từ ngắn giống nhau và cùng trật tự cục bộ.
Semantic — 35%
Dùng mô hình MiniLM đa ngôn ngữ để đo độ gần về ý nghĩa. Chỉ số có thể phát hiện diễn đạt lại, nhưng cũng có thể cao với hai câu cùng chủ đề mà không sao chép nhau.
Contiguous — 10%
Đo chuỗi token giống nhau dài nhất và liền mạch. Nó hữu ích khi một cụm chữ được chép nguyên văn liên tục.
Điểm Final được tính theo công thức: 35% LCS + 20% N-gram + 35% Semantic + 10% Contiguous. Hiện tại, một ứng viên phải đạt Final từ 35% mới được đưa vào danh sách nguồn nghi ngờ. Các trọng số là quy tắc kỹ thuật của phiên bản hiện tại và có thể được điều chỉnh khi hệ thống được đánh giá trên thêm dữ liệu.
4. Cách kiểm tra một kết quả nghi ngờ
- Đọc “Câu gốc”. Xác định đây là lập luận riêng, kiến thức phổ thông, thuật ngữ chuyên ngành hay câu trích dẫn.
- Xem phần highlight và token trùng. Cụm dài, đặc thù và liên tiếp đáng chú ý hơn các từ chức năng hoặc cụm phổ biến.
- Đọc đoạn trích từ nguồn. Không kết luận chỉ từ tiêu đề hoặc tỷ lệ; hãy xem hai đoạn có thực sự cùng lập luận và cấu trúc hay không.
- Mở URL nguồn. Kiểm tra tác giả, ngày công bố, bối cảnh đầy đủ và liệu trang đó có phải nguồn gốc hay chỉ sao chép từ nơi khác.
- Đối chiếu trích dẫn trong bài. Một đoạn giống nguồn nhưng có ngoặc kép, chú thích và tài liệu tham khảo phù hợp có thể là sử dụng hợp lệ.
- Sửa và kiểm tra lại. Nếu thiếu dẫn nguồn, bổ sung trích dẫn; nếu diễn đạt quá sát, viết lại từ sự hiểu biết của chính mình rồi chạy lại báo cáo.
5. Ví dụ diễn giải
Giả sử báo cáo có điểm toàn bài 12%, một câu cao nhất 74% và ba nguồn nghi ngờ. Hệ thống sẽ xếp mức trung bình vì điểm toàn bài đã vượt 10%. Tuy vậy, câu 74% có thể là tên đầy đủ của một chính sách hoặc định nghĩa bắt buộc. Người đọc cần mở nguồn, kiểm tra xem câu có đặt trong ngoặc kép và có dẫn tài liệu hay không. Nếu trích dẫn đầy đủ, điểm cao không tự nó chứng minh hành vi đạo văn; nếu không có dẫn nguồn và cấu trúc câu được giữ gần như nguyên vẹn, đây là vị trí nên sửa trước.
6. Checklist trước khi hoàn tất
- Đã mở và đọc các nguồn có điểm Final cao nhất.
- Đã phân biệt thuật ngữ phổ biến với cách diễn đạt đặc thù của tác giả.
- Đã kiểm tra ngoặc kép, chú thích và danh mục tài liệu tham khảo.
- Đã xem cả điểm trung bình toàn bài lẫn điểm câu cao nhất.
- Đã sửa các đoạn cần thiết và kiểm tra lại phiên bản cuối.
Xem thêm: Hạn chế và sai số của C-checker.