Khi mới bắt đầu làm việc với Claude, nhiều người dành rất nhiều thời gian để chỉnh sửa prompt với mong muốn AI trả lời chính xác hơn. Tuy nhiên, theo tài liệu chính thức của Anthropic, Prompt Engineering không chỉ dừng lại ở việc viết prompt mà còn là một quá trình liên tục kiểm thử, đánh giá và cải thiện kết quả.
Nói cách khác, thay vì hỏi:
"Prompt này có hay không?"
Bạn nên hỏi:
"Làm sao biết prompt này thực sự tốt?"
Đó là lúc Evaluation (Eval) trở thành một phần không thể thiếu. Đầu tiên, hãy xác định thế nào là "thành công"
Anthropic khuyến nghị trước khi đánh giá AI, bạn cần xác định rõ tiêu chí thành công của ứng dụng. Một tiêu chí tốt nên đáp ứng các đặc điểm:
Anthropic khuyến nghị:
1. Code-based grading
Đây là cách nhanh và đáng tin cậy nhất khi đầu ra có thể kiểm tra bằng quy tắc.
Ví dụ:
2. Human grading
Con người trực tiếp đọc và đánh giá kết quả.
Phương pháp này linh hoạt nhưng tốn nhiều thời gian và chi phí.
3. LLM-based grading
Claude cũng có thể đóng vai trò là "giám khảo" để chấm điểm câu trả lời dựa trên một rubric (bộ tiêu chí) được xác định trước.
Theo Anthropic, cách này phù hợp với các tác vụ khó lượng hóa bằng quy tắc như:
Nếu sử dụng LLM để chấm điểm, Anthropic khuyến nghị nên xây dựng rubric thật cụ thể.
Ví dụ:
Claude còn có thể hỗ trợ tạo thêm test case
Anthropic khuyến nghị sử dụng một số test case mẫu rồi nhờ Claude tạo thêm các trường hợp tương tự để mở rộng bộ dữ liệu đánh giá, giúp tiết kiệm thời gian kiểm thử. Viết prompt chỉ là bước đầu. Điều quan trọng là đánh giá xem prompt có hoạt động ổn định hay không. Vì vậy, Success Criteria và Evaluation là những thành phần quan trọng trong Prompt Engineering theo tài liệu chính thức của Anthropic.
Nếu bạn muốn tìm hiểu bài bản về Claude, Prompt Engineering, Context Engineering, Evaluation, Claude API và các kiến thức cần thiết để chuẩn bị cho chứng chỉ Claude Certified Architect – Foundations (CCAR-F), VnPro hiện có khóa học CCAR-F với lộ trình bám sát tài liệu chính thức của Anthropic, kết hợp lý thuyết và thực hành trên các tình huống thực tế. Bên cạnh đào tạo, VnPro cũng hỗ trợ học viên đăng ký và dự thi chứng chỉ quốc tế, tham khảo ngay nhé!!.
Nói cách khác, thay vì hỏi:
"Prompt này có hay không?"
Bạn nên hỏi:
"Làm sao biết prompt này thực sự tốt?"
Đó là lúc Evaluation (Eval) trở thành một phần không thể thiếu. Đầu tiên, hãy xác định thế nào là "thành công"
Anthropic khuyến nghị trước khi đánh giá AI, bạn cần xác định rõ tiêu chí thành công của ứng dụng. Một tiêu chí tốt nên đáp ứng các đặc điểm:
- Cụ thể (Specific): xác định rõ AI cần hoàn thành điều gì.
- Có thể đo lường (Measurable): sử dụng các chỉ số hoặc thang điểm rõ ràng.
- Thực tế (Achievable): phù hợp với khả năng của mô hình hiện tại.
- Liên quan (Relevant): phản ánh đúng mục tiêu của ứng dụng.
"Claude trả lời tốt."
Bạn có thể đặt mục tiêu cụ thể hơn:- Phân loại cảm xúc chính xác.
- Tóm tắt không bỏ sót ý quan trọng.
- Luôn giữ đúng văn phong thương hiệu.
- Không tiết lộ thông tin nhạy cảm.
Anthropic khuyến nghị:
- Thiết kế các tình huống gần với dữ liệu thực tế.
- Bao gồm cả những trường hợp ngoại lệ (edge cases).
- Ưu tiên khả năng đánh giá tự động nếu có thể.
- Có nhiều test case sẽ hiệu quả hơn chỉ dựa vào một vài ví dụ được chấm thủ công.
1. Code-based grading
Đây là cách nhanh và đáng tin cậy nhất khi đầu ra có thể kiểm tra bằng quy tắc.
Ví dụ:
- Exact Match (khớp hoàn toàn với đáp án)
- String Match (kiểm tra có chứa từ khóa bắt buộc)
2. Human grading
Con người trực tiếp đọc và đánh giá kết quả.
Phương pháp này linh hoạt nhưng tốn nhiều thời gian và chi phí.
3. LLM-based grading
Claude cũng có thể đóng vai trò là "giám khảo" để chấm điểm câu trả lời dựa trên một rubric (bộ tiêu chí) được xác định trước.
Theo Anthropic, cách này phù hợp với các tác vụ khó lượng hóa bằng quy tắc như:
- Đánh giá chất lượng tóm tắt.
- Kiểm tra giọng văn.
- Đánh giá mức độ tự nhiên.
- Kiểm tra tính đầy đủ của câu trả lời.
Nếu sử dụng LLM để chấm điểm, Anthropic khuyến nghị nên xây dựng rubric thật cụ thể.
Ví dụ:
- Câu trả lời phải đề cập đến tên công ty ngay ở câu đầu tiên.
- Nếu thiếu thông tin bắt buộc thì đánh giá là không đạt.
- Chỉ cho phép trả về "Correct" hoặc "Incorrect", hoặc chấm theo thang điểm 1–5 thay vì nhận xét quá chung chung.
Claude còn có thể hỗ trợ tạo thêm test case
Anthropic khuyến nghị sử dụng một số test case mẫu rồi nhờ Claude tạo thêm các trường hợp tương tự để mở rộng bộ dữ liệu đánh giá, giúp tiết kiệm thời gian kiểm thử. Viết prompt chỉ là bước đầu. Điều quan trọng là đánh giá xem prompt có hoạt động ổn định hay không. Vì vậy, Success Criteria và Evaluation là những thành phần quan trọng trong Prompt Engineering theo tài liệu chính thức của Anthropic.
Nếu bạn muốn tìm hiểu bài bản về Claude, Prompt Engineering, Context Engineering, Evaluation, Claude API và các kiến thức cần thiết để chuẩn bị cho chứng chỉ Claude Certified Architect – Foundations (CCAR-F), VnPro hiện có khóa học CCAR-F với lộ trình bám sát tài liệu chính thức của Anthropic, kết hợp lý thuyết và thực hành trên các tình huống thực tế. Bên cạnh đào tạo, VnPro cũng hỗ trợ học viên đăng ký và dự thi chứng chỉ quốc tế, tham khảo ngay nhé!!.