Xin chào ! Nếu đây là lần đầu tiên bạn đến với diễn đàn, xin vui lòng danh ra một phút bấm vào đây để đăng kí và tham gia thảo luận cùng VnPro.
X
 
  • Filter
  • Time
  • Show
Clear All
new posts

  • Prompt tốt chưa đủ – Muốn AI hoạt động ổn định, hãy học cách xây dựng bộ đánh giá (Evaluation)

    Khi mới bắt đầu làm việc với Claude, nhiều người dành rất nhiều thời gian để chỉnh sửa prompt với mong muốn AI trả lời chính xác hơn. Tuy nhiên, theo tài liệu chính thức của Anthropic, Prompt Engineering không chỉ dừng lại ở việc viết prompt mà còn là một quá trình liên tục kiểm thử, đánh giá và cải thiện kết quả.

    Nói cách khác, thay vì hỏi:

    "Prompt này có hay không?"

    Bạn nên hỏi:

    "Làm sao biết prompt này thực sự tốt?"

    Đó là lúc Evaluation (Eval) trở thành một phần không thể thiếu. Đầu tiên, hãy xác định thế nào là "thành công"

    Anthropic khuyến nghị trước khi đánh giá AI, bạn cần xác định rõ tiêu chí thành công của ứng dụng. Một tiêu chí tốt nên đáp ứng các đặc điểm:
    • Cụ thể (Specific): xác định rõ AI cần hoàn thành điều gì.
    • Có thể đo lường (Measurable): sử dụng các chỉ số hoặc thang điểm rõ ràng.
    • Thực tế (Achievable): phù hợp với khả năng của mô hình hiện tại.
    • Liên quan (Relevant): phản ánh đúng mục tiêu của ứng dụng.
    Ví dụ, thay vì đặt mục tiêu chung chung như:
    "Claude trả lời tốt."
    Bạn có thể đặt mục tiêu cụ thể hơn:
    • Phân loại cảm xúc chính xác.
    • Tóm tắt không bỏ sót ý quan trọng.
    • Luôn giữ đúng văn phong thương hiệu.
    • Không tiết lộ thông tin nhạy cảm.
    Những tiêu chí này giúp việc đánh giá trở nên rõ ràng và khách quan hơn. Một bài kiểm thử nên giống tình huống thực tế. Sau khi có tiêu chí, bước tiếp theo là xây dựng các test case.
    Anthropic khuyến nghị:
    • Thiết kế các tình huống gần với dữ liệu thực tế.
    • Bao gồm cả những trường hợp ngoại lệ (edge cases).
    • Ưu tiên khả năng đánh giá tự động nếu có thể.
    • Có nhiều test case sẽ hiệu quả hơn chỉ dựa vào một vài ví dụ được chấm thủ công.
    Điều này giúp bạn biết liệu prompt có hoạt động ổn định trong nhiều tình huống khác nhau hay chỉ đúng với một vài ví dụ. Có nhiều cách để chấm điểm kết quả. Tùy từng bài toán, bạn có thể lựa chọn nhiều phương pháp đánh giá.

    1. Code-based grading

    Đây là cách nhanh và đáng tin cậy nhất khi đầu ra có thể kiểm tra bằng quy tắc.

    Ví dụ:
    • Exact Match (khớp hoàn toàn với đáp án)
    • String Match (kiểm tra có chứa từ khóa bắt buộc)

    2. Human grading

    Con người trực tiếp đọc và đánh giá kết quả.

    Phương pháp này linh hoạt nhưng tốn nhiều thời gian và chi phí.

    3. LLM-based grading

    Claude cũng có thể đóng vai trò là "giám khảo" để chấm điểm câu trả lời dựa trên một rubric (bộ tiêu chí) được xác định trước.

    Theo Anthropic, cách này phù hợp với các tác vụ khó lượng hóa bằng quy tắc như:
    • Đánh giá chất lượng tóm tắt.
    • Kiểm tra giọng văn.
    • Đánh giá mức độ tự nhiên.
    • Kiểm tra tính đầy đủ của câu trả lời.
    Rubric càng rõ thì kết quả càng ổn định

    Nếu sử dụng LLM để chấm điểm, Anthropic khuyến nghị nên xây dựng rubric thật cụ thể.

    Ví dụ:
    • Câu trả lời phải đề cập đến tên công ty ngay ở câu đầu tiên.
    • Nếu thiếu thông tin bắt buộc thì đánh giá là không đạt.
    • Chỉ cho phép trả về "Correct" hoặc "Incorrect", hoặc chấm theo thang điểm 1–5 thay vì nhận xét quá chung chung.
    Một rubric rõ ràng sẽ giúp việc đánh giá nhất quán hơn giữa các lần chạy.

    Claude còn có thể hỗ trợ tạo thêm test case
    Anthropic khuyến nghị sử dụng một số test case mẫu rồi nhờ Claude tạo thêm các trường hợp tương tự để mở rộng bộ dữ liệu đánh giá, giúp tiết kiệm thời gian kiểm thử. Viết prompt chỉ là bước đầu. Điều quan trọng là đánh giá xem prompt có hoạt động ổn định hay không. Vì vậy, Success CriteriaEvaluation là những thành phần quan trọng trong Prompt Engineering theo tài liệu chính thức của Anthropic.

    ​Nếu bạn muốn tìm hiểu bài bản về Claude, Prompt Engineering, Context Engineering, Evaluation, Claude API và các kiến thức cần thiết để chuẩn bị cho chứng chỉ Claude Certified Architect – Foundations (CCAR-F), VnPro hiện có khóa học CCAR-F với lộ trình bám sát tài liệu chính thức của Anthropic, kết hợp lý thuyết và thực hành trên các tình huống thực tế. Bên cạnh đào tạo, VnPro cũng hỗ trợ học viên đăng ký và dự thi chứng chỉ quốc tế, tham khảo ngay nhé!!.
Working...
X