Từ mô hình đến Expert Agent
| Task | CMC-Legal | Ours | Δ |
|---|---|---|---|
| Legal Entity Recognition | 65.24 | 68.40 | +3.16 |
| Legal Topic Classification | 82.71 | 88.40 | +5.69 |
| Legal Concept Recall | 61.33 | 73.70 | +12.37 |
| Article Recall | 68.40 | 94.20 | +25.80 |
| Legal Schema Recall | 22.25 | 50.30 | +28.05 |
| Task | CMC-Legal | Ours | Δ |
|---|---|---|---|
| Relation Extraction | 87.35 | 71.10 | −16.25 |
| Legal Element Recognition | 51.33 | 66.00 | +14.67 |
| Legal Graph Structuring | 0.529 | 0.791 | +0.262 |
| Judgment Verification | 73.33 | 83.50 | +10.17 |
| User Intent Understanding | 61.68 | 74.80 | +13.12 |
| Task | CMC-Legal | Ours | Δ |
|---|---|---|---|
| Article / Clause Prediction | 35.33 | 73.20 | +37.87 |
| Legal Court Decision Prediction | 82.17 | 82.65 | +0.48 |
| Multi-Article Reasoning | 74.66 | 77.74 | +3.08 |
| Conflict & Consistency DetectionY-F1 | 11.85 | 51.32 | +39.47 |
| N-F1 | 39.59 | 46.38 | +6.79 |
| Penalty / Remedy Estimation | 57.38 | 49.58 | −7.80 |
| Task | CMC-Legal | Ours | Δ |
|---|---|---|---|
| Legal Document Summarization | 0.327 | 0.366 | +0.039 |
| Judicial Reasoning Generation | 0.417 | 0.320 | −0.097 |
| Objective Legal Opinion Generation | 0.493 | 0.457 | −0.036 |
| Task | CMC-Legal | Ours | Δ |
|---|---|---|---|
| Bias Detection | 41.76 | 56.00 | +14.24 |
| Privacy & Data Protection | 67.74 | 69.50 | +1.76 |
| Ethical Consistency Assessment | 86.56 | 87.94 | +1.38 |
| Unfair Contract Detection | 51.28 | 54.00 | +2.72 |
Benchmark công khai (VietLegal, CMC OpenAI 2026)
Benchmark năng lực sản phẩm
Câu hỏiNguyên tắc ưu đãi trong đấu thầu?
Chuyên gia tham gia:
Expert knowledge không chỉ nằm trong tài liệu — mà còn nằm trong cách chuyên gia xác định một kết luận có đúng hay không.






Legal chỉ là example.
Ở giữa là:
Mục tiêu không chỉ là Legal AI. Mục tiêu là một phương pháp để xây những AI có năng lực chuyên gia cho từng domain.
Phần trước — chuyên biệt hoá ở tầng tri thức, lập luận và kiểm chứng.
Chuyên biệt hoá ở tầng model.
Một cuộc họp tiếng Việt thực tế có:
Meeting speech khác rất xa một đoạn audio sạch dùng để demo speech-to-text.
* Thống kê speaker / accent / overlap trên phần dữ liệu có metadata tương ứng.
CER ↓ — thấp hơn là tốt hơn
Coverage từ tiếng Anh giữ được trong văn bản đầu ra ↑ — cao hơn là tốt hơn
CER ↓ — thấp hơn là tốt hơn
Không chỉ accuracy:
Từ AI tổng quát → đến AI chuyên biệt mà doanh nghiệp có thể hiểu, tin cậy và làm chủ.