Số hóa tri thức y học cổ truyền – Cơ hội và thách thức trong thời đại AI

Số hóa tri thức Y học cổ truyền mở ra cơ hội bảo tồn y thư cổ, chuẩn hóa dữ liệu và ứng dụng AI. Tìm hiểu cơ hội, thách thức và hướng phát triển trong tương lai.

Y học cổ truyền Việt Nam sở hữu một kho tàng tri thức được tích lũy qua nhiều thế hệ. Tri thức đó tồn tại trong y thư cổ, sách chuyên môn, tài liệu giảng dạy, kinh nghiệm của các danh y và tri thức dân gian.

Tuy nhiên, một vấn đề đặt ra là: làm thế nào để những tri thức này tiếp tục được bảo tồn và khai thác trong thời đại số?

Câu trả lời không chỉ nằm ở việc quét sách thành PDF.

Số hóa thực sự cần hướng đến một mục tiêu lớn hơn: biến những nguồn tư liệu rời rạc thành tri thức có cấu trúc, có nguồn gốc và có thể tra cứu.

Đây là nơi công nghệ dữ liệu, trí tuệ nhân tạo và đồ thị tri thức có thể đóng vai trò quan trọng.

Số hóa không chỉ là đưa sách lên Internet

Khi nói đến số hóa tài liệu, nhiều người thường nghĩ đến việc:

Sách giấy → Scan → PDF

Đây là bước đầu tiên cần thiết, nhưng chưa phải là điểm cuối.

Một tập PDF có thể giúp bảo tồn hình ảnh của tài liệu, nhưng máy tính vẫn khó hiểu nội dung bên trong.

Ví dụ, một y thư có thể chứa hàng nghìn thông tin liên quan đến:

  • Danh y;
  • Bệnh chứng;
  • Triệu chứng;
  • Phép trị;
  • Phương thuốc;
  • Vị thuốc;
  • Dược liệu.

Nếu toàn bộ thông tin chỉ nằm trong những trang PDF, người nghiên cứu vẫn phải đọc và tìm kiếm thủ công.

Do đó, một quá trình số hóa tri thức hoàn chỉnh hơn có thể bao gồm:

TÀI LIỆU GỐC
      ↓
SỐ HÓA HÌNH ẢNH
      ↓
OCR
      ↓
HIỆU ĐÍNH VĂN BẢN
      ↓
CHUẨN HÓA THUẬT NGỮ
      ↓
TRÍCH XUẤT THỰC THỂ
      ↓
LIÊN KẾT TRI THỨC
      ↓
CƠ SỞ TRI THỨC

Điểm quan trọng nằm ở những bước phía sau OCR.

Vì sao Y học cổ truyền cần được số hóa?

Bảo tồn tri thức trước nguy cơ thất truyền

Nhiều nguồn tri thức Y học cổ truyền đang tồn tại dưới dạng:

  • Sách cổ;
  • Bản chép tay;
  • Tài liệu cũ;
  • Kinh nghiệm truyền nghề;
  • Tri thức dân gian.

Các nguồn này có nguy cơ bị mất mát hoặc khó tiếp cận.

Số hóa giúp tạo ra các bản lưu trữ, giảm sự phụ thuộc vào một bản tài liệu vật lý duy nhất.

Tuy nhiên, bảo tồn kỹ thuật số cũng cần đi kèm với việc quản lý dữ liệu lâu dài.

Một file PDF nếu không có metadata, nguồn gốc và hệ thống lưu trữ phù hợp cũng có thể trở thành dữ liệu khó sử dụng trong tương lai.

Giúp tri thức dễ tiếp cận hơn

Một bộ y thư có thể gồm hàng nghìn trang.

Nếu chỉ tồn tại dưới dạng sách vật lý, việc tra cứu rất tốn thời gian.

Dữ liệu số có thể hỗ trợ:

  • Tìm kiếm từ khóa;
  • Tra cứu thuật ngữ;
  • Đối chiếu nhiều tài liệu;
  • Liên kết các khái niệm;
  • Theo dõi nguồn trích dẫn.

Ví dụ, người nghiên cứu có thể đặt câu hỏi:

Một vị thuốc này xuất hiện trong những phương thuốc nào?

Hoặc:

Một chứng bệnh được mô tả như thế nào trong các y thư khác nhau?

Để trả lời những câu hỏi này hiệu quả, dữ liệu cần có cấu trúc.

Thách thức lớn: thuật ngữ Y học cổ truyền

Đây có lẽ là một trong những vấn đề phức tạp nhất.

Một thuật ngữ Y học cổ truyền có thể:

  • Có nhiều cách viết;
  • Có nhiều tên gọi;
  • Thay đổi theo thời kỳ;
  • Có ý nghĩa khác nhau tùy ngữ cảnh.

Ví dụ, không thể đơn giản xây dựng hệ thống theo kiểu:

Thuật ngữ cổThuật ngữ hiện đại
AX
BY

Cách làm này có nguy cơ tạo ra những sự tương đương sai.

Một hệ thống dữ liệu tốt cần lưu giữ nhiều lớp thông tin hơn:

THUẬT NGỮ
│
├── Tên gốc
├── Các biến thể
├── Định nghĩa
├── Ngữ cảnh sử dụng
├── Văn bản nguồn
├── Thời kỳ
└── Khái niệm liên quan

Đây chính là lý do số hóa tri thức không chỉ là một bài toán công nghệ.

Nó đòi hỏi sự hợp tác giữa:

  • Chuyên gia Y học cổ truyền;
  • Nhà nghiên cứu lịch sử;
  • Chuyên gia Hán Nôm;
  • Dược sĩ;
  • Nhà khoa học dữ liệu;
  • Kỹ sư AI.

OCR là bước đầu, không phải bước cuối

OCR (Optical Character Recognition) giúp chuyển hình ảnh thành văn bản.

Nhưng với tài liệu Y học cổ truyền, OCR có thể gặp nhiều khó khăn.

Đặc biệt khi tài liệu chứa:

  • Chữ Hán;
  • Chữ Nôm;
  • Văn bản cũ;
  • Bản in bị mờ;
  • Bố cục phức tạp;
  • Ký tự đặc biệt.

Một lỗi OCR nhỏ cũng có thể làm thay đổi ý nghĩa của thuật ngữ.

Ví dụ, nếu một tên vị thuốc bị nhận dạng sai, lỗi đó có thể lan truyền vào toàn bộ cơ sở dữ liệu.

Vì vậy, quy trình phù hợp không nên là:

OCR → Tin tưởng hoàn toàn vào kết quả

Mà cần là:

OCR → Kiểm tra → Hiệu đính → Xác minh nguồn

Yếu tố human-in-the-loop đặc biệt quan trọng trong các dự án liên quan đến di sản và y học.

Từ văn bản đến dữ liệu có cấu trúc

Sau khi có văn bản số, bước tiếp theo là xác định những thành phần quan trọng.

Ví dụ, từ một đoạn y thư, hệ thống có thể nhận diện:

  • Một danh y;
  • Một tên bệnh;
  • Một chứng;
  • Một triệu chứng;
  • Một phương thuốc;
  • Một vị thuốc.

Trong khoa học dữ liệu, đây có thể được gọi là trích xuất thực thể.

Ví dụ:

Văn bản
   ↓
"Phương A gồm B, C, D"
   ↓
Trích xuất

Phương thuốc: A
Vị thuốc: B
Vị thuốc: C
Vị thuốc: D

Từ đó, thông tin có thể được lưu trong cơ sở dữ liệu.

Nhưng dữ liệu riêng lẻ vẫn chưa đủ.

Giá trị lớn hơn xuất hiện khi các thực thể được liên kết.

Knowledge Graph và bản đồ tri thức Y học cổ truyền

Một hướng tiếp cận đầy tiềm năng là xây dựng Knowledge Graph – đồ thị tri thức.

Trong đồ thị tri thức, dữ liệu được biểu diễn dưới dạng:

  • Thực thể (Entity);
  • Quan hệ (Relationship).

Ví dụ:

[DANH Y]
    │
    │ viết
    ▼
[Y THƯ]
    │
    │ mô tả
    ▼
[BỆNH CHỨNG]
    │
    │ điều trị bằng
    ▼
[PHƯƠNG THUỐC]
    │
    │ gồm
    ▼
[VỊ THUỐC]

Một đồ thị như vậy cho phép khám phá những mối liên hệ khó nhìn thấy khi đọc từng cuốn sách riêng lẻ.

Ví dụ:

  • Một vị thuốc xuất hiện trong bao nhiêu y thư?
  • Một phương thuốc có những biến thể nào?
  • Hai danh y có cùng đề cập đến một chứng bệnh hay không?
  • Một thuật ngữ thay đổi như thế nào qua các thời kỳ?

Trí tuệ nhân tạo có thể hỗ trợ gì?

AI có thể trở thành công cụ hỗ trợ mạnh trong việc khai thác dữ liệu Y học cổ truyền.

Một số khả năng bao gồm:

Xử lý văn bản

AI có thể hỗ trợ:

  • Phân loại tài liệu;
  • Tìm kiếm ngữ nghĩa;
  • Nhận diện thuật ngữ;
  • Trích xuất thực thể.

Hỗ trợ liên kết tri thức

AI có thể phát hiện các mối liên hệ tiềm năng giữa:

  • Thuật ngữ;
  • Phương thuốc;
  • Dược liệu;
  • Văn bản.

Tuy nhiên, “phát hiện mối liên hệ” không đồng nghĩa với “xác nhận sự thật”.

Mọi mối liên hệ được AI đề xuất cần được kiểm chứng.

Hỗ trợ tra cứu

Thay vì tìm kiếm bằng từ khóa đơn giản, người dùng có thể đặt câu hỏi bằng ngôn ngữ tự nhiên.

Ví dụ:

Những y thư nào đề cập đến vị thuốc X?

Một hệ thống tốt cần trả lời kèm theo nguồn tham chiếu.

Đây là điểm quan trọng.

AI trong lĩnh vực tri thức y học không nên chỉ đưa ra câu trả lời.

Nó cần có khả năng trả lời câu hỏi:

Thông tin này đến từ đâu?

Vấn đề lớn nhất: Hallucination

Một trong những rủi ro của AI tạo sinh là khả năng tạo ra thông tin nghe có vẻ hợp lý nhưng không tồn tại trong tài liệu nguồn.

Trong lĩnh vực Y học cổ truyền, điều này đặc biệt nguy hiểm.

Một AI có thể:

  • Tạo ra một bài thuốc không tồn tại;
  • Gán nhầm phương thuốc cho một danh y;
  • Liên kết sai một vị thuốc;
  • Diễn giải sai thuật ngữ cổ.

Do đó, hệ thống AI phục vụ nghiên cứu Y học cổ truyền cần ưu tiên:

Nguồn gốc hơn sự trôi chảy.

Một câu trả lời ngắn nhưng có nguồn rõ ràng có giá trị hơn một bài giải thích dài nhưng không thể kiểm chứng.

Đây là nguyên tắc quan trọng khi xây dựng các hệ thống RAG hoặc Knowledge Graph kết hợp AI.

Dữ liệu phải có provenance

Provenance có thể hiểu đơn giản là thông tin về nguồn gốc của dữ liệu.

Ví dụ, một thông tin trong hệ thống không chỉ nên được lưu:

“Phương thuốc A gồm B và C.”

Mà cần lưu thêm:

  • Xuất hiện trong tài liệu nào;
  • Tác giả hoặc nguồn nào;
  • Phiên bản nào;
  • Trang hoặc vị trí nào;
  • Ai đã nhập dữ liệu;
  • Ai đã kiểm chứng.

Có thể hình dung:

TRI THỨC
   │
   ├── Nội dung
   ├── Nguồn
   ├── Vị trí trong nguồn
   ├── Người hiệu đính
   ├── Ngày cập nhật
   └── Mức độ kiểm chứng

Đây là một yếu tố rất quan trọng nếu muốn xây dựng một nền tảng tri thức đáng tin cậy.

Không nên vội vàng “dịch” Y học cổ truyền sang Tây y

Một sai lầm có thể xảy ra trong quá trình số hóa là cố gắng ánh xạ mọi khái niệm Y học cổ truyền sang một thuật ngữ y học hiện đại.

Ví dụ:

Thuật ngữ cổ A = Bệnh hiện đại B

Những ánh xạ như vậy có thể rất hấp dẫn vì chúng giúp dữ liệu dễ tìm kiếm.

Nhưng nếu không có cơ sở nghiên cứu, chúng có thể tạo ra thông tin sai.

Do đó, cần phân biệt:

Liên kết trực tiếp

Có nguồn tài liệu hoặc bằng chứng rõ ràng.

Liên kết giả thuyết

Có khả năng liên quan nhưng cần nghiên cứu thêm.

Không liên kết

Không đủ bằng chứng để xác định.

Một cơ sở tri thức tốt cần cho phép biểu diễn mức độ chắc chắn, thay vì buộc mọi mối quan hệ phải là đúng hoặc sai tuyệt đối.

Con người vẫn là trung tâm

Công nghệ có thể xử lý hàng triệu ký tự.

AI có thể tìm kiếm trong hàng nghìn tài liệu.

Nhưng việc diễn giải tri thức vẫn cần chuyên môn.

Một hệ thống tốt nên hoạt động theo mô hình:

CHUYÊN GIA
    ↕
KIỂM CHỨNG
    ↕
CƠ SỞ TRI THỨC
    ↕
AI HỖ TRỢ
    ↕
NGƯỜI DÙNG

AI nên hỗ trợ chuyên gia làm việc hiệu quả hơn.

Không nên đảo ngược mô hình thành:

AI tạo tri thức → Con người tin tưởng

Đặc biệt trong lĩnh vực liên quan đến sức khỏe.

Một hướng đi cho tri thức Y học cổ truyền Việt Nam

Việt Nam có nhiều nguồn tri thức Y học cổ truyền:

  • Y thư cổ;
  • Danh y;
  • Dược liệu bản địa;
  • Kinh nghiệm dân gian;
  • Tài liệu đào tạo;
  • Nghiên cứu hiện đại.

Tuy nhiên, dữ liệu hiện có thường phân tán.

Một phần nằm trong:

  • Thư viện;
  • Sách in;
  • PDF;
  • Website;
  • Cơ sở dữ liệu riêng lẻ.

Thách thức trong tương lai không chỉ là tạo thêm nội dung.

Quan trọng hơn là tạo ra khả năng kết nối tri thức.

Có thể hình dung một hệ sinh thái:

Y THƯ CỔ ─────┐
DANH Y ───────┤
DƯỢC LIỆU ────┤
NGHIÊN CỨU ───┼──► CƠ SỞ TRI THỨC
THUẬT NGỮ ───┤
VĂN BẢN ──────┘
                     │
                     ▼
              KNOWLEDGE GRAPH
                     │
                     ▼
                AI / TÌM KIẾM
                     │
                     ▼
              NGƯỜI NGHIÊN CỨU

Đây có thể là một trong những hướng phát triển quan trọng của việc bảo tồn tri thức Y học cổ truyền trong kỷ nguyên số.

Kết luận

Số hóa tri thức Y học cổ truyền không chỉ là chuyển sách giấy thành file PDF.

Đó là một quá trình dài:

Bảo tồn → Số hóa → Hiệu đính → Chuẩn hóa → Cấu trúc hóa → Liên kết → Kiểm chứng

AI và các công nghệ mới có thể giúp tăng tốc quá trình này.

Nhưng công nghệ không thể thay thế hoàn toàn tri thức chuyên môn.

Một hệ thống tri thức đáng tin cậy cần được xây dựng trên ba nền tảng:

1. Dữ liệu có nguồn gốc rõ ràng

Mọi thông tin quan trọng cần có khả năng truy xuất về nguồn.

2. Chuyên gia tham gia kiểm chứng

AI có thể hỗ trợ, nhưng không nên tự quyết định tính đúng đắn của tri thức.

3. Công nghệ phục vụ bảo tồn và nghiên cứu

Mục tiêu cuối cùng không phải là xây dựng AI chỉ để trả lời câu hỏi.

Mục tiêu lớn hơn là giúp tri thức Y học cổ truyền Việt Nam được bảo tồn, tiếp cận và nghiên cứu tốt hơn.

Trong hành trình đó, chuyển đổi số có thể trở thành một cây cầu nối giữa những trang y thư của quá khứ và các công cụ nghiên cứu của tương lai.


BÀI VIẾT LIÊN QUAN

  • Y học cổ truyền là gì? Tổng quan về nền y học truyền thống Việt Nam
  • Hành trình của tri thức Y học cổ truyền Việt Nam qua các thời kỳ
  • Y thư cổ và vai trò trong bảo tồn tri thức Y học
  • Trí tuệ nhân tạo có thể hỗ trợ nghiên cứu Y học cổ truyền như thế nào?
  • Knowledge Graph và tương lai của dữ liệu Y học cổ truyền

Lưu ý: Việc ứng dụng AI trong Y học cổ truyền cần được thực hiện thận trọng, có chuyên gia tham gia kiểm chứng và tuân thủ các nguyên tắc về an toàn, minh bạch và khả năng truy xuất nguồn gốc tri thức.

Để lại một bình luận

Email của bạn sẽ không được hiển thị công khai. Các trường bắt buộc được đánh dấu *