Khi nói đến số hóa Y học cổ truyền, chúng ta thường nghĩ ngay đến:
- Sách PDF.
- Văn bản điện tử.
- Hình ảnh y thư.
- Cơ sở dữ liệu dược liệu.
Nhưng những loại dữ liệu này không giống nhau.
Một cuốn y thư được OCR thành văn bản vẫn rất khác với một bảng dữ liệu được tổ chức theo các trường cụ thể.
Sự khác biệt đó có thể được hiểu thông qua hai nhóm chính:
Dữ liệu phi cấu trúc (Unstructured Data)
và
Dữ liệu có cấu trúc (Structured Data).
Hiểu rõ hai loại dữ liệu này là bước quan trọng để xây dựng kho tri thức Y học cổ truyền trong môi trường số.
Dữ liệu phi cấu trúc là gì?
Dữ liệu phi cấu trúc là dữ liệu không được tổ chức sẵn theo một khuôn mẫu cố định để máy tính có thể dễ dàng xử lý từng thành phần.
Trong Y học cổ truyền, ví dụ phổ biến gồm:
- Văn bản y thư.
- Bản chép tay.
- PDF.
- Hình ảnh sách cổ.
- Ghi chép tự do.
- Bài viết chuyên môn.
Ví dụ:
“Trong phương này dùng các vị thuốc…”
Máy tính có thể lưu cả đoạn văn, nhưng chưa chắc đã hiểu:
- Đâu là tên bài thuốc?
- Đâu là tên dược liệu?
- Đâu là liều lượng?
- Đâu là nguồn?
Dữ liệu có cấu trúc là gì?
Dữ liệu có cấu trúc được tổ chức theo những trường xác định.
Ví dụ:
| ID | Tên | Loại | Nguồn |
|---|---|---|---|
| HERB001 | Dược liệu A | Thảo dược | Tài liệu X |
| HERB002 | Dược liệu B | Thảo dược | Tài liệu Y |
Mỗi hàng và cột có ý nghĩa rõ ràng.
Máy tính có thể dễ dàng:
- Tìm kiếm.
- Lọc.
- Thống kê.
- Liên kết.
Có thể hình dung:
DỮ LIỆU PHI CẤU TRÚC
────────────────────
Một đoạn văn dài
mang nhiều thông tin
nhưng chưa được tách rõ.
↓
DỮ LIỆU CÓ CẤU TRÚC
────────────────────
Tên: ...
Loại: ...
Nguồn: ...
Quan hệ: ...
Một y thư thuộc loại dữ liệu nào?
Câu trả lời phụ thuộc vào cách nó được lưu trữ.
Bản sách giấy
Y THƯ GIẤY
Là tài liệu vật lý.
Bản quét PDF
Y THƯ
↓
ẢNH / PDF
Đã được số hóa, nhưng nội dung vẫn chủ yếu là phi cấu trúc.
Văn bản OCR
PDF
↓
OCR
↓
TEXT
Có thể tìm kiếm, nhưng vẫn chủ yếu là dữ liệu phi cấu trúc.
Dữ liệu được trích xuất
TEXT
↓
TRÍCH XUẤT
Tên sách
Tác giả
Dược liệu
Bài thuốc
Lúc này, dữ liệu bắt đầu được cấu trúc hóa.
Chuyển từ văn bản sang dữ liệu có cấu trúc
Đây là một trong những hướng quan trọng của khoa học dữ liệu hiện nay.
Ví dụ một câu trong tài liệu:
“Phương thuốc X gồm các thành phần A, B và C.”
Con người có thể hiểu ngay.
Nhưng máy tính cần dữ liệu được biểu diễn rõ hơn:
PHƯƠNG THUỐC X
│
├── contains → A
├── contains → B
└── contains → C
Hoặc trong bảng:
| Phương thuốc | Thành phần |
|---|---|
| X | A |
| X | B |
| X | C |
Khi đó, thông tin có thể được xử lý bằng thuật toán.
Dữ liệu có cấu trúc không có nghĩa là tốt hơn mọi trường hợp
Đây là điểm cần lưu ý.
Văn bản tự do có những giá trị mà bảng dữ liệu không thể dễ dàng thay thế.
Ví dụ:
Một đoạn văn trong y thư
có thể chứa:
- Bối cảnh.
- Cách lập luận.
- Kinh nghiệm.
- Ngoại lệ.
- Những sắc thái ngôn ngữ.
Nếu cố ép tất cả vào bảng:
| Dược liệu | Công dụng |
|---|
chúng ta có thể đánh mất nhiều thông tin.
Do đó:
Dữ liệu có cấu trúc và phi cấu trúc không loại trừ nhau.
Chúng phục vụ những mục đích khác nhau.
Mô hình kết hợp hai loại dữ liệu
Một hệ thống tri thức tốt có thể giữ cả hai.
Y THƯ
│
┌──────────┴──────────┐
│ │
VĂN BẢN GỐC DỮ LIỆU TRÍCH XUẤT
│ │
NGỮ CẢNH CẤU TRÚC
│ │
└──────────┬──────────┘
↓
KHO TRI THỨC
Người dùng có thể:
- Xem thông tin đã được cấu trúc.
- Quay lại đoạn văn gốc.
- Kiểm tra bối cảnh.
Đây là mô hình phù hợp hơn việc chỉ giữ một dạng dữ liệu.
Dữ liệu bán cấu trúc là gì?
Ngoài hai nhóm trên còn có dữ liệu bán cấu trúc (Semi-structured Data).
Ví dụ:
{
"name": "Dược liệu A",
"aliases": ["Tên B", "Tên C"],
"sources": [
{
"document": "Y thư X"
}
]
}
Dữ liệu JSON có cấu trúc nhưng không bị giới hạn cứng như bảng quan hệ truyền thống.
Dữ liệu bán cấu trúc phù hợp khi:
- Một thực thể có nhiều thuộc tính khác nhau.
- Có trường thông tin không phải thực thể nào cũng có.
- Dữ liệu thay đổi theo thời gian.
Ví dụ về ba dạng dữ liệu
Có thể hình dung cùng một thông tin được biểu diễn theo ba cách.
1. Phi cấu trúc
Dược liệu A được đề cập trong tài liệu X...
2. Có cấu trúc
| Tên | Tài liệu |
|---|---|
| Dược liệu A | Tài liệu X |
3. Knowledge Graph
[DƯỢC LIỆU A]
│
└── mentioned_in
│
[TÀI LIỆU X]
Mỗi cách có ưu điểm riêng.
Knowledge Graph có phải là dữ liệu có cấu trúc?
Có thể xem Knowledge Graph là một hình thức biểu diễn dữ liệu có cấu trúc dựa trên:
- Thực thể.
- Thuộc tính.
- Quan hệ.
Ví dụ:
[DANH Y]
│
├── authored → [Y THƯ]
│
└── related_to → [TRƯỜNG PHÁI]
Điểm khác với bảng dữ liệu truyền thống là Knowledge Graph đặc biệt phù hợp với dữ liệu có nhiều quan hệ.
Vì sao Y học cổ truyền có nhiều dữ liệu phi cấu trúc?
Tri thức Y học cổ truyền được lưu truyền chủ yếu qua:
- Sách.
- Văn bản.
- Trước tác.
- Kinh nghiệm.
Do đó, phần lớn tri thức ban đầu nằm trong:
VĂN BẢN
Chứ không phải:
DATABASE
Đây là lý do số hóa Y học cổ truyền thường bắt đầu từ:
Tài liệu → Văn bản → Dữ liệu.
Trong khi nhiều hệ thống hiện đại có thể bắt đầu trực tiếp từ dữ liệu được sinh ra bởi máy móc hoặc biểu mẫu.
Bài toán Information Extraction
Để chuyển văn bản thành dữ liệu, cần thực hiện trích xuất thông tin.
Ví dụ:
VĂN BẢN
↓
NHẬN DIỆN THỰC THỂ
↓
DANH Y
DƯỢC LIỆU
BÀI THUỐC
ĐỊA DANH
↓
TRÍCH XUẤT QUAN HỆ
Các kỹ thuật AI và NLP có thể hỗ trợ quá trình này.
Ví dụ:
- Named Entity Recognition.
- Relation Extraction.
- Entity Linking.
Tuy nhiên, kết quả cần được kiểm tra, đặc biệt với văn bản cổ.
Vì sao cần liên kết dữ liệu trở lại nguồn gốc?
Khi một đoạn văn được chuyển thành dữ liệu:
VĂN BẢN
↓
[DƯỢC LIỆU A]
Nếu không lưu nguồn, sau này có thể không biết:
“Dữ liệu này được lấy từ đâu?”
Do đó, một cấu trúc tốt nên là:
[THỰC THỂ]
│
└── evidence
│
[ĐOẠN VĂN]
│
[TÀI LIỆU]
Điều này tạo ra provenance – dấu vết nguồn gốc dữ liệu.
Structured Data và AI
Dữ liệu có cấu trúc giúp AI thực hiện nhiều nhiệm vụ:
- Phân tích quan hệ.
- Truy vấn.
- Thống kê.
- Phát hiện mẫu.
Trong khi đó, dữ liệu phi cấu trúc giúp cung cấp:
- Ngữ cảnh.
- Nội dung phong phú.
- Thông tin chi tiết.
Một hệ thống AI hiện đại có thể kết hợp cả hai.
VĂN BẢN ─────────┐
│
DỮ LIỆU ─────────┼──→ AI SYSTEM
│
KNOWLEDGE GRAPH ─┘
Đây là hướng tiếp cận thường được quan tâm trong các hệ thống RAG kết hợp tri thức có cấu trúc.
Một kiến trúc dữ liệu cho Y học cổ truyền
Có thể hình dung theo nhiều lớp.
Lớp 1: Nguồn gốc
- Sách.
- Bản quét.
- Tài liệu.
Lớp 2: Văn bản
- OCR.
- Phiên âm.
- Văn bản đã hiệu đính.
Lớp 3: Dữ liệu cấu trúc
- Thuật ngữ.
- Dược liệu.
- Danh y.
- Bài thuốc.
Lớp 4: Tri thức liên kết
- Knowledge Graph.
- Ontology.
- Quan hệ thực thể.
NGUỒN GỐC
↓
VĂN BẢN
↓
DỮ LIỆU
↓
TRI THỨC LIÊN KẾT
Các lớp này không nên loại bỏ nhau.
Chúng bổ sung cho nhau.
Không nên “cấu trúc hóa quá mức”
Một nguy cơ khác là cố gắng biến mọi thông tin thành các trường dữ liệu cứng.
Ví dụ:
Dược liệu
Công dụng
Liều lượng
Có thể phù hợp với một số dữ liệu.
Nhưng nhiều đoạn văn có thể chứa:
- Điều kiện.
- Ngoại lệ.
- Tranh luận.
- Bối cảnh lịch sử.
Những yếu tố này khó ép vào vài cột dữ liệu.
Do đó, cần cân bằng:
Cấu trúc hóa những gì có thể xác định rõ, đồng thời giữ nguyên văn bản gốc để bảo tồn ngữ cảnh.
Từ dữ liệu đến tri thức
Có thể hình dung một quá trình:
RAW DOCUMENT
↓
DIGITIZATION
↓
TEXT
↓
STRUCTURED DATA
↓
LINKED KNOWLEDGE
↓
KNOWLEDGE GRAPH
Đây không nhất thiết là một quá trình hoàn toàn tuyến tính.
Dữ liệu mới có thể quay lại bổ sung cho các lớp trước.
Kết luận
Trong Y học cổ truyền, phần lớn tri thức ban đầu tồn tại dưới dạng phi cấu trúc như:
- Y thư.
- Văn bản.
- Ghi chép.
Trong khi đó, các hệ thống dữ liệu hiện đại cần thông tin có cấu trúc để:
- Tìm kiếm.
- Thống kê.
- Liên kết.
- Phân tích.
Vì vậy, một trong những nhiệm vụ quan trọng của số hóa tri thức là xây dựng cầu nối:
Từ văn bản phi cấu trúc → dữ liệu có cấu trúc → tri thức liên kết.
Nhưng quá trình này không nên làm mất:
- Văn bản gốc.
- Ngữ cảnh.
- Nguồn tư liệu.
Một hệ thống tốt không bắt người dùng phải lựa chọn giữa văn bản và dữ liệu.
Thay vào đó, nó kết hợp cả hai để tạo thành một nền tảng tri thức có thể:
đọc – tìm kiếm – kiểm chứng – phân tích – và phát triển bằng công nghệ.
Lưu ý
Việc chuyển tri thức từ văn bản sang dữ liệu có cấu trúc luôn có nguy cơ làm mất một phần ngữ cảnh. Vì vậy, dữ liệu được trích xuất nên duy trì liên kết với văn bản và nguồn gốc ban đầu để hỗ trợ kiểm chứng và diễn giải chính xác.
Từ khóa SEO
dữ liệu có cấu trúc Y học cổ truyền, dữ liệu phi cấu trúc YHCT, số hóa y thư, structured data YHCT, unstructured data YHCT, Knowledge Graph Y học cổ truyền, trích xuất thông tin y thư, NLP Y học cổ truyền, dữ liệu tri thức YHCT.