6 phút đọc
Trong kỷ nguyên số hóa nghiên cứu, các nhà khoa học thường đối mặt với tình trạng quy trình làm việc bị xé lẻ: hội thoại với AI diễn ra trên một ứng dụng, viết mã nguồn trong Jupyter Notebook, tra cứu dữ liệu sinh học trên các website chuyên ngành, và lưu trữ kết quả rải rác trong các thư mục máy tính. Sự thiếu đồng bộ này khiến ngữ cảnh bị đứt gãy và gây cản trở lớn cho việc tái lập kết quả nghiên cứu. Để giải quyết bài toán này, dự án mã nguồn mở aipoch/open-science đã ra đời và nhanh chóng cán mốc hơn 3.830 stars cùng 238 lượt forks trên GitHub. Được phát triển chính bằng ngôn ngữ TypeScript, đây là một workbench (bàn làm việc) nghiên cứu khoa học đa nền tảng (macOS, Windows, Linux) hoạt động theo cơ chế ưu tiên xử lý cục bộ (local-first) và không phụ thuộc vào một mô hình AI cố định (model-agnostic).
Không gian làm việc hợp nhất và khả năng truy vết nguồn gốc (Provenance)
Dự án aipoch/open-science tổ chức công việc theo từng dự án và phiên làm việc (sessions), đảm bảo mọi kết quả đầu ra luôn gắn liền với chuỗi bằng chứng tạo ra nó. Người dùng chỉ cần mô tả mục tiêu nghiên cứu bằng ngôn ngữ tự nhiên, các AI agent sẽ tự động thực hiện các tác vụ như đọc tệp tin, tìm kiếm web, chạy mã nguồn Python hoặc R, truy vấn nguồn dữ liệu khoa học và tạo ra báo cáo hoặc biểu đồ trực quan ngay trong một không gian duy nhất.
Điểm vượt trội của hệ thống nằm ở cơ chế quản lý dữ liệu đầu ra (artifacts). Mỗi tệp tin do AI tạo ra đều được lưu trữ dưới dạng một phiên bản bất biến có gắn kèm mã kiểm tra (checksum). Chế độ xem “Provenance” của ứng dụng cho phép nhà nghiên cứu truy vết toàn bộ thông tin xác thực tại thời điểm tạo lập:
- Mã nguồn thực thi và lịch sử chạy code của AI agent.
- Các tài liệu đầu vào được tham chiếu trực tiếp.
- Danh mục kiểm kê chi tiết về môi trường hệ thống được ghi nhận.
- Nhánh hội thoại cụ thể đã kích hoạt lệnh tạo file.
Ngoài ra, workbench này còn hỗ trợ tính năng rẽ nhánh hội thoại (branching). Khi người dùng chỉnh sửa một yêu cầu đã gửi trước đó để thử nghiệm một giả thuyết mới, hệ thống sẽ tạo ra một nhánh tin nhắn mới thay vì xóa đi các lượt phản hồi cũ. Các tùy chọn rẽ nhánh, tệp đính kèm và kết quả tạo ra đều được lưu giữ nguyên vẹn kể cả khi khởi động lại ứng dụng, giúp quá trình khám phá khoa học không bị chồng lấn hay làm mờ đi các kết quả nghiên cứu trước đó.
Hệ sinh thái 22 kỹ năng chuyên biệt và 24 cổng kết nối dữ liệu khoa học
Không chỉ dừng lại ở một giao diện tương tác AI thông thường, aipoch/open-science tích hợp sâu các công cụ chuyên ngành phục vụ cho nhiều lĩnh vực nghiên cứu từ học máy, thống kê, khoa học sự sống, hóa học, vật lý cho đến khoa học môi trường. Hệ thống cung cấp sẵn danh mục gồm 22 kỹ năng nghiên cứu chuyên sâu dựa trên tệp tin, bao gồm các mô hình sinh học nổi tiếng như AlphaFold2, Boltz, Borzoi, Chai-1, ESM-2, ESMFold2, Evo 2, cùng các công cụ như ProteinMPNN, scGPT hay kết nối tính toán từ xa qua SSH (Remote Compute) để đẩy các tác vụ nặng lên các cụm máy tính hiệu năng cao (HPC).
Bên cạnh đó, dự án tích hợp 24 cổng kết nối dữ liệu khoa học cốt lõi như PubMed, bioRxiv, Clinical Trials, ChEMBL, Genes & Ontologies, Genomes, BioMart, và Protein Annotation. Tất cả các kỹ năng và cổng kết nối này đều nằm dưới sự kiểm soát chặt chẽ của hệ thống phân quyền:
Hệ thống hiển thị rõ ràng các tùy chọn bảo mật đối với từng công cụ cụ thể bao gồm: Luôn cho phép (Always allow), Hỏi mỗi lần (Ask each time), hoặc Chặn hoàn toàn (Block), giúp đảm bảo an toàn thông tin tối đa cho phòng thí nghiệm.
Người dùng cũng có thể tự phát triển kỹ năng cá nhân bằng cách tải lên các gói định dạng ZIP, SKILL.md hoặc nhập trực tiếp các kỹ năng tương thích từ GitHub để cá nhân hóa workbench của mình.
Tính tương thích đa mô hình và hiệu năng dẫn đầu bảng xếp hạng
Sự linh hoạt của aipoch/open-science còn thể hiện ở khả năng tương thích mô hình AI đa dạng. Người dùng có bốn phương thức để kết nối mô hình bao gồm: sử dụng khóa API đám mây trực tiếp, cấu hình cổng kết nối tùy chỉnh (Custom gateway), chạy mô hình cục bộ thông qua llama.cpp hoặc Ollama, hoặc tái sử dụng gói đăng ký Claude hiện có qua trình duyệt bảo mật (phương thức Local Claude cũ đã bị loại bỏ hoàn toàn trong các bản cập nhật mới nhất để đảm bảo an toàn).
Kiến trúc tối ưu này đã giúp dự án đạt thành tích ấn tượng khi đứng vị trí số 1 trên bảng xếp hạng hiệu năng BiomniBench-DA Public 50 với điểm số tổng hợp là 79.05 (sử dụng cấu hình gpt-5.6-sol xhigh), đánh giá dựa trên điểm số trung bình từ hai giám khảo độc lập là Gemini 3.1 Pro và DeepSeek v4-pro.
Trong phiên bản bảo trì mới nhất v0.25.1 (cập nhật tháng 9 năm 2026), dự án tiếp tục cải thiện trải nghiệm người dùng khi hỗ trợ khởi chạy trực tiếp các kernel notebook được bảo vệ trên hệ điều hành Windows, sửa lỗi hiển thị ảnh xem trước và đồng bộ hóa múi giờ an toàn khi xuất file.
Những điểm hạn chế và khía cạnh chưa được làm rõ
Mặc dù sở hữu những thông số kỹ thuật ấn tượng và tính năng ưu việt, tài liệu hiện tại của aipoch/open-science vẫn chưa làm rõ một số khía cạnh quan trọng đối với người dùng thực tế. Dự án chưa cung cấp cấu hình phần cứng tối thiểu chi tiết để chạy mượt mà các mô hình ngôn ngữ lớn hoặc các kỹ năng nặng như AlphaFold2 hoàn toàn trên tài nguyên máy cục bộ. Thêm vào đó, tài liệu cũng chưa phân tích sâu về chi phí API phát sinh hoặc mức độ hao phí tài nguyên mạng khi AI agent liên tục thực hiện hàng loạt truy vấn phức tạp tới 24 cổng kết nối dữ liệu khoa học trong các dự án dài kỳ. Đây là những điểm mà các nhóm nghiên cứu cần tự kiểm chứng và tối ưu hóa dựa trên điều kiện hạ tầng riêng biệt của mình.
Nguồn tham khảo: Xem bài gốc