pc
Kiến trúc

Vì sao chỉ-trên-trình-duyệt quan trọng với riêng định dạng PDF.

Hầu hết công cụ PDF tải file của bạn lên server, chỉnh ở đó, rồi gửi lại. Chúng tôi thì không. Đây là lý do quyết định đó thay đổi mọi thứ.

PDF thường chứa tài liệu nhạy cảm nhất của một người: tờ khai thuế, hồ sơ y tế, hợp đồng đã ký, sao kê ngân hàng, ảnh chụp CCCD. Quy trình SaaS chuẩn — tải lên bên thứ ba, chờ xử lý, tải kết quả về — yêu cầu bạn tin tưởng chính sách lưu trữ, bộ đếm thời gian xoá, audit log, sub-processor và sự liêm chính của mọi kỹ sư có quyền truy cập database của công ty đó. Với phần lớn loại file thì đánh đổi đó chấp nhận được. Với PDF thì thường là không.

PDFCatalyst được xây dựng trên một tiền đề khác: trình duyệt vốn đã là một runtime PDF có khả năng. pdf.js của Mozilla render trang lên canvas, còn pdf-lib thao tác trên cây object bên dưới — ghi chú, giá trị trường AcroForm, xoay trang, watermark, số trang, tách, ghép. Cả hai đều chạy hoàn toàn bằng JavaScript trong tab của bạn. File được nạp dưới dạng mảng byte trong bộ nhớ, sửa trong bộ nhớ, rồi serialize lại thành một bản tải về. Các byte không bao giờ chạm hạ tầng của chúng tôi vì không có bước upload nào trong code path.

Điều đó nghĩa là gì trong thực tế

  • Quyền riêng tư có thể kiểm chứng, không phải lời hứa. Mở tab Network trong DevTools khi bạn chỉnh sửa. Bạn sẽ thấy zero request gửi PDF của bạn ra ngoài. Chúng tôi không thể làm rò rỉ thứ chúng tôi không bao giờ nhận.
  • Không có độ trễ tải lên. Một PDF scan 30 MB mất 8 giây để tải lên đối thủ — ở đây mở ngay lập tức, vì file đã ở trên thiết bị của bạn.
  • Hoạt động offline sau lần load đầu. Sau lần tải trang đầu tiên, trình chỉnh sửa được cache như tài nguyên service-worker. Bạn có thể điền tờ khai thuế trên máy bay.
  • Không có bề mặt lưu giữ dữ liệu. Không có server log, không S3 bucket, không warm cache, không backup tape nào chứa tài liệu của bạn. Không có gì để thu giữ theo lệnh.
  • Miễn phí bền vững. Xử lý PDF phía server tốn kém (compute + băng thông + lưu trữ). Vì gói miễn phí không làm gì trong số đó, $0 thực sự là giá — không phải bản dùng thử.

Đánh đổi thành thực

Chỉ-trên-trình-duyệt không phải bữa trưa miễn phí. Hai hạn chế thật: tài liệu lớn (hợp đồng scan 200 trang) tiêu RAM tỷ lệ với kích thước, vì cả file nằm trong bộ nhớ; và OCR trên PDF chỉ-ảnh đòi hỏi máy chủ mà trình duyệt không có. Đó đúng là các trường hợp gói trả phí v1.1 xử lý — OCR đám mây và điền tự động form scan, với đồng ý rõ ràng theo từng tài liệu và TTL 60 giây. Mọi thứ khác vẫn chỉ trên trình duyệt.

Chúng tôi ưu tiên tiếng Việt vì các công cụ lớn hiện có (iLovePDF, SmallPDF, PDF24) đã dịch UI nhưng không xử lý được ký tự tiếng Việt của các form chính phủ Việt Nam — Mẫu 02/KK-TNCN thuế TNCN, bảo hiểm xã hội, hợp đồng lao động — và pipeline xuất file của họ thường làm hỏng dấu tiếng Việt. Pipeline xuất của chúng tôi tự động fetch Roboto-Vietnamese ngay khi có ghi chú nào chứa ký tự ngoài ASCII, nên "Nguyễn Thị Hằng" hiển thị giống nhau ở bản xem trước trong trình chỉnh sửa và trong PDF đã xuất.

Nếu bạn muốn kiểm chứng bất cứ điều gì ở trên trước khi tin chúng tôi: đọc chính sách bảo mật, rồi mở DevTools khi bạn chỉnh sửa. Kiến trúc này không có gì để giấu.