DeepSeek AI: Đối thủ tiềm năng với phong cách giống ChatGPT

Nghi Vấn Bản Quyền AI: DeepSeek Có Thể Đã Học Từ ChatGPT Với Mức Tương Đồng Phong Cách 74,2%

Một nghiên cứu mới tiết lộ rằng phong cách văn bản của DeepSeek AI có mức tương đồng lên đến 74,2% so với ChatGPT của OpenAI.

Công bố trên arXiv.org ngày 3/3, báo cáo do Copyleaks – công ty chuyên phân tích và so sánh các mô hình AI – thực hiện, đặt ra nghi vấn: DeepSeek có thể đã được đào tạo dựa trên dữ liệu đầu ra của ChatGPT. Forbes nhận định phát hiện này có thể tác động sâu rộng đến quyền sở hữu trí tuệ, các quy định về AI cũng như định hướng phát triển của trí tuệ nhân tạo.

I. Phát Hiện “Dấu Vân Tay” Phong Cách Viết

Copyleaks đã sử dụng công nghệ sàng lọc tiên tiến để xác định “dấu vân tay” trong phong cách viết của nhiều mô hình ngôn ngữ (bao gồm OpenAI, Claude, Google Gemini, Meta Llama và DeepSeek).

  • Kết quả: Hầu hết các mô hình có thể dễ dàng được phân biệt. Tuy nhiên, phần lớn nội dung do DeepSeek tạo ra lại bị hệ thống nhận diện là sản phẩm của OpenAI.

Shai Nisan, Giám đốc khoa học dữ liệu tại Copyleaks, nhấn mạnh sự bất thường này: “DeepSeek có sự tương đồng lớn về phong cách với OpenAI, điều mà chúng tôi không thấy ở các mô hình khác.”

II. Nghi Vấn Về Quy Trình Đào Tạo và Sở Hữu Trí Tuệ

Phát hiện này đặt ra câu hỏi quan trọng về cách DeepSeek được đào tạo và liệu có khả năng nó đã sử dụng đầu ra từ các mô hình OpenAI hay không.

  • Quan điểm của Copyleaks: “Mặc dù những điểm tương đồng này chưa thể chứng minh chắc chắn rằng DeepSeek là một sản phẩm phái sinh, nhưng chúng đặt ra nghi vấn về quy trình phát triển của mô hình này.”

  • Hậu quả tiềm ẩn: Nếu DeepSeek thực sự đã sử dụng dữ liệu từ OpenAI mà không có sự cho phép, vấn đề bản quyền và sở hữu trí tuệ có thể trở nên phức tạp.

  • Thúc đẩy Minh bạch: Sự thiếu minh bạch trong nguồn dữ liệu đào tạo AI là một thách thức lớn. Phát hiện này có thể thúc đẩy các cơ quan quản lý yêu cầu các công ty AI công khai thông tin về tập dữ liệu và phương pháp huấn luyện của họ.

III. Bối Cảnh Lịch Sử và Cáo Buộc “Chưng Cất”

Đây không phải là lần đầu tiên DeepSeek bị đặt nghi vấn về nguồn gốc:

  • Năm 2023: Mô hình DeepSeek V3 từng bị phát hiện tự nhận là ChatGPT/GPT-4 trong một số truy vấn, làm dấy lên nghi vấn.

  • Cáo buộc “Chưng cất” (Distillation): Tháng 1/2024, OpenAI từng chia sẻ với Financial Times rằng họ đã phát hiện dấu hiệu cho thấy DeepSeek có thể đã sử dụng kỹ thuật “chưng cất” – một phương pháp giúp các mô hình nhỏ tái tạo khả năng của mô hình lớn bằng cách học từ đầu ra của chúng.

Nếu DeepSeek sử dụng kỹ thuật này với dữ liệu đầu ra của OpenAI mà không được phép, điều này có thể vi phạm điều khoản dịch vụ của OpenAI.

Lưu ý: DeepSeek và OpenAI vẫn chưa đưa ra phản hồi chính thức về kết luận và cáo buộc này.

goi-dienzalomessenger