• By BitSeed
  • Công nghệ giọng nói
  • 18 Sep

Với mô hình lớn, tại sao vẫn cần NLP

GPT-4o có thể viết thơ, Claude có thể lập trình, DeepSeek-R1 có thể suy luận, mô hình lớn dường như có thể làm mọi thứ. Nhưng khi bạn thực sự cài đặt nó vào loa thông minh để điều khiển điều hòa trong phòng khách, vấn đề就来了——mô hình 67,1 tỷ tham số, chỉ để tạo ra bốn chữ "mở điều hòa" đã cần vài giây, ch遑论quá trình điều khiển thiết bị tiếp theo. Đây chính là lý do cơ bản tại sao ngay cả trong thời đại mô hình lớn, công nghệ NLP truyền thống vẫn không thể thay thế.

Mô hình lớn và NLP về bản chất giải quyết các vấn đề ở các cấp độ khác nhau. Mô hình lớn擅长生成和理解ngôn ngữ tự nhiên phức tạp, nó có được khả năng sinh ngôn ngữ mạnh mẽ thông qua huấn luyện với dữ liệu khổng lồ, có thể thực hiện trò chuyện nhiều vòng, viết sáng tạo thậm chí là sinh mã. Nhưng khả năng通用này có giá cả——số tham số của mô hình thường lên đến hàng tỷ, khi suy luận cần大量tài nguyên tính toán, độ trễ phản hồi trên mức giây. Còn công nghệ NLP truyền thống như phân loại ý định và nhận diện thực thể, mặc dù chức năng tương đối单一, nhưng trong các nhiệm vụ cụ thể có thể做到phản hồi ở mức mili giây, độ chính xác vượt quá 95%. Trong các场景tương tác thời gian thực như loa thông minh, sau khi người dùng nói "tắt đèn" phải đợi ba giây mới thực hiện, trải nghiệm là không thể chấp nhận được.

Từ góc độ kiến trúc kỹ thuật, mô hình lớn采用phương thức xử lý hộp đen端到端, văn bản đầu vào trực tiếp xuất ra kết quả, quá trình trung gian không minh bạch và khó调试. Khi hệ thống xuất hiện lỗi, bạn rất khó定位là nhận diện ý định sai hay trích xuất thực thể có vấn đề. Ngược lại, NLP采用quá trình xử lý mô đun hóa——đầu tiên thực hiện phân loại ý định, nhận biết người dùng muốn làm gì; sau đó thực hiện填充槽位, trích xuất tham số关鍵; cuối cùng thực hiện hành động tương ứng. Phương thức xử lý có cấu trúc này không chỉ便于定位và tối ưu hóa vấn đề, mà还能针对mỗi mô đun进行独立调优性能. Trong场景phòng khách khách sạn, khi khách nói "điều chỉnh nhiệt độ đến hai mươi độ", hệ thống NLP có thể准确识别出ý định là "điều chỉnh nhiệt độ", thực thể là "hai mươi độ", toàn bộ quá trình rõ ràng và có thể kiểm soát.

Sự khác biệt về tiêu hao tài nguyên更是天壤之别. Chạy một mô hình lớn thường cần GPU cao cấp hỗ trợ, công suất ở mức trăm瓦特, điều này đối với thiết bị边缘là không thể承受. Công nghệ lượng hóa mới nhất mặc dù có thể nén mô hình xuống còn vài GB, nhưng tốc độ suy luận trên thiết bị nhúng vẫn không thể满足yêu cầu thời gian thực. Dữ liệu nghiên cứu显示, ngay cả LLM nhỏ được lượng hóa 4 bit, độ trễ từ đầu tiên trên thiết bị边缘 cũng trên 500 mili giây. Còn mô hình NLP được优hua专门 có thể nén xuống còn vài chục MB, có thể chạy mượt trên chip ARM thông thường, công suất chỉ vài瓦特. Đặc tính nhẹ nhàng này使得công nghệ NLP能够大规模部署trên loa thông minh, nhà thông minh và các thiết bị终端 có tài nguyên hạn chế.

Khả năng thích ứng lĩnh vực là một khác biệt关鍵khác. Khả năng通用của mô hình lớn là一把双刃剑——nó có thể xử lý various chủ đề, nhưng表现trong lĩnh vực cụ thể thường không如mô hình NLP được huấn luyện专门. Ví dụ trong场景điều khiển nhà thông minh, cách diễn đạt của người dùng tương đối cố định, chủ yếu liên quan đến有限loại ý định như bật/tắt, điều chỉnh, tra cứu等. Mô hình NLP được huấn luyện针对các场景cao tần này, chỉ用几千条dữ liệu标注就能达到độ chính xác cao. Còn要让mô hình lớn理解lệnh như "làm mờ一点đèn phòng khách" và thực hiện准确, cần kỹ thuật提示phức tạp thậm chí là微调, chi phí và độ phức tạp都大幅增加.

Trong triển khai thực tế,方案tốt nhất thường là协同của mô hình lớn và công nghệ NLP. Đối với các lệnh điều khiển đơn giản và thao tác cao tần, sử dụng mô hình NLP nhẹ ở端侧xử lý trực tiếp, đảm bảo phản hồi mili giây; đối với理解ngôn ngữ tự nhiên phức tạp, trò chuyện nhiều vòng hoặc câu hỏi kiến thức,则调用dịch vụ mô hình lớn trên đám mây. Kiến trúc hỗn hợp này既保证了tính thời gian thực và độ tin cậy của chức năng cơ bản,又能提供trải nghiệm tương tác thông minh cao cấp. Ví dụ trong终端học tập AI场景giáo dục, lệnh đơn giản như "câu tiếp theo" của học sinh được xử lý bởi NLP cục bộ, còn câu hỏi sâu như "tại sao bài toán này phải giải như vậy"则交给mô hình lớn trả lời.

Các考虑về quyền riêng tư và an toàn cũng支持sự tồn tại liên tục của công nghệ NLP. Mô hình lớn thường需要传输dữ liệu đến đám mây xử lý, điều này存在rủi ro về quyền riêng tư khi xử lý thông tin nhạy cảm. Còn mô hình NLP cục bộ có thể运行hoàn toàn ngoại tuyến, tất cả xử lý dữ liệu都在thiết bị端完成, không存在rủi ro rò rỉ dữ liệu. Trong场景đ看重quyền riêng tư như phòng khách khách sạn, xử lý lệnh giọng nói của khách bằng NLP cục bộ rõ ràng phù hợp hơn. Ngoài ra, khả năng giải thích và kiểm soát của mô hình NLP cũng更强, doanh nghiệp có thể控制系统chính xác ranh giới hành vi,避免문제 "ảo giác" có thể xảy ra của mô hình lớn.

So sánh效益chi phí更是rõ ràng. Triển khai dịch vụ mô hình lớn hỗ trợ千萬người dùng, cần cụm GPU trị giá hàng triệu đô la và chi phí vận hành持续. Còn dịch vụ NLP quy mô tương đương, có thể hỗ trợ bằng máy chủ CPU thông thường, chi phí có thể chỉ bằng một phần mười của前者. Đối với hầu hết các ứng dụng场景dọc,用mô hình lớn xử lý các lệnh đơn giản như "mở đèn" "đóng cửa",就像用dao bò để giết gà, không chỉ lãng phí tài nguyên,还影响trải nghiệm người dùng.

Là nhà cung cấp thiết bị终端tương tác giọng nói AI, chúng tôi充分考虑了sự bổ sung优垫của mô hình lớn và công nghệ NLP trong thiết kế sản phẩm.通过部署引擎NLP được优hua trên thiết bị终端, chúng tôi能够提供phản hồi lệnh mili giây, đồng thời通过接口đám mây对接dịch vụ mô hình lớn,为người dùng提供câu hỏi kiến thức, sáng tạo nội dung等các chức năng cao cấp. Kiến trúc thông minh phân tầng này既保证了sự trôi chảy của tương tác cơ bản,又能根据yêu cầu thực tế扩展灵hoạt năng lực cao cấp. Mô hình lớn开启了新纪元AI, nhưng trong ứng dụng落地, công nghệ NLP成熟, hiệu quả và có thể kiểm soát vẫn是基石không thể thiếu.