Bảng thuật ngữ máy học

Bảng chú giải này định nghĩa các thuật ngữ về trí tuệ nhân tạo.

A

loại bỏ

Một kỹ thuật để đánh giá tầm quan trọng của một đặc điểm hoặc thành phần bằng cách tạm thời xoá đặc điểm hoặc thành phần đó khỏi một mô hình. Sau đó, bạn sẽ huấn luyện lại mô hình mà không có tính năng hoặc thành phần đó. Nếu mô hình được huấn luyện lại hoạt động kém hơn đáng kể, thì tính năng hoặc thành phần bị xoá có thể là quan trọng.

Ví dụ: giả sử bạn huấn luyện một mô hình phân loại trên 10 đặc điểm và đạt được độ chính xác 88% trên tập kiểm định. Để kiểm tra tầm quan trọng của tính năng đầu tiên, bạn có thể huấn luyện lại mô hình chỉ bằng 9 tính năng khác. Nếu mô hình được huấn luyện lại hoạt động kém hơn đáng kể (ví dụ: độ chính xác 55%), thì có thể tính năng bị xoá là một tính năng quan trọng. Ngược lại, nếu mô hình được huấn luyện lại hoạt động hiệu quả như nhau, thì có thể tính năng đó không quan trọng đến vậy.

Việc loại bỏ cũng có thể giúp xác định tầm quan trọng của:

  • Các thành phần lớn hơn, chẳng hạn như toàn bộ hệ thống con của một hệ thống học máy lớn hơn
  • Quy trình hoặc kỹ thuật, chẳng hạn như bước tiền xử lý dữ liệu

Trong cả hai trường hợp, bạn sẽ quan sát thấy hiệu suất của hệ thống thay đổi (hoặc không thay đổi) như thế nào sau khi bạn xoá thành phần.

Thử nghiệm A/B

Một phương pháp thống kê để so sánh hai (hoặc nhiều) kỹ thuật – AB. Thông thường, A là một kỹ thuật hiện có và B là một kỹ thuật mới. Thử nghiệm A/B không chỉ xác định kỹ thuật nào hoạt động hiệu quả hơn mà còn xác định xem sự khác biệt đó có ý nghĩa thống kê hay không.

Thử nghiệm A/B thường so sánh một chỉ số duy nhất trên hai kỹ thuật; ví dụ: độ chính xác của mô hình so với hai kỹ thuật như thế nào? Tuy nhiên, thử nghiệm A/B cũng có thể so sánh bất kỳ số lượng hữu hạn nào của các chỉ số.

khối tăng tốc

#GoogleCloud

Một danh mục các thành phần phần cứng chuyên dụng được thiết kế để thực hiện các phép tính chính cần thiết cho các thuật toán học sâu.

Các chip tăng tốc (hoặc chỉ là bộ tăng tốc) có thể tăng đáng kể tốc độ và hiệu quả của các tác vụ huấn luyện và suy luận so với CPU đa năng. Chúng lý tưởng cho việc huấn luyện mạng nơ-ron và các tác vụ tương tự cần nhiều sức mạnh tính toán.

Sau đây là một số ví dụ về chip tăng tốc:

  • Bộ xử lý Tensor (TPU) của Google có phần cứng chuyên dụng để học sâu.
  • GPU của NVIDIA, mặc dù ban đầu được thiết kế để xử lý đồ hoạ, nhưng được thiết kế để cho phép xử lý song song, có thể tăng đáng kể tốc độ xử lý.

độ chính xác

#fundamentals
#Chỉ số

Số lượng dự đoán phân loại chính xác chia cho tổng số dự đoán. Đó là:

$$\text{Accuracy} = \frac{\text{correct predictions}} {\text{correct predictions + incorrect predictions }}$$

Ví dụ: một mô hình đưa ra 40 dự đoán chính xác và 10 dự đoán không chính xác sẽ có độ chính xác là:

$$\text{Accuracy} = \frac{\text{40}} {\text{40 + 10}} = \text{80%}$$

Phân loại nhị phân cung cấp tên cụ thể cho các danh mục khác nhau của dự đoán chính xácdự đoán không chính xác. Vì vậy, công thức tính độ chính xác cho phân loại nhị phân như sau:

$$\text{Accuracy} = \frac{\text{TP} + \text{TN}} {\text{TP} + \text{TN} + \text{FP} + \text{FN}}$$

trong đó:

So sánh và đối chiếu độ chính xác với độ đo chính xáckhả năng thu hồi.

Xem Phân loại: Độ chính xác, độ bao phủ, độ chính xác và các chỉ số liên quan trong Khoá học học máy ứng dụng để biết thêm thông tin.

hành động

#agent

Một giai đoạn trong vòng lặp có tác nhân, trong đó tác nhân thực hiện hành động được chọn trong giai đoạn lý do. Ví dụ: giai đoạn hành động có thể gửi một yêu cầu API.

hành động

#agent

Trong học tăng cường, cơ chế mà tác nhân chuyển đổi giữa các trạng thái của môi trường. Tác nhân chọn hành động bằng cách sử dụng chính sách.

không gian hành động

#agent

Tập hợp các tài nguyên mà tác nhân có thể dùng để thực hiện một tác vụ. Không gian hành động có thể bao gồm các công cụ và API mà tác nhân có thể gọi và các quyền mà tác nhân nắm giữ. Nhìn chung, không gian thao tác chỉ cần đủ lớn để tác nhân thực hiện tác vụ. Nếu không gian hành động quá nhỏ, tác nhân có thể không có đủ tài nguyên để thực hiện nhiệm vụ. Nếu không gian hành động quá lớn, tác nhân có xu hướng dễ mắc lỗi hơn.

hàm kích hoạt

#fundamentals

Một hàm cho phép mạng nơ-ron tìm hiểu các mối quan hệ phi tuyến tính (phức tạp) giữa các đặc điểm và nhãn.

Các hàm kích hoạt phổ biến bao gồm:

Đồ thị của các hàm kích hoạt không bao giờ là đường thẳng đơn lẻ. Ví dụ: biểu đồ của hàm kích hoạt ReLU bao gồm 2 đường thẳng:

Một biểu đồ Descartes gồm 2 đường. Đường thẳng đầu tiên có giá trị y không đổi là 0, chạy dọc theo trục x từ -vô cùng,0 đến 0,-0.
          Đường thứ hai bắt đầu tại 0,0. Đường thẳng này có độ dốc là +1, nên đường thẳng này chạy từ 0,0 đến +vô cực,+vô cực.

Biểu đồ của hàm kích hoạt sigmoid có dạng như sau:

Một biểu đồ cong hai chiều với các giá trị x trải dài trên miền từ vô cực âm đến vô cực dương, trong khi các giá trị y trải dài trong phạm vi gần 0 đến gần 1. Khi x là 0, y là 0,5. Độ dốc của đường cong luôn dương, với độ dốc cao nhất ở 0,0,5 và độ dốc giảm dần khi giá trị tuyệt đối của x tăng lên.

Hãy xem phần Mạng nơ-ron: Hàm kích hoạt trong Khoá học học máy ứng dụng để biết thêm thông tin.

đang học

Một phương pháp huấn luyện trong đó thuật toán chọn một số dữ liệu mà thuật toán học được. Học tập chủ động đặc biệt có giá trị khi dữ liệu có nhãn khan hiếm hoặc tốn kém để thu thập. Thay vì mù quáng tìm kiếm nhiều ví dụ được gắn nhãn, thuật toán học tập chủ động sẽ chọn lọc phạm vi ví dụ cụ thể mà thuật toán cần để học.

AdaGrad

Một thuật toán phương pháp giảm độ dốc tinh vi giúp điều chỉnh lại độ dốc của từng tham số, mang lại cho mỗi tham số một tốc độ học độc lập một cách hiệu quả. Để biết nội dung giải thích đầy đủ, hãy xem Phương pháp hạ gradient thích ứng cho học tập trực tuyến và tối ưu hoá ngẫu nhiên.

sự thích ứng

#generativeAI

Từ đồng nghĩa với việc điều chỉnh hoặc tinh chỉnh.

nhân viên hỗ trợ

#generativeAI
#agent

Phần mềm có thể suy luận về thông tin đầu vào của người dùng để lên kế hoạch và thực hiện các hành động thay cho người dùng.

Trong học tăng cường, tác nhân là thực thể sử dụng một chính sách để tối đa hoá lợi nhuận dự kiến thu được từ việc chuyển đổi giữa các trạng thái của môi trường.

tác nhân

#generativeAI
#agent

Dạng tính từ của agent. Agentic đề cập đến những phẩm chất mà các tác nhân sở hữu (chẳng hạn như tính tự chủ).

vòng lặp tác nhân

#agent

Một chu kỳ mà tác nhân lặp lại cho đến khi đáp ứng điều kiện chấm dứt. Chu kỳ này thường bao gồm 4 giai đoạn sau:

  1. Quan sát
  2. Lý do
  3. Đạo luật
  4. Ý kiến phản hồi

quy trình làm việc dựa trên tác nhân

#generativeAI
#agent

Một quy trình linh hoạt trong đó tác nhân tự động lên kế hoạch và thực hiện các hành động để đạt được mục tiêu. Quy trình này có thể bao gồm suy luận, gọi các công cụ bên ngoài và tự điều chỉnh kế hoạch.

điều phối tác nhân

#agent

Việc quản lý và định tuyến tập trung các tác vụ trên nhiều tác nhân phụ hoặc lệnh gọi LLM. Điều phối tác nhân chia nhỏ các tác vụ phức tạp thành các tác vụ phụ nhỏ hơn và chỉ định các tác vụ đó cho các tác nhân phụ có khả năng cao nhất.

phân cụm kết hợp

#clustering

Xem phần phân cụm theo hệ thống phân cấp.

nội dung AI rác

#generativeAI

Kết quả của hệ thống AI tạo sinh ưu tiên số lượng hơn chất lượng. Ví dụ: một trang web có nội dung AI rác được điền bằng nội dung chất lượng thấp, do AI tạo và được sản xuất với chi phí thấp.

phát hiện điểm bất thường

Quá trình xác định giá trị ngoại lệ. Ví dụ: nếu giá trị trung bình cho một đặc điểm nhất định là 100 với độ lệch chuẩn là 10, thì tính năng phát hiện điểm bất thường sẽ gắn cờ giá trị 200 là đáng ngờ.

Thực tế tăng cường (AR)

Viết tắt của thực tế tăng cường.

diện tích dưới đường cong PR

#Chỉ số

Xem PR AUC (Diện tích dưới đường cong PR).

diện tích dưới đường cong ROC

#Chỉ số

Xem AUC (Diện tích dưới đường cong ROC).

trí tuệ nhân tạo tổng quát

Một cơ chế không phải do con người tạo ra, thể hiện nhiều khả năng giải quyết vấn đề, sáng tạo và thích ứng. Ví dụ: một chương trình minh hoạ trí tuệ nhân tạo đa năng có thể dịch văn bản, sáng tác bản giao hưởng chơi giỏi những trò chơi chưa được phát minh.

trí tuệ nhân tạo

#fundamentals

Một chương trình hoặc mô hình không phải do con người tạo ra, có thể giải quyết các nhiệm vụ phức tạp. Ví dụ: một chương trình hoặc mô hình dịch văn bản hoặc một chương trình hoặc mô hình xác định bệnh từ hình ảnh chụp X-quang đều thể hiện trí tuệ nhân tạo.

Về mặt chính thức, học máy là một lĩnh vực con của trí tuệ nhân tạo. Tuy nhiên, trong những năm gần đây, một số tổ chức đã bắt đầu sử dụng các thuật ngữ trí tuệ nhân tạohọc máy thay thế cho nhau.

chú ý

Một cơ chế được dùng trong mạng nơ-ron cho biết tầm quan trọng của một từ cụ thể hoặc một phần của từ. Cơ chế chú ý nén lượng thông tin mà mô hình cần để dự đoán mã thông báo/từ tiếp theo. Cơ chế chú ý điển hình có thể bao gồm một tổng có trọng số trên một tập hợp các đầu vào, trong đó trọng số cho mỗi đầu vào được tính toán bởi một phần khác của mạng nơ-ron.

Bạn cũng có thể tham khảo cơ chế tự chú ýcơ chế tự chú ý nhiều đầu. Đây là các khối xây dựng của Transformer.

Hãy xem bài viết LLM (mô hình ngôn ngữ lớn): Mô hình ngôn ngữ lớn là gì? trong Khoá học học máy ứng dụng để biết thêm thông tin về cơ chế tự chú ý.

thuộc tính

#responsible

Từ đồng nghĩa với tính năng.

Trong tính công bằng của học máy, các thuộc tính thường đề cập đến những đặc điểm liên quan đến cá nhân.

lấy mẫu thuộc tính

#df

Một chiến thuật để huấn luyện rừng quyết định trong đó mỗi cây quyết định chỉ xem xét một tập hợp con ngẫu nhiên gồm các đặc điểm có thể có khi tìm hiểu điều kiện. Nhìn chung, một tập hợp con khác của các đối tượng được lấy mẫu cho mỗi nút. Ngược lại, khi huấn luyện cây quyết định mà không lấy mẫu thuộc tính, tất cả các đặc điểm có thể có đều được xem xét cho từng nút.

AUC (Diện tích dưới đường cong ROC)

#fundamentals
#Chỉ số

Một số từ 0,0 đến 1,0 biểu thị khả năng của mô hình phân loại nhị phân trong việc tách các lớp dương khỏi các lớp âm. AUC càng gần 1.0 thì khả năng phân tách các lớp của mô hình càng tốt.

Ví dụ: hình minh hoạ sau đây cho thấy một mô hình phân loại tách biệt hoàn toàn các lớp dương (hình bầu dục màu xanh lục) với các lớp âm (hình chữ nhật màu tím). Mô hình hoàn hảo một cách phi thực tế này có AUC là 1.0:

Một trục số có 8 ví dụ dương ở một bên và 9 ví dụ âm ở bên còn lại.

Ngược lại, hình minh hoạ sau đây cho thấy kết quả của một mô hình phân loại đã tạo ra kết quả ngẫu nhiên. Mô hình này có AUC là 0,5:

Một trục số có 6 ví dụ dương và 6 ví dụ âm.
          Trình tự của các ví dụ là dương tính, âm tính, dương tính, âm tính, dương tính, âm tính, dương tính, âm tính, dương tính, âm tính, dương tính, âm tính.

Có, mô hình trước đó có AUC là 0, 5 chứ không phải 0.

Hầu hết các mô hình đều nằm ở khoảng giữa hai thái cực này. Ví dụ: mô hình sau đây tách biệt phần nào các giá trị dương với giá trị âm, do đó có AUC nằm trong khoảng từ 0,5 đến 1,0:

Một trục số có 6 ví dụ dương và 6 ví dụ âm.
          Trình tự của các ví dụ là tiêu cực, tiêu cực, tiêu cực, tiêu cực, tích cực, tiêu cực, tích cực, tích cực, tiêu cực, tích cực, tích cực, tích cực.

AUC bỏ qua mọi giá trị mà bạn đặt cho ngưỡng phân loại. Thay vào đó, AUC sẽ xem xét tất cả các ngưỡng phân loại có thể có.

Hãy xem phần Phân loại: ROC và AUC trong Khoá học học máy ứng dụng để biết thêm thông tin.

thực tế tăng cường

Một công nghệ giúp chồng hình ảnh do máy tính tạo lên khung cảnh thực tế mà người dùng nhìn thấy, từ đó mang đến một khung cảnh kết hợp.

autoencoder

Một hệ thống học cách trích xuất thông tin quan trọng nhất từ dữ liệu đầu vào. Bộ mã hoá tự động là sự kết hợp giữa bộ mã hoábộ giải mã. Trình mã hoá tự động dựa vào quy trình gồm 2 bước sau:

  1. Bộ mã hoá ánh xạ thông tin đầu vào sang định dạng (thường là) có tổn hao có kích thước thấp hơn (trung gian).
  2. Bộ giải mã tạo một phiên bản có tổn hao của dữ liệu đầu vào ban đầu bằng cách ánh xạ định dạng ít chiều hơn sang định dạng đầu vào ban đầu có nhiều chiều hơn.

Các bộ mã hoá tự động được huấn luyện từ đầu đến cuối bằng cách yêu cầu bộ giải mã cố gắng tái tạo đầu vào ban đầu từ định dạng trung gian của bộ mã hoá càng gần càng tốt. Vì định dạng trung gian nhỏ hơn (ít chiều hơn) so với định dạng ban đầu, nên bộ mã hoá tự động buộc phải tìm hiểu thông tin nào trong dữ liệu đầu vào là cần thiết và đầu ra sẽ không hoàn toàn giống với đầu vào.

Ví dụ:

  • Nếu dữ liệu đầu vào là một hình ảnh, thì bản sao không hoàn toàn giống sẽ tương tự như hình ảnh gốc, nhưng có phần sửa đổi. Có thể bản sao không hoàn toàn giống sẽ loại bỏ nhiễu khỏi hình ảnh gốc hoặc điền vào một số pixel bị thiếu.
  • Nếu dữ liệu đầu vào là văn bản, thì một bộ mã hoá tự động sẽ tạo ra văn bản mới mô phỏng (nhưng không giống hệt) văn bản gốc.

Xem thêm mô hình tự mã hoá biến phân.

đánh giá tự động

#generativeAI

Sử dụng phần mềm để đánh giá chất lượng đầu ra của một mô hình.

Khi đầu ra của mô hình tương đối đơn giản, một tập lệnh hoặc chương trình có thể so sánh đầu ra của mô hình với một phản hồi mẫu. Loại đánh giá tự động này đôi khi được gọi là đánh giá theo chương trình. Các chỉ số như ROUGE hoặc BLEU thường hữu ích cho việc đánh giá theo chương trình.

Khi đầu ra của mô hình phức tạp hoặc không có câu trả lời đúng duy nhất, một chương trình học máy riêng biệt có tên là trình đánh giá tự động đôi khi sẽ thực hiện quy trình đánh giá tự động.

Tương phản với đánh giá của con người.

thiên vị tự động

#responsible

Khi người đưa ra quyết định là con người ưu tiên các đề xuất do hệ thống tự động đưa ra quyết định so với thông tin không có sự can thiệp của hệ thống tự động, ngay cả khi hệ thống tự động đưa ra quyết định mắc lỗi.

Hãy xem phần Tính công bằng: Các loại thiên kiến trong Khoá học học máy ứng dụng để biết thêm thông tin.

AutoML

Mọi quy trình tự động để xây dựng mô hình học máy . AutoML có thể tự động thực hiện các tác vụ như sau:

AutoML rất hữu ích cho các nhà khoa học dữ liệu vì có thể giúp họ tiết kiệm thời gian và công sức trong việc phát triển các quy trình học máy, đồng thời cải thiện độ chính xác của dự đoán. Công cụ này cũng hữu ích cho những người không phải là chuyên gia, bằng cách giúp họ dễ dàng thực hiện các tác vụ học máy phức tạp.

Hãy xem phần Học máy tự động (AutoML) trong Khoá học học máy ứng dụng để biết thêm thông tin.

tác nhân tự trị

#agent

Một tác nhân hướng đến mục tiêu phức tạp bằng cách lập kế hoạch, hành động và thích ứng mà không cần sự can thiệp liên tục của con người.

đánh giá autorater

#generativeAI
Một cơ chế kết hợp để đánh giá chất lượng đầu ra của mô hình AI tạo sinh, kết hợp đánh giá thủ công với đánh giá tự động. Autorater là một mô hình học máy được huấn luyện dựa trên dữ liệu do hoạt động đánh giá của con người tạo ra. Lý tưởng nhất là một công cụ chấm điểm tự động học cách mô phỏng một người đánh giá.

Có sẵn các công cụ đánh giá tự động được tạo sẵn, nhưng các công cụ đánh giá tự động tốt nhất là những công cụ được tinh chỉnh cụ thể cho nhiệm vụ mà bạn đang đánh giá.

mô hình tự hồi quy

#generativeAI

Một mô hình suy luận một dự đoán dựa trên các dự đoán trước đó của chính nó. Ví dụ: mô hình ngôn ngữ tự hồi quy dự đoán mã thông báo tiếp theo dựa trên các mã thông báo đã dự đoán trước đó. Tất cả mô hình ngôn ngữ lớn dựa trên Transformer đều tự hồi quy.

Ngược lại, các mô hình hình ảnh dựa trên GAN thường không tự hồi quy vì chúng tạo hình ảnh trong một lần chuyển tiếp duy nhất chứ không phải theo từng bước lặp lại. Tuy nhiên, một số mô hình tạo hình ảnh tính tự hồi quy vì chúng tạo hình ảnh theo từng bước.

tổn thất phụ trợ

Hàm tổn thất – được dùng cùng với hàm tổn thất chính của mô hình mạng nơron. Hàm này giúp tăng tốc quá trình huấn luyện trong các lần lặp lại ban đầu khi trọng số được khởi tạo ngẫu nhiên.

Các hàm mất mát phụ đẩy độ dốc hiệu quả đến các lớp trước đó. Điều này tạo điều kiện cho sự hội tụ trong quá trình huấn luyện bằng cách giải quyết vấn đề về độ dốc biến mất.

độ chính xác trung bình tại k

#Chỉ số

Một chỉ số để tóm tắt hiệu suất của mô hình trên một câu lệnh duy nhất tạo ra kết quả được xếp hạng, chẳng hạn như danh sách được đánh số đề xuất sách. Độ chính xác trung bình tại k là giá trị trung bình của các giá trị độ chính xác tại k cho mỗi kết quả phù hợp. Do đó, công thức tính độ chính xác trung bình tại k là:

\[{\text{average precision at k}} = \frac{1}{n} \sum_{i=1}^n {\text{precision at k for each relevant item} } \]

trong đó:

  • \(n\) là số lượng mặt hàng có liên quan trong danh sách.

Tương phản với khả năng nhớ lại ở k.

điều kiện căn chỉnh theo trục

#df

Trong cây quyết định, điều kiện chỉ liên quan đến một đặc điểm. Ví dụ: nếu area là một đối tượng, thì sau đây là điều kiện căn chỉnh theo trục:

area > 200

Tương phản với điều kiện xiên.

B

lan truyền ngược

#fundamentals

Thuật toán triển khai phương pháp giảm độ dốc trong mạng nơron.

Việc huấn luyện mạng nơ-ron bao gồm nhiều lần lặp lại của chu kỳ hai lượt sau đây:

  1. Trong quá trình truyền xuôi, hệ thống sẽ xử lý một gồm ví dụ để đưa ra(các) dự đoán. Hệ thống so sánh từng dự đoán với từng giá trị nhãn. Khoảng chênh lệch giữa giá trị dự đoán và giá trị nhãn là tổn thất cho ví dụ đó. Hệ thống tổng hợp các tổn thất cho tất cả các ví dụ để tính tổng tổn thất cho lô hiện tại.
  2. Trong lượt truyền ngược (lan truyền ngược), hệ thống sẽ giảm tổn thất bằng cách điều chỉnh trọng số của tất cả các nơ-ron trong tất cả (các) lớp ẩn.

Mạng nơ-ron thường chứa nhiều nơ-ron trên nhiều lớp ẩn. Mỗi nơ-ron trong số đó đóng góp vào tổn thất tổng thể theo những cách khác nhau. Thuật toán lan truyền ngược xác định xem có nên tăng hay giảm trọng số được áp dụng cho các nơ-ron cụ thể hay không.

Tốc độ học tập là một hệ số nhân kiểm soát mức độ mà mỗi lượt truyền ngược tăng hoặc giảm mỗi trọng số. Tốc độ học tập lớn sẽ tăng hoặc giảm mỗi trọng số nhiều hơn tốc độ học tập nhỏ.

Theo thuật ngữ giải tích, phương pháp lan truyền ngược triển khai quy tắc chuỗi từ giải tích. Tức là quá trình lan truyền ngược sẽ tính toán đạo hàm riêng của sai số đối với từng tham số.

Nhiều năm trước, các chuyên gia về học máy phải viết mã để triển khai phương pháp lan truyền ngược. Các API học máy hiện đại như Keras hiện triển khai tính năng lan truyền ngược cho bạn. Chà!

Hãy xem phần Mạng nơ-ron trong Khoá học học máy ứng dụng để biết thêm thông tin.

đóng gói

#df

Một phương pháp để huấn luyện một tập hợp trong đó mỗi mô hình thành phần huấn luyện trên một tập hợp con ngẫu nhiên của các ví dụ huấn luyện được lấy mẫu có thay thế. Ví dụ: rừng ngẫu nhiên là một tập hợp các cây quyết định được huấn luyện bằng phương pháp lấy mẫu lại.

Thuật ngữ bagging là viết tắt của bootstrap aggregating (tập hợp khởi động).

Hãy xem phần Rừng ngẫu nhiên trong khoá học Rừng quyết định để biết thêm thông tin.

túi từ

Một biểu diễn của các từ trong một cụm từ hoặc đoạn văn, bất kể thứ tự. Ví dụ: mô hình túi từ biểu thị 3 cụm từ sau đây một cách giống hệt nhau:

  • con chó nhảy lên
  • con chó nhảy lên
  • chó nhảy qua

Mỗi từ được liên kết với một chỉ mục trong vectơ thưa, trong đó vectơ có một chỉ mục cho mỗi từ trong từ vựng. Ví dụ: cụm từ the dog jumps (chú chó nhảy) được ánh xạ thành một vectơ đặc trưng có giá trị khác 0 tại 3 chỉ mục tương ứng với các từ the (chú), dog (chó) và jumps (nhảy). Giá trị khác 0 có thể là bất kỳ giá trị nào sau đây:

  • Số 1 cho biết sự xuất hiện của một từ.
  • Số lần một từ xuất hiện trong túi. Ví dụ: nếu cụm từ là the maroon dog is a dog with maroon fur (con chó màu hạt dẻ là một con chó có bộ lông màu hạt dẻ), thì cả maroon (màu hạt dẻ) và dog (chó) đều được biểu thị là 2, trong khi các từ khác sẽ được biểu thị là 1.
  • Một số giá trị khác, chẳng hạn như logarit của số lần một từ xuất hiện trong túi.

đường cơ sở

#Chỉ số

Một mô hình được dùng làm điểm tham chiếu để so sánh hiệu suất của một mô hình khác (thường là mô hình phức tạp hơn). Ví dụ: mô hình hồi quy logistic có thể đóng vai trò là một đường cơ sở tốt cho mô hình sâu.

Đối với một vấn đề cụ thể, đường cơ sở giúp các nhà phát triển mô hình định lượng hiệu quả tối thiểu dự kiến mà một mô hình mới phải đạt được để mô hình mới đó hữu ích.

mô hình cơ sở

#generativeAI

Một mô hình được huấn luyện tiền kỳ có thể đóng vai trò là điểm bắt đầu cho quá trình điều chỉnh để giải quyết các nhiệm vụ hoặc ứng dụng cụ thể.

Xem thêm mô hình được huấn luyện tiền kỳmô hình nền tảng.

#fundamentals

Tập hợp ví dụ được dùng trong một lần lặp lại quá trình huấn luyện. Kích thước lô xác định số lượng ví dụ trong một lô.

Hãy xem epoch để biết nội dung giải thích về mối quan hệ giữa một lô và một epoch.

Hãy xem phần Hồi quy tuyến tính: Siêu tham số trong Khoá học học máy ứng dụng để biết thêm thông tin.

suy luận theo lô

#GoogleCloud

Quy trình suy luận dự đoán trên nhiều ví dụ chưa được gắn nhãn được chia thành các tập hợp con nhỏ hơn ("lô").

Suy luận theo lô có thể tận dụng các tính năng song song hoá của các chip tăng tốc. Tức là nhiều bộ tăng tốc có thể đồng thời suy luận dự đoán trên nhiều lô ví dụ chưa được gắn nhãn, giúp tăng đáng kể số lượng suy luận mỗi giây.

Hãy xem bài viết Hệ thống học máy trong sản xuất: Suy luận tĩnh so với suy luận động trong Khoá học học máy ứng dụng để biết thêm thông tin.

chuẩn hoá theo lô

Chuẩn hoá đầu vào hoặc đầu ra của hàm kích hoạt trong lớp ẩn. Chuẩn hoá theo lô có thể mang lại những lợi ích sau:

kích thước lô

#fundamentals

Số lượng ví dụ trong một . Ví dụ: nếu kích thước lô là 100, thì mô hình sẽ xử lý 100 ví dụ cho mỗi lần lặp lại.

Sau đây là các chiến lược kích thước lô phổ biến:

  • Phương pháp giảm độ dốc ngẫu nhiên (SGD), trong đó kích thước lô là 1.
  • Kích thước lô đầy đủ, trong đó kích thước lô là số lượng ví dụ trong toàn bộ tập dữ liệu huấn luyện. Ví dụ: nếu tập dữ liệu huấn luyện chứa một triệu ví dụ, thì kích thước lô sẽ là một triệu ví dụ. Xử lý theo lô đầy đủ thường là một chiến lược không hiệu quả.
  • lô nhỏ, trong đó kích thước lô thường nằm trong khoảng từ 10 đến 1.000. Lô nhỏ thường là chiến lược hiệu quả nhất.

Hãy xem phần sau đây để biết thêm thông tin:

Mạng nơron Bayesian

Một mạng nơ-ron xác suất có tính đến sự không chắc chắn trong trọng số và đầu ra. Một mô hình hồi quy mạng nơ-ron tiêu chuẩn thường dự đoán một giá trị vô hướng; ví dụ: một mô hình tiêu chuẩn dự đoán giá nhà là 853.000. Ngược lại, mạng nơ-ron Bayesian dự đoán một phân phối các giá trị; ví dụ: mô hình Bayesian dự đoán giá nhà là 853.000 với độ lệch chuẩn là 67.200.

Mạng nơ-ron Bayesian dựa vào Định lý Bayes để tính toán độ không chắc chắn về trọng số và dự đoán. Mạng nơ-ron Bayesian có thể hữu ích khi bạn cần định lượng mức độ không chắc chắn, chẳng hạn như trong các mô hình liên quan đến dược phẩm. Mạng nơ-ron Bayesian cũng có thể giúp ngăn chặn tình trạng khái quát hoá kém.

Tối ưu hoá theo phương pháp Bayes

Một kỹ thuật mô hình hồi quy xác suất để tối ưu hoá các hàm mục tiêu tốn nhiều tài nguyên tính toán bằng cách tối ưu hoá một hàm thay thế giúp định lượng mức độ không chắc chắn bằng kỹ thuật học Bayesian. Vì bản thân quá trình tối ưu hoá theo phương pháp Bayesian rất tốn kém, nên phương pháp này thường được dùng để tối ưu hoá các tác vụ khó đánh giá có số lượng nhỏ tham số, chẳng hạn như chọn siêu tham số.

Phương trình Bellman

Trong học tăng cường, danh tính sau đây được đáp ứng bởi Q-function tối ưu:

\[Q(s, a) = r(s, a) + \gamma \mathbb{E}_{s'|s,a} \max_{a'} Q(s', a')\]

Thuật toán học tăng cường áp dụng danh tính này để tạo Q-learning bằng quy tắc cập nhật sau:

\[Q(s,a) \gets Q(s,a) + \alpha \left[r(s,a) + \gamma \displaystyle\max_{\substack{a_1}} Q(s',a') - Q(s,a) \right] \]

Ngoài học tăng cường, phương trình Bellman còn được áp dụng cho lập trình động. Xem mục nhập về phương trình Bellman trên Wikipedia.

BERT (Bidirectional Encoder Representations from Transformers)

Một cấu trúc mô hình để biểu diễn văn bản. Một mô hình BERT được huấn luyện có thể đóng vai trò là một phần của mô hình lớn hơn để phân loại văn bản hoặc các tác vụ học máy khác.

BERT có các đặc điểm sau:

Các biến thể của BERT bao gồm:

  • ALBERT, viết tắt của A Light BERT (BERT nhẹ).
  • LaBSE.

Hãy xem bài viết Nguồn mở BERT: Hoạt động huấn luyện trước hiện đại cho Xử lý ngôn ngữ tự nhiên để biết thông tin tổng quan về BERT.

thiên kiến (đạo đức/tính công bằng)

#responsible
#fundamentals

1. Định kiến, thành kiến hoặc thiên vị đối với một số sự vật, con người hoặc nhóm người so với những người khác. Những thiên kiến này có thể ảnh hưởng đến việc thu thập và diễn giải dữ liệu, thiết kế của một hệ thống và cách người dùng tương tác với hệ thống. Các dạng thiên kiến thuộc loại này bao gồm:

2. Lỗi hệ thống do quy trình lấy mẫu hoặc báo cáo gây ra. Các dạng thiên kiến thuộc loại này bao gồm:

Không nhầm lẫn với thuật ngữ độ lệch trong các mô hình học máy hoặc độ lệch của dự đoán.

Hãy xem phần Tính công bằng: Các loại thiên kiến trong Khoá học học máy ứng dụng để biết thêm thông tin.

độ lệch (toán học) hoặc hệ số thiên lệch

#fundamentals

Một điểm cắt hoặc độ lệch so với điểm gốc. Độ lệch là một tham số trong các mô hình học máy, được biểu thị bằng một trong những tham số sau:

  • b
  • w0

Ví dụ: độ lệch là b trong công thức sau:

$$y' = b + w_1x_1 + w_2x_2 + … w_nx_n$$

Trong một đường thẳng hai chiều đơn giản, độ lệch chỉ có nghĩa là "giao điểm với trục y". Ví dụ: độ lệch của đường thẳng trong hình minh hoạ sau đây là 2.

Đồ thị của một đường thẳng có độ dốc là 0,5 và độ lệch (giao điểm với trục y) là 2.

Sai số tồn tại vì không phải tất cả các mô hình đều bắt đầu từ gốc (0,0). Ví dụ: giả sử một công viên giải trí có giá vé vào cửa là 2 EUR và khách hàng phải trả thêm 0,5 EUR cho mỗi giờ ở lại. Do đó, một mô hình ánh xạ tổng chi phí có độ lệch là 2 vì chi phí thấp nhất là 2 EUR.

Không nên nhầm lẫn thiên kiến với thiên kiến về đạo đức và sự công bằng hoặc độ lệch của dự đoán.

Hãy xem phần Hồi quy tuyến tính trong Khoá học học máy ứng dụng để biết thêm thông tin.

hai chiều

Một thuật ngữ dùng để mô tả hệ thống đánh giá văn bản đứng trướcđứng sau một phần văn bản mục tiêu. Ngược lại, hệ thống một chiều chỉ đánh giá văn bản đứng trước một phần văn bản mục tiêu.

Ví dụ: hãy xem xét một mô hình ngôn ngữ được che giấu phải xác định xác suất cho từ hoặc các từ đại diện cho phần gạch chân trong câu hỏi sau:

Bạn bị làm sao vậy?

Một mô hình ngôn ngữ một chiều sẽ chỉ dựa vào xác suất của ngữ cảnh do các từ "What", "is" và "the" cung cấp. Ngược lại, mô hình ngôn ngữ hai chiều cũng có thể thu thập ngữ cảnh từ "với" và "bạn", điều này có thể giúp mô hình tạo ra những dự đoán chính xác hơn.

mô hình ngôn ngữ hai chiều

Một mô hình ngôn ngữ xác định xác suất mà một token nhất định xuất hiện ở một vị trí nhất định trong một đoạn trích văn bản dựa trên văn bản trướcsau.

bigram

Một N-gram trong đó N=2.

phân loại nhị phân

#fundamentals

Một loại tác vụ phân loại dự đoán một trong hai lớp loại trừ lẫn nhau:

Ví dụ: mỗi mô hình học máy sau đây đều thực hiện phân loại nhị phân:

  • Một mô hình xác định xem thư điện tử có phải là thư rác (hạng mục dương) hay không phải thư rác (hạng mục âm).
  • Một mô hình đánh giá các triệu chứng y tế để xác định xem một người có mắc một bệnh cụ thể (hạng mục dương) hay không mắc bệnh đó (hạng mục âm).

Tương phản với phân loại đa mục.

Xem thêm hồi quy logisticngưỡng phân loại.

Hãy xem phần Phân loại trong Khoá học học máy ứng dụng để biết thêm thông tin.

điều kiện nhị phân

#df

Trong cây quyết định, điều kiện chỉ có 2 kết quả có thể xảy ra, thường là hoặc không. Ví dụ: sau đây là một điều kiện nhị phân:

temperature >= 100

Tương phản với tình trạng phi nhị giới.

Hãy xem Các loại điều kiện trong khoá học Rừng quyết định để biết thêm thông tin.

phân thùng

Từ đồng nghĩa với phân nhóm.

mô hình hộp đen

Một mô hình có "suy luận" mà con người không thể hiểu được hoặc khó hiểu. Tức là mặc dù con người có thể thấy câu lệnh ảnh hưởng đến câu trả lời, nhưng con người không thể xác định chính xác cách mô hình hộp đen xác định câu trả lời. Nói cách khác, mô hình hộp đen thiếu mức độ diễn giải.

Hầu hết mô hình sâumô hình ngôn ngữ lớn đều là hộp đen.

BLEU (Bilingual Evaluation Understudy)

Một chỉ số từ 0 đến 1 để đánh giá bản dịch bằng máy, ví dụ: từ tiếng Tây Ban Nha sang tiếng Nhật.

Để tính điểm, BLEU thường so sánh bản dịch của một mô hình học máy (văn bản được tạo) với bản dịch của một chuyên gia là con người (văn bản tham chiếu). Mức độ trùng khớp giữa N-gram trong văn bản được tạo và văn bản tham chiếu sẽ xác định điểm BLEU.

Bài viết gốc về chỉ số này là BLEU: a Method for Automatic Evaluation of Machine Translation (BLEU: một phương pháp đánh giá tự động bản dịch của máy).

Xem thêm BLEURT.

BLEURT (Bilingual Evaluation Understudy from Transformers)

Một chỉ số để đánh giá bản dịch bằng máy từ ngôn ngữ này sang ngôn ngữ khác, đặc biệt là từ tiếng Anh và sang tiếng Anh.

Đối với bản dịch từ tiếng Anh sang tiếng Anh, BLEURT phù hợp với điểm đánh giá của con người hơn so với BLEU. Không giống như BLEU, BLEURT nhấn mạnh sự tương đồng về ngữ nghĩa (ý nghĩa) và có thể điều chỉnh việc diễn giải.

BLEURT dựa vào một mô hình ngôn ngữ lớn được huấn luyện trước (chính xác là BERT) rồi sau đó được điều chỉnh trên văn bản của người dịch.

Bài viết gốc về chỉ số này là BLEURT: Learning Robust Metrics for Text Generation (BLEURT: Học các chỉ số mạnh mẽ để tạo văn bản).

Câu hỏi Boolean (BoolQ)

#Chỉ số

Một tập dữ liệu để đánh giá mức độ thành thạo của LLM trong việc trả lời các câu hỏi có hoặc không. Mỗi thử thách trong tập dữ liệu đều có 3 thành phần:

  • Một truy vấn
  • Một đoạn văn ngụ ý câu trả lời cho câu hỏi.
  • Câu trả lời đúng là hoặc không.

Ví dụ:

  • Câu hỏi: Có nhà máy điện hạt nhân nào ở Michigan không?
  • Đoạn văn: ...3 nhà máy điện hạt nhân cung cấp khoảng 30% lượng điện cho Michigan.
  • Câu trả lời đúng: Có

Các nhà nghiên cứu đã thu thập các câu hỏi từ những cụm từ tìm kiếm ẩn danh, tổng hợp trên Google Tìm kiếm, sau đó sử dụng các trang trên Wikipedia để xác minh thông tin.

Để biết thêm thông tin, hãy xem bài viết BoolQ: Khám phá độ khó đáng ngạc nhiên của các câu hỏi tự nhiên có/không.

BoolQ là một thành phần của tập hợp SuperGLUE.

BoolQ

#Chỉ số

Từ viết tắt của Câu hỏi Boolean.

tăng cường

Một kỹ thuật học máy kết hợp lặp đi lặp lại một tập hợp các mô hình phân loại đơn giản và không chính xác lắm (được gọi là "trình phân loại yếu") thành một mô hình phân loại có độ chính xác cao ("trình phân loại mạnh") bằng cách tăng trọng số cho các ví dụ mà mô hình hiện đang phân loại sai.

Hãy xem phần Cây quyết định được tăng cường độ dốc? trong khoá học Rừng quyết định để biết thêm thông tin.

hộp giới hạn

Trong một hình ảnh, toạ độ (x, y) của một hình chữ nhật xung quanh một vùng quan tâm, chẳng hạn như chú chó trong hình ảnh bên dưới.

Ảnh chụp một chú chó đang ngồi trên ghế sofa. Một khung hình chữ nhật màu xanh lục có toạ độ trên cùng bên trái là (275, 1271) và toạ độ dưới cùng bên phải là (2954, 2761) bao quanh cơ thể của chú chó

phát sóng

Mở rộng hình dạng của một toán hạng trong phép toán ma trận để kích thước tương thích cho phép toán đó. Ví dụ: đại số tuyến tính yêu cầu hai toán hạng trong một phép toán cộng ma trận phải có cùng kích thước. Do đó, bạn không thể thêm ma trận có hình dạng (m, n) vào vectơ có độ dài n. Hoạt động truyền tin cho phép thao tác này bằng cách mở rộng vectơ có độ dài n thành ma trận có hình dạng (m, n) bằng cách sao chép các giá trị tương tự xuống từng cột.

Hãy xem nội dung mô tả sau đây về truyền tin trong NumPy để biết thêm thông tin chi tiết.

phân giỏ

#fundamentals

Chuyển đổi một đặc điểm duy nhất thành nhiều đặc điểm nhị phân được gọi là nhóm hoặc thùng, thường dựa trên một dải giá trị. Tính năng bị cắt thường là một tính chất liên tục.

Ví dụ: thay vì biểu thị nhiệt độ dưới dạng một đặc điểm liên tục duy nhất có dấu phẩy động, bạn có thể chia các phạm vi nhiệt độ thành các nhóm rời rạc, chẳng hạn như:

  • <= 10 độ C sẽ là nhóm "lạnh".
  • 11 – 24 độ C sẽ là nhóm "ôn hoà".
  • >= 25 độ C sẽ là nhóm "ấm".

Mô hình sẽ xử lý mọi giá trị trong cùng một nhóm theo cách giống nhau. Ví dụ: giá trị 1322 đều nằm trong nhóm nhiệt độ vừa phải, nên mô hình sẽ xử lý hai giá trị này giống nhau.

Hãy xem phần Dữ liệu dạng số: Phân nhóm trong Khoá học học máy ứng dụng để biết thêm thông tin.

C

lớp căn chỉnh

Giá trị điều chỉnh sau dự đoán, thường là để tính đến độ lệch của dự đoán. Các dự đoán và xác suất được điều chỉnh phải khớp với phân phối của một tập hợp nhãn đã quan sát.

tạo đề xuất

Nhóm đề xuất ban đầu do hệ thống đề xuất chọn. Ví dụ: hãy xem xét một hiệu sách cung cấp 100.000 đầu sách. Giai đoạn tạo đề xuất sẽ tạo ra một danh sách nhỏ hơn nhiều gồm những cuốn sách phù hợp cho một người dùng cụ thể, chẳng hạn như 500 cuốn. Nhưng ngay cả 500 cuốn sách cũng là quá nhiều để đề xuất cho một người dùng. Các giai đoạn tiếp theo và tốn kém hơn của hệ thống đề xuất (chẳng hạn như chấm điểmxếp hạng lại) sẽ giảm 500 đề xuất đó xuống một tập hợp đề xuất nhỏ hơn và hữu ích hơn nhiều.

Hãy xem Tổng quan về việc tạo đề xuất trong khoá học Hệ thống đề xuất để biết thêm thông tin.

lấy mẫu ứng viên

Một quy trình tối ưu hoá trong thời gian huấn luyện sẽ tính toán xác suất cho tất cả các nhãn dương, chẳng hạn như sử dụng softmax, nhưng chỉ cho một mẫu ngẫu nhiên gồm các nhãn âm. Ví dụ: cho một ví dụ được gắn nhãn beagledog, hoạt động lấy mẫu ứng viên sẽ tính toán các xác suất dự đoán và các số hạng tổn thất tương ứng cho:

  • chó săn thỏ