Skip to main content

Unit 2: Subjective Question Bank

1. Define Data Mining.

Data Mining is process of extracting useful, hidden patterns and knowledge from large datasets. It is the analysis step of KDD.

2. What is KDD? Explain the steps briefly.

KDD (Knowledge Discovery in Databases) is the full process of finding knowledge in data.

  1. Cleaning: Removing noise/errors.
  2. Integration: Combining multiple data sources.
  3. Selection: Choosing relevant data.
  4. Transformation: Converting data into mining formats (Scaling).
  5. Mining: Extracting patterns (The core step).
  6. Evaluation: Identifying truly useful patterns.
  7. Presentation: Visualizing results for the user.

3. Data Mining vs. Data Warehousing.

  • Warehouse: A repository used to store and integrate data.
  • Mining: A process used to analyze and find patterns in that data.

4. Major issues in data mining.

  • Performance: Handling massive data quickly.
  • Data Diversity: Mining complex data like images or web pages.
  • User Interaction: Making mining tools easy to use.
  • Ethics: Protecting user privacy.

5. Data, Information, and Knowledge.

  • Data: Raw facts (e.g., "50").
  • Information: Data with meaning (e.g., "50 items sold").
  • Knowledge: Information used for action (e.g., "Sales are high; restock now").

6. What is data cleaning?

The process of removing noise (errors) and handling missing values to improve data quality.

7. What is data transformation?

Changing data into formats suitable for mining.

  • Normalization: Scaling numbers (e.g., 0 to 1).
  • Aggregation: Summarizing data (e.g., daily to monthly sales).

8. What is a data repository? Give types.

A centralized place to store data.

  • Relational: Tables with rows/columns.
  • Warehouse: Historical data for analysis.
  • Transactional: Fast, everyday records (OLTP).

9. Classification vs. Clustering.

  • Classification: Predicting labels for new data (Supervised). E.g., Spam vs. Not Spam.
  • Clustering: Grouping similar items without labels (Unsupervised). E.g., Grouping customers by behavior.

10. What is an association rule?

Finding items that frequently occur together. Example: People who buy bread also buy butter (Bread \rightarrow Butter).

11. What are outliers?

Data points that are significantly different from the rest. Use Case: Used for Fraud Detection.

12. Data mining functionalities with examples.

  • Association: Finding related items (Market Basket).
  • Classification: Categorizing data (Loan Approval).
  • Clustering: Finding natural groups (News categories).
  • Outlier Analysis: Finding anomalies (Credit card fraud).

13. Descriptive vs. Predictive tasks.

  • Descriptive: Summarizes current data (e.g., Clustering).
  • Predictive: Forecasts future or unknown values (e.g., Regression).
  • Web Mining: Analyzing website usage.
  • Multimedia Mining: Analyzing images and video.
  • Spatial Mining: Analyzing location/map data.
  • Privacy-Preserving: Mining data without exposing personal details.

15. Methods of presenting models.

  • IF-THEN Rules: Logical "If this, then that" statements.
  • Decision Trees: A flowchart structure showing tests and outcomes.