nlp_project/
├── data_loader.py # Stanford Sentiment data loading & splitting
├── visualize.py # Shared plotting utilities
├── baseline_model.py # TF-IDF + Logistic/Linear Regression baselines
├── bilstm_model.py # BiLSTM classifier + regressor (TensorFlow/Keras)
├── bert_sentiment_model.py # RoBERTa-base regression model (HuggingFace)
├── berkeley_model.py # Twitter-RoBERTa multi-label toxicity model
├── twitter_inference.py # Apply models to Twitter CSV data
└── chatgpt_inference.py # Apply models to lmsys/lmsys-chat-1m dataset
python baseline_model.py
python bilstm_model.py
python bert_sentiment_model.py
python berkeley_model.py
python twitter_inference.py \
--input tweets.csv \
--output tweets_with_scores.csv \
--sentiment_model_path ./sentiment_roberta_model_final \
--berkeley_model_path ./uc_berkeley_model_best
python chatgpt_inference.py \
--output chatgpt_anonymous_df.csv \
--sentiment_model_path ./sentiment_roberta_model_final \
--berkeley_model_path ./uc_berkeley_model_best \
--sample 200000
| File | Used by |
|---|---|
sentiment_labels.txt | data_loader.py |
dictionary.txt | data_loader.py |
tweets.csv | twitter_inference.py |
Berkeley and ChatGPT datasets are downloaded automatically from HuggingFace.
pandas scikit-learn tensorflow transformers datasets torch langdetect matplotlib seaborn
5 commits
2 commits
Python
100.0%
nlp_project/
├── data_loader.py # Stanford Sentiment data loading & splitting
├── visualize.py # Shared plotting utilities
├── baseline_model.py # TF-IDF + Logistic/Linear Regression baselines
├── bilstm_model.py # BiLSTM classifier + regressor (TensorFlow/Keras)
├── bert_sentiment_model.py # RoBERTa-base regression model (HuggingFace)
├── berkeley_model.py # Twitter-RoBERTa multi-label toxicity model
├── twitter_inference.py # Apply models to Twitter CSV data
└── chatgpt_inference.py # Apply models to lmsys/lmsys-chat-1m dataset
python baseline_model.py
python bilstm_model.py
python bert_sentiment_model.py
python berkeley_model.py
python twitter_inference.py \
--input tweets.csv \
--output tweets_with_scores.csv \
--sentiment_model_path ./sentiment_roberta_model_final \
--berkeley_model_path ./uc_berkeley_model_best
python chatgpt_inference.py \
--output chatgpt_anonymous_df.csv \
--sentiment_model_path ./sentiment_roberta_model_final \
--berkeley_model_path ./uc_berkeley_model_best \
--sample 200000
| File | Used by |
|---|---|
sentiment_labels.txt | data_loader.py |
dictionary.txt | data_loader.py |
tweets.csv | twitter_inference.py |
Berkeley and ChatGPT datasets are downloaded automatically from HuggingFace.
pandas scikit-learn tensorflow transformers datasets torch langdetect matplotlib seaborn
5 commits
2 commits
Python
100.0%