Till Örebro universitet

oru.seÖrebro universitets publikationer
Ändra sökning
RefereraExporteraLänk till posten
Permanent länk

Direktlänk
Referera
Referensformat
  • apa
  • ieee
  • modern-language-association-8th-edition
  • vancouver
  • Annat format
Fler format
Språk
  • de-DE
  • en-GB
  • en-US
  • fi-FI
  • nn-NO
  • nn-NB
  • sv-SE
  • Annat språk
Fler språk
Utmatningsformat
  • html
  • text
  • asciidoc
  • rtf
How Reliable Are GPT-4o and LLAMA3.3-70B in Classifying Natural Language Requirements? The Impact of the Temperature Setting
Örebro universitet, Handelshögskolan vid Örebro Universitet. (CERIS - Centre for Empirical Research on Information Systems)ORCID-id: 0000-0002-3265-7627
Örebro universitet, Handelshögskolan vid Örebro Universitet. (CERIS - Centre for Empirical Research on Information Systems)ORCID-id: 0000-0002-0311-1502
Örebro universitet, Handelshögskolan vid Örebro Universitet. (CERIS - Centre for Empirical Research on Information Systems)ORCID-id: 0000-0002-3722-6797
Örebro universitet, Handelshögskolan vid Örebro Universitet. (CERIS - Centre for Empirical Research on Information Systems)ORCID-id: 0000-0001-8604-8862
2025 (Engelska)Ingår i: IEEE Software, ISSN 0740-7459, E-ISSN 1937-4194, Vol. 42, nr 6, s. 97-104Artikel i tidskrift (Refereegranskat) Published
Abstract [en]

Classifying natural language requirements (NLRs) plays a crucial role in software engineering, helping us distinguish between functional and non-functional requirements. While large language models offer automation potential, we should address concerns about their consistency, meaning their ability to produce the same results over time. In this work, we share experiences from experimenting with how well GPT-4o and LLAMA3.3-70B classify NLRs using a zero-shot learning approach. Moreover, we explore how the temperature parameter influences classification performance and consistency for these models. Our results show that large language models like GPT-4o and LLAMA3.3- 70B can support automated NLRs classification. GPT-4o performs well in identifying functional requirements, with the highest consistency occurring at a temperature setting of one. Additionally, non-functional requirements classification improves at higher temperatures, indicating a trade-off between determinism and adaptability. LLAMA3.3-70B is more consistent than GPT-4o, and its classification accuracy varies less depending on temperature adjustments.

Ort, förlag, år, upplaga, sidor
Institute of Electrical and Electronics Engineers (IEEE), 2025. Vol. 42, nr 6, s. 97-104
Nyckelord [en]
Software engineering, Predictive models, Accuracy, Transformers, Training, Natural languages, Temperature measurement, Software reliability, Natural language processing
Nationell ämneskategori
Systemvetenskap, informationssystem och informatik med samhällsvetenskaplig inriktning
Forskningsämne
Informatik
Identifikatorer
URN: urn:nbn:se:oru:diva-122267DOI: 10.1109/MS.2025.3572561ISI: 001600046500002Scopus ID: 2-s2.0-105006549832OAI: oai:DiVA.org:oru-122267DiVA, id: diva2:1981195
Tillgänglig från: 2025-07-03 Skapad: 2025-07-03 Senast uppdaterad: 2026-08-12Bibliografiskt granskad

Open Access i DiVA

Fulltext saknas i DiVA

Övriga länkar

Förlagets fulltextScopus

Person

Karlsson, FredrikChatzipetrou, PanagiotaGao, ShangHavstorm, Tanja Elina

Sök vidare i DiVA

Av författaren/redaktören
Karlsson, FredrikChatzipetrou, PanagiotaGao, ShangHavstorm, Tanja Elina
Av organisationen
Handelshögskolan vid Örebro Universitet
I samma tidskrift
IEEE Software
Systemvetenskap, informationssystem och informatik med samhällsvetenskaplig inriktning

Sök vidare utanför DiVA

GoogleGoogle Scholar

doi
urn-nbn

Altmetricpoäng

doi
urn-nbn
Totalt: 278 träffar
RefereraExporteraLänk till posten
Permanent länk

Direktlänk
Referera
Referensformat
  • apa
  • ieee
  • modern-language-association-8th-edition
  • vancouver
  • Annat format
Fler format
Språk
  • de-DE
  • en-GB
  • en-US
  • fi-FI
  • nn-NO
  • nn-NB
  • sv-SE
  • Annat språk
Fler språk
Utmatningsformat
  • html
  • text
  • asciidoc
  • rtf