OpenAI: ఓపెన్ఏఐ బెంచ్మార్క్లలో మార్పులు.. ఆస్ట్రా స్కోర్లు పెరుగుదల
ఈ వార్తాకథనం ఏంటి
ఓపెన్ఏఐ తన తాజా మోడల్ జీపీటీ-6 ఆస్ట్రా కోసం నిర్వహించిన బెంచ్మార్క్ పరీక్షల్లో పలు మార్పులు చేసింది. గత వారం ఆస్ట్రాను ప్రకటించిన తర్వాత ఈ గణాంకాలను సంస్థ పలుమార్లు సవరించింది. కొన్ని పరీక్షల్లో ఆస్ట్రా పనితీరు మెరుగ్గా కనిపించగా.. ప్రత్యర్థి సంస్థ ఆంత్రోపిక్కు చెందిన మోడళ్ల స్కోర్లు తగ్గాయి. ఎల్ఎల్ఎం (Large Language Models) రంగంలో కంపెనీల మధ్య పోటీ తీవ్రంగా ఉన్న సమయంలో ఈ మార్పులు చోటుచేసుకోవడం ఆసక్తికరంగా మారింది.
వివరాలు
బ్లాగ్ విడుదలలో సాంకేతిక సమస్యలు
ఓపెన్ఏఐ ఆస్ట్రా వివరాలను వెల్లడిస్తూ విడుదల చేయాల్సిన బ్లాగ్పోస్ట్ కూడా సాంకేతిక సమస్యలను ఎదుర్కొంది.
అమెరికా తూర్పు కాలమానం (ET) ప్రకారం మధ్యాహ్నం 2 గంటలకు బ్లాగ్ను అందుబాటులోకి తీసుకురావాలని సంస్థ తొలుత నిర్ణయించింది.
అయితే అది అందరికీ అందుబాటులోకి రావడానికి దాదాపు రెండు గంటలు పట్టింది.
ఓపెన్ఏఐ ఎక్స్ ఖాతా నుంచి బ్లాగ్కు లింక్ను షేర్ చేసినప్పుడు అది సరిగ్గా పనిచేయకుండా ఎర్రర్ చూపించింది.
ఆ తర్వాత సంస్థ సీఈఓ సామ్ ఆల్ట్మన్ ఈ సమస్యలను అంగీకరిస్తూ స్వయంగా లింక్ను షేర్ చేశారు.
వివరాలు
తొలి బ్లాగ్ను ఎందుకు వెనక్కి తీసుకున్నారో వెల్లడించని ఓపెన్ఏఐ
మధ్యాహ్నం 2 గంటల తర్వాత కొద్దిసేపటికే ఓపెన్ఏఐ బ్లాగ్పోస్ట్ను ప్రచురించింది.
అయితే ఆ తర్వాత ఎలాంటి కారణం వెల్లడించకుండా దాన్ని వెనక్కి తీసుకుంది. ఈ చర్యకు బెంచ్మార్క్ పనితీరు గణాంకాలకు సంబంధం లేదని సంస్థ తెలిపింది.
తిరిగి బ్లాగ్ను ప్రచురించినప్పుడు అందులో ఉన్న కొన్ని మూల్యాంకన గణాంకాలు మారిపోయాయి.
అవి ఆస్ట్రాకు అనుకూలంగా ఉన్నట్లు కనిపించాయి. ప్రచురణ తర్వాత కూడా కొన్ని గణాంకాలు మారుతూనే ఉండటం.. ఎల్ఎల్ఎంల పనితీరును కొలవడానికి ఒకే రకమైన బెంచ్మార్క్ పరీక్షలను ఉపయోగించడంలో ఉన్న సవాళ్లను, గణాంకాల్లో మార్పులు చేసే అవకాశాలపై ఉన్న ఆందోళనలను బయటపెట్టింది.
వివరాలు
తమ చర్యలను సమర్థించుకున్న ఓపెన్ఏఐ
ఈ మార్పులపై ఓపెన్ఏఐ ప్రతినిధి సంస్థ చర్యలను సమర్థించారు. మూల్యాంకనాలను సరిగ్గా నిర్వహించడంపై తాము ఎంతో శ్రద్ధ చూపుతున్నామని తెలిపారు.
నివేదికలో ఉపయోగించే ఖచ్చితమైన మోడల్ చెక్పాయింట్, స్కాఫోల్డ్ వంటి అంశాలను బట్టి చాలా మూల్యాంకనాల్లో కొన్ని శాతం పాయింట్ల మేర తేడాలు ఉండొచ్చని వివరించారు.
అందుబాటులో ఉన్న మోడల్ పనితీరును సాధ్యమైనంత కచ్చితంగా ప్రతిబింబించేలా లాంచ్ బ్లాగ్లో కొన్ని సవరణలు చేశామని చెప్పారు.
దీంతో వినియోగదారులు మోడళ్ల మధ్య అర్థవంతమైన పోలికలు చేసుకోవచ్చని పేర్కొన్నారు.
వివరాలు
ఆస్ట్రా హ్యాల్యూసినేషన్ రేటు సగానికి తగ్గించి.. మళ్లీ పాత స్థాయికి
బ్లాగ్పోస్ట్కు సంబంధించిన తొలి ఇంటర్నెట్ ఆర్కైవ్ కాపీలో ఆస్ట్రా హ్యాల్యూసినేషన్ రేటు 4.2 శాతంగా ఉంది.
కొన్ని కాపీల్లోనూ ఇదే గణాంకం కొనసాగింది. ఆ తర్వాతి వెర్షన్లో మాత్రం ఈ రేటును 2 శాతానికి అంటే దాదాపు సగానికి తగ్గించారు.
ఇదే సమయంలో ఆస్ట్రా ముందున్న జీపీటీ-5.6 సోల్ హ్యాల్యూసినేషన్ రేటు కూడా 12.2 శాతం నుంచి 9.4 శాతానికి తగ్గింది.
అయితే ఓపెన్ఏఐ ఈ గణాంకాన్ని మళ్లీ మార్చింది. ప్రస్తుతం ఆస్ట్రా, సోల్ హ్యాల్యూసినేషన్ రేట్లు వరుసగా 4.2 శాతం, 12.2 శాతంగా ఉన్నాయి.
వివరాలు
సోల్ ExploitBench స్కోర్లో భారీ పెరుగుదల
సైబర్ సెక్యూరిటీకి సంబంధించిన ఓపెన్ఏఐ అంతర్గత ExploitBench పరీక్షలో జీపీటీ-5.6 సోల్ స్కోర్ను కూడా సంస్థ గణనీయంగా పెంచినట్లు కనిపించింది.
తొలి వెర్షన్లో 5.5 శాతంగా ఉన్న స్కోర్.. తర్వాతి వెర్షన్లలో 11.5 శాతానికి చేరింది.
అయితే ఈ గణాంకాన్ని తిరిగి 5.5 శాతానికి తీసుకురావడంపై ప్రస్తుతం పరిశీలిస్తున్నామని ఓపెన్ఏఐ తెలిపింది.
11.5 శాతం ఫలితం సోల్ వాణిజ్యపరంగా అందుబాటులో లేని అధిక స్థాయి రీజనింగ్తో సాధించిందని సంస్థ వివరించింది.
వివరాలు
ఇతర మోడళ్ల కంటే గణితంలో ఆస్ట్రా బలంగా ఉన్నట్లు కనిపించిన వైనం
గణిత సామర్థ్యంలో ఆస్ట్రా ప్రత్యేకంగా బలంగా ఉందని ఓపెన్ఏఐ పేర్కొంది. సంస్థ విడుదల చేసిన ప్రకటన తొలి పేరాలోనే ఈ సామర్థ్యాన్ని ప్రత్యేకంగా ప్రస్తావించింది.
FrontierMath Tier 4 (v2) పరీక్షలో ఆస్ట్రా స్కోర్ అన్ని ఆర్కైవ్ కాపీల్లో 97.6 శాతంగానే ఉంది.
అయితే జీపీటీ-5.6 సోల్, ఆంత్రోపిక్కు చెందిన తాజా మోడల్ ఫేబుల్ 5.1 స్కోర్లను ఓపెన్ఏఐ కొంతకాలం మార్చింది.
దీంతో ఈ రెండు మోడళ్ల కంటే ఆస్ట్రా గణితంలో చాలా మెరుగ్గా ఉన్నట్లు కనిపించింది.
వివరాలు
ఫేబుల్, సోల్ స్కోర్లలోనూ మార్పులు
సెప్టెంబర్ 3న మధ్యాహ్నం 2:23 గంటలకు తీసిన తొలి కాపీలో ఫేబుల్ 5.1 స్కోర్ 87.8 శాతంగా ఉంది.
సాయంత్రం 5:17 గంటల నాటికి అది దాదాపు 10 శాతం పాయింట్లు తగ్గి 78 శాతానికి చేరింది. ఆ తర్వాత మళ్లీ 83 శాతానికి పెరిగింది.
జీపీటీ-5.6 సోల్ స్కోర్లోనూ ఇదే తరహా మార్పు కనిపించింది. తొలుత 83 శాతంగా ఉన్న స్కోర్ 80.5 శాతానికి తగ్గి.. ప్రస్తుతం మళ్లీ 83 శాతానికి చేరింది.
వివరాలు
మూల్యాంకన గణాంకాలు, పరీక్షా పరిస్థితులపై స్పష్టత అవసరం
ఓపెన్ఏఐలోని వేర్వేరు పరిశోధనా బృందాలు వివిధ బెంచ్మార్క్ గణాంకాలను నిర్వహిస్తాయి.
అనంతరం వాటిని ఒక కేంద్ర బృందానికి పంపి ప్రచురిస్తారు. ఈ గణాంకాలు అత్యుత్తమ పరిస్థితుల్లో సాధించిన ఫలితాలను సూచిస్తాయని కంపెనీ స్పష్టంగా చెబుతోంది.
సాధారణ వినియోగదారులకు అందుబాటులో ఉన్న ChatGPTలోని మోడల్ పనితీరుతో వీటిలో స్వల్ప తేడాలు ఉండొచ్చని పేర్కొంది.
బ్లాగ్లోని డిస్క్లెయిమర్లో.. ఆయా పరీక్షల్లో నిర్దిష్ట స్థాయిలో అత్యధిక ప్రయత్నంతో సాధించిన స్కోర్లనే చూపిస్తున్నట్లు పేర్కొంది.
ప్రతి గణాంకానికి సంబంధించిన ఫుట్నోట్లలో మరిన్ని షరతులు, వివరణలను కూడా సంస్థ అందించింది.